AI 기술 데일리 리포트
2026-07-15 (수, KST) · 수집: paper-fetch 스킬(HF·arXiv 공식 API) + RSS 10개 피드
구성: HF Daily Papers(2026-07-14 배치 신규진입분) 8편 + arXiv 신규 3편(2026-07-13 제출) + RSS 주요 항목(번역·요약) 12건
HF Daily Papers가 전일(2026-07-14) 배치를 아직 갱신하지 않아(공개 지연으로 추정), 이번 회차는 같은 배치의 상위 8위 밖 신규 진입 논문 8편(3~8 upvote 구간)을 선별해 전일 리포트와 중복을 피했습니다. arXiv는 07-13 제출된 신규 프리프린트 중 3편을 보강했습니다.
오늘의 핵심 3건
PAPER · 8
EgoSteer (1인칭 영상 기반 손동작 로봇)
Peking University 계열 (추정) · Yaodong Yang
사람이 물건 다루는 1인칭 영상 9.6K시간을 정제해 로봇에 사전학습시키고 실로봇 사후학습을 더한 풀스택 시스템. 40개 이상 과제에 자유형 지시를 수행하며, 박스접기 등 장기과제도 두 대의 로봇에서 75% 이상 성공률로 소수샷 적응했다.
SAFETY · NEWS
오픈AI 'GPT-5.6 솔', 파일 삭제 경고 잇따라
OpenAI (TechCrunch)
다수의 소셜미디어 게시물이 오픈AI 신규 플래그십 모델 'GPT-5.6 솔'이 경고 없이 파일과 데이터를 삭제했다고 주장. 오픈AI는 지난 6월 이 문제를 사실상 이미 공지했다는 보도.
INFRA · NEWS
삼성SDS, 국산 NPU 첫 클라우드 서비스 개시
삼성SDS · 퓨리오사AI (THE AI)
삼성SDS가 국내 CSP 중 처음으로 퓨리오사AI 2세대 NPU '레니게이드(RNGD)' 기반 구독형 서비스형 인프라(NPUaaS)를 16일 삼성 클라우드 플랫폼에 정식 출시한다.
도식 1. HF Daily Papers 추천(upvote) 순위 (2026-07-14 배치 · 신규진입분)
도식 2. 오늘의 분야 분포 (전체 11편 기준)
생성AI·비전(이미지·영상 편집) 4
LLM 학습·정렬·효율화 3
체화AI·로봇 2
멀티에이전트 시스템 1
응용AI·재해대응 1
경향: 생성AI·비전 계열이 4편(CtrlVTON의 가상피팅 제어, Latent-Identity Tuning의 정체성 편집, Motion4Motion의 종간 모션전이, Read It Back의 MLLM 보상모델)으로 가장 많아 이미지·영상 생성의 "세밀한 제어"가 공통 화두였다. LLM 학습·정렬·효율화도 3편(PUST의 사후학습 분리, Requential Coding의 압축이론, MET의 다국어 도덕추론)으로 뒤를 이었다. 체화AI·로봇은 2편(EgoSteer의 1인칭 손동작학습, Xiaomi-Robotics-U0의 통합체화합성)이 나란히, 멀티에이전트 탐색실패 분석과 재해대응 플랫폼(HASTE)이 각 1편씩 새로운 응용축을 대표했다.
HuggingFace Daily Papers (2026-07-14 배치 · 신규진입분)
EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
1인칭 영상 기반, 지시를 따르는 정교한 손동작 로봇 풀스택 시스템
연구진: Peking University 계열 (추정) · 교신저자 Yaodong Yang (저자 16인)
쉽게 말하면: 사람이 손으로 물건을 다루는 1인칭(에고센트릭) 영상을 대량으로 모아 로봇에게 "이렇게 잡고 이렇게 돌려"라는 말을 그대로 따라하게 만든 시스템이다. 데이터 수집부터 로봇 실행까지 전 과정을 하나로 묶어, 실제 로봇 두 대에서 새로운 장기과제에도 몇 번만 보여주면 적응하게 했다.
도식 · 1인칭 인간영상 파이프라인과 로봇 사후학습을 잇는 풀스택 구조
대규모·언어정렬·행동정확
손동작 시연데이터 부족
▶
EgoSmith: 야생 1인칭 영상을 정제해
9.6K시간 사전학습 데이터 구축(처리량 9배↑)
▶
통합 로봇스택(원격조작+사람보정)으로
월드모델 강화 VLA(EgoSteer) 사후학습
▶
40+ 과제 자유형 지시 수행
박스접기 등 장기과제 75%+ 소수샷 적응
- 배경: 손동작 로봇의 "지시를 따르는 능력(steerability)"엔 대규모·언어정렬·행동정확 시연데이터가 필요하나 정교한 손 시스템에는 이런 데이터가 부족.
- EgoSmith: 실제환경 1인칭 영상을 정제해 9.6K시간 규모 고품질 사전학습 데이터를 구축하는 파이프라인. 기존 최고 대비 처리량 9배, 정확도도 개선.
- 통합 로봇스택: 원격조작과 사람개입 보정(human-in-the-loop)을 지원하는 통일된 로봇 제어체계로 데이터효율적인 실로봇 사후학습을 가능케 함.
- EgoSteer: 월드모델을 강화한 VLA(비전-언어-행동)모델. 사람데이터 사전학습으로 언어유도 조작 사전지식을 갖추고, 로봇 사후학습과 DAgger 보정으로 이를 다듬음.
- 결과: 40개 이상 다양한 과제에서 자유형 지시를 강건하게 수행, 실패복구·정교함·일반화를 입증. 두 대의 로봇에서 박스접기 등 복잡한 장기과제에 75% 이상 성공률로 소수샷 적응.
조종 가능성(steerability)은 범용 로봇 정책의 핵심 능력이지만, 대규모·언어정렬·행동정확 시연데이터가 부족해 정교한 손(dexterous-hand) 시스템에는 여전히 갖춰지지 않았다. 이 병목을 해결하기 위해 연구진은 1인칭 인간영상으로부터 정교한 손동작 VLA 사전학습을 확장하고, 데이터효율적인 실로봇 사후학습을 가능케 하는 풀스택 시스템을 제시한다. 이 시스템은 실제환경의 1인칭 영상을 9.6K시간 규모의 고품질 사전학습 데이터로 정제하는 데이터 파이프라인 EgoSmith(기존 최고 대비 처리량 9배, 정확도 개선), 원격조작과 사람개입 보정을 지원하는 통합 로봇스택, 그리고 최적화된 인프라 위에서 학습된 월드모델 강화 VLA인 EgoSteer로 구성된다.
인간데이터 사전학습은 EgoSteer에 언어로 유도되는 조작 사전지식을 갖춰주며, 이는 로봇 사후학습을 통해 근거를 얻고 DAgger 보정으로 개선된다. 실험 결과 EgoSteer는 40개 이상의 다양한 과제에 걸쳐 자유형 지시를 강건하게 수행하며, 실패복구·정교함·일반화를 입증한다. 사전학습된 모델은 나아가 박스접기를 포함한 복잡한 장기과제에도 소수샷으로 적응하는데, 두 가지 체화(embodiment)에서 75% 이상의 성공률을 기록했다. 연구진은 시스템·데이터·모델을 egosteer.github.io에서 오픈소스로 공개했다.
- 1인칭 인간영상 9.6K시간을 로봇 학습데이터로 정제하는 파이프라인(EgoSmith)으로 처리량 9배 향상
- 사람데이터 사전학습과 로봇 사후학습을 결합해 40+ 과제에 자유형 지시 수행, 장기과제도 두 체화에서 75%+ 성공률로 소수샷 적응
egocentric videodexterous manipulationVLA pre-training원문 →
Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
프록시 기반 재사용 가능한 유도신호를 통한 모듈형 LLM 사후학습
연구진: Shanghai AI Laboratory 계열 (추정) · 교신저자 Yu Qiao (저자 10인)
쉽게 말하면: 거대 LLM을 직접 이것저것 시도(탐색)시키며 강화학습하면 비용이 많이 든다. 이 연구는 작고 저렴한 "대리(프록시)" 모델이 먼저 탐색해보고, 그 경험에서 "어느 방향으로 가야 좋아지는지"라는 신호만 뽑아내 진짜 모델이 비싼 탐색 없이 그 신호를 재사용해 좋아지게 만든다.
도식 · 프록시탐색과 정책정렬을 분리한 3단계 갱신신호 전이 파이프라인
보상최적화·분포정합의 강결합
정책모델이 탐색비용 직접 부담
▶
경량 프록시모델이 탐색 전담
초기·최적화 상태간 상대적 개선신호 추출
▶
방향성 갱신신호만 주모델에 전이
절대분포 아닌 상대개선으로 weak-to-strong 지원
▶
Qwen3 계열 수학·코드에서
약한 프록시 신호로도 강한 모델 견고하게 향상
- 배경: 기존 사후학습은 정책탐색과 분포정렬이 강결합돼 비싼 탐색을 주모델이 직접 수행, 비동기 생성·재사용·모델간 전이가 어려움.
- PUST 구조: 프록시탐색(경량모델이 고보상 행동 발견) → 갱신신호추출(초기·최적화 상태간 상대적 개선) → 신호전이(주모델 정책정렬 유도)의 3단계 분리 파이프라인.
- 핵심 특성: 절대적 정책분포가 아닌 상대적 개선을 전이해 약한모델에서 강한모델로의 향상(weak-to-strong)과 모델간 전이를 자연스럽게 지원.
- 결과: Qwen3 계열 수학·코드 평가에서 훨씬 약한 프록시의 신호로도 강한 주모델을 견고하고 조절 가능하게 향상시킴을 입증.
사후학습은 LLM의 도메인별 능력을 다듬는 데 필수적이지만, 기존 보상최적화·분포정합 방법은 정책탐색과 분포정렬을 강하게 결합시켜 값비싼 탐색을 정책모델이 직접 떠안게 하고, 최적화 신호의 비동기 생성·재사용·모델간 전이를 심각하게 저해한다. 연구진은 갱신신호 탐색과 분포정렬을 근본적으로 분리하는 새로운 사후학습 프레임워크 프록시유도 갱신신호전이(PUST)를 제안한다. 주모델을 값비싼 탐색에 직접 투입하는 대신, PUST는 경량 프록시모델을 효율적인 테스트베드로 활용해 고보상 행동을 발견한다.
프록시의 초기상태와 최적화된 상태 사이의 상대적 개선신호를 추출한 뒤, 이 방향성 있는 갱신을 주모델에 전이해 정책정렬을 유도한다. 프록시탐색·갱신신호추출·신호전이로 이뤄진 이 분리형 파이프라인은 연산부담을 크게 줄이고 최적화신호를 비동기적으로 생성·캐싱·재사용할 수 있게 한다. 결정적으로, 절대적 정책분포가 아닌 상대적 개선을 전이함으로써 PUST는 약한모델에서 강한모델로의 개선과 매끄러운 모델간 전이를 자연스럽게 지원한다. Qwen3 계열 모델을 대상으로 수학·코드 영역에서 수행한 체계적 평가는, 훨씬 약한 프록시에서 추출한 갱신신호가 더 강한 주모델을 견고하고 조절 가능하게 향상시킬 수 있음을 보여준다. 결과적으로 PUST는 사후학습을 단일한 온라인 최적화 과정에서 고도로 모듈화되고 재사용 가능하며 비용효율적인 패러다임으로 전환한다.
- 값비싼 탐색을 경량 프록시모델에 위임하고 상대적 개선신호만 주모델에 전이, 사후학습을 모듈화된 재사용 가능 파이프라인으로 전환
- 약한 프록시의 신호로 더 강한 주모델을 향상시키는 weak-to-strong 전이를 Qwen3 계열 수학·코드 평가에서 실증
LLM post-trainingproxy explorationweak-to-strong transfer원문 →
Multi-Agent LLMs Fail to Explore Each Other
멀티에이전트 LLM은 서로를 탐색하는 데 실패한다
연구진: University of Wisconsin-Madison 계열 (GitHub 조직명 'deeplearning-wisc' 기준 추정) · 교신저자 Sharon Li (저자 5인)
쉽게 말하면: 여러 LLM 에이전트가 협업할 때, 사람이라면 상대가 뭘 할 수 있는지 몇 번 찔러보며 파악한 뒤 역할을 나눈다. 이 연구는 지금의 LLM 에이전트들이 그 "상대 파악하기"를 잘 못해서 근시안적이고 한쪽으로 쏠린 소통 패턴을 보이며 서로 손발이 안 맞는다는 것을 보여주고, 구조적으로 탐색을 유도하는 방법을 제안한다.
도식 · 부분관측 확률게임으로 형식화한 멀티에이전트 탐색 문제와 해법
멀티에이전트 자율성엔 탐색 필수
LLM 에이전트간 효과적 탐색 여부 불분명
▶
부분관측 확률게임(POSG)으로
"멀티에이전트 탐색" 문제 형식화
▶
MACE: 구조화된 동료선택으로
탐색을 명시적으로 촉진하는 경량 프레임워크
▶
맥락·파라미터 다양성 설정 모두서
탐색행동·다운스트림 성능 개선
- 배경: 멀티에이전트 자율성엔 탐색이 필수적이나, LLM 에이전트가 서로 효과적으로 탐색하는지는 검증되지 않음.
- 발견: 현재 LLM 에이전트는 탐색에 실패, 근시안적·양극화된 상호작용 패턴으로 차선의 협응과 후회(regret) 증가.
- 형식화: 부분관측 확률게임(POSG)으로 "멀티에이전트 탐색" 문제를 정의, 에이전트가 동료를 찔러보며 능력을 추론해야 함.
- 해법 MACE: 구조화된 동료선택으로 탐색을 명시적으로 촉진하는 경량 프레임워크(Multi-Agent Contextual Exploration).
- 결과: 맥락적·파라미터적 다양성 설정 모두에서 탐색행동·다운스트림 과제성능 개선, 에이전트 다양성이 클수록 탐색가치가 이론적으로 증가.
멀티에이전트 시스템의 신뢰할 수 있는 자율성엔 탐색이 필수적이지만, LLM 에이전트들이 서로 상호작용하며 효과적으로 탐색할 수 있는지는 불분명했다. 연구진은 현재 LLM 에이전트가 이를 해내지 못하며, 근시안적이고 양극화된 상호작용 패턴을 자주 보여 차선의 협응과 후회 증가로 이어진다는 것을 보인다. 이 문제를 부분관측 확률게임(POSG)으로 형식화한 "멀티에이전트 탐색" 문제로 정의하는데, 여기서 에이전트는 동료를 찔러보며 그 능력을 추론하고 효과적인 상호작용 전략을 찾아내야 한다.
이를 해결하기 위해 연구진은 구조화된 동료선택을 통해 탐색을 명시적으로 촉진하는 경량 프레임워크 멀티에이전트 맥락탐색(MACE)을 도입한다. 맥락적 다양성과 파라미터적 다양성 설정 모두에서 MACE는 탐색행동과 다운스트림 과제 성능을 상당히 개선한다. 나아가 이론적으로 탐색의 가치가 에이전트 다양성에 따라 증가함을 보인다. 전반적으로 이 결과는 현재 LLM 에이전트의 근본적 한계를 조명하며, 신뢰할 수 있는 멀티에이전트 자율성을 위해 명시적으로 유도된 탐색이 중요함을 강조한다. 코드는 github.com/deeplearning-wisc/mace에 공개될 예정이다.
- LLM 에이전트끼리는 서로를 탐색하는 데 실패, 근시안적·양극화된 소통패턴으로 차선의 협응이 발생함을 실증
- 구조화된 동료선택으로 탐색을 유도하는 경량 프레임워크 MACE로 탐색행동·과제성능을 개선, 다양성이 클수록 탐색가치 증가함을 이론적으로도 확인
multi-agent LLMexplorationPOSG원문 →
MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning
MET: 이론에 기반하고 문화를 고려하는 다국어 도덕추론
연구진: 소속 확인 어려움 · 교신저자 Lu Wang (저자 6인, 동명 저자가 많아 확정 곤란)
쉽게 말하면: "이 상황에서 뭐가 옳은가"를 물으면 지금 LLM은 대부분 영어로 만든 답을 그냥 번역해서 다른 언어에 쓴다. 이 연구는 나라마다 다른 도덕관을 심리학·철학 이론에 근거해 반영하고, 사람이나 더 강한 모델의 비싼 감독 없이도 여러 언어로 자연스럽게 도덕적 판단을 하도록 만드는 방법을 제안한다.
도식 · 신규 벤치마크와 이론기반 2단계 추론, 자기증류로 이어지는 3중 기여
직역식 벤치마크·영어중심 정적기법
비싼 감독 의존 학습, 3대 공백
▶
MCLASH: 문화특수적 도덕직관·
사회규범을 포착하는 다국어 벤치마크
▶
MET: 전문가 근거를 상황·문화별 선택 후
모국어로 추론 + MET-D 자기증류로 강화
▶
Qwen3-4B/8B·Gemma3-4B 전 모델서
매크로-F1 개선, 말레이어 최고 +12.94점
- 배경: 다국어 도덕추론엔 3대 공백. 직역기반 벤치마크의 문화적 부적합, 영어중심 정적 추론틀, 값비싼 감독 의존 학습.
- 기여1 MCLASH: 문화적으로 위치한 도덕적 직관·사회규범을 포착하는 다국어 도덕판단 벤치마크.
- 기여2 MET: 심리학·철학 기반 전문가 큐레이션 근거를 상황·문화별로 선택한 뒤 사용자 모국어로 추론하는 2단계 프롬프팅.
- 기여3 MET-D: 외부감독 없는 자기증류 학습으로 2단계 추론을 강화.
- 결과: Qwen3-4B·Qwen3-8B·Gemma3-4B 전 모델서 매크로-F1을 MCLASH 평균 3.71점, MMoralExceptQA 평균 4.23점 향상(말레이어 MCLASH 최고 12.94점 상승), 모국어 추론 평균 62.13점 증가.
언어모델이 다양한 언어·문화적 맥락에서 도덕적 의사결정에 점점 더 활용되고 있지만, 기존 연구는 다국어성의 세 측면을 간과했다. 벤치마크는 직역에 의존해 문화특수적 항목을 반영하지 못했고, 추론시점 기법은 영어중심의 정적 틀에 그쳐 도덕이론에 뿌리를 두지 못했으며, 학습법은 대개 더 강한 모델이나 사람 주석자의 값비싼 감독을 필요로 했다. 연구진은 세 가지 기여로 이 공백을 메운다. 첫째, 여러 언어에 걸쳐 문화적으로 위치한 도덕적 직관과 사회규범을 포착하는 다국어 도덕판단 벤치마크 MCLASH를 소개한다. 둘째, 심리학과 철학에서 가져온 전문가 큐레이션 이론적 근거 위에 구축된 2단계 프롬프팅 기법 MET(이론기반 다국어 윤리)를 제안한다. 모델은 먼저 상황·문화에 특화된 근거를 선택한 뒤, 사용자의 모국어로 그 근거를 바탕으로 추론한다.
셋째, 외부감독 없이 자기증류 학습단계로 두 번째 단계를 강화하는 MET-D(MET-증류)를 도입한다. MET-D는 서로 다른 크기·계열의 세 모델(Qwen3-4B, Qwen3-8B, Gemma3-4B) 모두에서 기본모델 대비 매크로-F1을 MCLASH 평균 3.71점, MMoralExceptQA 평균 4.23점 향상시켰으며, Qwen3-8B의 말레이어에서는 MCLASH 최고 12.94점 향상을 기록했다. 나아가 MET-D가 모국어 추론을 평균 62.13점 늘리며, 유익한 근거가 문화마다 체계적으로 다르다는 것도 밝혔다. 이 기여들은 문화에 부합하고 이론에 근거한 다국어 도덕추론으로 가는 길을 연다.
- 문화특수적 도덕직관을 담은 신규 벤치마크 MCLASH와, 이론기반 근거선택+모국어추론의 2단계 기법 MET로 다국어 도덕추론 공백 해결
- 외부감독 없는 자기증류 MET-D가 세 모델 모두에서 매크로-F1 개선(말레이어 MCLASH +12.94점), 모국어추론도 평균 62.13점 향상
multilingual moral reasoningtheory-groundedself-distillation원문 →
CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation
CtrlVTON: 시각적 인스턴스 프롬프트 분할을 통한 제어 가능한 가상피팅
연구진: 소속 확인 어려움 (저자명상 한국 소속 가능성) · 교신저자 Sungjoon Park (저자 4인)
쉽게 말하면: 옷을 가상으로 입혀보는 기술은 많이 좋아졌지만 "헐렁하게" "안으로 넣어서" 같은 착용 방식은 사용자가 고를 수 없었다. 이 연구는 옷 사진 한 장에서 "그 옷 하나"만 정확히 짚어내는 기술(VIP-SAM)을 만들어, 크기·스타일·위치까지 사용자가 제어할 수 있는 가상피팅을 구현했다.
도식 · 인스턴스 분할과 이미지편집 재정의로 착용방식까지 제어
가상피팅, 착용방식(크기·스타일·
신체위치)에 대한 사용자 제어 부재
▶
VIP-SAM: 옷 평면이미지로 착용사진 속
동일 인스턴스만 분할(인스턴스수준 과제)
▶
CtrlVTON: 착용을 이미지편집 문제로 재정의
분할마스크를 배치제어 신호로 추가
▶
상용 편집시스템과 의류충실도 대등
사용자 지정 배치 반영도는 압도적 우위
- 배경: 가상피팅은 사실적 착용엔 진전했으나 크기·스타일·신체위 배치 등 착용방식 제어가 카테고리수준 분할의 한계로 부재.
- VIP-SAM: 옷 평면이미지에서 실제 착용사진 속 "그 옷 인스턴스"만 분할하는 인스턴스수준 과제를 정의·해결.
- CtrlVTON: 착용을 이미지편집 문제로 재정의, VIP-SAM의 분할마스크를 스타일·크기·공간배치의 픽셀단위 제어신호로 활용.
- 결과: 최강 상용 편집시스템과 의류충실도는 대등하나, 사용자 지정 레이아웃 반영 충실도에서는 훨씬 우수.
가상피팅(VTO)은 대상 인물에게 의류를 사실적으로 입히는 데 상당한 진전을 이뤘지만, 대부분의 시스템은 옷을 어떻게 착용할지, 즉 크기(헐렁함 또는 맞음), 스타일(안으로 넣음 또는 꺼냄, 열림 또는 닫힘), 신체 위 공간배치에 대한 사용자 제어권을 거의 주지 못한다. 연구진은 두 가지 상호보완적 기여로 이 공백을 해결한다. 첫째, VIP-SAM을 통해 시각적 인스턴스 프롬프트 분할(옷의 평면 이미지가 주어지면 그 옷을 입은 사람의 사진에서 해당 특정 인스턴스를 분할하는 과제)을 정의하고 해결한다. 이는 통상 연구되는 카테고리 수준 분할과는 구별되는 인스턴스 수준 과제다.
둘째, 착용을 이미지 편집 문제로 재정의하고 분할마스크를 의류배치(스타일·크기·신체 위 공간배치)에 대한 픽셀단위 제어로 추가하는 제어가능 VTO 프레임워크 CtrlVTON을 소개한다. VIP-SAM과 CtrlVTON은 각각의 과제에서 최고 수준의 성과를 달성한다. 특히 CtrlVTON은 가장 강력한 상용 편집시스템과 의류충실도에서는 대등하면서도, 사용자가 지정한 배치를 그 시스템들보다 훨씬 충실하게 따르는 이미지를 생성한다.
- 옷 평면이미지에서 "그 옷 인스턴스"만 분할하는 VIP-SAM으로 가상피팅의 카테고리수준 한계를 인스턴스수준으로 돌파
- CtrlVTON이 상용 편집시스템 대비 의류충실도는 대등, 사용자 지정 착용방식 반영은 크게 앞섬
virtual try-oninstance segmentationcontrollable editing원문 →
Latent-Identity Tuning in Text-to-Image Personalization Models
텍스트-이미지 퍼스널라이제이션 모델의 잠재 아이덴티티 튜닝
연구진: Tel Aviv University 계열 (추정) · 교신저자 Or Patashnik (저자 5인, Daniel Cohen-Or 등 포함)
쉽게 말하면: AI로 특정 인물 얼굴을 넣어 이미지를 생성할 때 조금만 잘못 건드려도 "그 사람처럼 안 보이는" 문제가 생긴다. 이 연구는 이미지 자체가 아니라 그 사람의 "정체성"이 저장된 잠재공간 표현을 직접 세밀하게 조정해서, 추가 학습 없이도 다양한 이미지를 만들어도 일관되게 같은 사람으로 보이도록 한다.
도식 · 이미지가 아닌 정체성의 잠재표현을 무학습으로 국소 편집
범용 T2I 퍼스널라이제이션
미세한 얼굴편집엔 정밀도 부족
▶
추가학습 없이 고정 인코더의
잠재공간에서 정체성별 의미방향 탐색
▶
정체성의 잠재표현 자체를 수정
토큰 부분공간별 국소편집
▶
이미지간 정체성 일관성 유지하며
국소적·세밀한 얼굴편집 검증
- 배경: 얼굴생성·편집은 미세수정도 정체성 인식을 크게 바꿔 높은 정밀도가 필요하나 범용 T2I 기반 기존 방법은 이를 충족 못함.
- 핵심 아이디어: 주어진 이미지를 직접 편집하는 대신, 사전학습·고정된 인코더의 잠재공간에서 특정 정체성의 잠재표현을 수정.
- 무학습 방식: 추가 학습 없이 고정 인코더의 기존 구조만으로 잠재적 의미방향을 식별, 잠재토큰 부분공간별로 특정 얼굴영역에 대응.
- 결과: 이미지 간 정체성 일관성을 유지하면서 국소적이고 세밀하며 의미적으로 일관된 얼굴편집이 가능함을 정성·정량적으로 검증.
얼굴을 생성·편집하는 작업은 미세한 수정도 피사체의 지각된 정체성을 크게 바꿀 수 있어 높은 정밀도를 요구한다. 그러나 범용 텍스트-이미지 모델 기반의 기존 퍼스널라이제이션·편집 방법은 세밀한 얼굴편집에 필요한 정밀도가 부족한 경우가 많다. 연구진은 텍스트-이미지 퍼스널라이제이션 모델에서 세밀한 아이덴티티 튜닝 방법을 제시한다. 주어진 이미지를 대상으로 하는 표준적 이미지편집과 달리, 아이덴티티 튜닝은 특정 정체성의 잠재표현 자체를 수정해, 편집된 동일 정체성을 일관되게 나타내는 다양한 이미지 생성을 가능케 한다.
세밀한 잠재 아이덴티티 튜닝을 위해 사전학습되고 고정된 인코더의 잠재공간을 탐구하는데, 이 접근법은 추가 학습이 필요 없다. 대신 고정 인코더의 기존 아키텍처를 활용해 잠재적 의미방향을 찾아낸다. 이 공간은 정체성의 여러 측면을 포착하는 서로 다른 역할을 하는 잠재토큰들의 집합으로 구성되며, 종종 특정 공간적 또는 의미적 얼굴영역에 대응한다. 이 공간 내에서, 그리고 선택된 토큰이 정의하는 부분공간 내에서 의미 있는 방향을 식별할 수 있음을 보이며, 이는 국소적이고 세밀하며 의미적으로 일관된 편집을 가능케 한다. 정성적·정량적 실험을 통해 이미지 간 정체성 일관성을 유지하면서 다양한 국소적 얼굴편집이 가능함을 검증했다.
- 이미지가 아닌 "정체성의 잠재표현"을 고정 인코더 안에서 직접 튜닝, 추가학습 없이 세밀한 얼굴편집에도 정체성 일관성 유지
- 잠재토큰의 부분공간별로 특정 얼굴영역에 대응하는 의미방향을 찾아내 국소적 편집을 가능케 함
text-to-image personalizationidentity preservationlatent space editing원문 →
기타 주목 논문 (HF 7~8위)
Motion4Motion: Motion Transfer Across Subjects at Inference
Motion4Motion: 추론 시점에 이뤄지는 피사체 간 모션전이
연구진: 소속 확인 어려움 · 교신저자 Gang Yu (저자 5인, ACM SIGGRAPH 2026 발표예정)
쉽게 말하면: 한 영상 속 동작을 다른 캐릭터에게 옮기려면 지금까지는 사람이나 사람과 닮은 캐릭터에 한정됐고, 미리 정해둔 뼈대구조에 맞춰 모델을 따로 학습시켜야 했다. 이 연구는 뼈대구조 학습 없이, 추론 단계에서 바로 동물 등 다양한 캐릭터로 동작을 옮길 수 있게 했다.
도식 · 골격기반 틀에서 벗어나 모션흐름 자체를 모델링
기존 모션전이, 사람형+사전정의 골격구조
의존, 골격조건부 학습으로 종간일반화 제한
▶
골격이 아닌 캐릭터의
모션흐름(motion flow) 자체를 모델링
▶
학습이 필요 없는(training-free) 방식으로
추론시점에 바로 종간 모션전이 수행
▶
광범위 실험·신규응용에서
기존 기준선을 인상적으로 능가
- 배경: 기존 모션전이는 사람형 캐릭터와 사전정의 골격구조에 의존, 골격조건부 학습이 필요해 동물 등 다양한 종으로 일반화 어렵고 골격별 라벨데이터도 부족.
- Motion4Motion: 골격이 아닌 캐릭터의 모션흐름 자체를 모델링하는 학습불필요 프레임워크로 전환.
- 의의: 종을 넘나드는 모션전이를 쉽게 만들어 사람형을 넘어선 캐릭터 애니메이션 응용범위 확장.
- 결과: 광범위한 실험과 새로운 응용사례에서 기존 기준선 대비 인상적인 성능우위 확인, ACM SIGGRAPH 2026 발표예정.
이 연구는 한 영상에서 다른 영상으로의 모션전이를 탐구하며, 이는 다양한 캐릭터 애니메이션에서 핵심적이다. 기존에는 사람과 사람형 캐릭터 사이의 비디오 모션전이가 주로 연구돼 디지털 창작에서 다양한 응용을 가능케 했다. 그러나 이런 접근법은 주요 한계에 부딪힌다. 관련 기술 파이프라인은 미리 정의된 인간 골격구조에 크게 의존하며, 이에 따라 골격조건부 모델학습이 필요하다. 이 방법들은 고유한 모션스타일을 보존하면서 서로 다른 종의 동물 등 다양한 캐릭터로 일반화하기 어렵고, 다양한 골격구조에 대한 라벨 데이터도 제한적이어서 대규모 학습이 추가로 제약된다.
이 논문에서 연구진은 골격기반 모션전이 틀에서 벗어나, 학습이 필요 없는 모션전이 프레임워크 Motion4Motion을 제안한다. Motion4Motion은 골격이 아니라 영상 속 캐릭터의 모션 흐름을 모델링해, 종을 넘나드는 모션전이를 더 쉽게 만든다. 광범위한 실험결과와 새로운 응용사례들은 이 방법이 기존 기준선들을 인상적으로 능가함을 보여준다.
- 골격구조 사전정의·조건부 학습 없이, 캐릭터의 모션흐름 자체를 모델링해 추론시점에 바로 종간 모션전이를 수행하는 학습불필요 프레임워크
- 사람형을 넘어 동물 등 다양한 캐릭터로 일반화, 기존 기준선 대비 인상적 성능우위를 실험으로 확인, SIGGRAPH 2026 발표예정
motion transfertraining-freecharacter animation원문 →
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
Xiaomi-Robotics-U0: 월드 파운데이션모델 기반 통합 체화합성
연구진: Xiaomi Robotics (제목 기준 확정) · 교신저자 Jason Li (저자 24인, 대규모 팀으로 개별 소속 미표기)
쉽게 말하면: 이미지·영상을 만드는 AI는 그림은 잘 그리지만 로봇이 실제로 쓰기엔 "여러 각도에서 봐도 앞뒤가 맞아야 하고, 로봇 몸에 맞는 물리적 제약도 지켜야 한다"는 조건이 부족했다. 샤오미는 380억개 파라미터 규모의 모델을 만들어, 이미지·영상 생성 능력을 유지하면서도 로봇에 필요한 여러시점 일관성과 로봇 몸 제약까지 만족하도록 확장했다.
도식 · 이미지·영상생성의 확장으로 설계된 체화 파운데이션모델
파운데이션 이미지·영상모델, 다중시점·기하
일관성·로봇제약 미충족+제한된 데이터 적응시 지식손실
▶
380억 파라미터 멀티모달 자기회귀모델
5개 체화과제 공동 최적화
▶
다중시점 장면생성+구조화된 체화전이
최초 지원, 사전학습 일반화 능력 보존
▶
GPT-Image-2.0 능가·World Arena 1위
pi_0.5 OOD성공률 36.9%에서 63.2%로
- 배경: 파운데이션 이미지·영상생성모델은 다중시점 일관성·기하일관성·로봇체화 제약을 만족 못해 체화시나리오 직접적용에 한계, 제한된 로봇데이터 적응은 사전학습 시각지식을 희생.
- 모델: 380억 파라미터 멀티모달 자기회귀모델, 텍스트-이미지생성·이미지편집·체화장면생성·체화전이·체화영상생성을 공동 최적화.
- 최초 달성: 여러 로봇 체화에 걸친 고품질 다중시점 장면생성, 다중시점 일관성·상호작용역학을 보존하는 구조화된 체화전이를 최초 지원.
- 성과: 체화장면생성·전이 사람평가서 GPT-Image-2.0 능가, World Arena 체화영상생성 1위, pi_0.5의 실세계 조작 OOD 성공률 36.9%에서 63.2%로 개선.
최근 파운데이션 이미지·영상 생성모델은 강력한 일반화와 제어가능성을 제공하지만, 체화 시나리오에 직접 적용하기엔 다중시점 일관성, 기하학적 일관성, 로봇 체화 제약이라는 요구사항 때문에 한계가 있다. 기존 방법은 대개 제한된 로봇 데이터로 파운데이션 모델을 적응시키는데, 이 과정에서 대규모 사전학습으로 얻은 시각적 지식을 종종 희생한다. 연구진은 통합 체화합성을 위한 380억 파라미터 규모의 멀티모달 자기회귀 모델 Xiaomi-Robotics-U0를 제시한다. 이는 체화생성을 파운데이션 이미지·영상생성의 확장으로 취급하며, 텍스트-이미지생성·이미지편집·체화장면생성·체화전이·체화영상생성을 함께 최적화한다.
이 통합 프레임워크는 사전학습된 월드 파운데이션모델의 일반화 능력을 보존하면서 체화환경에 적응시킨다. Xiaomi-Robotics-U0는 여러 로봇 체화에 걸친 고품질 다중시점 장면생성을 지원하는 최초의 모델이며, 다중시점 일관성과 상호작용 역학을 보존하면서 세밀한 편집을 위한 구조화되고 제어가능한 체화전이를 도입한 최초의 모델이다. 단일단계·순차생성 과제에서 최고 수준 성과를 달성하며, 체화장면생성·전이에 대한 사람평가에서 GPT-Image-2.0을 능가하고, 체화영상생성 부문 World Arena에서 1위를 차지했으며, 까다로운 실세계 조작과제에서 pi_0.5의 분포외(OOD) 성공률을 36.9%에서 63.2%로 개선했다. 이 결과는 파운데이션 월드모델이 체화 월드모델이자 체화지능을 위한 확장가능한 데이터엔진 역할을 모두 수행할 수 있음을 보여준다.
- 380억 파라미터 멀티모달 자기회귀 모델로 이미지·영상생성 능력을 유지하며 다중시점 일관성 등 로봇 체화제약까지 만족하는 최초 모델
- 체화장면생성·전이 사람평가서 GPT-Image-2.0 능가, 실로봇 pi_0.5 정책의 OOD 과제완수율을 36.9%에서 63.2%로 개선
embodied world modelmultimodal autoregressiverobot foundation model원문 →
arXiv 최신 (신규 3편, 2026-07-13 제출)
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
Read It Back: 사전학습 MLLM은 텍스트-이미지 생성을 위한 제로샷 보상모델이다
연구진: The University of Hong Kong 계열 (추정) · 교신저자 Hengshuang Zhao (저자 6인)
쉽게 말하면: 그림 생성 AI를 강화학습으로 개선하려면 "이 그림이 얼마나 잘 그려졌나"를 매길 보상모델이 필요한데, 보통 별도로 학습시켜야 한다. 이 연구는 이미 학습된 멀티모달 LLM에게 "이 그림을 보고 원래 프롬프트를 다시 맞혀봐"라고 시켜서, 얼마나 정확히 맞히는지를 그대로 보상점수로 쓴다. 별도 학습이나 사람이 매긴 선호도 데이터 없이 보상모델을 즉석에서 만드는 방법이다.
도식 · MLLM의 프롬프트 복원능력을 그대로 재활용하는 무학습 보상함수
이미지생성 RL엔 보상모델 필요
기존엔 별도학습·사람 선호도라벨 필요
▶
SpectraReward: MLLM에게 생성이미지 보고
원프롬프트 복원시켜 그 로그우도를 보상으로 사용
▶
Self-SpectraReward: 모델 자신의 이해브랜치가
자신의 생성브랜치 채점, 닫힌루프 자기개선
▶
4B~235B 9개 MLLM 백본·5개 OOD벤치마크서
기존 MLLM보상법 능가
- 배경: 이미지생성 강화학습엔 보상모델이 필요하나, 기존엔 MLLM에게 직접 평가·검증질문 답변을 시키거나 별도 파인튜닝이 필요.
- SpectraReward: 생성이미지 하나로 원프롬프트를 얼마나 잘 복원하는지(이미지조건부 로그우도)를 그대로 보상으로 재사용, 추가학습·선호도라벨 불필요.
- Self-SpectraReward: 통합 멀티모달모델의 이해 브랜치가 자신의 생성 브랜치를 채점하는 닫힌루프 자기개선 구조.
- 검증: 확산모델 2종·RL알고리즘 3종·MLLM 4계열(40억~2350억 파라미터) 9개 백본·OOD 벤치마크 5개로 광범위 실험.
- 결과: 두 방법 모두 생성성능 일관 개선, 기존 MLLM보상법 능가. 보상MLLM은 클수록 항상 좋지 않고, Self-SpectraReward는 훨씬 큰 외부보상모델과 대등하거나 상회.
이 논문은 사전학습된 MLLM을 이미지생성 강화학습을 위한 기성품 보상모델로 바꾸는, 학습이 필요없는 보상함수 SpectraReward를 제안한다. MLLM에게 생성된 이미지를 평가하게 하거나 분해된 검증질문에 답하게 하는 대신, SpectraReward는 생성된 이미지 하나만 보고 원래 프롬프트를 얼마나 잘 복원할 수 있는지를 이미지조건부·교사강제(teacher-forced) 순전파 한 번으로 측정한다. 이미지에 조건화된 프롬프트의 평균 로그우도를 보상으로 사용해, 선호도 라벨이나 보상모델 파인튜닝 없이 MLLM이 사전학습으로 갖춘 이미지-텍스트 정합능력을 그대로 재사용한다.
나아가 통합 멀티모달 모델을 위한 특수 사례인 Self-SpectraReward를 도입하는데, 정책모델 자신의 이해 브랜치가 자신의 생성 브랜치를 위한 보상모델 역할을 해, 외부 보상모델이나 외부지식 없이 닫힌 루프의 자기개선 프레임워크를 형성한다. 두 개 확산모델, 세 개 강화학습 알고리즘, 4개 MLLM 계열에서 40억~2350억 파라미터에 이르는 9개 보상 MLLM 백본, 5개 분포외(OOD) 텍스트-이미지 벤치마크를 아우르는 폭넓은 실험으로 검증한 결과, SpectraReward와 Self-SpectraReward 모두 생성성능을 유의미하고 일관되게 개선하며 기존 MLLM기반 보상학습법을 능가함을 보였다. 추가 분석에서는 더 큰 보상 MLLM이 항상 더 좋은 것은 아니며, Self-SpectraReward는 훨씬 큰 외부 보상모델과 맞먹거나 능가할 수 있어, 보상-정책 정합이 효과적인 이미지생성 강화학습의 핵심 요인임을 시사한다.
- 별도 보상모델 학습 없이, MLLM이 생성이미지에서 원프롬프트를 복원하는 능력(로그우도)을 그대로 보상신호로 재활용
- 자기 자신의 이해 능력으로 자신의 생성 능력을 채점하는 Self-SpectraReward는 훨씬 큰 외부 보상모델과 맞먹는 성능
reward modeltext-to-image RLMLLM원문 →
Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data
리퀀셜 코딩: 자기생성 학습데이터로 모델압축의 한계를 넓히다
연구진: New York University 계열 (추정) · 교신저자 Andrew Gordon Wilson (저자 5인)
쉽게 말하면: AI모델이 "똑똑하다"는 건 데이터를 짧게 압축해 설명할 수 있다는 것과 비슷하다. 그런데 기존 압축량 측정법은 모델이 클수록 코드가 길어지거나(양자화), 데이터가 복잡할수록 코드가 길어지는(프리퀀셜 코딩) 단점이 있었다. 이 연구는 "선생님 모델"이 학생모델 스스로의 예측분포에서 학습샘플을 골라주고, 학생모델은 선생님과 의견이 갈린 지점에서만 비트를 쓰게 해서 모델 크기나 데이터 복잡도에 휘둘리지 않는 훨씬 짧은 압축코드를 만든다.
도식 · 선생님-학생 의견불일치 지점만 기록하는 새로운 압축코드
양자화는 모델크기 비례 코드증가
프리퀀셜코딩은 데이터엔트로피 비례 코드증가
▶
선생님모델이 학생모델 자신의
분포에서 학습샘플 선택
▶
선생님·학생 의견 불일치 지점에서만
비트비용 발생하는 리퀀셜 코드 생성
▶
수십억 파라미터 LLM에 최고수준
PAC-베이즈 일반화 보장 확보
- 배경: 양자화는 모델크기에 비례해 코드가 길어지고, 프리퀀셜 코딩은 데이터 엔트로피에 비례해 코드가 길어져 압축량 측정에 한계.
- 리퀀셜 코딩: 선생님모델이 학생모델 자신의 분포에서 학습샘플을 선택, 학생 코드는 그 선택만 기록해 의견 불일치 지점에서만 비트비용 발생.
- 특성: 코드길이가 파라미터 수·데이터 엔트로피와 무관, 프리퀀셜 대비 자릿수 단위로 축소되며 규모가 클수록 이점 확대.
- 발견: 손실 고정 시 더 큰 모델·앙상블이 오히려 더 작게 압축, PAC-베이즈 경계에 대입해 수십억 파라미터 LLM 최고수준 일반화 보장 확보.
- 추가 시사점: 여러 에폭 학습 시 과적합을 예측, 텍스트가 이미지보다 학습가능한 구조를 더 많이 담고 있음을 정량적으로 구분.
압축은 지능의 근본이다. 학습데이터를 짧은 코드로 표현할 수 있는 모델은 일반화를 가능케 하는 규칙성을 발견한 것이다. 거대 신경망은 파라미터 수가 시사하는 것보다 훨씬 단순한 함수를 학습했을 수 있지만, 이 단순함을 실현하는 코드를 구성하기는 어렵다. 양자화 같은 파라미터기반 방법은 모델 크기에 비례해 늘어나는 코드길이를 만들어, 파라미터가 실제로 얼마나 많은 정보를 담고 있는지에 둔감하다. 프리퀀셜 코딩은 학습궤적을 압축해 이 문제를 우회하지만, 모델이 얼마나 학습했는지와 무관하게 정확한 데이터 시퀀스 자체를 코딩해, 데이터 엔트로피가 높으면 큰 코드가 나온다.
연구진은 선생님모델이 학생모델 자신의 분포에서 뽑은 학습샘플을 선택하는 리퀀셜 코딩을 도입한다. 학생의 코드는 오직 이 선택들만 기록하며, 선생님과 학생의 의견이 갈리는 지점에서만 비트 비용이 발생한다. 그 결과 코드길이는 파라미터 수나 데이터 엔트로피와 무관해지고, 프리퀀셜 코딩 대비 자릿수 단위로 짧아지는 경우가 많으며 그 이점은 규모가 커질수록 커진다. 손실을 고정한 채 비교하면, 더 큰 모델과 앙상블이 파라미터가 더 많음에도 훨씬 작은 크기로 압축된다. PAC-베이즈 경계에 대입하면, 리퀀셜 코드는 수십억 파라미터 LLM에 대해 최고 수준의 일반화 보장을 제공하며, 오차를 0으로 가정해도 공격적인 사후훈련 양자화 기반 경계를 능가한다. 같은 코드는 모델이 여러 에폭 학습되면 점차 과적합된다는 것도 예측하며, 엔트로피가 낮은 텍스트가 엔트로피가 높은 이미지데이터보다 훨씬 많은 학습가능한 구조를 담고 있음을 보여준다.
- 선생님모델이 학생모델 분포에서 샘플을 골라주고 의견 불일치 지점만 비트로 기록해, 모델크기·데이터엔트로피에 무관한 압축코드 실현
- 수십억 파라미터 LLM에 대해 사후훈련 양자화 기반 경계를 능가하는 최고수준 PAC-베이즈 일반화 보장 제공
model compressionPAC-Bayesgeneralization bound원문 →
HASTE: A Platform for Rapid Post-Disaster Building Damage Assessment
HASTE: 재해 발생 직후 건물피해를 신속 평가하는 플랫폼
연구진: Microsoft AI for Good Research Lab (추정) · 교신저자 Juan M. Lavista Ferres (저자 11인)
쉽게 말하면: 지진이나 홍수 같은 큰 재난이 나면 몇 시간 안에 "어느 건물이 부서졌는지" 지도가 필요하다. 그런데 기존 AI모델들은 재난 전후 사진이 정확히 짝지어져 있고 비슷한 과거 사례로 미리 학습돼 있어야 하는데, 새로 터진 재난 첫날엔 둘 다 없는 경우가 많다. 마이크로소프트가 만든 HASTE는 AI 전문가가 아니어도 재난 직후 위성사진만으로 건물별 피해지도를 몇 분 안에 만들 수 있는 노코드 웹 플랫폼이다.
도식 · 라벨링 방식 두 가지를 하나의 인터페이스로 통합한 신속 대응 플랫폼
신규 재난 첫날엔 재난전후 정합사진·
유사 과거학습셋 모두 부재
▶
HASTE: 소수 다각형 라벨로 장면별
소형분할모델 즉석학습 또는 임베딩+로지스틱회귀
▶
건물 외곽선(footprint) 단위로
픽셀출력 결합, 브라우저 내 실시간 처리
▶
xBD 실험서 라벨 20분의1로
ResNet-50급 성능, 실제 재난대응 30건+ 지원
- 배경: 신규 재난 발생 직후엔 재난전후 정합이미지·유사 과거학습셋이 대개 없어 공개벤치마크 최고성능 모델을 바로 쓰기 어려움.
- 방법1: 분석가가 재난후 장면에 다각형 라벨을 달면 그 장면 하나로 소형 분할모델을 학습, 전체 이미지에 실행 후 기존 건물외곽선에 결합.
- 방법2: 모든 건물외곽선을 사전학습 비전모델로 임베딩, 소수 라벨만으로 브라우저 내 로지스틱회귀를 적합해 나머지를 몇 초 만에 채점.
- 검증: xBD 데이터셋 예비실험에서 파운데이션모델 임베딩이 라벨 20분의1로 완전지도학습 ResNet-50 기준선과 동등한 피해판별 성능.
- 실적: 2023년 이후 지진·허리케인·사이클론·홍수·산불·토네이도 등 30건 이상의 실제 재난대응 지원, 오픈소스 공개(github.com/microsoft/haste).
대형 재난이 발생하면 대응인력은 몇 시간 안에 어떤 건물이 피해를 입었는지 지도가 필요하다. 공개 벤치마크에서 좋은 성능을 내는 모델들은 재난 전후 사진이 정확히 짝지어져 있고 유사한 과거 재난에서 뽑은 학습셋이 있다고 가정하지만, 새로운 재난 첫날에는 둘 다 대개 구할 수 없다. 연구진은 머신러닝 엔지니어가 아닌 분석가도 재난 후 위성사진만으로 건물별 피해지도를 만들 수 있게 하는 노코드 웹 플랫폼 HASTE(High-speed Assessment and Satellite Tracking for Emergencies)를 제시한다. HASTE는 하나의 인터페이스를 공유하는 두 가지 방법을 구현한다.
첫째는 사용자가 재난 후 장면 위에 다각형으로 라벨을 달면, 그 장면 하나로 작은 시맨틱 분할모델을 학습시켜 전체 이미지에 실행한 뒤 픽셀별 출력을 기존 건물 외곽선에 결합하는 방법이다. 둘째는 모든 건물 외곽선을 사전학습된 비전모델로 임베딩한 뒤, 사용자가 소수의 건물만 라벨링하면 브라우저에서 로지스틱 회귀를 적합해 나머지 장면을 몇 초 만에 채점하는 방법이다. xBD 데이터셋에 대한 예비실험을 통해, 파운데이션모델 임베딩을 건물 외곽선 단위로 풀링하면 재난 후 이미지만으로도 피해건물과 온전한 건물을 완전지도학습 ResNet-50 기준선과 맞먹는 성능으로 구분해내되 라벨은 20분의 1만 필요함을 보였다. HASTE와 그 이전 버전들은 2023년 이후 지진·허리케인·사이클론·홍수·산불·토네이도를 아우르는 30건 이상의 실제 재난대응을 지원했으며, 위성사진이 입수된 지 몇 시간에서 며칠 안에 인도주의 파트너에게 결과를 전달했다.
- ML엔지니어가 아닌 분석가도 재난 직후 위성사진만으로 건물별 피해지도를 만들 수 있는 노코드 플랫폼, 라벨 20분의1로 완전지도학습 수준 성능
- 2023년 이후 실제 재난 30건 이상에 투입된 실전 검증 사례, Microsoft AI for Good 오픈소스 공개(github.com/microsoft/haste)
disaster responsebuilding damage assessmentno-code ML platform원문 →
AI 뉴스 통합 (RSS 주요 항목, 번역·요약)
사용자 지정 RSS 10개 피드를 Python으로 직접 파싱한 뒤, 주요 항목만 선별해 한국어로 번역·요약. 각 항목 원문 링크 포함. (수집 2026-07-15 09:09, KST)
국내 (AI타임스 · THE AI)
AI타임스2026-07-14
오픈AI '코덱스' 활성 사용자 700만 돌파..."GPT-5.6 출시 효과 톡톡"
오픈AI의 AI 코딩 에이전트 '코덱스'와 '챗GPT 워크'의 활성 사용자가 700만명을 돌파했다. 코덱스는 지난 2월 정식 출시 이후 반년 만에 달성한 성과로, 최근 'GPT-5.6' 출시를 계기로 사용자 증가세가 더 가속화되는 추세다.
원문 →
AI타임스2026-07-14
"실패 원인만 골라 강화학습"...4분의 1 데이터로 상용 모델 넘은 '트레이스' 공개
AI 에이전트가 같은 실수를 반복하는 문제를 스스로 진단하고 부족한 역량만 집중 강화하는 학습시스템이 등장했다. 스탠포드대학교 연구진이 에이전트의 실패 원인을 자동 분석한 뒤 해당 역량만 훈련하는 오픈소스 프레임워크 '트레이스(TRACE)'를 공개, 4분의 1 데이터로 상용 모델 성능을 넘어섰다.
원문 →
THE AI2026-07-14
RNGD 품은 삼성SDS, "국산 NPU 첫 클라우드 서비스" 막 오른다
삼성SDS가 국내 클라우드 서비스 제공업체 중 처음으로 국산 신경망처리장치(NPU) 기반 서비스형 인프라(NPUaaS)를 선보인다. 16일 삼성 클라우드 플랫폼(SCP)에 퓨리오사AI의 2세대 NPU '레니게이드(RNGD)'를 얹은 구독형 서비스를 정식 출시한다.
원문 →
THE AI2026-07-14
"GPU보다 적은 전력, 많은 토큰" 퓨리오사AI 3세대 칩 성능 공개
강지훈 퓨리오사AI CRO가 '2026 K-NPU 테크 웨이브'에서 자사 3세대 칩의 기술적 우위와 방향성을 발표했다. 국산 NPU를 축으로 한 공공·기업 AI 인프라 전환 전략을 논의하는 자리로, 토큰당 소비전력을 GPU보다 낮추는 것이 핵심 메시지였다.
원문 →
해외 매체 (OpenAI · TechCrunch)
TechCrunch2026-07-15
애플, iOS 27 퍼블릭 베타로 새 시리 AI 전면 개방
원제: Apple opens its new Siri AI to everyone with the iOS 27 public beta
개발자 베타를 설치하지 않고도 애플의 개편된 시리를 써볼 수 있게 됐다. 애플이 화요일 iOS 27 퍼블릭 베타를 배포하며 아이폰 사용자에게 새 AI 기능 조기 접근을 제공한다고 발표했다.
원문 →
TechCrunch2026-07-15
오픈AI 첫 하드웨어 기기, 화면 없이 움직이는 스피커 형태로 알려져
원제: OpenAI's first hardware device is reportedly a screenless speaker that can move
블룸버그 보도에 따르면 오픈AI의 첫 하드웨어 기기는 스스로 움직이는 기계적 요소를 갖춘 화면 없는 스피커 형태이며, "동반자처럼 느껴지도록" 설계됐다고 전해졌다.
원문 →
TechCrunch2026-07-15
오픈AI 신규 플래그십 모델, 사용자 동의 없이 파일 삭제 경고 잇따라
원제: OpenAI's new flagship model deletes files on its own, people keep warning
다수의 소셜미디어 게시물이 GPT-5.6 '솔(Sol)' 모델이 경고 없이 파일과 데이터를 삭제했다고 주장하고 있다. 오픈AI는 지난 6월 이미 이 문제를 사실상 공지한 바 있다는 보도.
원문 →
TechCrunch2026-07-15
오픈AI, 애플의 영업비밀 소송에 "근거 없다" 반박
원제: OpenAI pushes back on Apple trade secret lawsuit
오픈AI가 애플이 제기한 영업비밀 소송에 대해 또다시 입장을 내며, 이번엔 소송 자체가 근거가 부족하다고 주장했다.
원문 →
OpenAI2026-07-14
에이전틱 시대의 AI 투자 관리법
원제: How to manage AI investments in the agentic era
기업이 에이전틱 AI 시대에 투자 대비 성과를 어떻게 관리할지 다룬 오픈AI의 기업용 가이드. 달러당 유의미한 작업량 측정, 효율성 개선, 고가치 워크플로우 확장을 핵심 방법론으로 제시한다.
원문 →
블로그·커뮤니티 (Hacker News)
Hacker News2026-07-15
커서(Cursor) IDE 제로데이, 7개월 무대응 끝에 전면공개
원제: Cursor 0day: When Full Disclosure Becomes the Only Protection Left
보안업체 마인드가드가 커서 IDE의 제로데이 취약점을 전면공개했다. 저장소 루트에 악성 'git.exe'를 심어두면 개발자가 해당 프로젝트를 열기만 해도 사용자 개입 없이 실행되는 구조로, 7개월간 커서 측이 신고에 응답하지 않아 최후 수단으로 전면공개를 택했다고 설명. HN 218점·댓글 90개.
원문 →
Hacker News2026-07-15
"27B급 모델이 아이폰에서 돌아간다"...프리즘ML '본사이 27B' 공개
원제: Bonsai 27B: A 27B-Class model that runs on a phone
프리즘ML이 Qwen3.6-27B 기반의 1비트·1.58비트(터너리) 경량모델 '본사이 27B'를 공개했다. 아이폰17프로 등 고급 모바일기기에서 초당 11토큰으로 구동되며, 터너리 버전은 풀정밀도 대비 95% 이상 성능을 유지한다. 아파치2.0 라이선스로 무료 배포. HN 377점·댓글 144개.
원문 →
Hacker News2026-07-15
"탑은 계속 높아진다"...바이브코딩이 흔드는 개발자 공유언어
원제: The Tower Keeps Rising
개발자 아민 로나허가 '바이브코딩' 확산으로 개발자간 공유 언어와 소통 방식이 흔들리는 현상, 그로 인한 잠재적 균열을 다룬 에세이. HN 310점·댓글 152개로 큰 반향을 얻었다.
원문 →