AI 기술 데일리 리포트
2026-07-08 (수, KST) · 수집: paper-fetch 스킬(HF·arXiv 공식 API) + RSS 10개 피드
구성: HF Daily Papers(2026-07-07 배치, 당일 미게재로 직전 평일 폴백) 8편 + arXiv 신규 3편 + RSS 주요 항목(번역·요약)
오늘의 핵심 3건
PAPER · 64
OmniOpt (현대 옵티마이저 통합분류체계)
소속 미표기
100종 넘는 옵티마이저를 5단계 메타파이프라인과 LMO로 통일 표기해 언어모델 사전학습부터 이미지분류까지 교차도메인 벤치마크로 비교. HF 최다 추천(64).
MODEL · NEWS
텐센트, 'Hy3' 오픈소스 정식 출시
Tencent
2950억 매개변수 훈위안 Hy3를 오픈웨이트로 공개, 코딩 제외 검색·에이전트·장문이해 등에서 GLM-5.2와 경쟁·상회 주장(AI타임스). 오늘 arXiv 신규 논문 CompactionRL이 GLM-5.2 학습 파이프라인에 실제 채택된 사례와 겹쳐, 중국발 오픈웨이트 모델 경쟁과 학습기법 공유가 함께 가는 흐름이 보인다.
POLICY · NEWS
네이버·KAI, 방산 특화 소버린 AI 개발
네이버 · KAI
네이버·네이버클라우드가 한국항공우주산업과 손잡고 독자 방산 AI 모델 개발에 착수, 전투기 등 무기체계 제어까지 확장하는 피지컬 AI를 목표로 제시(AI타임스). 국내 소버린 AI 논의가 방위산업까지 넓어지는 사례.
도식 1. HF Daily Papers 추천(upvote) 순위 (2026-07-07 배치)
UI-MOPD (GUI 에이전트 지속학습)
62
ResearchStudio-Reel (논문→포스터·영상·블로그)
47
ResearchStudio-Idea (연구 아이디어 발상)
38
GigaWorld-1 (로봇정책 평가 월드모델)
31
Vision Pretraining (경계기반 공간지각)
30
도식 2. 오늘의 분야 분포 (전체 11편 기준)
에이전트 시스템(GUI·로봇·장기과제) 3
학습방법론(최적화·증류·검증) 3
연구자동화 도구 2
3D·비전 생성/지각 2
해석가능성·프라이버시 1
경향: 에이전트 시스템(GUI 지속학습 UI-MOPD, 로봇정책평가 GigaWorld-1, 장기과제 CompactionRL)과 학습방법론 효율화(옵티마이저 통합 OmniOpt, 약함에서강함 증류 Direct-OPD, 검증 스케일링 LLM-as-a-Verifier)가 각 3편으로 최다 - 에이전트를 더 오래·안정적으로 돌리는 문제와 그 학습을 더 싸고 검증가능하게 만드는 문제가 나란히 다뤄지고 있다. 연구 자체를 자동화하는 ResearchStudio 스위트가 2편(포스터·영상·블로그 생성 + 아이디어발상) 등장한 점도 특기할 만하다. 3D·비전 생성/지각(PixWorld, 경계기반 사전학습)이 2편, 해석가능성·프라이버시(MANCE)가 1편으로 다양성을 더한다.
HuggingFace Daily Papers (2026-07-07 배치)
OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
OmniOpt: 현대 옵티마이저의 분류체계·기하학·벤치마킹
연구진: 소속 미표기 · 교신저자 Cheng Tan (저자 12인)
쉽게 말하면: 옵티마이저(학습 알고리즘)가 100개 넘게 쏟아졌지만 서로 다른 이름과 설명 방식 때문에 비교가 어렵다. 이 논문은 모든 옵티마이저를 같은 5단계 틀과 공통 수학언어로 다시 쓰고, 언어모델 사전학습부터 이미지 분류까지 한 벤치마크에서 직접 겨루게 했다.
도식 · 통일 표기 + 이중분류체계로 옵티마이저 100여 종을 비교가능하게 정리
100여 종 옵티마이저
(이름·설명방식 제각각)
▶
5단계 메타파이프라인
+ LMO로 통일 표기
▶
메커니즘 계열 ×
목표지표 이중분류체계
▶
언어모델 사전학습~이미지분류
교차도메인 벤치마크로 트레이드오프 정리
- 배경: 옵티마이저 선택은 연산량·메모리·튜닝예산·과제다양성이 얽힌 시스템 설계 결정인데, 100종 넘는 방법이 파편화된 채 존재.
- 통일 표기: 모든 옵티마이저 업데이트를 5단계 메타파이프라인으로 취급, 대부분이 이 중 1~2단계만 관여함을 확인. 노름제약 선형최소화 오라클(LMO)로 서로 다른 옵티마이저를 하나의 언어로 통일.
- 이중분류체계: 메커니즘 계열(각 방법이 속한 그룹)과 목표지표(개선하려는 학습목표)라는 두 축으로 분류.
- 벤치마크: 대표 옵티마이저·모델규모·학습체제(언어모델 사전학습~이미지분류)를 아우르는 교차도메인 벤치마크로 각 계열의 트레이드오프를 체계적으로 분석.
대규모 모델 학습에서 옵티마이저 선택은 연산·메모리·튜닝 예산·과제 다양성이 동시에 얽히는 시스템 수준의 설계 결정이 됐지만, 100종이 넘는 방법이 파편화된 채 흩어져 있다. OmniOpt는 이런 상황을 정리하기 위한 통합 서베이 겸 벤치마크 쿡북이다. 모든 옵티마이저 업데이트를 5단계로 이뤄진 구조화된 변환(메타파이프라인)으로 취급하고, 대부분의 방법이 이 중 한두 단계에만 관여한다는 점을 보인다. 이어 노름제약 선형최소화 오라클(LMO)을 이용해 서로 다른 옵티마이저들을 하나의 수학적 언어로 통일한다.
이 두 관점을 토대로 메커니즘 계열(각 방법이 속한 그룹)과 목표지표(개선하고자 하는 측정가능한 학습목표)라는 이중분류체계를 세우고, 언어모델 사전학습부터 이미지분류까지 대표 옵티마이저·모델규모·학습체제를 아우르는 교차도메인 벤치마크에 전체 분류체계를 실제로 구현했다. 각 방법 계열을 여러 효과지표에 걸쳐 체계적으로 분석해 트레이드오프를 정리함으로써, 명시적인 메커니즘·목표 가정 아래 옵티마이저를 선택할 수 있는 실용적 좌표계를 연구커뮤니티에 제공한다.
- 100종 넘는 옵티마이저를 5단계 메타파이프라인 + LMO로 통일 표기해 비교 가능하게 만듦
- 메커니즘 계열 × 목표지표 이중분류체계를 언어모델~이미지분류 교차도메인 벤치마크로 실증
optimizer selectionbenchmarktaxonomy원문 →
UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
UI-MOPD: 지속적 GUI 에이전트 학습을 위한 다중플랫폼 온폴리시 증류
연구진: 소속 미표기 · 교신저자 Jinpeng Wang (저자 11인)
쉽게 말하면: PC용으로 잘 훈련된 화면조작 AI를 모바일에도 쓰게 학습시키면, 되레 PC에서 하던 걸 까먹어버리는 경우가 많다(파국적 망각). 이 연구는 플랫폼마다 전담 선생님 모델을 두고, 지금 어떤 플랫폼인지에 맞춰 선생님을 바꿔가며 하나의 공유 정책에 가르쳐서 이 문제를 줄인다.
도식 · 플랫폼별 교사모델 전환 증류로 파국적 망각 완화
Uni-GUI 데이터셋
(플랫폼 다양성 부족 해소)
▶
플랫폼별 교사모델
동적 선택
▶
플랫폼조건부 증류 +
행동패턴 혼합 방지
▶
OSWorld 38.2% ·
MobileWorld 12.0% 성공률
- 배경: GUI 에이전트가 단일 플랫폼 작업수행에서 크로스플랫폼 상호작용으로 확장 중이나, 고품질 크로스플랫폼 궤적 데이터가 부족하고 플랫폼별 관행 차이로 공동학습 시 행동패턴 혼합·파국적 망각이 발생.
- 데이터: 고품질 크로스플랫폼 GUI 상호작용 데이터셋 Uni-GUI 구축.
- UI-MOPD: 다중교사 온폴리시 증류를 지속학습에 최초로 결합. 현재 환경에 맞는 플랫폼별 교사를 동적으로 선택하고, 플랫폼조건부 증류로 플랫폼 특화 행동사전(prior)을 공유 정책에 전달.
- 결과: OSWorld·MobileWorld 실험에서 각각 38.2%·12.0% 성공률 달성, 크로스플랫폼 능력 유지와 신규플랫폼 적응의 균형에서 효과 입증.
최근 멀티모달 파운데이션 모델과 에이전트 시스템의 발전은 GUI 에이전트를 단일 플랫폼 작업수행에서 크로스플랫폼 상호작용으로 밀어붙이고 있다. 하지만 다중플랫폼 GUI 에이전트 구축은 여전히 쉽지 않다. 한편으로는 고품질에 실행 가능한 크로스플랫폼 상호작용 궤적 데이터가 여전히 희소하고 기존 데이터는 플랫폼 커버리지가 제한적이다. 다른 한편으로는 플랫폼마다 상호작용 관행이 크게 달라, 공동 또는 지속적 학습이 행동패턴 혼합, 플랫폼별 능력 저하, 파국적 망각으로 이어지기 쉽다.
이를 해결하기 위해 저자들은 고품질 크로스플랫폼 GUI 상호작용 데이터셋 Uni-GUI를 구축하고, 다중교사 온폴리시 증류를 GUI 에이전트 지속학습에 결합한 최초의 방법 UI-MOPD를 제안한다. UI-MOPD는 현재 환경에 맞춰 플랫폼별 교사를 동적으로 선택하고, 플랫폼조건부 증류를 통해 플랫폼 특화 행동사전을 공유 정책에 전달함으로써 기존 플랫폼의 능력을 보존하면서 신규 플랫폼에 적응할 수 있게 한다. OSWorld와 MobileWorld에서의 실험은 UI-MOPD가 각각 38.2%, 12.0%의 과제 성공률을 달성했음을 보여주며, 크로스플랫폼 능력 유지와 신규플랫폼 적응 사이 균형을 맞추는 데 있어 효과를 입증한다.
- 플랫폼별 전담 교사모델을 동적으로 골라 가르치는 "다중교사 온폴리시 증류"를 GUI 에이전트 지속학습에 첫 적용
- OSWorld 38.2%·MobileWorld 12.0% 성공률로 크로스플랫폼 능력 보존과 신규 적응 양립 확인
GUI agentscontinual learningmulti-teacher distillation원문 →
ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog
ResearchStudio-Reel: 논문에서 포스터·영상·블로그까지, 연구 확산의 마지막 단계 자동화
연구진: Microsoft Research (추정, 프로젝트 링크 aka.ms/ResearchStudio) · 교신저자 Yan Lu (저자 20인)
쉽게 말하면: 논문 하나 나오면 포스터·발표영상·블로그까지 따로따로 처음부터 다시 만들어야 했다. 이 연구는 논문을 딱 한 번만 추출해두고 그 재료를 포스터·영상·블로그가 공유해 쓰게 만들어 세 결과물의 내용이 서로 어긋나지 않게 하고, PPT·워드로 다시 열어 고칠 수 있게 했다.
도식 · 1회 추출한 재료를 3개 생성기가 공유해 사실관계 일관성 확보
논문 원본
(텍스트+그림+수치)
▶
Paper2Assets
공유 추출기(1회 추출)
▶
3개 생성기: Paper2Poster ·
Paper2Video · Paper2Blog
▶
Paper2Reel HTML 뷰어
(구간 클릭시 영상·슬라이드·자막·블로그 동기 이동)
- 배경: 논문을 포스터·발표영상·블로그로 바꾸는 "마지막 단계"는 여전히 수작업. 기존 자동화는 산출물마다 논문을 처음부터 다시 추출하고, PPT·워드로 재편집 불가능한 일방향 렌더만 내놓으며, 품질 기준도 정체된 VLM 선호점수에 그침.
- 구조: 하나의 상류 추출기(Paper2Assets)를 여러 다운스트림 생성기가 공유하는 "스킬 조합" 방식. 확정적 요소를 측정형 채움 루프로 감싸고, 통과·실패가 명확한 렌더 게이트로 품질을 검증.
- 5개 스킬: 공유 추출기 Paper2Assets, 편집가능 생성기 3종(Paper2Poster·Paper2Video·Paper2Blog), 상호작용형 통합계층 Paper2Reel(구간별 클릭으로 영상·슬라이드·자막·블로그를 동시 이동).
- 결과: Paper2Poster 벤치마크에서 미학·정보 하위기준 전 항목 선두, 저자 본인 포스터의 미학성마저 상회(전체 84~93% 논문에서 우세). 편집가능한 3대 산출물을 모두 내놓는 유일한 파이프라인.
연구 확산, 즉 논문을 포스터와 발표 영상, 블로그 포스트로 바꾸는 작업은 여전히 수작업 "마지막 1마일"로 남아있다. 기존 자동화는 각 산출물을 따로 다뤄 매번 논문을 처음부터 다시 추출하고, 저자가 파워포인트나 워드로 다시 열 수 없는 일방향 렌더만 내놓는 경우가 많으며, 정체된 VLM(비전언어모델) 선호점수라는 무른 기준에 품질을 맡겨 핵심 내용이 비어보이는 문제를 겪는다. 저자들은 이 마지막 1마일을 스킬의 조합, 즉 하나의 상류 추출기를 공유하고 확정적 요소를 측정형 채움 루프로 감싸며 통과·실패가 명확한 렌더 게이트로 마무리되는 얇고 에이전트가 읽을 수 있는 계약으로 구성하는 것이 최선이라 주장한다.
이를 ResearchStudio-Reel로 구체화했다. Claude Code와 Codex 기반 5개 스킬이 하나의 공유 추출기(Paper2Assets), 세 개의 편집가능 생성기(Paper2Poster·Paper2Video·Paper2Blog), 하나의 상호작용형 통합계층(Paper2Reel)으로 조직된다. Paper2Assets는 각 논문을 한 번만 추출해 모든 다운스트림 스킬이 재사용할 수 있는 공유 번들로 만든다. 세 생성기는 사실관계가 일관되며 파워포인트·워드로 왕복 편집 가능한, 인쇄 품질 포스터·동기화된 발표 영상·이중언어 블로그를 만든다. Paper2Reel은 이 셋을 하나의 독립형 HTML 뷰어로 묶어, 구간별 클릭만으로 영상·슬라이드·자막·블로그가 대응 내용으로 함께 이동하게 한다. Paper2Poster 벤치마크에서 이 포스터는 기존 자동화 시스템과 최신 단일추론 LLM 모두를 상대로 미학·정보 하위기준 전 항목에서 앞섰고, 두 개의 별도 VLM 심사 기준으로도 저자 본인 포스터의 미학성을 상회해 전체 논문의 84~93%에서 우세했다.
- 논문을 1회만 추출해 포스터·영상·블로그가 공유하는 구조로, 세 결과물 간 내용 불일치 문제를 근본 해결
- 편집가능한(PPT·워드 재편집 가능) 3대 산출물을 모두 내놓는 유일한 파이프라인, Paper2Poster 벤치마크 미학·정보 전항목 선두
research disseminationautomated artifact generationClaude Code skills원문 →
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
PixWorld: 픽셀 공간에서 통합한 3D 장면 생성과 복원
연구진: 소속 미표기 · 교신저자 Jia-Wang Bian (저자 6인)
쉽게 말하면: 3D 복원(있는 걸 보이는 그대로 재현)과 3D 생성(없는 걸 새로 만들기)은 그동안 완전히 다른 두 팀처럼 따로 다뤄졌다. 이 연구는 둘 다 "눈에 보이는 픽셀" 기준으로 확산모델을 학습시켜 하나의 모델이 두 역할을 다 하게 만들었다.
도식 · 픽셀공간 확산 하나로 3D 복원·생성을 통합
3D 복원(픽셀 회귀) +
3D 생성(잠재공간 확산) 이원화
▶
픽셀공간 통합 확산
(VAE·RAE 불필요)
▶
렌더링 이미지에 직접 확산 지도
+ 기하인지 손실 추가
▶
복원 SOTA급 유지 +
생성 성능 종전 잠재공간 방식 상회
- 배경: 3D 복원은 픽셀기반 회귀, 3D 생성은 잠재확산이라는 서로 다른 패러다임으로 다뤄짐. 최근 잠재공간 통합 시도는 확산 목표가 실제 3D 표현이 아닌 잠재특징에 정의되고, 사전학습 VAE·RAE가 필요하며 잠재인코딩으로 정보손실을 겪는 한계.
- PixWorld: 두 과제를 픽셀공간 확산이라는 하나의 패러다임으로 재정식화. 렌더링된 이미지에 직접 확산을 지도해 위 한계를 제거하고 최적화를 3D 장면 충실도와 정렬.
- 추가 손실: 2D 이미지수준에 그쳐 3D 기하 인지가 없는 광도·지각 지도를 넘어, 사전학습 3D 파운데이션 모델의 기하인지 특징공간에서 렌더링뷰와 정답을 정렬하는 기하지각 손실을 추가.
- 결과: 기존 잠재공간 생성 방법을 일관되게 상회하고 최신 복원 방법과 대등한 성능, 통합 픽셀공간 접근의 우수성을 입증.
3D 복원과 생성은 통상 서로 다른 패러다임으로 다뤄진다. 복원은 픽셀기반 회귀로, 생성은 잠재확산으로 처리되는 식이다. 최근 연구들이 이 둘을 잠재공간에서 통합하려 시도했지만 눈에 띄는 단점이 있다. 확산 목표가 근본 3D 표현이 아니라 잠재특징 위에 정의되고, 두 갈래 모두 사전학습된 변분 오토인코더(VAE)나 표현 오토인코더(RAE)를 필요로 하면서 잠재 인코딩이 초래하는 정보 손실을 겪는다는 점이다.
이 논문에서 저자들은 두 과제를 통합 픽셀공간 확산 패러다임 아래 재정식화하고 PixWorld를 소개한다. 3D 복원과 생성을 함께 다루는 단일 모델이다. 렌더링된 이미지에 직접 확산을 지도함으로써 PixWorld는 위 한계를 제거하고 최적화를 3D 장면 충실도와 정렬시킨다. 2D 이미지 수준에서 작동해 3D 기하 인지가 없는 광도·지각 지도를 넘어, 사전학습된 3D 파운데이션 모델의 기하 인지 특징공간에서 렌더링된 뷰를 정답과 정렬하는 기하지각 손실을 추가로 도입해 3D 구조적 지도를 제공한다. PixWorld는 기존 잠재공간 생성 방법을 일관되게 상회하고 최신 복원 방법과 대등한 성능을 내, 통합 픽셀공간 접근법의 우수성을 입증한다.
- 3D 복원(픽셀회귀)과 생성(잠재확산)이라는 이원화된 패러다임을 픽셀공간 확산 하나로 통합, VAE·RAE 불필요
- 사전학습 3D 파운데이션 모델 특징공간에서 정렬하는 기하지각 손실로 3D 구조 지도 추가, 생성·복원 모두에서 경쟁력 확보
3D reconstruction3D generationpixel-space diffusion원문 →
ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes
ResearchStudio-Idea: ML 학회 결과 기반 근거중심 연구 아이디어 발상 스킬 스위트
연구진: 소속 미표기 · 교신저자 Yap Kim Hui (저자 11인)
쉽게 말하면: 아이디어를 그냥 뱉어내는 건 LLM도 잘하지만, 진짜 쓸만한 연구 아이디어가 되려면 기존 문헌에 근거를 두고, 진짜 병목을 짚고, 비슷한 시도와 차별화하고, 위험까지 따져야 한다. 이 연구는 2021~2025년 ICLR·ICML·NeurIPS 논문 1947편의 채택·거절 패턴을 분석해 "잘 되는 아이디어 발상 패턴" 15개를 뽑아내고, 이를 실제 아이디어 카드로 자동 생성한다.
도식 · 학회 결과 분석으로 뽑은 발상패턴을 근거기반 제안으로 변환
ICLR·ICML·NeurIPS
2021~2025 논문 1947편
▶
31개 세부패턴 →
15개 재사용 발상패턴 정제
▶
Paper-Search·Scoop-Check·
IdeaSpark 3종 스킬 결합
▶
근거기반·선행연구충돌 점검까지
마친 추적가능한 연구제안
- 배경: LLM 덕에 연구 아이디어 발상 자체는 쉬워졌지만, 좋은 아이디어로 발전시키려면 문헌에 근거를 두고 진짜 병목을 짚고 기존 해법과 차별화하고 위험을 평가하는 과정이 더 필요.
- 데이터 분석: ICLR·ICML·NeurIPS 2021~2025년 1947편(Oral, 고피인용 부분집합, 거절논문 포함) 분석으로 반복되는 31개 발상 하위패턴 발견, 15개 재사용 가능한 발상패턴으로 통합.
- 3종 스킬: 독자적 다중소스 문헌검색 Paper-Search, 참신성 주장을 위한 선행연구 충돌 점검기 Scoop-Check, 근거수집·패턴기반생성·충돌검색·감사·아이디어카드 렌더링을 하나로 묶은 종단형 IdeaSpark.
- 결과: 블라인드 자동심사에서 스킬없음·범용스킬 기준선보다 일관되게 더 강한 제안 생성, 참신성도 경쟁력 유지.
대형언어모델 덕분에 연구 아이디어 발상은 점점 더 손쉬워지고 있지만, 효과적인 아이디어 발전은 후보 방향을 그저 만들어내는 것 이상을 요구한다. 연구자는 문제를 현재 문헌에 근거지우고, 의미있는 병목을 짚어내고, 기존 해법과 차별화하고, 실행에 들어가기 전 위험을 평가해야 한다. 저자들은 이런 연구 발상의 첫 단계를 위한 재사용 가능한 스킬 스위트 ResearchStudio-Idea를 제시한다. 독자적 다중소스 문헌검색 스킬 Paper-Search, 참신성 주장을 위한 독자적 선행연구 충돌 점검기 Scoop-Check, 근거수집·패턴기반생성·충돌검색·감사·아이디어카드 렌더링을 하나의 워크플로로 결합하는 종단형 스킬 IdeaSpark로 구성된다.
IdeaSpark는 2021~2025년 ICLR·ICML·NeurIPS에서 수집한 1947편의 머신러닝 학회 논문(Oral 논문, 별도 추적되는 고피인용 부분집합, 거절된 제출물 포함) 말뭉치로부터 구축됐다. 이 결과들의 분석은 반복되는 31개 발상 하위패턴을 드러내고, 이를 15개의 재사용 가능한 발상패턴으로 통합했다. 각 패턴은 연구맥락·병목유형·차별화전략·뒷받침 선례·흔한 실패양상을 담은 구조화된 카드로 조작화된다. 연구 문제와 근거묶음이 주어지면 IdeaSpark는 근거 준비도를 평가하고, 주변 연구맥락을 재구성하고, 미해결 병목을 식별하고, 관련 패턴을 선택하고, 하나의 후보 방향을 구체화하고, 상충할 수 있는 선행연구를 검색하고, 결과정보 기반 감사를 수행한다. 블라인드 자동심사 평가에서 IdeaSpark는 스킬없음·범용스킬 기준선보다 일관되게 더 강한 연구제안을 만들어내면서도 경쟁력 있는 참신성을 유지했다.
- ICLR·ICML·NeurIPS 5년치 1947편(채택·거절 포함) 분석으로 "잘 통하는 발상 패턴" 15개를 실증적으로 도출
- 문헌검색·선행연구충돌점검·아이디어카드생성을 하나로 묶어, 근거기반·추적가능한 연구제안을 자동 생성
research ideationprior-art collision checkevidence grounding원문 →
MANCE: Manifold Aware Concept Erasure
MANCE: 다양체 인지 개념 지우기
연구진: Allen Institute for AI (추정) · 교신저자 Yanai Elazar (저자 3인)
쉽게 말하면: 모델 표현에서 특정 개념(예: 성별·나이) 하나만 쏙 골라 지우려 해도, 다른 정보까지 같이 망가지기 쉽다. 이 연구는 "자연스러운 표현은 저차원의 구조화된 표면(다양체) 위에 몰려있다"고 보고, 개념을 지우는 조작을 그 표면 위로만 제한하면 나머지 정보가 덜 망가진다는 가설을 세우고 검증했다.
도식 · 다양체로 제약한 개입으로 목표 개념만 정밀 삭제
텍스트·비전 표현
(여러 개념이 상관돼 얽혀있음)
▶
다양체 제약 가설(MCH)
자연표현은 저차원 구조화 표면에 집중
▶
분류기 신호로 반복갱신 +
추정 다양체로 투영(MANCE)
▶
119개 설정(언어모델13·NLP개념3·
CelebA속성40)서 누출지표 일관 개선
- 배경: 개념 지우기는 표현에 담긴 다른 정보를 보존하면서 목표 개념만 제거하려 하지만, 표현은 지우려는 대상과 상관된 여러 개념을 함께 인코딩하는 경우가 많아 목표를 지우면 다른 정보도 손상되기 쉬움.
- 가설(MCH): 자연 표현이 구조화된 저차원 다양체에 집중돼 있다면, 개입은 그 다양체로 제한될 때 개입 중 다른 정보를 더 잘 보존한다는 다양체 제약 가설을 제안.
- MANCE: 목표 개념을 예측하는 분류기의 신호를 이용해 표현을 반복 갱신. 자연 입력에서 얻은 표현으로 다양체를 추정한 뒤, 개념제거 업데이트를 추정 다양체로 투영.
- 결과: 텍스트·비전 아우르는 119개 설정(언어모델 13개, NLP개념 3종, CelebA-CLIP 속성 40종)에서 기존 방법 위에 MANCE를 얹으면 일관되게 누출 지표 개선. 폐쇄형 삭제 알고리즘을 앞세운 MANCE+·MANCE++는 비선형 개념지우기 최신 성능 달성.
개념 지우기는 표현에 인코딩된 다른 정보를 보존하면서 표현으로부터 목표 개념을 제거하는 것을 목표로 한다. 표현은 흔히 지우려는 대상과 상관된 여러 개념을 인코딩하기 때문에, 목표를 제거하면 그 개념들을 손상시킬 위험이 있어 이는 어려운 과제다. 저자들은 다양체 제약 가설(Manifold Constraint Hypothesis, MCH)을 제안한다. 자연 표현이 구조화된 저차원 다양체에 집중돼 있다면, 개입을 그 다양체로 제한할 때 개입 중 표현에 인코딩된 다른 정보를 더 잘 보존할 수 있다는 것이다.
저자들은 MCH를 새로운 개념 지우기 방법 MANCE(MANifold aware Concept Erasure)로 구체화한다. MANCE는 목표 개념을 예측하는 분류기로부터 얻는 신호를 사용해 표현에 반복적 갱신을 수행한다. 자연 입력에서 얻은 표현으로 다양체를 추정한 다음, 개념 제거 업데이트를 그 추정 다양체로 투영한다. 저자들은 텍스트와 비전에 걸친 119개 설정에서 광범위한 평가를 수행했다. 13개 언어모델, 3개 NLP 개념, 40개 CelebA-CLIP 속성이 포함된다. 기존 방법 위에 MANCE를 적용하면 일관되게 개선된 누출 결과를 보였다. 또한 폐쇄형 삭제 알고리즘을 앞세우는 MANCE+와 MANCE++를 도입하는데, 이는 매칭된 전체공간 업데이트 대비 더 나은 누출-외과적정밀성 트레이드오프를 달성한다. 최고 성능 방법인 MANCE++는 비선형 개념 지우기에서 최신(SOTA) 결과를 달성한다.
- "자연 표현은 저차원 구조화 다양체에 집중된다"는 다양체 제약 가설(MCH)을 제안하고 개념지우기에 실제 적용
- 언어모델13종·NLP개념3종·CelebA속성40종 등 119개 설정에서 검증, MANCE++는 비선형 개념지우기 SOTA 달성
concept erasuremanifold constraint hypothesisinterpretability원문 →
기타 주목 논문 (HF 7~8위)
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
GigaWorld-1: 로봇 정책 평가를 위한 월드모델 구축 로드맵
연구진: 소속 미표기 · 교신저자 Zheng Zhu (저자 27인)
쉽게 말하면: 로봇 정책이 진짜 잘 작동하는지 확인하려면 실제 로봇으로 느리고 비싼 실험을 반복해야 한다. 이 연구는 "영상으로 미리 시뮬레이션해서 평가하는" 월드모델이 얼마나 믿을만한지 32만건 넘는 시뮬레이션과 실제 로봇 실행을 짝지어 대규모로 검증했다.
도식 · 실로봇 실행과 매칭한 대규모 분석으로 정책평가용 월드모델 설계원칙 도출
실로봇 원격조작 데이터 +
정책 롤아웃(다양한 조작과제)
▶
WMBench: 비디오월드모델 7종×
행동표현 4종 교차비교
▶
32만4천+ 시뮬레이션 롤아웃
vs 실로봇 실행 매칭 분석
▶
GigaWorld-1: 정책평가 특화 월드모델
+ 코드·모델·데이터 전면공개
- 배경: 로봇 파운데이션 모델 평가는 실물 로봇의 느리고 값비싼 반복 실행이 필요해 병목이 됨. 언어모델처럼 디지털 벤치마크로 빠르게 평가할 대안으로 월드모델이 대리 평가자로 주목받지만, 정책평가에 신뢰할만한 월드모델의 핵심 속성은 불분명했음.
- WMBench: 실로봇 원격조작 데이터와 매칭된 정책 롤아웃으로 구성된 벤치마크. 모델계열·행동인코딩·롤아웃호라이즌·평가지표를 통제비교 가능하게 함.
- 대규모 분석: 비디오월드모델 7종, 행동표현방식 4종, 32만4000건 이상의 시뮬레이션 롤아웃(실로봇 실행과 매칭)을 분석. CVPR 2026 GigaBrain 챌린지의 대규모 커뮤니티 제출물, 정제된 합성궤적, 1만2000시간 넘는 학습영상까지 더해 분석 심화.
- 결과: 평가자 품질은 단기 시각적 사실성보다 장기·행동충실 롤아웃 일관성이 좌우, 사전학습 이득은 데이터규모뿐 아니라 일반 세계지식과 로봇특화 제어가능성의 균형에서 비롯, 행동인코딩·메모리설계·평가중심 사후학습 등 아키텍처 선택이 실로봇 행동과의 정합을 크게 좌우함을 확인.
체화된 로봇 파운데이션 모델을 평가하는 일은 중요한 병목으로 남아있다. 언어모델은 디지털 벤치마크로 효율적으로 평가되는 반면, 로봇 정책은 하드웨어와 인간 감독에 제약되는 느리고 값비싼 실세계 롤아웃을 필요로 하며, 이 때문에 월드모델을 대리 정책평가자로 쓰려는 관심이 커졌다. 그러나 월드모델을 정책평가에 신뢰할만하게 만드는 핵심 속성은 여전히 제대로 이해되지 않았다. 이 논문은 로봇 정책평가를 위한 월드모델에 대한 체계적 연구를 제시하며, 실로봇 원격조작 데이터와 매칭된 정책 롤아웃으로 구성돼 모델계열·행동인코딩·롤아웃호라이즌·평가지표에 걸친 통제된 비교를 가능케 하는 벤치마크 WMBench를 소개한다.
WMBench를 사용해 저자들은 비디오 월드모델 7종, 행동표현방식 4종, 실로봇 실행과 짝지어진 32만4000건 이상의 시뮬레이션 정책 롤아웃을 분석하며, 여기에 CVPR 2026 GigaBrain 챌린지의 대규모 커뮤니티 제출물, 정제된 합성궤적, 1만2000시간을 넘는 학습영상으로 분석을 더욱 풍부하게 했다. 실험은 세 가지 핵심 통찰을 제공한다. 평가자 품질은 단기 시각적 사실성보다는 장기·행동충실 롤아웃 일관성이 좌우한다는 것, 사전학습 이득은 데이터 규모뿐 아니라 일반 세계지식과 로봇 특화 제어가능성 사이의 균형에서 비롯된다는 것, 행동인코딩·메모리설계·평가중심 사후학습을 포함한 아키텍처 선택이 실세계 로봇 행동과의 정합을 강하게 좌우한다는 것이다. 이 결과를 토대로 저자들은 실용적 설계 로드맵을 도출하고 이를 정책평가에 특별히 최적화된 월드모델 GigaWorld-1로 구현했으며, 체화된 파운데이션 모델을 위한 확장가능한 평가 연구를 위해 코드·모델·데이터셋·툴킷을 전면 공개했다.
- 실로봇 실행과 매칭한 32만4000+ 시뮬레이션 롤아웃으로 "월드모델이 정책평가 대리자로 믿을만한가"를 대규모 실증
- 평가자 품질을 좌우하는 건 단기 시각적 사실성이 아닌 장기·행동충실 일관성이라는 핵심 통찰 도출
world modelsrobot policy evaluationbenchmark원문 →
Vision Pretraining for Dense Spatial Perception
밀집 공간지각을 위한 비전 사전학습
연구진: 소속 미표기 · 교신저자 Nan Xue (저자 9인)
쉽게 말하면: 요즘 비전 AI는 "이게 뭔지"(의미) 맞추는 데는 강하지만 "정확히 어디서 끊기는지"(경계) 파악은 약하다. 이 연구는 경계선 자체를 예측하도록 미리 학습시키면, 그걸 발판 삼아 더 정밀한 공간감각(깊이 등)을 익힐 수 있다는 걸 보였다.
도식 · 경계 우선 학습을 발판으로 밀집 공간지각 확보
픽셀 관측
(구조화·정량적·실행가능한 표현 필요)
▶
마스킹된 경계 모델링
(자기지도, 서브픽셀 경계 학습)
▶
경계보유 토큰을 마스킹 타깃으로
밀집 시각토큰 학습 확장
▶
LingBot-Vision → LingBot-Depth
1.0→2.0 깊이완성 성능 향상
- 배경: 밀집 공간지각(구조화·정량적·실행가능한 표현 복원)은 물리적 지능에 필수적이지만, 현대 비전 파운데이션 모델은 의미적 불변성을 우선시하느라 세밀한 공간 이해를 희생하는 경향.
- 착안점: 경계와 형태 불연속이 기하학적 속성을 지각하는 핵심 단서라는 전제 아래, 경계중심 관점으로 비전 사전학습을 재검토.
- 마스킹된 경계 모델링: 서브픽셀 경계 표현을 동적으로 학습하는 자기지도 패러다임을 제안, 이렇게 찾아낸 경계보유 토큰을 마스킹 타깃으로 활용해 밀집 시각토큰 학습을 촉진.
- 결과: 이 프레임워크를 확장한 LingBot-Vision을 개발, DINOv3를 강력한 기준선으로 다양한 다운스트림 비전과제에서 효과 입증. LingBot-Depth 1.0에서 2.0으로의 진전을 이끌어 깊이완성 성능을 향상.
밀집 공간지각, 즉 픽셀 관측으로부터 구조화되고 정량적이며 실행 가능한 표현을 복원하는 능력은 물리적 지능에 필수적이다. 그러나 현대 비전 파운데이션 모델은 의미적 불변성을 우선시하는 경향이 있고, 이는 종종 세밀한 공간 이해를 희생시킨다. 이 연구에서 저자들은 경계와 형태 불연속이 기하학적 속성을 지각하는 데 필수적인 단서를 제공한다는 전제에서 출발해, 경계중심 관점으로 비전 사전학습을 연구한다.
구체적으로 저자들은 마스킹된 경계 모델링(masked boundary modeling)을 제안한다. 서브픽셀 경계 표현을 동적으로 학습하고, 이어서 발견된 경계보유 토큰을 마스킹 타깃으로 활용해 밀집 시각토큰 학습을 촉진하는 자기지도 패러다임이다. 이 프레임워크를 확장함으로써 저자들은 LingBot-Vision을 개발했고, DINOv3를 강력한 기준선으로 삼아 다양한 다운스트림 비전 과제 전반에서 그 효과를 입증했다. 특히 LingBot-Vision은 깊이완성을 위한 LingBot-Depth 1.0에서 2.0으로의 진전을 이끌어, 체화 인공지능의 핵심 축인 깊이추정 향상으로 이어진다. 저자들의 연구 결과는 경계 모델링이 단순한 선분 이상의 것으로, 공간적으로 구조화된 시각 표현을 학습하기 위한 확장가능한 사전학습 원리로 기능함을 보여준다.
- "경계선을 먼저 정밀하게 배우면 공간감각이 좋아진다"는 가설을 마스킹된 경계 모델링으로 구현
- DINOv3 기준선 대비 개선 확인, 깊이완성 모델을 1.0에서 2.0으로 끌어올리는 실질적 성능향상 견인
masked boundary modelingdense spatial perceptiondepth completion원문 →
arXiv 최신 (신규 3편)
LLM-as-a-Verifier: A General-Purpose Verification Framework
LLM-as-a-Verifier: 범용 검증 프레임워크
연구진: Stanford University (추정) · 교신저자 Azalia Mirhoseini (저자 9인)
쉽게 말하면: 지금까지 LLM 채점은 "맞다·틀리다" 또는 점수 하나로 뭉뚱그려 답하는 경우가 많아 애매한 경우를 잘 구분 못했다. 이 연구는 점수 하나 대신 "몇 점일 확률분포"를 계산해 훨씬 세밀하게 비교하고, 이 신호로 Claude Code 확장기능까지 만들어 에이전트가 스스로 진행상황을 점검하게 했다.
도식 · 이산점수 대신 확률적 채점으로 검증을 스케일링 축으로 전환
에이전트 과제 후보 해답
(Terminal-Bench, SWE-Bench 등)
▶
이산 점수 대신 채점토큰
로짓 분포의 기댓값 계산
▶
채점 세분화 × 반복평가 ×
기준분해 3축으로 확장
▶
Terminal-Bench V2 86.5% ·
SWE-Bench Verified 78.2% 등 SOTA
- 배경: 사전학습·사후학습·테스트시점 연산 확장이 LLM 능력 향상의 핵심 축이 되어온 가운데, 저자들은 해답의 정확성을 판별하는 능력인 "검증"을 새로운 확장축으로 지목.
- LLM-as-a-Verifier: 추가 학습 없이 에이전트 과제에 세밀한 피드백을 제공하는 범용 검증 프레임워크. 후보 해답에 이산 점수를 매기는 기존 LM 심판과 달리, 채점토큰 로짓 분포에 대한 기댓값을 계산해 연속 점수를 산출.
- 3축 확장: 이 확률적 정식화 덕분에 검증이 (1)채점 세분화 (2)반복평가 (3)기준분해라는 세 방향으로 확장 가능해짐. 채점 세분화를 키우면 정답·오답 해답 간 구분이 좋아지고, 반복평가·기준분해를 키우면 분산·복잡도 감소로 검증정확도가 추가 개선.
- 결과·응용: Terminal-Bench V2(86.5%), SWE-Bench Verified(78.2%), RoboRewardBench(87.4%), MedAgentBench(73.3%)에서 최신 성능. 과제진척도 추정 대리지표로도 활용해 Claude Code 확장기능을 구축, RL에도 밀집 피드백을 제공해 로보틱스·수학추론 벤치마크에서 SAC·GRPO의 표본효율을 개선.
사전학습, 사후학습, 테스트시점 연산의 확장은 LLM 능력을 향상시키는 핵심 패러다임으로 자리잡았다. 이 논문에서 저자들은 해답의 정확성을 판별하는 능력인 검증(verification)을 새로운 확장축으로 지목한다. 이를 구현하고 효과를 입증하기 위해 저자들은 추가 학습 없이 에이전트 과제에 세밀한 피드백을 제공하는 범용 검증 프레임워크 LLM-as-a-Verifier를 소개한다. 후보 해답에 이산 점수를 매기도록 LLM에 프롬프트하는 표준 LM 심판과 달리, LLM-as-a-Verifier는 채점 토큰 로짓의 분포에 대한 기댓값을 계산해 연속 점수를 만들어낸다.
이 확률적 정식화는 검증이 여러 차원, 즉 채점 세분화·반복평가·기준분해에 걸쳐 확장될 수 있게 한다. 특히 저자들은 채점의 세분화 정도를 키우는 것이 정답과 오답 해답 사이의 구분을 더 잘되게 해, 더 잘 보정된 비교로 이어짐을 보인다. 게다가 반복평가와 기준분해를 확장하는 것은 분산과 복잡도 감소를 통해 검증 정확도의 추가적 향상으로 일관되게 이어진다. 저자들은 나아가 검증자의 연속 점수를 이용해 후보들 가운데 최선의 해답을 고르는 비용효율적 순위 알고리즘을 소개한다. LLM-as-a-Verifier는 Terminal-Bench V2(86.5%), SWE-Bench Verified(78.2%), RoboRewardBench(87.4%), MedAgentBench(73.3%)에서 최신(SOTA) 성능을 달성한다. 검증을 넘어, 세밀한 신호는 과제 진척도를 추정하는 대리지표로도 쓰일 수 있어 저자들은 Claude Code용 확장기능을 만들어 개발자가 자신의 에이전트 시스템을 모니터링하고 개선할 수 있게 했다. 마지막으로 LLM-as-a-Verifier가 강화학습에 밀집 피드백을 제공해, 로보틱스와 수학추론 벤치마크에서 SAC와 GRPO의 표본 효율을 개선할 수 있음을 보인다.
- 이산 점수 대신 채점토큰 로짓의 기댓값을 쓰는 확률적 정식화로, 채점세분화·반복평가·기준분해 3축 확장이 모두 검증정확도 개선으로 이어짐을 실증
- Terminal-Bench V2·SWE-Bench Verified 등 4개 벤치마크 SOTA, Claude Code 확장기능으로 에이전트 진척 모니터링까지 연결
verification scalingLLM judgeagentic feedback원문 →
Weak-to-Strong Generalization via Direct On-Policy Distillation
온폴리시 직접증류를 통한 약함에서 강함으로의 일반화
연구진: 소속 미표기 · 교신저자 Hao Zhou (저자 10인)
쉽게 말하면: 큰 모델을 강화학습으로 직접 훈련시키려면 롤아웃(시도)을 많이 뽑아야 해서 비싸다. 이 연구는 작고 저렴한 모델로 먼저 강화학습을 돌린 뒤 "그 학습이 모델을 어느 방향으로 바꿨는지"라는 신호만 뽑아 훨씬 큰 모델에게 그대로 전달해, 큰 모델을 직접 강화학습시키지 않고도 성능을 끌어올렸다.
도식 · 소형모델 RL의 "정책 변화량"만 뽑아 대형모델에 전달
소형모델 RL 학습완료(교사) +
RL 이전 원본 체크포인트
▶
post-RL vs pre-RL 로그비율
= 학생용 조밀한 암묵보상
▶
Direct-OPD: 강한 학생모델
자신의 온폴리시 상태에 신호 적용
▶
Qwen3-1.7B, AIME 2024서
48.3%→62.4% (A100 8장, 4시간)
- 배경: 검증가능 보상 강화학습(RLVR)은 언어모델 추론 향상에 강력하지만, 매번 새 강력모델이 나올 때마다 반복하기엔 비용이 큼. 목표모델이 학습 중 많은 롤아웃을 생성해야 하기 때문. 모델이 커질수록 사후학습 자체가 병목이 됨.
- 대안: 롤아웃이 저렴한 소형모델에서 먼저 RL을 돌린 뒤, 그 RL이 학습한 것을 재활용해 더 강한 목표모델을 개선하는 약함에서 강함으로(weak-to-strong)의 대안 제시. RL 이후 소형교사를 그대로 증류하는 건 부족 - 교사의 최종 정책이 RL 이득과 소형모델의 한계를 함께 뒤섞고 있기 때문.
- Direct-OPD: 교사가 유발한 정책 변화 자체를 전달. post-RL 교사와 RL 이전 자기 자신(참조모델)을 비교해 그 로그비율을 학생을 위한 조밀한 암묵보상으로 취급. 이 신호를 더 강한 학생모델 자신의 온폴리시 상태에 적용.
- 결과: Qwen3-1.7B를 AIME 2024에서 48.3%에서 62.4%로, A100 8장으로 단 4시간 만에 끌어올림. 스텝매칭 직접RL을 능가하고 여러 정책변화를 순차적으로 합성 가능.
검증가능 보상을 통한 강화학습(RLVR)은 언어모델 추론을 향상시키는 강력한 방법이지만, 새로운 강력 모델이 나올 때마다 이를 반복하는 것은 비용이 크다. 목표 모델이 학습 도중 많은 롤아웃을 생성해야 하기 때문이다. 모델 규모가 커질수록 사후학습 자체가 병목이 된다. 저자들은 약함에서 강함으로(weak-to-strong)의 대안을 연구한다. 롤아웃이 저렴한 더 작은 모델에서 RL을 돌린 뒤, 그 RL 실행이 학습한 것을 재사용해 더 강한 목표 모델을 개선하는 방식이다. RL 이후의 약한 교사를 직접 증류하는 것만으로는 충분하지 않은데, 교사의 최종 정책이 유용한 RL 이득과 더 작은 모델의 한계를 함께 뒤섞기 때문이다.
저자들은 대신 교사의 RL이 유발한 정책 변화 자체를 전달하는 Direct-OPD(Direct On-Policy Distillation)를 제안한다. Direct-OPD는 post-RL 교사를 자기 자신의 pre-RL 참조모델과 비교해, 그 로그비율을 학생을 위한 조밀한 암묵적 보상으로 취급한다. 쉽게 말해, 체크포인트 쌍은 RL이 약한 모델로 하여금 어떤 행동을 더 하거나 덜 하도록 만들었는지를 알려주며, Direct-OPD는 이 신호를 더 강한 학생 자신의 온폴리시 상태에 적용한다. 이는 명시적 보상모델을 학습시키거나 목표모델에 희소보상 RL을 돌리지 않고도 약한 모델의 RL 지도신호를 그대로 재사용하는 것이다. 실험적으로 Direct-OPD는 더 약한 교사를 활용해 더 강한 목표모델을 일관되게 개선한다. 특히 Qwen3-1.7B를 AIME 2024에서 48.3%에서 62.4%로, A100 8장으로 단 4시간 만에 끌어올린다. 이는 스텝매칭 직접RL을 능가하며 여러 정책 변화의 순차적 합성도 가능케 한다. 결과는 RL 결과가 모방해야 할 최종모델로서 뿐 아니라 모델 규모를 넘나드는 암묵적 보상신호로도 재사용될 수 있음을 보여준다.
- 소형모델 RL의 "최종 정책"이 아닌 "RL이 만든 정책 변화(로그비율)"만 증류해 교사의 한계까지 함께 물려받는 문제를 회피
- Qwen3-1.7B가 AIME 2024에서 48.3%→62.4%로 향상(A100 8장, 4시간), 목표모델용 별도 RL 없이 달성
weak-to-strong generalizationon-policy distillationRLVR원문 →
CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents
CompactionRL: 장기과제 에이전트를 위한 문맥압축 결합 강화학습
연구진: Tsinghua University · Zhipu AI (추정, GLM 계열 모델 연계) · 교신저자 Yuxiao Dong (저자 5인)
쉽게 말하면: 코딩 에이전트가 오래 작업하다 보면 지금까지의 대화 내용이 너무 길어져 한계를 넘어버린다. 지금까지 "예전 내용을 요약해서 압축"하는 방식은 있었지만, 그 압축 능력 자체를 강화학습으로 훈련시키는 시도는 별로 없었다. 이 연구는 "일 잘하기"와 "요약 잘하기"를 동시에 훈련시켜, 실제 코딩 벤치마크에서 성능을 끌어올렸다.
도식 · 과제수행+요약생성 공동학습으로 문맥한계를 넘는 장기과제 수행
장기과제 에이전트 궤적
(문맥 길이가 유한한 창을 초과)
▶
이전 상태를 요약 후
압축된 문맥으로 롤아웃 지속
▶
과제수행+요약생성 공동최적화
(토큰수준 손실정규화+궤적간 GAE)
▶
GLM-4.5-Air: SWE-bench 66.8%(+7.0)
· GLM-5.2 학습파이프라인에 채택
- 배경: 장기과제 에이전트형 LLM은 유한한 문맥창의 제약을 크게 받음. 과제완료 전에 확장된 상호작용 궤적이 최대 문맥 길이를 넘기 쉬움. 문맥압축(이전 상태를 요약하고 압축된 문맥 아래 롤아웃을 이어감)이 자연스러운 해법이지만, 이를 강화학습에 결합하는 연구는 충분히 탐구되지 않음.
- CompactionRL: 문맥압축을 갖춘 장기과제 에이전트형 LLM을 학습시키는 강화학습 전략. 과제수행과 요약생성을 토큰수준 손실정규화와 궤적간 일반화된 이점추정(GAE)으로 공동 최적화.
- 학습 효과: 이 설계로 LLM 에이전트가 압축된 장기과제 궤적으로부터 학습할 수 있게 됨. 공개모델 위에 CompactionRL을 학습시켜 에이전트형 코딩 과제에서 일관된 성능향상 관찰.
- 결과: 공개 GLM-4.5-Air(106B-A30B) 모델을 SWE-bench Verified Pass@1 66.8%(+7.0점), Terminal-Bench 2.0 24.5%(+3.1점)까지 끌어올림. GLM-4.7-Flash(30B-A3B) 기반에서도 각각 +5.5, +6.8점 개선. CompactionRL은 공개 GLM-5.2(750B-A40B) 모델 학습용 RL 파이프라인에 실제로 채택돼 배포됨.
장기과제 에이전트형 LLM은 유한한 문맥창에 점점 더 큰 제약을 받는다. 과제가 완료되기 전에 확장된 상호작용 궤적이 최대 문맥 길이를 초과할 수 있기 때문이다. 문맥압축은 이전 상호작용 상태를 요약하고 압축된 문맥 아래 롤아웃을 이어감으로써 자연스러운 해법을 제공하지만, 이를 강화학습에 결합하는 것은 여전히 충분히 탐구되지 않은 영역으로 남아있다. 저자들은 문맥압축을 갖춘 장기과제 에이전트형 LLM을 학습시키는 강화학습 전략 CompactionRL을 제안한다. 이 접근법은 토큰수준 손실정규화와 궤적간 일반화된 이점추정(GAE)을 이용해 과제수행과 요약생성을 공동으로 최적화한다. 이 설계는 LLM 에이전트가 압축된 장기과제 궤적으로부터 학습할 수 있게 한다.
저자들은 공개 모델 위에 CompactionRL을 학습시켜 에이전트형 코딩 과제에서 일관된 성능 향상을 관찰했다. CompactionRL은 공개 GLM-4.5-Air 모델(106B-A30B, 총 파라미터-활성 파라미터)이 SWE-bench Verified에서 Pass@1 66.8%, Terminal-Bench 2.0에서 24.5%를 달성하게 하며, 이는 각각 절대치 기준 7.0점, 3.1점 향상이다. GLM-4.7-Flash(30B-A3B) 위에 구축한 경우 CompactionRL은 Pass@1을 각각 5.5점, 6.8점 개선해 SWE-bench Verified 56.0%, Terminal-Bench 2.0 20.2%에 도달했다. 이에 따라 CompactionRL은 공개 GLM-5.2 모델(750B-A40B)을 학습시키는 강화학습 파이프라인에 실제로 배치돼 사용되고 있다.
- "일 잘하기"(과제수행)와 "요약 잘하기"(문맥압축)를 토큰수준 손실정규화로 공동 최적화, 장기과제 에이전트의 문맥한계 문제를 정면 대응
- GLM-4.5-Air SWE-bench Verified +7.0점(66.8%) 등 실측 개선, 실제 GLM-5.2(750B-A40B) 학습 파이프라인에 채택돼 배포
context compactionlong-horizon agentsreinforcement learning원문 →
AI 뉴스 통합 (RSS 주요 항목, 번역·요약)
사용자 지정 RSS 10개 피드를 Python으로 직접 파싱한 뒤, 주요 항목만 선별해 한국어로 번역·요약. 각 항목 원문 링크 포함. (수집 2026-07-08, KST)
국내 (AI타임스 · THE AI · ZDNet Korea)
AI타임스2026-07-08
AI가 벌어준 돈, 82%는 '인프라'의 몫...모델은 11% 불과
리서치 플랫폼 엑스포넨셜 뷰(Exponential View)가 발간한 'AI 경제 현황' 보고서에 따르면, 생성 AI 경제가치 중 오픈AI·앤트로픽 등 파운데이션 모델 분야 비중은 11%에 그치고 나머지 대부분(82%)은 인프라 쪽으로 돌아간다는 분석.
원문 →
AI타임스2026-07-07
텐센트, 'Hy3' 오픈소스 정식 출시…'GLM-5.2' 절반 크기로 코딩 외 성능 압도
텐센트가 2950억 매개변수 규모 플래그십 모델 '훈위안 Hy3'를 오픈웨이트로 공개. 코딩을 제외한 검색·에이전트·장문이해 등 대부분 핵심 영역에서 중국 최고 수준 모델 GLM-5.2와 경쟁하거나 앞선다고 주장.
원문 →
AI타임스2026-07-07
네이버·KAI, 방산 특화 소버린 AI 개발…'무기 자율화' 피지컬 AI 조준
네이버·네이버클라우드가 한국항공우주산업(KAI)과 함께 독자 방산 특화 AI 모델 개발에 착수. 소프트웨어 공급을 넘어 전투기 등 무기체계를 직접 제어·운용하는 피지컬 AI 단계까지 확장이 목표.
원문 →
AI타임스2026-07-07
구글, 사용자 '렌즈·음성' 검색 기록까지 AI 학습에 쓴다
구글이 이용자가 별도로 설정을 바꾸지 않는 한, 구글 렌즈·음성검색(Search Live) 등에서 생성되는 이미지·음성 데이터를 AI 모델 학습에 활용하는 정책을 기본값으로 적용했다는 내용. 개인정보 활용 범위 확대 우려가 제기됨.
원문 →
해외 매체 (TechCrunch · MIT Tech Review)
TechCrunch2026-07-07
클로드 코워크, 모바일·웹으로 확장
원제: Claude Cowork expands to mobile and web
데스크에서 작업을 시작해 휴대폰으로 진행상황을 확인하고, 노트북을 닫은 뒤에도 나중에 결과물을 받아볼 수 있게 됐다는 내용. 코딩 에이전트 경쟁이 사무실 전반의 업무로 확장되는 흐름의 일환으로 소개됨.
원문 →
TechCrunch2026-07-07
오픈소스 AI 부상, 아직은 앤트로픽에 타격 없는 이유
원제: Why the rise of open source AI isn't hurting Anthropic … yet
오픈소스 모델의 성공이 프론티어 랩의 희생 위에서 오는 게 아니라, 같은 생애주기의 서로 다른 국면을 각각 포착하고 있다는 분석.
원문 →
TechCrunch2026-07-07
마이크로소프트도 AI 비용절감 행렬에, 자사 모델 비중 확대
원제: Microsoft joins AI cost-cutting trend by relying more on its own models
마이크로소프트가 AI 지출을 줄이며 외부 모델 대신 자체 모델 활용 비중을 높이는 실리콘밸리 최신 흐름에 합류했다는 소식.
원문 →
TechCrunch2026-07-07
디스코드, AI 모더레이션 버그로 무해한 이미지에도 오탐 정지 인정
원제: Discord admits AI moderation bug wrongfully banned users over harmless images
5월부터 계정에 영향을 준 버그로 주말에만 200명이 추가로 정지됐으며, 팀이 문제를 파악해 수정했다고 확인.
원문 →
TechCrunch2026-07-07
메타, 신규 AI 이미지 생성기 '뮤즈' 출시
원제: Meta rolls out Muse, a new AI image generator
광고, 인테리어, 창작자 활용 등 다양한 용도를 겨냥한 신규 이미지 생성 모델.
원문 →
MIT Tech Review2026-07-07
IT 리더가 AI를 확장하려면 필요한 아키텍처의 기본 요소들
원제: The foundational elements of AI architecture that IT leaders need to scale
AI 역량이 빠르게 발전하고 에이전트형 시스템으로 옮겨가면서 조직의 활용사례가 계속 늘고 있으며, 이 지속적 변화가 새로운 리스크도 함께 불러온다는 내용.
원문 →
블로그·커뮤니티 (Simon Willison · The Gradient · Hacker News)
Simon Willison2026-07-07
sqlite-utils 4.0 공개, 데이터베이스 스키마 마이그레이션 지원
원제: sqlite-utils 4.0, now with database schema migrations
해당 프로젝트의 124번째 릴리스이자 2020년 11월 3.0 이후 첫 메이저 버전. 일부 작지만 중요한 호환성 변경(breaking change)을 포함.
원문 →
Simon Willison2026-07-05
대부분 클로드 페이블이 작성한 sqlite-utils 4.0rc2 (비용 약 149.25달러)
원제: sqlite-utils 4.0rc2, mostly written by Claude Fable (for about $149.25)
몇 주 전 4.0rc1을 다룬 데 이어, Max 구독으로 클로드 페이블을 쓸 수 있는 기간이 얼마 남지 않아 4.0 정식판 완성에 활용해본 후기.
원문 →
Hacker News · 246p2026-07-08
로컬 CPU에서도 돌아가는 고품질 TTS, 코코로(Kokoro)
원제: Local, CPU-Friendly, High-Quality TTS (Text-to-Speech) with Kokoro
GPU 없이 일반 CPU에서도 자연스러운 음성합성이 가능한 경량 TTS 모델 코코로를 소개하는 글. HN에서 246포인트 획득.
원문 →
The Gradient2026-02-19 (과거 게재분)
목표지향성을 넘어서: 덕윤리적 행위성과 AI 정렬
원제: After Orthogonality: Virtue-Ethical Agency and AI Alignment
합리적 인간과 AI 모두 목표를 갖지 않아야 한다는 주장 아래, 목표지향성 중심의 정렬 논의에 덕윤리적 행위성 개념을 대안으로 제시하는 에세이. RSS 피드에 최근 게시물이 드물어 이전 게재분이 함께 수집됐음을 밝힌다.
원문 →