← 데일리 목록

AI 기술 데일리 리포트

2026-06-30 (화, KST) · 수집: paper-fetch 스킬(HF·arXiv 공식 API) + RSS 10개 피드
구성: HF Daily Papers(2026-06-30) 8편 + arXiv 신규 3편 + RSS 주요 항목(번역·요약)

오늘의 핵심 3건

VIDEO · 40

LiveEdit

HKUST (추정)

실시간 스트리밍 영상을 프레임 단위로 편집하며 배경 보존과 저지연을 동시에. R-Bench 등에서 강세.

AGENT · 38

Agents-A1

소속 미표기 (저자 50인)

파라미터가 아닌 'agent horizon'을 키워, 35B MoE 모델로 조 단위 파라미터급 성능 달성.

MODEL · NEWS

GPT-5.6 Sol 프리뷰

OpenAI

코딩·과학·사이버보안 역량을 강화한 차세대 모델 프리뷰. 가장 진보한 안전 스택과 함께 제시.

도식 1. HF Daily Papers 추천(upvote) 순위 (2026-06-30 배치)

LiveEdit (HKUST 추정)
40
Agents-A1 (35B 에이전트)
38
Trimming Long-Tail (Tailor-Bench)
29
TUA-Bench (터미널 에이전트)
25
ReFreeKV (KV 캐시 압축)
18
AsyncOPD (비동기 증류)
16
Orca (world foundation model)
11
TACO (도구 사용 RL)
11

도식 2. 오늘의 분야 분포 (전체 11편 기준)

에이전트 4 월드 모델 2 LLM 학습·효율 2 비디오 편집·생성 1 음악 생성 1 로보틱스 1

경향: 에이전트(장기 horizon 학습, 터미널·도구 사용, 계획)가 최다. 월드 모델(물리 일반화 평가, 통합 상태전이)과 학습 효율(KV 캐시, 비동기 on-policy 증류)이 뒤를 잇고, 음악 생성·로보틱스가 주제 다양성을 더함.

HuggingFace Daily Papers (2026-06-30)

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

연구진: HKUST 홍콩과기대 (추정) · 교신저자 Yue Ma (저자 4인)
쉽게 말하면: 실시간으로 들어오는 영상을 프레임 단위로 편집하되, 편집하지 않은 배경은 흔들림 없이 그대로 두고, 대화형으로 쓸 수 있을 만큼 지연을 줄이는 기술이다. 기존 스트리밍 영상 기술은 '새로 만들기'에 맞춰져 있어 '원본을 지키며 일부만 고치기'에는 바로 못 썼는데, 이를 편집용으로 풀었다.
도식 · 3단계 증류 + 마스크 캐시로 실시간 편집
스트리밍 영상
프레임 입력
▶
3단계 증류
양방향 기반모델에서
단방향 스트리밍 편집기로
▶
AR 마스크 캐시
프레임 간 영역
계산 재사용
▶
인과적 실시간 편집
배경 보존
  • 두 핵심 난제: (1) 시간이 지나도 배경·비편집 영역의 안정 유지, (2) 실시간 대화형에 필요한 저지연(low latency).
  • 기존 한계: 최근 스트리밍 영상 생성법은 합성(synthesis) 목적이라, 편집의 엄격한 보존 요건과 영역별 제어에 직접 적용 불가.
  • 3단계 증류(distillation): 강력한 양방향(bidirectional) 기반 모델의 편집 능력을 효율적 단방향(unidirectional) 스트리밍 편집기로 점진 이전해, 장기간 편집을 안정적으로 유지.
  • AR 마스크 캐시: 자기회귀(AR, autoregressive) 지향 마스크 캐시로 프레임 간 영역 관련 계산을 재사용해 중복 처리를 줄이고 추론을 가속.

스트리밍 비디오 편집은 빠르게 발전했으나, 실배포에는 두 가지가 걸림돌이다. 시간이 흐르는 동안 배경과 비편집 영역을 안정적으로 유지하는 것, 그리고 실시간 상호작용에 필요한 저지연이다. 한편 최근의 스트리밍 영상 생성법은 대개 합성을 위해 개발돼, 편집에 요구되는 엄격한 보존과 영역별 제어 때문에 그대로 쓸 수 없다. 저자들은 강한 콘텐츠 보존과 실시간 응답성을 갖춘, 인과적(causal)·프레임 단위 편집 프레임워크를 제시한다. 핵심 설계는 3단계 증류 파이프라인으로, 강력한 양방향 기반 모델의 편집 능력을 효율적 단방향 스트리밍 편집기로 점진 이전해 시각적 충실도를 해치지 않으면서 장기 편집을 안정화한다. 실시간 배포를 위해 AR 지향 마스크 캐시를 도입해 프레임 간 영역 관련 계산을 재사용함으로써 중복 연산을 크게 줄이고 추론을 가속한다.

streaming video editingdiffusiondistillation원문 →

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

연구진: 소속 미표기 · 교신저자 Yuhao Zhou (저자 50인, 대형 통합연구)
쉽게 말하면: 모델 파라미터를 무작정 키우는 대신, '에이전트가 한 번에 끌고 가는 작업의 길이(horizon)'를 키우는 데 집중했다. 그 결과 35B 모델로 조 단위 파라미터급 성능을 냈다. 비유하면 머리를 더 크게 만드는 대신 더 긴 호흡으로 끝까지 일을 처리하는 훈련을 시킨 셈이다.
도식 · agent-horizon 확장 + 3단계 학습
지식·행동·관찰·검증
연결 인프라
(평균 45K 토큰 궤적)
▶
전 도메인 SFT
+ 도메인별 teacher
▶
멀티-teacher
도메인 라우팅
on-policy 증류
▶
Agents-A1 35B MoE
6개 도메인 통합
  • 두 축의 확장: agent-horizon scaling을 (1) 장기 궤적(long-horizon trajectory) 확장과 (2) 이질적 에이전트 능력 확장으로 나눠 탐구.
  • 인프라: 외부 지식·행동·관찰·verifier 결과를 잇는 long-horizon knowledge-action 인프라로 평균 45K 토큰 길이의 에이전트 궤적 생성.
  • 3단계 레시피: 전 도메인 SFT(supervised fine-tuning)로 폭넓은 에이전트 행동을 정렬하고, 도메인별 teacher 모델로 전문성을 포착한 뒤, salient vocabulary alignment를 쓰는 멀티-teacher 도메인 라우팅 on-policy 증류로 6개 이질 도메인을 배포 가능한 단일 학생 모델로 통합.
  • 결과: 장기 에이전트 벤치마크에서 강하고 폭넓은 성능. 35B Mixture-of-Experts 구성으로 조 단위 파라미터급 성능에 도달.

저자들은 agent horizon을 확장해 조 단위 파라미터급 성능에 도달하는 35B Mixture-of-Experts(MoE) 에이전트 모델 Agents-A1을 소개한다. agent-horizon scaling을 두 관점, 즉 장기 궤적 확장과 이질적 에이전트 능력 확장에서 연구한다. 이를 위해 외부 지식·행동·관찰·verifier 결과를 연결하는 long-horizon knowledge-action 인프라를 구축해 평균 45K 토큰 길이의 에이전트 궤적을 생성한다. 이 위에서 3단계 레시피로 학습한다. 먼저 전 도메인 supervised fine-tuning으로 베이스 모델을 폭넓은 에이전트 행동에 정렬하고, 다음으로 도메인별 teacher 모델을 학습해 각 도메인의 전문성을 포착하며, 마지막으로 salient vocabulary alignment를 갖춘 멀티-teacher 도메인 라우팅 on-policy 증류를 제안해 도메인 간 지식 전이 효율을 높이고 6개 이질 도메인을 하나의 배포 가능한 학생 모델로 통합한다. Agents-A1은 장기 에이전트 벤치마크에서 강하고 폭넓은 성능을 보인다.

agentic modelMixture-of-Expertsdistillation원문 →

Trimming the Long-Tail of Visual World Modeling Evaluation

연구진: UIUC 일리노이대 어배너-섐페인 (추정) · 교신저자 Heng Ji (저자 9인)
쉽게 말하면: 영상·이미지 생성 모델은 흔한 물리 상황은 그럴듯하게 흉내 내지만, 드물거나 말이 안 되는 도구 사용 같은 상황도 물리 법칙대로 처리하는지는 의문이다. 이 연구는 '흔한 것'이 아니라 '드물고 불규칙한' 상호작용을 일부러 시켜보는 시험지(Tailor-Bench)를 만들었다.
도식 · 3개 시나리오 모드로 물리 일반화 진단
드문·불규칙
물리 상호작용
▶
Tailor-Bench
Regular / Unconventional /
Impossible 모드
▶
이미지·영상
생성 모델 평가
▶
물리 원리
내재·일반화 진단
  • 문제의식: 물리 상호작용은 long-tail 분포(흔한 것이 다수, 드문 것이 광범위). 기존 벤치마크는 흔한 상호작용에 치우쳐 모델이 물리 원리를 내재·일반화하는지 불명확.
  • Tailor-Bench: 불규칙한 물리 상호작용 시뮬레이션을 모델에 요구하는 벤치마크.
  • 3개 모드: Regular(흔한 도구-과제 쌍), Unconventional(속성 호환 대체 도구로 affordance 일반화 시험), Impossible(속성 위반 도구로 제약 인지 탐색).
  • 평가 설정: 통합 프로토콜 아래 두 가지 보완 설정으로 이미지·영상 생성 모델의 물리 추론을 체계적으로 측정.

물리 상호작용은 long-tailed 분포를 따른다. 흔하고 규칙적인 상호작용이 인간 경험과 시각 데이터를 지배하는 반면, 드물고 불규칙한 상호작용은 광범위하지만 과소 대표된다. 최근의 시각 world model(이미지·영상 생성 모델)은 기존 벤치마크에서 인상적 사실성을 보이나, 주로 흔한 물리 상호작용 시뮬레이션에 집중한다. 그렇다면 현재의 시각 world model이 물리 원리를 내재화하고 일반화하는가라는 핵심 질문이 생긴다. 저자들은 world model이 불규칙한 물리 상호작용을 시뮬레이션하도록 도전시키는 벤치마크 Tailor-Bench를 제시한다. 체계적 평가를 위해 추론을 점진적으로 어렵게 하는 세 시나리오 모드를 설계한다. Regular는 흔한 도구-과제 쌍, Unconventional은 속성 호환 대체 도구로 affordance 일반화를 시험, Impossible은 속성을 위반하는 도구로 제약 인지를 탐색한다. 아울러 통합 프로토콜 아래 두 보완 설정을 둔다.

visual world modelbenchmarkphysical reasoning원문 →

TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

연구진: Amazon (추정) · 교신저자 Belinda Zeng (저자 10인)
쉽게 말하면: 요즘 에이전트는 코딩만이 아니라 문서 편집·이메일·웹 검색 같은 일도 '터미널(명령줄)'에서 처리한다. 이 연구는 그런 범용 터미널 에이전트를, 진짜 터미널에서 과제를 실행시키고 결과로 채점하는 시험지를 만들었다.
도식 · 실행 기반 채점의 범용 터미널 벤치마크
120개 실세계 과제
(5개 과제군)
▶
실제 터미널 +
결정론적 설정 스크립트
▶
실행 기반 채점
(execution-based)
▶
범용 터미널
에이전트 능력 측정
  • 평가 공백: 범용 computer-use 벤치마크는 GUI 중심, 터미널 기반 벤치마크는 기술·프로그래밍 중심이라 범용 터미널 에이전트(TUA)를 제대로 평가 못함.
  • 구성: 5개 과제군에 걸친 120개 실세계 과제. 문서 편집·이메일 관리·실시간 웹 정보 탐색 등 일상 활동 포함.
  • 전문 워크플로우: PhD급 도메인 전문가와 공동설계한 과학·공학 과제로 전용 소프트웨어 사용을 요구해 범용성 확대.
  • 채점: 각 과제는 수작업 설계, 결정론적 설정 스크립트로 실제 터미널에서 실행되고 실행 기반(execution-based)으로 평가.

대규모 언어모델과 harness 프레임워크가 발전하며, 터미널에서 작동하는 에이전트는 코딩을 넘어 더 넓은 범용 computer-use 과제를 수행하고 있다. 그러나 기존 벤치마크는 범용 터미널 computer-use 에이전트(TUA)를 충분히 평가하지 못한다. 범용 computer-use 벤치마크는 주로 GUI를 겨냥하고, 터미널 기반 벤치마크는 역사적으로 shell에 친화적인 기술·프로그래밍 중심 워크플로우를 강조하기 때문이다. 저자들은 범용 터미널 에이전트용 벤치마크 TUA-Bench를 제시한다. 5개 과제군에 걸친 120개 실세계 과제를 담아, 문서 편집·이메일 관리·실시간 웹 정보 탐색 같은 일상 디지털 활동과 더불어 PhD급 도메인 전문가와 공동설계해 전용 소프트웨어를 요구하는 과학·공학 워크플로우를 포괄한다. 이 폭이 기존 shell 중심·도메인 한정 벤치마크와 구별된다. 각 과제는 수작업으로 설계되고, 결정론적 설정 스크립트와 함께 실제 터미널에서 실행되며 실행 기반으로 채점된다.

terminal-use agentsbenchmarkcomputer-use원문 →

ReFreeKV: Towards Threshold-Free KV Cache Compression

연구진: 난징항공항천대 NUAA (추정) · 교신저자 Piji Li (저자 9인)
쉽게 말하면: LLM이 추론할 때 쓰는 KV 캐시(과거 토큰 정보를 담는 메모리)를 줄이려면, 보통 입력마다 '얼마나 남길지' 임계값을 손으로 정해야 했다. 입력 종류가 다양하면 이게 어려운데, 이 연구는 그 임계값을 없애고 모델이 알아서 예산을 배분하게 했다.
도식 · 임계값 없는 적응적 KV 압축
임의 도메인·길이
입력
▶
threshold-free 목적함수
임계값 제약 제거
▶
적응적 예산 배분
(입력별 자동)
▶
풀캐시 성능 보존
KV 압축
  • 숨은 전제: 기존 KV 캐시 프루닝은 입력·도메인별 KV 예산 임계값을 미리 정해야 최적 성능. 이 입력 민감 설계가 약점.
  • 실세계 문제: open-domain 입력은 도메인·길이·난이도가 다양하고 임계값 선택 경계가 불명확해, 임의 입력에서 큰 성능 저하.
  • 새 목적: 임계값 제약을 걷어내고 풀캐시 성능을 유지하며 예산 배분을 적응적으로 조정하는 'threshold-free' 방법론 제안.
  • ReFreeKV: 그 목적의 첫 구현. 13개 데이터셋에 걸친 다양한 입력에서 robust함을 실험으로 확인.

LLM 추론 중 메모리 소비를 줄이기 위해 KV 캐시 프루닝 기법들이 제안됐다. 이들은 여러 데이터셋에서 무손실 메모리 절감을 달성하나, 흔히 강조되지 않는 조건에 의존한다. 최적 성능을 위해 입력·도메인별 KV 캐시 예산 임계값을 미리 정해야 한다는 점이다. 그런데 이런 입력 민감 설계는 실세계에서 크게 제약된다. open-domain 입력은 도메인·길이·난이도가 다양하고 임계값 선택의 명확한 경계가 없기 때문이다. 결과적으로 이러한 입력 민감 임계값 의존은 임의 입력에서 큰 성능 저하를 부르는 근본적 한계가 될 수 있다. 저자들은 견고한 KV 압축을 위해 임계값 제약을 제거하는 새 목적을 제안하며, 풀캐시 성능을 보존하면서 예산 배분을 적응적으로 조정하는 'threshold-free' 방법을 옹호한다. 이어 이 목적의 첫 구현인 ReFreeKV를 제안한다. 다양한 입력을 담은 13개 데이터셋에 걸친 광범위한 실험으로 그 효과를 보인다.

KV cachecompressionLLM inference원문 →

AsyncOPD: How Stale Can On-Policy Distillation Be?

연구진: 위스콘신대 매디슨 UW-Madison (추정) · 교신저자 Kangwook Lee (저자 12인)
쉽게 말하면: 모델이 자기 출력으로 학습(on-policy 증류)할 때, 출력 생성과 학습 업데이트를 분리하면 속도는 빨라지지만 '오래된(stale) 데이터'가 생긴다. 이 오래된 데이터를 얼마나 견딜 수 있는지를 처음으로 체계적으로 분석한 연구다.
도식 · 비동기 OPD의 staleness 분석
비동기 rollout
(stale 정책 데이터)
▶
KL 방향별 분석
forward vs reverse
▶
reverse-KL
견고화 기법
▶
빠르고 안정적인
on-policy 증류
  • 병목: OPD(on-policy distillation)는 LLM 후학습에 중요해지나, 추론 워크로드에서 rollout이 학습 시간을 지배하는 on-policy 시스템 병목 발생.
  • 비동기의 대가: rollout 생성과 learner 업데이트를 분리하면 병목은 완화되나 stale-policy 데이터가 생긴다. RL에선 연구됐지만 OPD에선 미탐구.
  • 첫 체계 분석: teacher 피드백을 local KL 손실로 구현하고 full-vocab teacher logit 저장이 비싸 finite teacher-score 캐시를 쓰는 실용 설정에서 staleness 효과 연구.
  • 발견: KL 방향이 stale 문제를 좌우. teacher-weighted forward KL은 stale rollout에 강건, student-weighted reverse KL은 취약. 취약한 reverse-KL 케이스용 대응책 제시.

On-policy distillation(OPD)은 student를 자기 자신의 rollout 위에서 teacher 피드백으로 학습시키며, LLM 후학습에서 점점 중요해지고 있다. 그러나 강화학습(RL)과 마찬가지로 OPD도 on-policy 시스템 병목에 직면한다. 추론 워크로드에서는 rollout이 학습 시간을 지배할 수 있기 때문이다. 비동기 학습 파이프라인은 rollout 생성과 learner 업데이트를 분리해 병목을 완화하지만, 그 과정에서 stale-policy 데이터가 생긴다. 비동기 RL의 stale 데이터는 선행 연구가 있으나 OPD에서의 효과는 미탐구로 남아 있다. 저자들은 비동기 OPD의 staleness를 처음으로 체계적으로 연구한다. teacher 피드백이 local KL 손실로 구현되고, full-vocab teacher logit을 저장·전송하기엔 비싸 finite teacher-score 캐시가 필요한 실용 설정에 초점을 둔다. 먼저 KL 방향이 stale-data 문제를 바꾼다는 점을 보인다. teacher-weighted forward KL은 stale rollout에 더 강건한 반면, student-weighted reverse KL은 취약하다. 둘째, 취약한 reverse-KL 사례에 대한 대응을 제시한다.

on-policy distillationasynchronous trainingKL divergence원문 →

기타 주목 논문 (7~8위)

Orca: The World is in Your Mind

연구진: 소속 미표기 · 교신저자 Pengwei Wang (저자 57인, 대형 통합연구) · upvote 11
쉽게 말하면: 영상·언어·행동을 각각 따로 예측하는 대신, 세계가 '한 상태에서 다음 상태로 어떻게 바뀌는지'를 하나의 잠재 공간에서 배우는 범용 world model이다. 그 공간을 텍스트·이미지·행동 등 여러 출구로 꺼내 쓴다.
도식 · Next-State-Prediction 기반 통합 잠재공간
멀티모달 세계 신호
영상 125K시간 +
이벤트 160M
▶
Next-State-Prediction
통합 상태전이 모델링
▶
무의식 학습 +
의식 학습
▶
readout: 텍스트·
이미지·체화 행동
  • 개념: next-token / next-frame / next-action을 따로 최적화하는 대신, Next-State-Prediction으로 상태 전이를 통합 모델링해 세계를 이해·예측·행동.
  • 두 학습 축: unconscious learning(연속 영상에서 조밀한 자연 상태 전이 포착) + conscious learning(언어로 기술된 이벤트·VQA 감독으로 희소·유의미 상태 전이 모델링).
  • 사전학습 데이터: 영상 125K시간 + 이벤트 주석 160M로 구성한 world-learning inventory로 통합 world latent space 학습.
  • 검증: 텍스트 생성·이미지 예측·체화 행동 생성 3개 대표 readout으로 학습된 잠재공간의 다운스트림 활용성 평가.

저자들은 범용 world foundation model의 초기 구현인 Orca를 소개한다. Orca는 멀티모달 세계 신호로부터 통합된 world latent space를 학습하고 이를 멀티모달 readout 인터페이스로 노출한다. 고립된 next-token, next-frame, next-action 예측을 최적화하는 대신, Next-State-Prediction 모델링을 중심에 두어 세계를 이해·예측하고 그에 따라 행동하는 통합 상태전이 모델링 경로를 제시한다. Orca는 두 보완 패러다임으로 학습한다. unconscious learning은 연속 영상에서 조밀한 자연 상태 전이를 포착하고, conscious learning은 언어로 기술된 이벤트와 VQA 감독으로 희소하고 유의미한 상태 전이를 모델링한다. 사전학습을 위해 125K시간 영상과 160M 이벤트 주석을 포함하는 대규모 world-learning inventory 데이터를 구축한다. 사전학습 후 Orca는 통합 world latent space를 학습하며, 텍스트 생성·이미지 예측·체화 행동 생성이라는 세 대표 readout으로 그 잠재가 다운스트림을 지원하는지 평가한다.

world foundation modelmultimodalnext-state prediction원문 →

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

연구진: 칭화대 Tsinghua University (추정) · 교신저자 Jianhua Tao (저자 8인) · upvote 11
쉽게 말하면: 멀티모달 에이전트가 이미지에 코드 도구를 써가며 추론할 때, 어떤 도구 호출이 정답에 실제로 도움이 됐는지 콕 집어 점수 매기기 어렵다. TACO는 외부 심판 없이, 도구를 썼을 때와 안 썼을 때 답이 어떻게 달라지는지로 각 호출의 가치를 스스로 매겨 학습한다.
도식 · judge 없는 도구 기여도 강화학습(GRPO 변형)
이미지 + 코드-도구
호출 추론
▶
DAPR: probe 토큰으로
도구 효과 측정
(유용 + / 오도 −)
▶
Outcome-Gated
Advantage Routing
▶
도구 기여 반영
GRPO 학습
  • 문제: 코드 연산은 유용·중복·오도(misleading) 모두 가능. 결과 보상만으론 구분 못하고, 기존 process reward는 개별 호출 귀속에 실패하거나 외부 judge 모델을 요구.
  • DAPR(Differential Answer-Probe Reward): self-supervised·judge-free 도구 기여 advantage. 추론에 삽입한 probe 토큰으로 도구 사용 유무의 예측 차이를 보고 각 호출 가치를 산정(유용 +, 오도 −, 무변화 0).
  • 재사용: 기존 answer checker만 활용하고 별도 judge 모델 불필요.
  • OGAR(Outcome-Gated Advantage Routing): 결과로 게이팅한 advantage 라우팅을 결합한 GRPO 변형으로, 두 advantage 채널을 함께 최적화.

에이전트형 멀티모달 모델은 코드로 이미지에 다양한 연산을 수행하고 반환된 view를 보며 추론하는데, 이는 세밀한 시각 질의응답에 효과적인 패러다임이다. 그러나 코드 연산은 유용할 수도, 중복일 수도, 오히려 오도(misleading)할 수도 있다. 결과만 보는 보상은 이를 정확히 구분하지 못하고, 기존 process reward는 최종 정답을 개별 도구 호출에 귀속시키지 못하거나 외부 judge 모델을 요구한다. 이를 위해 저자들은 두 결합 advantage 채널 위에 세운 코드-도구 에이전트용 GRPO 변형 TACO(Tool-Augmented Credit Optimization)를 제안한다. 첫째, Differential Answer-Probe Reward(DAPR)는 self-supervised·judge-free 도구 기여 advantage로, 각 도구 호출이 정답에 미친 효과로 그 가치를 매긴다. 모델 추론에 삽입한 probe 토큰이 도구 사용 유무에 따른 예측을 끌어내고, 결과 보상의 차이를 호출의 가치로 삼는다. 유용한 호출은 양, 오도하는 호출은 음, 아무것도 바꾸지 않는 호출은 0이다. 이는 기존 answer checker를 재사용하며 보조 judge가 필요 없다.

agentic multimodalGRPOtool use원문 →

arXiv 최신 (신규 보강, 2026-06-29~30 제출)

HF Daily Papers와 중복 제거한 arXiv 최신 제출분. upvote 신호가 없는 신규 등재라 주제 다양성(음악 생성·에이전트 계획·로보틱스) 참고용으로 3건 선별.

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

연구진: Tencent AI Lab (추정) · 교신저자 Dong Yu (저자 11인)
쉽게 말하면: 가사와 반주가 어우러진 한 곡 전체(풀렝스)를 만드는 모델이다. '보컬과 악기를 맞추는 것'과 '트랙별 디테일을 살리는 것'이 서로 상충하는데, 이를 계층(단계) 모델링으로 풀었다. 먼저 큰 그림을 잡고, 그다음 보컬·반주를 따로 다듬는다.
도식 · 계층 표현 모델링(LLM-Diffusion)
가사·프롬프트
▶
LeLM: 혼합 토큰으로
의미 계획
▶
보컬·반주 토큰
병렬 정제 + diffusion
▶
풀렝스 노래
(안정·음악성)
  • 구조적 상충: 혼합 토큰 모델링은 보컬-악기 조율은 좋으나 트랙별 디테일이 흐려지고, dual-track 예측은 음향은 좋으나 시퀀스가 길고 전역 계획이 약함.
  • 계층 모델링: LeLM이 먼저 혼합 토큰으로 의미 계획(semantic planning)을 한 뒤, 보컬·반주 토큰을 병렬 예측해 트랙별 정제.
  • 하이브리드: LLM과 Diffusion을 결합한 프레임으로 제어 가능한 풀렝스 노래 생성.
  • 후학습: progressive post-training으로 안정성과 음악성을 점진 강화.

풀렝스 노래 생성은 일관성과 음악성을 유지하고, 세밀한 보컬·반주 음향을 렌더링하며, 가사와 프롬프트를 따라야 한다. 기존 언어모델 기반 시스템은 구조적 상충에 직면한다. 혼합 토큰(mixed-token) 모델링은 보컬-악기 조율을 보존하나 트랙별 디테일을 흐리고, dual-track 예측은 음향을 개선하나 더 긴 시퀀스를 요구하며 전역 계획을 약화시킨다. 저자들은 제어 가능한 풀렝스 노래 생성을 위한 하이브리드 LLM-Diffusion 프레임워크 LeVo 2를 제시한다. LeVo 2는 이 상충을 계층 모델링으로 정식화한다. LeLM이 먼저 의미 계획을 위해 혼합 토큰을 예측한 뒤, 트랙별 정제를 위해 보컬·반주 토큰을 병렬로 예측하고, diffusion 기반 모듈이 음향을 다듬는다. 여기에 progressive post-training을 더해 안정성과 음악성을 강화한다.

song generationLLM-Diffusionaudio원문 →

Self-Evolving World Models for LLM Agent Planning

연구진: 싱가포르경영대 SMU (추정) · 교신저자 Yang Deng (저자 4인)
쉽게 말하면: LLM 에이전트가 행동하기 전에 '이렇게 하면 어떻게 될까'를 미리 예측(foresight)하게 하되, 모델 자체는 건드리지 않고 배포 중 참고하는 맥락만 스스로 고쳐가며 예측 신뢰도를 높이는 틀이다. 예측이 미덥지 않으면 걸러낸다.
도식 · 파라미터 동결, 컨텍스트만 진화
행동 전 결과
예측 필요
▶
Episodic +
Semantic Memory
▶
Selective Foresight
저신뢰 예측 필터
▶
파라미터 고정
맥락만 자기진화
  • 문제: world model은 장기 에이전트에 foresight(행동 결과 예측)를 주지만, 신뢰할 수 없는 예측은 무시·오용되거나 의사결정을 악화시킴.
  • WorldEvolver: 다운스트림 에이전트와 모든 모델 파라미터를 동결한 채 배포 시점(deployment-time) 컨텍스트만 수정하는 self-evolving world model 프레임.
  • 3모듈: Episodic Memory(실제 행동 전이를 검색 기반 시뮬레이션으로 활용), Semantic Memory(예측-관찰 불일치에서 지속적 휴리스틱 규칙 추출), Selective Foresight(통합 전 저신뢰 예측 필터링).
  • 효과: 학습 없이 배포 중 예측 품질을 점진 개선해 계획 신뢰성 향상.

world model은 장기 LLM 에이전트에 행동 결과를 실행 전에 예측하는 foresight를 부여하는 원리적 방법이다. 그러나 신뢰할 수 없는 foresight는 무시되거나 오용되고, 심지어 다운스트림 의사결정을 악화시킬 수 있다. 저자들은 다운스트림 에이전트와 모든 모델 파라미터를 동결한 채 배포 시점 컨텍스트를 수정하는 self-evolving world model 프레임워크 WorldEvolver를 제안한다. WorldEvolver는 세 모듈을 통합한다. (1) Episodic Memory는 실제 행동 전이를 검색 기반 시뮬레이션으로 활용하고, (2) Semantic Memory는 예측-관찰 불일치에서 지속적 휴리스틱 규칙을 추출하며, (3) Selective Foresight는 통합 전에 저신뢰 예측을 걸러낸다. 이로써 파라미터 갱신 없이 배포 중 예측 품질을 점진적으로 개선한다.

world modelLLM agentplanning원문 →

GROW²: Grounding Which and Where for Robot Tool Use

연구진: 싱가포르국립대 NUS (추정) · 교신저자 David Hsu (저자 3인)
쉽게 말하면: 칼이 없을 때 접시로 케이크를 자를 수 있을까? 로봇이 도구를 원래 용도 밖으로 창의적으로 쓰려면 '무엇을 도구로 쓸지(which)'와 '그 도구의 어디를 쓸지(where)'를 모두 찾아야 한다. 이 연구는 그 둘을 의미·기하 두 단계로 나눠 푼다.
도식 · open-world affordance grounding 계층 분해
자연어 과제 지시
▶
의미 수준: VLM 상식으로
도구 객체 선택(which)
▶
기하 수준: 작용
영역 localize(where)
▶
open-world
도구 사용
  • 과제: open-world affordance grounding. 정해진 범주 밖 객체를 도구로 고르고, 그 도구가 작용할 특정 영역을 localize.
  • 핵심 추상화: 객체 부분(parts)을 자연스러운 추상화로 보고, grounding을 의미(semantic)·기하(geometric) 두 수준으로 계층 분해해 데이터 무거운 end-to-end 학습을 우회.
  • 의미 수준: 비전-언어 모델(VLM)의 상식 추론으로 자연어 지시를 해석해 도구 후보 객체를 선택.
  • 기하 수준: 선택한 객체에서 작용할 영역(region of action)을 정밀 localize.

칼이 없을 때 로봇이 케이크를 자르기 위해 접시를 쓸 수 있을까? 도구 사용은 로봇 능력을 크게 확장하지만, 의도된 기능을 넘어 창의적으로 도구를 쓰려면 로봇은 open-world affordance grounding이라는 난제에 직면한다. 도구로 작동할 open-category 객체를 선택하고, 그것이 작용할 특정 영역을 localize해야 한다. 이를 위해 저자들은 GROW²(GROunding Which and Where)를 제안한다. 객체 부분(parts)을 자연스러운 추상화로 활용해 grounding 과정을 의미(semantic) 수준과 기하(geometric) 수준으로 계층 분할함으로써, 데이터가 많이 드는 end-to-end 학습의 필요를 우회한다. 의미적으로 GROW²는 비전-언어 모델(VLM)의 상식 추론을 활용해 자연어 과제 지시를 해석하고 도구가 될 객체를 선택한다.

robot tool useaffordanceVLM원문 →

AI 뉴스 통합 (RSS 주요 항목, 번역·요약)

사용자 지정 RSS 10개 피드를 Python으로 직접 파싱한 뒤, 주요 항목만 선별해 한국어로 번역·요약. 각 항목 원문 링크 포함. (수집 2026-06-30, KST)

국내 (AI타임스 · THE AI)

THE AI2026-06-30

삼성·SK, 반도체·AI에 합산 4,755조 투자…정부 '3대 메가프로젝트' 보고회

6월 29일 청와대 영빈관 '대한민국 대도약 3대 메가프로젝트 국민보고회'에서 이재용 삼성 회장이 총 2,655조 원, 최태원 SK 회장이 2,100조 원(15GW 규모 AI 데이터센터 구축 포함) 투자 계획을 발표. 양사 합산 4,755조 원 규모로, 한국을 AI·반도체 거점으로 키우려는 행보.

원문 →
AI타임스2026-06-30

오픈AI, '코덱스' 사용량 급증 오류에 '비상 상황실' 가동…한도 일괄 초기화

AI 코딩 에이전트 코덱스(Codex)의 사용 한도가 평소보다 훨씬 빨리 소진된다는 신고가 잇따르자, 오픈AI가 엔지니어로 구성된 'war room'을 가동해 원인 조사에 착수. 문제 계정의 사용 한도를 일괄 초기화하는 조치도 시행(비즈니스 인사이더).

원문 →
THE AI2026-06-30

노타, 퓨리오사AI NPU로 LG 'K-엑사원 236B' 구동 최적화

노타가 퓨리오사AI의 데이터센터용 NPU 환경에서 LG AI연구원의 약 2,360억 파라미터 초대형 모델 K-엑사원(EXAONE) 236B 최적화를 완료했다고 발표. 상황에 따라 전문가 모델을 선택적으로 쓰는 구조로, 국산 하드웨어-모델 풀스택 구동 사례.

원문 →
THE AI2026-06-30

리벨리온, 추론 최적화 기업 스퀴즈비츠 인수…'풀스택 AI'로 확장

리벨리온이 AI 추론 최적화 기업 스퀴즈비츠 지분 100%를 확보한다고 발표. 자체 NPU 하드웨어에 더해 모델이 실제 서비스로 도는 추론 서빙까지 단일 플랫폼으로 제공하는 통합 AI 인프라 기업으로 사업 영역 확장.

원문 →

해외 매체 (OpenAI · TechCrunch · MIT Tech Review)

OpenAI2026-06-26

OpenAI, 차세대 모델 'GPT-5.6 Sol' 프리뷰 공개

원제: Previewing GPT-5.6 Sol: a next-generation model

코딩·과학·사이버보안 역량을 강화한 차세대 모델을 프리뷰. OpenAI가 가장 진보한 안전 스택(safety stack)과 함께 제시한다고 밝힘.

원문 →
TechCrunch2026-06-29

앤트로픽, 캘리포니아 주정부에 Claude '반값' 공급 협약

원제: Anthropic and Gov. Newsom forge deal allowing California government to use Claude at half price

앤트로픽이 캘리포니아주와 협약을 맺어 주정부가 Claude를 절반 가격에 사용하도록 함. 기사에 따르면 같은 시기 연방정부와는 앤트로픽이 대립 구도라는 점도 언급.

원문 →
TechCrunch2026-06-29

"AI 일자리 논쟁, 더 복잡해졌다"…고강도 도입 기업 인력 10.2% 증가

원제: The AI jobs debate just got messier

신규 보고서에 따르면 'high-intensity AI 도입' 기업은 인력이 10.2% 증가했고, 그중 신입(entry-level)은 12% 늘어, 'AI가 주니어 일자리를 없앤다'는 통념과 배치되는 결과.

원문 →
TechCrunch2026-06-29

구글, Gemini 개인화 AI 이미지 생성 미국 무료 개방

원제: Gemini's personalized AI image generation is now free for US users

미국의 자격 있는 무료 사용자에게 확대. 연결된 구글 앱의 데이터와 사용자 관심사를 기반으로 챗봇이 이미지를 생성하도록 함.

원문 →
TechCrunch2026-06-29

바이브 코딩 플랫폼 Base44, 자체 모델 출시

원제: Vibe coding platform Base44 launches own model as AI startups seek defensibility

Wix 소유 Base44가 자체 AI 모델 배포를 시작. 궁극적으로 프런티어 모델을 능가하는 것이 목표. AI 스타트업이 방어력(defensibility)을 확보하려는 흐름의 사례.

원문 →
MIT Tech Review2026-06-29

"AI 에이전트는 당신의 '동료'가 아니다"

원제: AI agents are not your "coworkers"

AI 에이전트를 사람 동료처럼 의인화하는 마케팅·인식에 대한 비평. 에이전트의 실제 한계와 과장 사이 간극을 지적(뉴스레터 The Algorithm).

원문 →

블로그·커뮤니티 (Hacker News · Simon Willison)

Hacker News · 807p2026-06-30

"Qwen 3.6 27B가 로컬 개발의 최적점"

원제: Qwen 3.6 27B is the sweet spot for local development (quesma.com)

로컬에서 돌리는 코딩·개발 용도로 Qwen 3.6 27B가 성능·자원 균형이 가장 좋다는 리뷰. HN 807점·댓글 570개로 큰 화제.

원문 →
Hacker News · 188p2026-06-30

Ornith-1.0: 에이전트 코딩용 자가개선 오픈소스 모델

원제: Ornith-1.0: self-improving open-source models for agentic coding (GitHub)

에이전트형 코딩을 위한 자가개선(self-improving) 오픈소스 모델 공개. 오픈소스 에이전트 코딩 흐름의 신규 사례로 주목.

원문 →
Simon Willison2026-06-23

Claude Code로 Moebius 0.2B 인페인팅 모델을 브라우저에서 구동

원제: Porting the Moebius 0.2B image inpainting model to run in the browser with Claude Code

경량(0.2B) 이미지 인페인팅 모델을 Claude Code를 이용해 브라우저에서 실행되도록 포팅한 실습 기록. 마킹한 영역을 채워 넣는 작은 모델의 활용 사례.

원문 →