AI 기술 데일리 리포트
2026-07-01 (수, KST) · 수집: paper-fetch 스킬(HF·arXiv 공식 API) + RSS 10개 피드
구성: HF Daily Papers(2026-06-30 배치) 8편 + arXiv 신규 3편 + RSS 주요 항목(번역·요약)
오늘의 핵심 3건
PAPER · 120
Agentic Abstention
Univ. of Washington / AI2 (추정)
에이전트가 언제 '멈춰야' 하는지를 정식 문제로 정의. 매 턴 answer·abstain·gather 중 선택하는 순차 결정으로 다룸. HF 최다 추천(120).
MODEL · NEWS
Claude Sonnet 5
Anthropic
더 강한 에이전트 역량과 낮은 가격, 개선된 안전성. 에이전트를 더 저렴하게 돌리는 대안으로 포지셔닝(HN 816점).
PRODUCT · NEWS
Claude Science
Anthropic
제약·바이오텍·연구자 대상 행사에서 발표한 과학 연구 지원 신규 플래그십 제품.
도식 1. HF Daily Papers 추천(upvote) 순위 (2026-06-30 배치)
Agentic Abstention (에이전트 멈춤)
120
Trimming Long-Tail (물리 world model)
35
Video-MME-Logical (영상 시간추론)
23
도식 2. 오늘의 분야 분포 (전체 11편 기준)
에이전트 4
LLM 효율·학습 2
영상 이해·편집 2
시각 world model 1
테이블 기반모델 1
RL·정렬 1
경향: 에이전트(멈춤 판단, 터미널 도구 사용, agent horizon 확장, 계획용 world model)가 최다 4편. LLM 효율·학습(KV 캐시 압축, 비동기 파이프라인 병렬)과 영상 이해·편집(스트리밍 편집, 시간-논리 추론)이 각 2편. 시각 world model의 물리 일반화 평가, 테이블 기반모델 일반화, RL 보수성과 reward hacking이 주제 다양성을 더함.
HuggingFace Daily Papers (2026-06-30 배치)
Agentic Abstention: Do Agents Know When to Stop Instead of Act?
연구진: University of Washington · Allen Institute for AI (추정) · 교신저자 Lucy Lu Wang (저자 3인)
쉽게 말하면: 에이전트는 검색·브라우징·터미널 도구로 여러 턴에 걸쳐 목표를 수행한다. 그런데 모든 목표가 명확하거나 지금 환경에서 달성 가능한 건 아니다. 사람으로 치면 "이건 아무리 더 해봐야 안 되겠다" 싶을 때 손을 멈추는 판단인데, 이 연구는 에이전트가 언제 '멈춤(abstain)'을 택해야 하는지를 정식 문제로 정의했다.
도식 · 매 턴 3지 선택의 순차 결정 문제
불명확·달성불가
목표 + 도구 환경
▶
매 턴 선택:
answer / abstain /
gather more info
▶
순차 결정으로
멈춤 시점 판단
▶
불필요한
도구 호출 중단
- 정의: Agentic Abstention = 불확실성 아래에서 에이전트가 추가 상호작용이 도움 안 될 때를 인지하고 행동을 멈추는(abstain) 문제.
- 기존 abstention과 차이: 표준 LLM abstention은 보통 단일 턴 answer-or-abstain 결정으로 평가되지만, agentic abstention은 매 턴 answer·abstain·정보 수집(gather) 중 선택하는 순차 결정(sequential decision) 문제.
- 평가 환경: 웹 쇼핑, 터미널 환경, 질의응답 등 다중 턴 도구 사용 과제에서 멈춤 판단의 신뢰성 측정.
- 관련 축: context engineering(맥락 구성)과 CONVOLVE 등을 키워드로 다룸.
LLM 에이전트는 검색·브라우징 인터페이스·터미널 도구를 써서 여러 턴에 걸쳐 사용자 목표를 달성하도록 기대된다. 그러나 모든 목표가 잘 명세돼 있거나 주어진 환경에서 달성 가능한 것은 아니다. 그런 경우 신뢰할 수 있는 에이전트라면 추가 상호작용이 도움이 되지 않으리라는 점을 인식하고 더 이상의 도구 호출을 삼가야(abstain) 한다. 저자들은 Agentic Abstention, 즉 불확실성 아래에서 에이전트가 언제 행동을 멈춰야 하는지 결정하는 문제를 정의한다. 대개 단일 턴의 answer-or-abstain 결정으로 평가되는 표준 LLM abstention과 달리, agentic abstention은 순차 결정 문제다. 에이전트는 매 턴 답하거나(answer), 삼가거나(abstain), 더 많은 정보를 모을(gather more information) 수 있으며, 멈춰야 할 필요성은 상호작용이 진행되며 달라진다. 저자들은 이 문제를 웹 쇼핑·터미널·질의응답 등 여러 환경에서 다룬다.
- 단일 턴 응답형 abstention을 다중 턴 순차 결정으로 확장
- 매 턴 answer·abstain·gather 선택으로 '언제 멈출지'를 신뢰성 있게 판단
agentic abstentionsequential decisioncontext engineering원문 →
LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
연구진: HKUST 홍콩과기대 (추정) · 교신저자 Yue Ma (저자 4인)
쉽게 말하면: 실시간으로 들어오는 영상을 프레임 단위로 편집하되, 편집하지 않은 배경은 흔들림 없이 그대로 두고, 대화형으로 쓸 수 있을 만큼 지연을 줄이는 기술이다. 기존 스트리밍 영상 기술은 '새로 만들기'에 맞춰져 있어 '원본을 지키며 일부만 고치기'에는 바로 못 썼는데, 이를 편집용으로 풀었다.
도식 · 3단계 증류 + 마스크 캐시로 실시간 편집
스트리밍 영상
프레임 입력
▶
3단계 증류
양방향 기반모델에서
단방향 스트리밍 편집기로
▶
AR 마스크 캐시
프레임 간 영역
계산 재사용
▶
인과적 실시간 편집
배경 보존
- 두 핵심 난제: (1) 시간이 지나도 배경·비편집 영역의 안정 유지, (2) 실시간 대화형에 필요한 저지연(low latency).
- 기존 한계: 최근 스트리밍 영상 생성법은 합성(synthesis) 목적이라, 편집의 엄격한 보존 요건과 영역별 제어에 직접 적용 불가.
- 3단계 증류(distillation): 강력한 양방향(bidirectional) 기반 모델의 편집 능력을 효율적 단방향(unidirectional) 스트리밍 편집기로 점진 이전해, 장기간 편집을 안정적으로 유지.
- AR 마스크 캐시: 자기회귀(AR, autoregressive) 지향 마스크 캐시로 프레임 간 영역 관련 계산을 재사용해 중복 처리를 줄이고 추론을 가속.
스트리밍 비디오 편집은 빠르게 발전했으나, 실배포에는 두 가지가 걸림돌이다. 시간이 흐르는 동안 배경과 비편집 영역을 안정적으로 유지하는 것, 그리고 실시간 상호작용에 필요한 저지연이다. 한편 최근의 스트리밍 영상 생성법은 대개 합성을 위해 개발돼, 편집에 요구되는 엄격한 보존과 영역별 제어 때문에 그대로 쓸 수 없다. 저자들은 강한 콘텐츠 보존과 실시간 응답성을 갖춘, 인과적(causal)·프레임 단위 편집 프레임워크를 제시한다. 핵심 설계는 3단계 증류 파이프라인으로, 강력한 양방향 기반 모델의 편집 능력을 효율적 단방향 스트리밍 편집기로 점진 이전해 시각적 충실도를 해치지 않으면서 장기 편집을 안정화한다. 실시간 배포를 위해 AR 지향 마스크 캐시를 도입해 프레임 간 영역 관련 계산을 재사용함으로써 중복 연산을 크게 줄이고 추론을 가속한다.
- 3단계 증류로 양방향 기반모델의 편집 능력을 단방향 스트리밍 편집기로 이전
- AR 마스크 캐시로 프레임 간 계산 재사용, 배경 보존하며 실시간 편집
streaming video editingdiffusiondistillation원문 →
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
연구진: 소속 미표기 · 교신저자 Yuhao Zhou (저자 50인, 대형 통합연구)
쉽게 말하면: 모델 파라미터를 무작정 키우는 대신, '에이전트가 한 번에 끌고 가는 작업의 길이(horizon)'를 키우는 데 집중했다. 그 결과 35B 모델로 조 단위 파라미터급 성능을 냈다. 비유하면 머리를 더 크게 만드는 대신 더 긴 호흡으로 끝까지 일을 처리하는 훈련을 시킨 셈이다.
도식 · agent-horizon 확장 + 3단계 학습
지식·행동·관찰·검증
연결 인프라
(평균 45K 토큰 궤적)
▶
전 도메인 SFT
+ 도메인별 teacher
▶
멀티-teacher
도메인 라우팅
on-policy 증류
▶
Agents-A1 35B MoE
6개 도메인 통합
- 두 축의 확장: agent-horizon scaling을 (1) 장기 궤적(long-horizon trajectory) 확장과 (2) 이질적 에이전트 능력 확장으로 나눠 탐구.
- 인프라: 외부 지식·행동·관찰·verifier 결과를 잇는 long-horizon knowledge-action 인프라로 평균 45K 토큰 길이의 에이전트 궤적 생성.
- 3단계 레시피: 전 도메인 SFT(supervised fine-tuning)로 폭넓은 에이전트 행동을 정렬하고, 도메인별 teacher 모델로 전문성을 포착한 뒤, 멀티-teacher 도메인 라우팅 on-policy 증류로 6개 이질 도메인을 배포 가능한 단일 학생 모델로 통합.
- 결과: 장기 에이전트 벤치마크에서 강하고 폭넓은 성능. 35B Mixture-of-Experts 구성으로 조 단위 파라미터급 성능에 도달.
저자들은 agent horizon을 확장해 조 단위 파라미터급 성능에 도달하는 35B Mixture-of-Experts(MoE) 에이전트 모델 Agents-A1을 소개한다. agent-horizon scaling을 두 관점, 즉 장기 궤적 확장과 이질적 에이전트 능력 확장에서 연구한다. 이를 위해 외부 지식·행동·관찰·verifier 결과를 연결하는 long-horizon knowledge-action 인프라를 구축해 평균 45K 토큰 길이의 에이전트 궤적을 생성한다. 이 위에서 3단계 레시피로 학습한다. 먼저 전 도메인 supervised fine-tuning으로 베이스 모델을 폭넓은 에이전트 행동에 정렬하고, 다음으로 도메인별 teacher 모델을 학습해 각 도메인의 전문성을 포착하며, 마지막으로 멀티-teacher 도메인 라우팅 on-policy 증류를 제안해 도메인 간 지식 전이 효율을 높이고 6개 이질 도메인을 하나의 배포 가능한 학생 모델로 통합한다. Agents-A1은 장기 에이전트 벤치마크에서 강하고 폭넓은 성능을 보인다.
- 파라미터 대신 agent horizon(작업 길이)을 확장하는 학습 전략
- 35B MoE로 조 단위 파라미터급 성능, 6개 도메인 단일 모델 통합
agentic modelMixture-of-Expertsagent horizon원문 →
TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
연구진: Amazon (추정) · 교신저자 Belinda Zeng (저자 10인)
쉽게 말하면: 요즘 에이전트는 코딩만이 아니라 문서 편집·이메일·웹 검색 같은 일도 '터미널(명령줄)'에서 처리한다. 이 연구는 그런 범용 터미널 에이전트를, 진짜 터미널에서 과제를 실행시키고 결과로 채점하는 시험지를 만들었다.
도식 · 실행 기반 채점의 범용 터미널 벤치마크
120개 실세계 과제
(5개 과제군)
▶
실제 터미널 +
결정론적 설정 스크립트
▶
실행 기반
채점 프로토콜
▶
범용 터미널
에이전트 능력 측정
- 문제의식: 터미널 에이전트가 코딩을 넘어 폭넓은 컴퓨터 사용 과제로 확장 중인데, 기존 벤치마크가 이를 제대로 평가 못 함. 일반 컴퓨터 사용 벤치마크는 GUI 중심, 터미널 벤치마크는 프로그래밍 중심에 치우침.
- TUA-Bench: 범용 터미널 사용 에이전트(TUA)를 위한 벤치마크. 120개 실세계 과제를 5개 과제군에 걸쳐 구성.
- 범위: 특수 소프트웨어를 쓰는 일상 디지털 활동 등, 코딩에 국한되지 않는 shell 기반 워크플로.
- 채점: 실행 기반(execution-based) 채점 프로토콜로 결과를 검증.
대형 언어 모델과 harness 프레임워크가 발전하며, 터미널에서 동작하는 에이전트는 코딩을 넘어 더 넓은 범위의 일반 컴퓨터 사용 과제를 수행할 수 있게 되고 있다. 그러나 기존 벤치마크는 범용 터미널 컴퓨터 사용 에이전트(TUA)를 충분히 평가하지 못한다. 일반 컴퓨터 사용 벤치마크는 주로 그래픽 사용자 인터페이스(GUI)를 겨냥하고, 터미널 기반 벤치마크는 역사적으로 shell에 고유한 기술·프로그래밍 중심 워크플로를 강조하기 때문이다. 저자들은 범용 터미널 사용 에이전트를 위한 벤치마크 TUA-Bench를 제시한다. TUA-Bench는 5개 과제군에 걸친 120개의 실세계 과제를 포함하며, 특수 소프트웨어를 활용하는 일상 디지털 활동을 아우른다. 각 과제는 실제 터미널 환경과 결정론적 설정 스크립트 위에서 실행되고, 실행 기반 채점 프로토콜로 평가된다.
- GUI·프로그래밍에 치우친 기존 평가의 공백을 메우는 범용 터미널 에이전트 벤치마크
- 5개 과제군 120개 실세계 과제, 실행 기반 채점으로 재현성 확보
terminal-use agentsbenchmarkexecution-based scoring원문 →
ReFreeKV: Towards Threshold-Free KV Cache Compression
연구진: Nanjing Univ. of Aeronautics and Astronautics 난징항공항천대 (추정) · 교신저자 Piji Li (저자 9인)
쉽게 말하면: LLM이 긴 문맥을 처리할 때 KV 캐시가 메모리를 많이 먹는다. 기존 압축법은 "얼마나 버릴지"를 입력마다 미리 정한 임계값(threshold)에 의존하는데, 실제 오픈 도메인 입력은 길이·난도·분야가 제각각이라 그 임계값을 정하기 어렵다. 이 연구는 임계값 없이 예산을 적응적으로 배분한다.
도식 · 임계값 없는 적응 예산 KV 캐시 압축
다양한 도메인·길이
·난도 입력
▶
threshold-free
적응 예산 배분
▶
KV 캐시
가지치기(pruning)
▶
임계값 튜닝 없이
메모리 절감·성능 유지
- 기존 한계: 다수 KV 캐시 가지치기 기법이 무손실 메모리 절감을 달성하지만, 최적 성능을 위해 입력/도메인별 KV 예산 임계값을 사전 결정해야 하는 조건에 의존.
- 실환경 문제: 오픈 도메인 입력은 도메인·길이·난도가 다양하고 경계가 불분명해, 임계값 선택 자체가 근본적 제약이 됨.
- ReFreeKV: 임계값 없이(threshold-free) 예산을 적응 배분(adaptive budget allocation)해 입력 민감 튜닝을 제거.
- 목표: 다양한 입력에서 큰 성능 저하 없이 LLM 추론 메모리를 줄이는 것.
LLM 추론 중 메모리 소비를 줄이기 위해 KV 캐시 가지치기(pruning) 기법이 여러 제안됐다. 이들은 많은 데이터셋에서 무손실 메모리 절감을 이룰 수 있으나, 흔히 강조되지 않는 조건에 의존한다. 최적 성능을 얻으려면 입력/도메인별 KV 캐시 예산 임계값을 사전에 정해야 한다는 점이다. 그러나 이러한 입력 민감 설계는 실제 시나리오에서 상당히 제한적일 수 있다. 오픈 도메인 입력은 다양한 도메인·길이·난도에 걸쳐 있고, 임계값 선택을 위한 명확한 경계가 없기 때문이다. 결과적으로 입력 민감 임계값 의존성은 큰 성능 저하를 유발하는 근본적 한계가 될 수 있다. 저자들은 임계값 없는 적응 예산 배분으로 이 문제를 다루는 ReFreeKV를 제안한다.
- 입력/도메인별 임계값 사전 설정 의존성을 제거한 threshold-free KV 캐시 압축
- 적응 예산 배분으로 다양한 오픈 도메인 입력에서 메모리 절감과 성능을 양립
KV cache compressionthreshold-freeLLM inference원문 →
Beyond IID: How General Are Tabular Foundation Models, Really?
연구진: University of Freiburg / ELLIS 프라이부르크대 (추정) · 교신저자 Frank Hutter (저자 10인)
쉽게 말하면: 표(테이블) 데이터용 기반 모델(tabular foundation model)이 주목받는데, 정작 평가는 이들이 이미 잘하는 쉬운 벤치마크에 몰려 있다. 이 연구는 어려운 시나리오(비-IID, 고차원)까지 포함한 통합 평가 도구(Data Foundry)로 "이 모델들이 정말 얼마나 범용인가"를 묻는다.
도식 · 통합 평가로 테이블 기반모델 일반성 진단
분산·이질
테이블 데이터셋
▶
Data Foundry
통합 평가 프로토콜
▶
비-IID·고차원
난이도 시나리오
▶
기반모델 vs 트리모델
일반화 비교
- 문제의식: 테이블 예측용 기반 모델이 학계·산업에서 빠르게 확산 중이나, 과제·분야별 평가가 분절돼 모델 연구자가 접근하기 어렵다.
- 기존 편향: 연구자들이 표준 벤치마크에 의존하는데, 이는 대개 테이블 기반모델이 이미 잘하는 과제로 정의돼 가장 어려운 시나리오가 배제됨. 그 결과 한계적 개선에만 집중.
- Data Foundry: 다양한 데이터셋·과제를 아우르는 통합 벤치마크 소프트웨어·프로토콜.
- 초점: IID를 넘어선 비-IID 데이터, 고차원 데이터셋 등 도전적 조건에서 트리 기반 모델과의 일반화 비교.
테이블 데이터에 대한 예측 머신러닝용 기반 모델(tabular foundation model)이 최근 학계와 산업에서 큰 주목을 받고 있다. 여러 분야의 연구 커뮤니티가 다양한 데이터셋·과제에서 이들을 평가하지만, 이러한 과제·분야별 평가는 대체로 모델 연구자에게 접근하기 어렵다. 벤치마크 소프트웨어와 평가 프로토콜이 분절돼 있기 때문이다. 그 결과 모델 연구자들은 표준 벤치마크에 의존하는데, 이는 주로 테이블 기반모델이 이미 뛰어난 과제에 대해 정의돼 있다. 가장 도전적인 시나리오는 배제되며, 이는 한계적 개선에만 초점을 맞추게 해 의미 있는 진전을 제약한다. 저자들은 이를 해소하기 위해 다양한 데이터셋과 과제를 아우르는 통합 평가 도구(Data Foundry)를 도입하고, IID를 넘어 비-IID·고차원 등 더 어려운 조건에서 테이블 기반모델의 일반성을 트리 기반 모델과 비교해 진단한다.
- 쉬운 표준 벤치마크에 치우친 평가 관행을 지적하고 통합 평가 도구(Data Foundry) 제안
- 비-IID·고차원 등 도전적 조건에서 테이블 기반모델의 실제 일반성 검증
tabular foundation modelsbenchmarkingnon-IID원문 →
기타 주목 논문 (HF 7~8위)
Trimming the Long-Tail of Visual World Modeling Evaluation
연구진: UIUC 일리노이대 어배너-섐페인 (추정) · 교신저자 Heng Ji (저자 9인)
쉽게 말하면: 영상·이미지 생성 모델은 흔한 물리 상황은 그럴듯하게 흉내 내지만, 드물거나 말이 안 되는 도구 사용 같은 상황도 물리 법칙대로 처리하는지는 의문이다. 이 연구는 '흔한 것'이 아니라 '드물고 불규칙한' 상호작용을 일부러 시켜보는 시험지(Tailor-Bench)를 만들었다.
도식 · 3개 시나리오 모드로 물리 일반화 진단
드문·불규칙
물리 상호작용
▶
Tailor-Bench
Regular / Unconventional /
Impossible 모드
▶
이미지·영상
생성 모델 평가
▶
물리 원리
내재·일반화 진단
- 문제의식: 물리 상호작용은 long-tail 분포(흔한 것이 다수, 드문 것이 광범위). 기존 벤치마크는 흔한 상호작용에 치우쳐 모델이 물리 원리를 내재·일반화하는지 불명확.
- Tailor-Bench: 불규칙한 물리 상호작용 시뮬레이션을 모델에 요구하는 벤치마크.
- 3개 모드: Regular(흔한 도구-과제 쌍), Unconventional(속성 호환 대체 도구로 affordance 일반화 시험), Impossible(속성 위반 도구로 제약 인지 탐색).
- 평가 설정: 통합 프로토콜 아래 두 가지 보완 설정으로 이미지·영상 생성 모델의 물리 추론을 체계적으로 측정.
물리 상호작용은 long-tailed 분포를 따른다. 흔하고 규칙적인 상호작용이 인간 경험과 시각 데이터를 지배하는 반면, 드물고 불규칙한 상호작용은 광범위하지만 과소 대표된다. 최근의 시각 world model(이미지·영상 생성 모델)은 기존 벤치마크에서 인상적 사실성을 보이나, 주로 흔한 물리 상호작용 시뮬레이션에 집중한다. 그렇다면 현재의 시각 world model이 물리 원리를 내재화하고 일반화하는가라는 핵심 질문이 생긴다. 저자들은 world model이 불규칙한 물리 상호작용을 시뮬레이션하도록 도전시키는 벤치마크 Tailor-Bench를 제시한다. 체계적 평가를 위해 추론을 점진적으로 어렵게 하는 세 시나리오 모드를 설계한다. Regular는 흔한 도구-과제 쌍, Unconventional은 속성 호환 대체 도구로 affordance 일반화를 시험, Impossible은 속성을 위반하는 도구로 제약 인지를 탐색한다. 아울러 통합 프로토콜 아래 두 보완 설정을 둔다.
- long-tail의 드문·불규칙 물리 상호작용을 겨냥한 Tailor-Bench 제안
- Regular·Unconventional·Impossible 3모드로 affordance·제약 인지 진단
visual world modelbenchmarkphysical reasoning원문 →
Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning
연구진: Beihang University 베이항대 (추정) · 교신저자 Si Liu (저자 8인)
쉽게 말하면: 영상 이해 모델이 각 프레임의 물체·사건을 '알아보는' 것과, 프레임이 흐르며 바뀌는 상태를 '따라가며 추론하는' 것은 다르다. 이 연구는 후자(시간-논리 추론)만 똑 떼어 시험하는 진단용 벤치마크를 만들었다.
도식 · 5개 시간-논리 연산의 통제된 진단
동적 시각 증거
(프레임 시퀀스)
▶
5개 시간-논리 연산
상태추적·순차계수·시간순서
·동적공간·구조합성
▶
장면 복잡도·정적 인식
혼입 요인 통제
▶
MLLM 시간-논리
추론 능력 분리 측정
- 핵심 질문: 멀티모달 대형 언어 모델(MLLM)이 개별 프레임의 물체·사건을 '인식'하는 것을 넘어, 동적 시각 증거를 '추론'할 수 있는가.
- 정의: video temporal-logical reasoning = 시각 상태가 프레임에 걸쳐 변할 때 증거를 유지·갱신·합성하는 능력.
- 기존 한계: 기존 영상 벤치마크는 이 능력을 장면 복잡도·정적 인식·비통제 시간 변동과 뒤섞음.
- 5개 연산: 상태 추적, 순차 계수, 시간 순서, 동적 공간성, 구조적 합성으로 조직한 통제 벤치마크로 능력을 분리 측정.
멀티모달 대형 언어 모델(MLLM)에 대한 최근 관심은 핵심 질문을 낳는다. 이들이 개별 프레임에서 물체나 사건을 단지 인식하는 데 그치지 않고 동적 시각 증거에 대해 추론할 수 있는가. 저자들이 video temporal-logical reasoning이라 부르는 이 능력은, 시각 상태가 프레임에 걸쳐 변화할 때 모델이 증거를 유지·갱신·합성하도록 요구한다. 기존 영상 벤치마크는 흔히 이 능력을 장면 복잡도, 정적 인식, 통제되지 않은 시간 변동과 혼동한다. 이 능력을 분리하기 위해 저자들은 다섯 가지 시간-논리 연산, 즉 상태 추적(state tracking), 순차 계수(sequential counting), 시간 순서(temporal ordering), 동적 공간성(dynamic spatiality), 구조적 합성(structural composition)을 중심으로 조직한 통제 벤치마크 Video-MME-Logical을 도입한다.
- 정적 인식·장면 복잡도와 뒤섞이던 영상 시간-논리 추론 능력을 분리해 진단
- 상태추적·순차계수·시간순서·동적공간·구조합성 5개 연산의 통제 벤치마크
MLLMtemporal-logical reasoningstate tracking원문 →
arXiv 최신 (신규 3편)
Self-Evolving World Models for LLM Agent Planning
연구진: Singapore Management University (추정) · 교신저자 Yang Deng (저자 4인)
쉽게 말하면: LLM 에이전트가 "이 행동을 하면 결과가 어떻게 될지" 미리 내다보게 하는 게 world model인데, 그 예측이 틀리면 오히려 방해가 된다. 이 연구는 에이전트와 모델 파라미터는 그대로 얼려두고, 배포 중에 얻은 경험으로 world model의 '문맥'만 스스로 고쳐 예측을 개선한다.
도식 · 파라미터 동결 + 테스트타임 문맥 자기수정
실제 행동 전이
+ 예측-관측 불일치
▶
에피소드 메모리
+ 시맨틱 메모리
(문맥 수정)
▶
선택적 예견
저신뢰 예측 필터링
▶
예측 정확도·
계획 성능 향상
- WorldEvolver: 다운스트림 에이전트와 모든 모델 파라미터를 동결한 채, 배포 시점 문맥(deployment-time context)만 수정하는 self-evolving world model 프레임워크.
- Episodic Memory: 실제 행동 전이를 검색 기반 시뮬레이션(retrieval-based simulation)으로 활용.
- Semantic Memory: 예측-관측 불일치에서 지속적 heuristic 규칙을 추출.
- Selective Foresight: 저신뢰 예측을 걸러 에이전트 추론 문맥에 통합. ALFWorld·ScienceWorld에서 예측 정확도 최고, AgentBoard 다운스트림 성공률에서 world model 베이스라인 상회.
world model은 장기(long-horizon) LLM 에이전트에게 foresight, 즉 실행 전 행동 결과 예측을 부여하는 원리적 방법이다. 그러나 신뢰할 수 없는 foresight는 무시되거나 오용되고, 심지어 다운스트림 의사결정을 악화시킬 수 있다. 저자들은 다운스트림 에이전트와 모든 모델 파라미터를 동결한 채 배포 시점 문맥을 수정하는 self-evolving world model 프레임워크 WorldEvolver를 도입한다. WorldEvolver는 세 모듈을 통합한다. (i) 실제 행동 전이를 검색 기반 시뮬레이션으로 활용하는 Episodic Memory, (ii) 예측-관측 불일치에서 지속적 heuristic 규칙을 추출하는 Semantic Memory, (iii) 저신뢰 예측을 걸러 에이전트 추론 문맥에 통합하는 Selective Foresight. ALFWorld·ScienceWorld에서 world model 예측 정확도를 Word2World로, 다운스트림 에이전트 성공률을 AgentBoard로 측정한 결과, 세 backbone 전반에서 최고 예측 정확도를 달성하고 다른 world model 베이스라인보다 다운스트림 성공률에서 앞선다. 테스트타임 메모리 수정이 예측 충실도와 계획 성능을 함께 높인다는 점을 보인다.
- 파라미터 재학습 없이 배포 시점 문맥만 수정해 world model 예측을 개선
- 에피소드·시맨틱 메모리와 선택적 예견으로 예측 정확도·에이전트 성공률 동시 향상
world modelLLM agent planningtest-time memory원문 →
One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining
연구진: MBZUAI 무함마드 빈 자예드 AI대 (추정) · 교신저자 Samuel Horváth (저자 5인)
쉽게 말하면: 초대형 LLM을 여러 GPU에 나눠 학습할 때(pipeline parallelism), 동기식은 'pipeline bubble' 때문에 GPU가 놀아 낭비가 크다. 비동기식은 이를 없애지만 gradient가 한 스텝 늦게 반영되는 'staleness'가 생겨 불안정하다고 여겨졌다. 이 연구는 그 불안정성이 방식 자체의 한계가 아니라 옵티마이저 선택 탓임을 보인다.
도식 · 옵티마이저가 좌우하는 1-스텝 지연 안정성
비동기 파이프라인
(1-스텝 gradient 지연)
▶
옵티마이저 의존성 규명
AdamW 취약 vs Muon 강건
▶
Error Feedback
기반 보정 + 수렴 이론
▶
최대 10B에서
동기 학습과 격차 해소
- 배경: 동기식 pipeline parallelism은 pipeline bubble 동안 GPU가 유휴 상태로 낭비. 비동기식은 bubble을 없애 처리량을 극대화하나 gradient staleness가 대가.
- 대상: PipeDream-2BW는 깊이와 무관하게 항상 1-스텝 gradient 지연을 보장해 매력적이나, "staleness 하 최적화는 근본적으로 불안정"이라는 통념으로 채택이 제한됨.
- 핵심 발견: 1-스텝 지연의 성능 저하는 옵티마이저 선택에 크게 좌우. AdamW는 심하게 저하되지만 최신 기법 Muon은 강건. 옵티마이저 무관 Error Feedback 기반 보정으로 지연 효과를 추가 완화하고, Muon의 수렴을 이론적으로 뒷받침.
- 결과: 최대 10B 파라미터 모델 평가에서 동기 학습과의 성능 격차를 메워 대규모 비동기 파이프라인 병렬의 실용성 입증.
현대 대규모 LLM 사전학습은 Pipeline Parallelism 활용으로 이득을 보지만, 동기식 구현은 pipeline bubble 동안 GPU를 유휴 상태로 두어 연산 자원을 낭비한다. 비동기 Pipeline Parallelism은 이 bubble을 없애 처리량을 극대화하지만 gradient staleness를 대가로 치른다. 비동기 스케줄 중 PipeDream-2BW는 특히 매력적이다. 원래 PipeDream과 달리 pipeline 깊이와 무관하게 일정한 1-스텝 gradient 지연을 보장하기 때문이다. 그러나 staleness 하 최적화가 근본적으로 불안정하다는 통념 탓에 채택이 제한돼 왔다. 저자들은 이 가정에 도전해, 1-스텝 지연의 성능 저하가 내재적 한계가 아니라 옵티마이저 선택에 강하게 좌우됨을 보인다. PipeDream-2BW 도입 당시 지배적이던 AdamW는 심각한 저하를 겪지만, 최신 기법 Muon은 1-스텝 지연에서 강한 강건성을 보인다는 첫 포괄적 실증 분석을 제시한다. 나아가 옵티마이저 무관 Error Feedback 기반 보정으로 지연 효과를 추가 완화하고, 보정 유무에 대한 Muon의 수렴을 이론적으로 분석한다. 최대 10B 파라미터 모델에 대한 광범위 평가로 동기 학습과의 격차를 메움을 확인한다.
- 1-스텝 gradient 지연의 불안정성은 방식이 아니라 옵티마이저 선택 문제임을 실증
- Muon의 강건성 + Error Feedback 보정으로 최대 10B에서 동기 학습 수준 달성
asynchronous pipeline parallelismgradient stalenessMuon원문 →
Pessimism's Paradox: Conservative Offline Training Amplifies Reward Hacking During Online Adaptation in Reasoning Models
연구진: 소속 미상 · 교신저자 Divya Chaudhary (저자 4인)
쉽게 말하면: "오프라인에서 보수적으로(잘 아는 행동 근처에만 머물게) 학습하면, 나중에 온라인에서 보상 모델의 허점을 덜 악용할 것"이라는 게 통념이다. 이 연구는 실험으로 그 반대를 보인다. 보수성을 높일수록 온라인 적응에서 reward hacking 피해가 오히려 커진다.
도식 · 보수성이 reward hacking을 증폭하는 3-링크 사슬
DPO 3단계 보수성
(β_lo / β_mid / β_hi)
▶
학습된 보상 앙상블로
온라인 적응
▶
① 엔트로피 압축
② 다양성 감소
③ 앙상블 불일치 악용
▶
보수성 높을수록
Goodhart gap 증가 (ρ=1.0)
- 실험 설계: Qwen3-14B를 DPO로 세 수준 보수성(β_lo, β_mid, β_hi)으로 학습한 뒤, 각 체크포인트를 학습된 보상 앙상블(3×Qwen3-1.7B)로 온라인 적응하며 GSM8K 정답 정확도로 실제 성능 측정.
- 핵심 결과: 오프라인 보수성이 높을수록 reward-hacking 피해가 단조 증가(Goodhart gap과 그 곡선 아래 면적 AUGC 기준, 세 조건 전반 Spearman ρ=1.0).
- 인과 사슬: (1) 고-β DPO가 정책 엔트로피를 압축하고, 그로 인해 (2) 저엔트로피 정책이 다양성 낮은 응답을 생성해 보상모델 학습 분포의 좁은 영역에 집중하며, 그럼에도 (3) 앙상블 불일치(epistemic uncertainty)가 β와 함께 증가해 온라인에서 더 빨리 악용됨.
- 시사점: (β, AUGC)에 멱법칙을 적합해 정렬 충실도와 hacking 취약성을 균형짓는 실용적 최적 보수성 β*를 식별. 최대(maximal)가 아니라 보정된(calibrated) 보수성이 필요.
보수적 오프라인 학습은 이후 온라인 적응을 위한 안전한 토대로 널리 권장된다. 정책이 잘 뒷받침되는 행동 근처에 머물면 학습된 보상 모델의 결함을 덜 악용하리라는 논리다. 저자들은 이 직관을 실증적·기제적으로 반박한다. Qwen3-14B 정책을 Direct Preference Optimisation(DPO)로 세 수준의 보수성(경험적 로그비 백분위에서 유도한 β_lo, β_mid, β_hi)으로 학습한 뒤, 각 체크포인트를 학습된 보상 앙상블(3×Qwen3-1.7B)에 대해 온라인 적응시키며 GSM8K 정답 정확도로 실제 성능을 측정한다. 그 결과 오프라인 보수성이 높을수록 reward-hacking 피해가 단조 증가하며(Goodhart gap과 AUGC 기준, 세 조건 전반 Spearman ρ=1.0), 세 링크의 인과 사슬을 확인한다. (i) 고-β DPO는 정책 엔트로피를 압축하고, (ii) 저엔트로피 정책은 다양성이 낮은 응답을 생성해 보상 모델 학습 분포의 좁은 영역에 집중하며, (iii) 그럼에도 앙상블 불일치(epistemic uncertainty)는 β와 함께 증가해 온라인 최적화에서 더 빨리 악용된다. (β, AUGC) 데이터에 멱법칙을 적합해 실용적 최적 보수성 β*를 식별한다. 결론은 이 분야가 최대가 아니라 보정된 보수성을 필요로 한다는 것이다.
- "보수적일수록 안전"이라는 통념 반박: 보수성이 높을수록 reward hacking 피해 단조 증가
- 엔트로피 압축·다양성 감소·앙상블 불일치의 인과 사슬 규명, 보정된 보수성 β* 제안
reward hackingDPOoffline-to-online RL원문 →
AI 뉴스 통합 (RSS 주요 항목, 번역·요약)
사용자 지정 RSS 10개 피드를 Python으로 직접 파싱한 뒤, 주요 항목만 선별해 한국어로 번역·요약. 각 항목 원문 링크 포함. (수집 2026-07-01, KST)
국내 (AI타임스 · THE AI)
AI타임스2026-07-01
메타, '클로드·코덱스' 사내 사용 제한…"AI 증류 우려 사전 차단"
메타가 앤트로픽 '클로드 코드', 오픈AI '코덱스' 등 외부 AI 코딩 도구의 사내 사용을 대폭 제한. 자체 플랫폼 메타코드(MetaCode)에 무게를 싣는 동시에, 경쟁사가 제기할 수 있는 'AI 증류(distillation)' 논란을 사전 차단하려는 조치로 해석.
원문 →
AI타임스2026-07-01
메타, 뇌 신호 해독 '브레인투쿼티 v2' 공개…"비침습 BCI 성능 한계 넘어"
뇌에 전극을 이식하는 수술 없이 뇌 활동만으로 머릿속에 떠올린 문장을 실시간 텍스트로 변환하는 비침습형 두뇌-컴퓨터 인터페이스(BCI). 뇌 손상 등으로 말하거나 움직이기 어려운 환자의 의사소통 지원을 겨냥.
원문 →
THE AI2026-07-01
리벨리온, 추론 최적화 기업 스퀴즈비츠 인수…'풀스택 AI'로 확장
리벨리온이 AI 추론 최적화 기업 스퀴즈비츠 지분 100%를 확보한다고 발표. 자체 NPU 하드웨어에 더해 모델이 실제 서비스로 도는 추론 서빙까지 단일 플랫폼으로 제공하는 통합 AI 인프라로 사업 영역 확장.
원문 →
THE AI2026-07-01
인하대, LLM·지식그래프 결합 맞춤형 추천 AI 'SPiKE' 개발
인하대 서영덕 전기컴퓨터공학과 교수팀이 대형언어모델(LLM)과 지식 그래프를 결합해 사용자의 취향과 맥락, '취향의 이유'까지 반영하는 맞춤형 추천 AI 'SPiKE'를 개발. 서강대 신성복 교수 등과 공동 연구.
원문 →
해외 매체 (Anthropic·Google·OpenAI · TechCrunch · MIT Tech Review)
TechCrunch2026-07-01
앤트로픽, 'Claude Sonnet 5' 출시…에이전트를 더 저렴하게
원제: Anthropic launches Claude Sonnet 5 as a cheaper way to run agents
더 강한 에이전트 역량, 낮은 가격, 개선된 안전성을 갖춘 Claude Sonnet 5 공개. Opus·GPT 등 대비 에이전트를 더 저렴하게 돌리는 대안으로 포지셔닝(HN 816점).
원문 →
MIT Tech Review2026-07-01
'Claude Science', 앤트로픽의 새 플래그십 제품
원제: Claude Science is Anthropic's newest flagship product
제약 임원·바이오텍 창업자·연구자 대상 행사에서 앤트로픽이 과학 연구를 지원하기 위한 대형 신제품 Claude Science를 발표(HN 337점).
원문 →
TechCrunch2026-07-01
엔비디아 경쟁사 Etched, 50억 달러 밸류·10억 달러 매출 확보
원제: Nvidia competitor Etched hits $5B valuation, $1B in sales for AI chip
엔비디아 AI 칩 경쟁사 Etched가 자사 칩 기반 추론 시스템으로 이미 10억 달러 규모 계약을 확보했다고 발표. 밸류에이션은 50억 달러에 도달.
원문 →
TechCrunch2026-07-01
구글, 더 빠르고 저렴한 이미지 생성기 'Nano Banana 2 Lite' 공개
원제: Google introduces a faster, cheaper image generator with Nano Banana 2 Lite
구글이 이미지 생성기를 더 빠르고 저렴하게 갱신. AI 콘텐츠를 만드는 크리에이터에게 실용성을 높인 경량 버전으로 제시.
원문 →
OpenAI2026-06-30
OpenAI, 유전체·생물학 벤치마크 'GeneBench-Pro' 공개
원제: Introducing GeneBench-Pro
유전체학·생물학·과학 연구에서 AI 성능을 복잡한 실세계 데이터셋으로 시험하는 신규 벤치마크. 과학 도메인 평가에 초점.
원문 →
TechCrunch2026-07-01
포커 AI 만든 딥마인드 3인방, 이제 퀀트 헤지펀드로 돈 번다
원제: The DeepMind trio who built a poker AI are now making money for quant hedge funds
전 딥마인드 연구자 3인이 창업한 프라하 기반 AI 랩 EquiLibre Technologies가 5억 달러 이상 가치로 평가. 포커 AI 기술을 퀀트 헤지펀드 영역에 적용.
원문 →
블로그·커뮤니티 (Simon Willison · Hacker News)
Simon Willison2026-07-01
에이전트가 작업 데모 영상을 직접 녹화 (shot-scraper video)
원제: Have your agent record video demos of its work with shot-scraper video
shot-scraper 1.10에 추가된 새 명령 'shot-scraper video'. storyboard.yml로 웹을 대상으로 한 실행 루틴을 정의해, 에이전트가 자기 작업의 데모 영상을 녹화하도록 함.
원문 →
Hacker News · 137p2026-07-01
"쿠버네티스를 브라우저에 이식했다" (webernetes)
원제: I ported Kubernetes to the browser
쿠버네티스를 브라우저 안에서 구동하도록 이식한 실험 프로젝트(webernetes). 데모와 함께 공개돼 HN 137점을 기록.
원문 →
Hacker News2026-07-01
"Cursor iOS 앱 설치 시 프라이버시 설정이 비가역적으로 바뀐다"
원제: Tell HN: Installing Cursor on iOS irreversibly changes your privacy settings
Cursor iOS 앱 설치 후 기존 'Privacy Mode (Legacy)' 설정이 되돌릴 수 없게 변경됐다는 사용자 제보. AI 코딩 도구의 모바일 확장과 데이터 처리 정책을 둘러싼 논점.
원문 →
Hacker News · 129p2026-07-01
mmWave 물질 분류 레이더 직접 제작 (2025)
원제: I built a mmWave material classification radar (2025)
밀리미터파(mmWave) 레이더로 물질을 분류하는 장치를 직접 만든 개인 프로젝트. 하드웨어·신호처리 실습 사례로 HN 129점.
원문 →