← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.10 · 09:00 KST

오늘의 AI 리서치

논문 10편 · Hugging Face Daily Papers 최근 14일 트렌딩(업보트 순) 및 arXiv 최신 cs.AI

오늘의 데일리 브리핑

오늘의 흐름은 모델 규모 경쟁보다 실행 구조를 재설계하는 AI에 가깝다. Kimi K3는 2.8T MoE와 100만 토큰 문맥으로 frontier open model을 겨냥했고, Frontis-MA1은 MLE 자체를 개선하는 AI4AI 루프를 실행 가능한 환경에서 학습한다.
에이전트는 긴 문맥을 계속 쌓기보다 상태를 외부에서 검증·관리하는 방향으로 이동한다. LongHorizon-Harness의 MEA 루프는 WeaveBench에서 Qwen 3.7-Plus를 51.8%에서 80.7%로 끌어올렸다.
현장 배치 관점에서는 TurboVLA의 0.2B·32Hz 로봇 제어와 JoyAI-Video-Edit의 720p 약 30 FPS가 눈에 띈다. 동시에 SCOPE·TrajDebug·AV-AIVAT은 문맥 신뢰, 실패 원인, 평가 비용을 다뤄 실제 운영의 신뢰성 층을 보강한다.

Hugging Face 주목 논문 6편

01

Kimi K3: 2.8T MoE 기반 오픈 프런티어 모델

Kimi K3: Open Frontier Intelligence

Kimi Team 외 · Hugging Face 업보트 486 · 2026-07-27

MoELong contextAgentic RL

논문 개요

Kimi K3는 native vision과 100만 토큰 context를 갖춘 2.8T-parameter MoE 모델이다. Delta Attention·Attention Residuals와 Stable LatentMoE를 결합하고, 긴 agentic rollout 및 sandbox state를 포함한 RL 인프라까지 함께 설계해 long-horizon coding·agent·reasoning·vision 작업을 겨냥한다.

arXiv 원문 보기 ↗

연구 목표

  • 오픈 가중치 모델로 frontier 수준의 범용·장기 실행 성능을 확보한다.

핵심 방법

  • KDA, Attention Residuals, Stable LatentMoE와 도메인별 RL을 알고리즘·시스템 공동 설계로 통합.

주요 결과

  • 저자 평가에서 다수의 open·proprietary 비교 모델을 앞서며, 최상위 proprietary 모델과의 차이는 남아 있다고 보고.

핵심 수치

  • 총 2.8T parameter, 활성 104B, routed expert 896개 중 토큰당 16개 활성, 1M context. Kimi K2 대비 종합 scaling efficiency 약 2.5× 개선.
02

Frontis-MA1: MLE를 개선하는 재귀적 AI4AI 에이전트

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Junlin Yang 외 · Hugging Face 업보트 181 · 2026-07-30

AI4AIMLERSI

논문 개요

재귀적 자기개선을 추상적 능력이 아니라 실행 가능한 machine learning engineering 문제로 놓는다. OpenMLE-Gym·RL·Evo 위에서 35B Frontis-MA1을 Draft, Improve, Debug, Crossover 네 program-evolution operator로 post-train하고, 이를 장기 탐색에서 조합한다.

arXiv 원문 보기 ↗

연구 목표

  • AI가 AI 개발 과정을 개선하는 RSI를 검증 가능한 MLE 작업에서 연구한다.

핵심 방법

  • 실행 피드백 기반 SFT·RL과 장기 탐색을 하나의 learning–evolution loop로 연결.

주요 결과

  • OpenMLE-Evo-Max는 GPT-5.5 + Codex를 넘어섰고 GPT-5.6 Sol 및 Kimi K3에 근접했다고 보고.

핵심 수치

  • MLE-Bench Lite Medal Average 39.39%→60.61%, Evo-Max에서 71.21%. RTX 4090 1장·12GB VRAM·과제당 12시간 조건.
03

LongHorizon-Harness: 검증된 외부 상태로 긴 에이전트 실행 관리

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma 외 · Hugging Face 업보트 162 · 2026-08-03

Agent harnessState management

논문 개요

긴 작업의 실패 원인을 모델 자체보다 누적 context 안의 task state 관리 문제로 본다. Manage-Execute-Audit(MEA)는 manager가 다음 subtask를 정하고, fresh-context executor가 수행하며, read-only auditor가 환경에서 독립 검증한 사실만 외부 state에 반영한다.

arXiv 원문 보기 ↗

연구 목표

  • 잘못된 self-assessment가 이후 행동으로 전파되는 긴 실행 문제를 줄인다.

핵심 방법

  • 명시적 외부 state와 manager–executor–auditor 분리, 교체 가능한 AgentAdapter.

주요 결과

  • 모델·harness·상호작용 도메인이 달라도 일관된 개선을 보고.

핵심 수치

  • Qwen 3.7-Plus: WeaveBench 51.8%→80.7%, Terminal-Bench 2.1 69.7%→77.2%, OSWorld 2.0 2.8%→8.3%.
04

TurboVLA: LLM 중심 경로를 걷어낸 32Hz 로봇 정책

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Hengyi Xie 외 · Hugging Face 업보트 139 · 2026-07-29

RoboticsVLAEfficiency

논문 개요

기존 VLA의 V→L→A 경로가 매 policy 호출에서 큰 LLM 비용을 만든다는 문제를 겨냥한다. TurboVLA는 vision·language를 각각 인코딩한 뒤 경량 양방향 상호작용으로 직접 V+L→A mapping을 만들고 compact decoder가 연속 action chunk를 예측한다.

arXiv 원문 보기 ↗

연구 목표

  • 소비자급 하드웨어에서도 실시간으로 동작하는 언어 조건 로봇 조작을 구현한다.

핵심 방법

  • LLM을 지각–행동 인터페이스에서 제거하고 경량 vision-language interaction을 사용.

주요 결과

  • 대형 VLA 정책과 같거나 높은 LIBERO 성능을 더 작은 모델로 달성했다고 보고.

핵심 수치

  • 0.2B parameter, RTX 4090에서 31.2ms latency(약 32Hz), 0.9GB VRAM, LIBERO 평균 성공률 97.7%.
05

DAPD: privileged teacher의 ‘특권 환상’을 막는 정책 증류

DAPD: Dual-Anchored Policy Distillation

Jianyu Wu 외 · Hugging Face 업보트 108 · 2026-08-03

Post-trainingDistillationRL

논문 개요

on-policy self-distillation에서 teacher가 가진 privileged information을 student가 추론 시점에는 재현할 수 없는데도 그 행동을 배운다는 ‘privilege illusion’을 지적한다. DAPD는 정보가 맞춰진 두 경로를 self-conditioned bridge로 정렬하고, 이를 양방향으로 적용한다.

arXiv 원문 보기 ↗

연구 목표

  • 추론 시점 정보 조건과 학습 시점 teacher supervision의 비대칭을 해소한다.

핵심 방법

  • Dual-Path Anchoring과 Dual-Source Anchoring으로 reference–rollout 양방향 정렬.

주요 결과

  • OPSD보다 privilege illusion을 줄이고 여러 모델 규모에서 성능 향상이 유지됐다고 보고.

핵심 수치

  • Qwen3-4B에서 과제 평균 +2.00점, 4B에서 +2.69점, 32B에서 +2.78점.
06

JoyAI-Video-Edit: streaming 제약에서 720p 약 30 FPS 편집

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Yicheng Xiao 외 · Hugging Face 업보트 89 · 2026-08-04

Video editingDiffusionStreaming

논문 개요

미래 frame이나 미리 정한 영상 길이를 쓰지 않는 real-time open-ended editing을 목표로 한다. 16B autoregressive diffusion에 chunk-wise adaptation, Source-Anchored DMD, Long-Horizon Autoregressive Distillation을 결합해 source fidelity와 긴 시간축 일관성을 함께 다룬다.

arXiv 원문 보기 ↗

연구 목표

  • 인과적 streaming 조건에서 낮은 지연과 장기 temporal consistency를 함께 확보한다.

핵심 방법

  • 2-step generation의 source fidelity와 누적 drift를 각각 정렬·완화하는 증류 설계.

주요 결과

  • 자동·인간 평가에서 기존 streaming editor를 크게 앞서며 강한 offline system과 경쟁적이라고 보고.

핵심 수치

  • 16B parameter, Nvidia B200 1장 기준 end-to-end 720p 편집 약 30 FPS.

arXiv 최신 논문 4편

07

SCOPE: 문맥을 버리지 않는 선택적 신뢰 학습

Learning When to Trust via Selective Context Preference Optimization

Xian Sun 외 · arXiv cs.AI · 2026-08-06

RobustnessDPO

논문 개요

오도 문맥에 강한 모델을 만들다 보면 유용한 문맥도 통째로 무시할 수 있다. SCOPE는 이를 selective trust 문제로 재정의하고, clean·misleading·correct-context·irrelevant-context 네 조건을 맞춘 human-annotated MIST benchmark와 preference optimization을 제안한다.

arXiv 원문 보기 ↗

연구 목표

  • 오도 정보에는 저항하면서 신뢰할 만한 외부 정보는 활용한다.

핵심 방법

  • 네 문맥 조건의 matched item과 SC2W 지표를 사용한 selective context preference optimization.

주요 결과

  • 단순한 ‘context 무시’가 아닌 문맥별 신뢰 판단을 평가·학습 대상으로 제시.

핵심 지표

  • 초록은 단일 정확도 대신 네 matched condition을 함께 보는 SC2W를 제안하며 개별 수치는 제시하지 않음.
08

TrajDebug: 실패를 만든 최초의 치명 오류를 추적

TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

Yunjia Qi 외 · arXiv cs.AI · 2026-08-06

Agent debuggingLong horizon

논문 개요

긴 실패 궤적에서 여러 국소 오류 중 최종 실패에 책임 있는 가장 이른 오류를 찾는 문제다. TrajDebug는 멀리 흩어진 증거를 다루기 위해 multi-resolution history compression과 evidence-based identification을 쓰고, 오류가 해소됐는지와 영향이 끝난 시점을 추적한다.

arXiv 원문 보기 ↗

연구 목표

  • cascading failure의 출발점인 critical error를 진단해 실행 가능한 수정 피드백을 만든다.

핵심 방법

  • error lifecycle tracing 및 현실적 실패 궤적 주석 benchmark TrajErrBench.

주요 결과

  • 기존 방법보다 긴 궤적의 오류 위치·영향을 더 정밀하게 찾는 진단을 목표로 제시.

핵심 지표

  • 초록은 정량 비교 결과를 언급하지만 상세 수치는 제시하지 않음.
09

Low Frequency Trap: Video LLM의 단순 사건 집계 한계

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

Sarvesh Baskar 외 · arXiv cs.AI · 2026-08-06

Video LLMEvaluation

논문 개요

실제 영상 benchmark는 사건 수·속도·길이·시각 복잡도를 얽어 놓아 실패 원인을 분리하기 어렵다. 이 논문은 튀는 공의 벽 충돌, blink, 상태 전환을 통제해 만들고, 최종 답뿐 아니라 모델이 보고한 event를 executable ground truth와 대조한다.

arXiv 원문 보기 ↗

연구 목표

  • VLM이 시간적 사건을 어느 조건에서 놓치는지 분해해 진단한다.

핵심 방법

  • trace-grounded parametric profiling으로 event count·frequency 등을 독립 통제.

주요 결과

  • 고빈도·다사건 환경에서 단순 event bookkeeping도 안정적으로 수행하지 못하는 실패 양상을 보고.

핵심 수치

  • 제어 영상 2,190개. 상세 성능 수치는 본문·부록 확인이 필요.
10

AV-AIVAT: 게임 평가 비용을 최대 74배 줄이는 anytime-valid stopping

AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games

arXiv cs.AI · 2026-08-06

Agent evaluationStatistics

논문 개요

두 에이전트의 강약을 판단하려면 승패의 운보다 실력 차이가 드러날 때까지 비용을 들여 게임을 반복해야 한다. AV-AIVAT는 Action-Informed Value Assessment Tool을 anytime-valid stopping과 결합해, 통계적 보장을 깨지 않으면서 증거가 충분한 즉시 평가를 멈춘다.

arXiv 원문 보기 ↗

연구 목표

  • 불완전정보 게임에서 신뢰도 수준을 보장하며 agent comparison 비용을 낮춘다.

핵심 방법

  • AIVAT variance reduction과 optional stopping에도 유효한 confidence sequence를 결합.

주요 결과

  • 고정 게임 수 평가가 낭비하거나 조기 종료하는 문제를 순차적 검증으로 다룬다.

핵심 수치

  • 제목 기준 평가 비용 최대 74× 절감. 적용 조건과 세부 비교는 본문 검증 필요.

수집 메모

Hugging Face Daily Papers는 2026-07-27~2026-08-09에 게시된 항목을 확인한 뒤, 해당 기간 논문을 업보트 순으로 정렬해 상위 주제 적합 논문 6편을 선정했다. arXiv는 최신 cs.AI 제출 목록에서 신뢰성·에이전트 디버깅·비디오 추론·평가 효율 주제 4편을 골랐다. 수치와 결과는 논문 초록 또는 Hugging Face paper metadata에서 저자가 보고한 내용이며, 초록에 수치가 없는 경우 그 사실을 명시했다.

생성 시각: 2026-08-10 09:00 KST · 외부 링크는 원문 초록으로 연결