← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.12 · 09:00 KST

오늘의 AI 리서치

논문 10편 · Hugging Face Daily Papers 최근 14일 트렌딩(업보트 순) 및 arXiv 최신 cs.AI

오늘의 데일리 브리핑

오늘은 에이전트의 실행 환경 자체를 학습·진화시키는 흐름이 두드러진다. Frontis-MA1은 MLE 작업을 직접 개선하고, LongHorizon-Harness와 Ouroboros는 검증된 상태 관리·리뷰된 변경으로 긴 실행과 자기개선을 다룬다.
추론 모델에서는 BDH-CQ가 언어화된 chain-of-thought 대신 반복 latent computation으로 작은 모델의 비용 효율을 끌어올린다. 한편 ABot-World-0과 JoyAI-Video-Edit는 긴 시간축의 비디오 생성·편집을 실제 단일 GPU 환경으로 가져온다.
arXiv 최신 배치는 모델의 감사 가능성·안전성·현실 평가에 무게를 둔다. MMDiff는 멀티모달 행동을 feature 단위로 제어하고, SHE는 safety harness를 rollout으로 진화시키며, DSLE·Sci-VBench는 게임·과학 비디오라는 더 까다로운 평가장을 연다.

Hugging Face 주목 논문 6편

01

ABot-World-0: 데스크톱 GPU 한 장에서 이어지는 인터랙티브 월드

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

Fan Jiang, Zhaoxu Sun, Mengchao Wang 외 · Alibaba AMAP CV Lab · HF 업보트 311 · 2026-07-22 제출

World modelVideoInteractive

논문 개요

AAA 게임·시뮬레이터·인터넷 비디오로 학습한 action-conditioned video world model이다. 키보드 입력으로 장면 이동과 3인칭 캐릭터 조작을 통합하고, 장기 rollout에서 제어 가능성과 시각적 일관성을 유지하는 것을 목표로 한다.

arXiv 원문 보기 ↗

연구 목표

  • 고가의 서버가 아닌 단일 데스크톱 GPU에서도 실시간 장기 폐루프 상호작용을 구현한다.

핵심 방법

  • 14개 결정적 품질 검사와 VLM 평가를 거친 WorldExplorer 데이터, teacher forcing·ODE distillation, 장기 self-rollout 정렬용 LongForcing을 결합.

주요 결과

  • WorldRoamBench와 extended rollout에서 경쟁력 있는 제어성과 일관된 장기 world evolution을 보고.

핵심 지표

  • RTX 5090에서 최대 720p 16 FPS, action-to-first-frame 1.2초, peak VRAM 약 19 GiB.
02

BDH-CQ: 말로 풀지 않는 반복 latent 추론

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

Björn Engdahl, Adrian Kosowski, Jan Chorowski 외 · Pathway · HF 업보트 241 · 2026-08-11 제출

ReasoningRecurrent memoryARC-AGI

논문 개요

입력 예시가 추론 시점의 recurrent memory를 계속 갱신하고, 모델은 중간 사고 과정을 텍스트로 드러내지 않은 채 고차원 latent space에서 반복 계산해 답을 낸다. in-context learning과 latent reasoning을 한 모델 안에서 연결한 접근이다.

arXiv 원문 보기 ↗

연구 목표

  • 작은 모델로도 ARC류 규칙 추론에서 비용-정확도 균형을 개선한다.

핵심 방법

  • 데모 입력을 recurrent memory에 축적하고, verbalized reasoning 없이 iterative latent computation을 수행.

주요 결과

  • ARC-AGI-1의 기존 cost-accuracy Pareto frontier를 넘는 운용점을 보고.

핵심 지표

  • 150M parameters에서 ARC-AGI-1 pass@2 29.5%, task당 계산 추정 비용 US$0.0007.
03

Frontis-MA1: MLE를 개선하는 재귀적 AI4AI 에이전트

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Junlin Yang, Che Jiang, Yu Fu 외 · Frontis AI · HF 업보트 182 · 2026-07-31 제출

AI4AIMLERL

논문 개요

재귀적 자기개선을 추상적 능력이 아니라 실행 가능한 machine learning engineering 문제로 둔다. OpenMLE 위에서 35B Frontis-MA1을 program-evolution agent로 post-train하고, 학습과 장기 탐색을 하나의 loop로 묶는다.

arXiv 원문 보기 ↗

연구 목표

  • AI가 AI 개발 과정을 개선하는 RSI를 검증 가능한 MLE 환경에서 재현 가능하게 연구한다.

핵심 방법

  • OpenMLE-Gym·RL·Evo와 Draft, Improve, Debug, Crossover 4개 operator를 execution-grounded SFT·RL로 학습.

주요 결과

  • held-out NatureBench Lite에서도 모델과 search framework의 전이 효과를 각각 보고.

핵심 지표

  • RTX 4090 1장·12시간/과제에서 Medal Average 39.39%→60.61%, Evo-Max 71.21%.
04

LongHorizon-Harness: 검증된 외부 상태로 긴 에이전트 실행 관리

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma, Hailang Huang, Shun Zou 외 · HF 업보트 166 · 2026-08-04 제출

Agent harnessState managementAudit

논문 개요

긴 과업의 핵심 병목을 모델 지능보다 context에 쌓이는 task state 관리로 본다. 외부 상태는 환경에서 독립 검증한 사실로만 갱신해, 잘못된 자기평가가 다음 행동으로 전파되는 문제를 줄인다.

arXiv 원문 보기 ↗

연구 목표

  • 도구 사용·수정이 얽힌 long-horizon task를 모델 교체 없이 더 안정적으로 수행한다.

핵심 방법

  • Manager가 다음 subtask를 정하고 fresh-context executor가 수행한 뒤, read-only auditor가 환경 상태를 확인하는 MEA loop.

주요 결과

  • 여러 모델·harness·상호작용 도메인에서 일관된 성능 향상을 보고.

핵심 지표

  • Qwen 3.7-Plus: WeaveBench 51.8%→80.7%, Terminal-Bench 2.1 69.7%→77.2%, OSWorld 2.0 2.8%→8.3%.
05

JoyAI-Video-Edit: 미래 프레임 없이 720p 약 30 FPS 편집

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Yicheng Xiao, Wenxun Dai, Xinran Qin 외 · Jingdong · HF 업보트 90 · 2026-08-05 제출

Video editingDiffusionStreaming

논문 개요

끝 길이와 미래 프레임을 알 수 없는 streaming 조건에서 source fidelity와 장기 temporal consistency를 함께 유지하는 16B autoregressive diffusion video editor다.

arXiv 원문 보기 ↗

연구 목표

  • 제한된 자원에서도 low-latency, open-ended 비디오 편집을 가능하게 한다.

핵심 방법

  • chunk-wise autoregressive adaptation, SA-DMD, Long-Horizon Autoregressive Distillation으로 train–inference mismatch와 drift를 완화.

주요 결과

  • 자동·인간 평가에서 기존 streaming editor를 크게 앞서고 강한 offline system과도 경쟁력을 보였다고 보고.

핵심 지표

  • 단일 Nvidia B200에서 end-to-end 720p 편집 약 30 FPS.
06

Ouroboros: 리뷰된 커밋으로 자기 진화하는 코딩 에이전트

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev 외 · HF 업보트 66 · 2026-08-11 제출

Coding agentSelf-evolutionSafety

논문 개요

도구·prompt·context assembly·핵심 구현을 reviewed commit으로 바꾸고, 승인된 변경이 이후 실행의 runtime이 되게 하는 self-developing harness다. 자기개선이 시스템 변경을 뜻하는 만큼 운영 안전을 핵심 문제로 다룬다.

arXiv 원문 보기 ↗

연구 목표

  • 실제 작업에서 드러난 결함과 비효율을 통제된 방식으로 agent core 개선에 반영한다.

핵심 방법

  • 자기개선 자체를 과제로 삼는 recursive free evolution과 일반 작업 경험 기반 evolution을 병행하고, 변경은 리뷰를 거침.

주요 결과

  • frozen snapshot benchmark와 계속 진화하는 live deployment를 분리해 평가 가능성과 운영성을 함께 확보하려 한다.

핵심 지표

  • Opus 5 run: Terminal-Bench 2.1 86.74%, OSWorld-Verified 90.69%; CL-Bench normalized reward 0.2301.

arXiv 최신 논문 4편

07

MMDiff: 멀티모달 모델의 행동 변화를 feature 단위로 찾고 제어

Multimodal Model Diffing for Feature Discovery and Control

Hunar Batra, Lachin Naghashyar, Ashkan Khakzar 외 · arXiv cs.AI · 2026-08-10

InterpretabilityMLLMSAE

논문 개요

멀티모달 학습 뒤 어떤 내부 feature가 달라져 시각 행동을 만들었는지 분리하고 제어하기 어렵다는 문제를 다룬다. MMDiff는 base LM과 multimodal-adapted 모델의 sparse autoencoder를 비교해 변경된 feature를 행동 인터페이스로 전환한다.

arXiv 원문 보기 ↗

연구 목표

  • MLLM의 내부 표현을 사후 관찰에 그치지 않고 감사·표적 제어 가능한 단위로 만든다.

핵심 방법

  • multimodal SAE 학습 후 base-LM SAE와 adapted SAE를 diffing하여 바뀐 feature를 isolation·control에 활용.

주요 결과

  • feature isolation, multimodal behavior discovery, targeted control의 세 활용 경로를 제시.

핵심 지표

  • 초록에는 단일 종합 성능 수치를 제시하지 않음. feature-level 제어 가능성 검증이 중심.
08

SHE: rollout 궤적으로 안전 경계를 진화시키는 agent harness

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

Wanying Qu, Qinghua Mao, Yu Li 외 · arXiv cs.AI · 2026-08-10

Agent safetyHarnessTrajectory

논문 개요

LLM agent의 안전은 모델 가중치뿐 아니라 context·memory·tool permission을 관리하는 harness에 좌우된다. SHE는 safety mechanism을 고정 배포물이 아니라 rollout에서 배운 경계를 통해 변화하는 구성요소로 본다.

arXiv 원문 보기 ↗

연구 목표

  • 새 위험에 맞춰 갱신되면서도 책임 소재가 분명한 agent safety boundary를 만든다.

핵심 방법

  • System Prompt, Rule Bank, Safety Memory, Tool Policy의 4개 artifact로 harness를 분해하고 trajectory 기반으로 국소 진화를 학습.

주요 결과

  • 서로 얽힌 harness 기능을 안전 책임 단위로 나눠 변경 범위와 검증 대상을 명확히 한다.

핵심 지표

  • 초록 기준 정량 benchmark 수치는 별도로 공개하지 않음.
09

DSLE: Dark Souls 보스전으로 만든 실시간 게임 에이전트 환경

DSLE: A Learning Environment for Dark Souls Boss Encounters

Derin Gezgin, Jim O'Connor, Tanner Goodwin 외 · arXiv cs.AI · 2026-08-10

Embodied AIRLBenchmark

논문 개요

Dark Souls: Remastered의 22개 보스전을 Gymnasium-style interface로 감싼 containerized game-playing benchmark다. 실시간 전투, 고차원 시각 입력, sparse terminal reward를 실제 실행 중인 게임의 action으로 연결한다.

arXiv 원문 보기 ↗

연구 목표

  • 지각·반응 속도·장기 전략이 함께 필요한 현실적인 agent 학습 환경을 제공한다.

핵심 방법

  • 서로 다른 난점을 갖는 5개 보스로 구성한 DSLE-5를 시작용 대표 suite로 정의하고, 실제 게임에 action을 전달.

주요 결과

  • random policy, expert system, evolutionary baseline, PPO와 DQN을 비교해 환경의 난도와 통제 가능성을 점검.

핵심 지표

  • 전체 22개 boss encounter, 권장 시작 suite DSLE-5 5개 보스.
10

Sci-VBench: 과학 지식·추론을 요구하는 비디오 생성 평가

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Diandian Zhang, Tingyu Song, Lin Fu 외 · arXiv cs.AI · 2026-08-10

Video generationBenchmarkScientific reasoning

논문 개요

겉보기 그럴듯함을 넘어 과학 지식과 시간적 인과를 담은 비디오를 평가하는 benchmark다. 자연과학·의료·인문사회·공학의 전문가 주석 사례로 knowledge-grounded video synthesis를 측정한다.

arXiv 원문 보기 ↗

연구 목표

  • 과학 도메인에서 비디오 생성 모델의 지식성·추론성을 재현 가능하게 평가한다.

핵심 방법

  • expert-annotated examples와 rubric-based protocol을 만들고, non-expert human·MLLM judge의 전문가 판단 일치도를 분석.

주요 결과

  • 제안 rubric 아래 비전문 인간 평가자와 MLLM-as-Judge도 전문가 평가와 비교적 높은 합의를 보였다고 보고.

핵심 지표

  • 60개 주제·4개 핵심 분야의 1,253개 사례, frontier proprietary model 16개를 benchmark.

수집 메모

Hugging Face Daily Papers는 2026-07-30~2026-08-11(UTC 기준 이용 가능 최신 일자)의 항목을 수집해 업보트·관심도 순으로 검토했다. 그중 agent 실행·자기개선·추론·비디오 생성에 직접 관련된 6편을 선정했다. arXiv는 최신 cs.AI 제출 목록(2026-08-10 배치)에서 멀티모달 해석성, agent 안전, embodied benchmark, 과학 비디오 평가 주제 4편을 골랐다. 정량 수치와 결과는 각 논문 초록 또는 Hugging Face paper metadata에 저자가 보고한 내용이며, 초록에 수치가 없으면 그 사실을 명시했다.

생성 시각: 2026-08-12 09:00 KST · 외부 링크는 원문 초록으로 연결