← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.15 · 09:00 KST

오늘의 AI 리서치

논문 10편 · Hugging Face Daily Papers 최근 14일 트렌딩(업보트 순) 및 arXiv cs.AI 최신 목록

오늘의 데일리 브리핑

오늘의 흐름은 ‘모델 자체’보다 모델이 작동하는 실행 구조를 정교하게 만드는 데 있다. LongHorizon-Harness와 QuoteBench는 에이전트의 최종 점수만으로는 상태 관리·명령 전달 경로의 실패를 놓친다고 지적하며, 외부 검증과 최종 상태 검사를 핵심 장치로 둔다.
한편 BDH-CQ와 StateBridge는 텍스트 토큰만으로는 제한되는 추론·협업 정보를 latent state로 다뤄, 작은 모델의 추론 비용 또는 다중 에이전트 통신 손실을 줄이려 한다.
월드 모델은 영상 생성의 잠재표현을 4D 장면·자율주행 계획으로 재사용하는 단계로 옮겨가고 있다. 재학습이나 test-time 미래 프레임 생성 없이도 전이성과 지연시간을 개선하려는 접근이 두드러진다.
AI scientist 연구에서는 raw evidence를 직접 읽는 전 과정 자동화와, 장기 R&D agent의 과정 품질을 평가하는 틀이 동시에 제안됐다. 성능 수치뿐 아니라 근거 추적·경험 재사용·방법론적 새로움을 따로 검증해야 한다는 신호다.

Hugging Face 주목 논문 5편

01

BDH-CQ: 반복 latent reasoning으로 ARC 비용-성능 경계 갱신

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska 외 · HF 업보트 604 · 2026-08-10 공개

ReasoningLatent memoryARC-AGI

논문 개요

입력 예시가 추론 시점에 recurrent memory를 지속적으로 갱신하고, 모델이 중간 사고 과정을 언어로 풀지 않은 채 고차원 latent space에서 반복 계산하도록 한 reasoning model이다. ARC-AGI-1과 통제된 ARC 유사 개입으로 데모에서 무엇을 학습하는지 분석한다.

arXiv 원문 보기 ↗

연구 목표

  • in-context learning과 latent iterative computation을 결합해 저비용 추론 성능을 높인다.

핵심 방법

  • 입력으로 갱신되는 recurrent memory와 비언어적 중간 계산을 사용한다.

주요 결과

  • 저자 보고 기준 ARC-AGI-1의 기존 비용-정확도 Pareto frontier를 넘었다.

핵심 지표

  • 150M parameter 구성에서 pass@2 29.5%, task당 계산 추론비용 US$0.0007.
02

Beyond Pixels: 영상 latent에서 직접 4D 세계를 생성

Beyond Pixels: From Video Priors to 4D Worlds

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang · HF 업보트 176 · 2026-08-11 공개

4D generationVideo latentWorld model

논문 개요

생성된 RGB 영상을 별도 4D 모델로 복원하는 과정의 distribution mismatch를 피하기 위해, video model의 최종 denoised latent를 명시적 4D 예측에 쓰는 Latent-to-4D를 제안한다. 같은 VAE 계열의 여러 video diffusion transformer로 하나의 checkpoint를 그대로 옮길 수 있다.

arXiv 원문 보기 ↗

연구 목표

  • 특정 video generator에 묶이지 않는 재사용 가능한 4D 생성 인터페이스를 만든다.

핵심 방법

  • video latent를 pretrained 4D decoder token grid와 정렬하고 frame-wise·global spatiotemporal attention으로 정제한다.

주요 결과

  • 약 1K reconstruction clip 학습만으로 여러 video diffusion transformer에 전이됐다.

핵심 지표

  • Text4D-200/I4D-200에서 DINO-F1이 Wan+4RC cascade보다 각각 2.88–3.45, 5.81 points 높았다.
03

LongHorizon-Harness: 장기 에이전트의 상태를 실행 바깥에서 검증

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang 외 · HF 업보트 171 · 2026-08-03 공개

Agent harnessState managementTool use

논문 개요

긴 작업에서 context 안에 누적된 task state와 자기평가가 오류를 증폭시키는 문제를 다룬다. task state를 실행과 분리하고 환경에서 독립 검증된 사실만 반영하는 Manage-Execute-Audit(MEA) loop를 구성한다.

arXiv 원문 보기 ↗

연구 목표

  • 상호 의존적인 장기 task에서 상태 추적과 완료 판정의 신뢰도를 높인다.

핵심 방법

  • manager, fresh-context executor, read-only auditor를 분리하고 AgentAdapter로 기존 agent loop에 연결한다.

주요 결과

  • 여러 모델·harness·상호작용 도메인에서 일관된 향상을 보고했다.

핵심 지표

  • Qwen 3.7-Plus: WeaveBench 51.8→80.7%, Terminal-Bench 2.1 69.7→77.2%, OSWorld 2.0 2.8→8.3%.
04

SimWAM: 미래 영상 생성 없이 학습하는 자율주행 World-Action Model

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun 외 · HF 업보트 103 · 2026-08-07 공개

Autonomous drivingWorld-action modelFlow matching

논문 개요

video dynamics prior를 행동 예측으로 옮기되, 추론 시 미래 프레임을 생성하는 비용을 없앤 end-to-end planner다. pretrained video expert와 가벼운 action expert를 joint flow matching으로 함께 학습하고, attention mask로 action prediction이 미래 frame을 보지 못하게 한다.

arXiv 원문 보기 ↗

연구 목표

  • WAM의 video prior 장점은 유지하면서 test-time latency를 낮춘다.

핵심 방법

  • 독립된 두 expert를 unified attention interface로 연결하고 compositional driving reward로 RL 최적화한다.

주요 결과

  • 낮은 지연시간으로 기존 WAM planner를 앞서고 nuScenes에 zero-shot 전이했다.

핵심 지표

  • NAVSIM에서 PDMS 91.5.
05

LLMRouter: 비용·품질을 함께 보는 LLM routing 공통 기반

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai 외 · HF 업보트 89 · 2026-08-07 공개

LLM routingInfrastructureCost

논문 개요

질문과 예산마다 최적 LLM이 다른 문제를 sequential decision process로 통일해 정식화한다. context/model encoder, scoring, decision rule, learning signal의 다섯 구성요소로 single-turn부터 personalized routing까지 포괄하며, xRouteBench와 16종 이상 router 구현을 제공한다.

arXiv 원문 보기 ↗

연구 목표

  • 서로 다른 router의 공정한 비교와 확장을 위한 공통 평가·배포 기반을 구축한다.

핵심 방법

  • routing supervision 자동 구성과 response quality·inference cost의 공동 평가 pipeline을 사용한다.

주요 결과

  • learned router가 고정 모델 baseline을 넘었고, 예산이 낮을수록 lightweight router의 경쟁력이 커졌다.

핵심 지표

  • 가장 강한 fixed-model baseline 대비 상대 14.6% 향상.

arXiv 최신 논문 5편

06

OmniScientist: 원시 다중모달 증거에서 논문까지

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu · arXiv cs.AI/cs.CL · 2026-08-13 목록

AI scientistMultimodalScientific discovery

논문 개요

텍스트·코드·사전 계산 요약에만 의존하던 AI scientist를 넘어, 이미지·신호·오디오·영상·3D 구조 등 원시 증거를 직접 다루는 end-to-end system이다. perception layer와 ideation·experiment·writeup의 세 autonomous agent를 deterministic pipeline에 넣고, novelty·통계·실행 provenance·수치 traceability를 코드로 확인한다.

arXiv 원문 보기 ↗

연구 목표

  • 연구 전 주기에 걸쳐 evidence-grounded scientific discovery를 자동화한다.

핵심 방법

  • raw evidence를 지각하고, 아이디어·엄밀성·주장 점검을 결정론적 검증으로 묶는다.

주요 결과

  • 36개 실제 데이터 사례 모두에서 원시 데이터부터 compiled manuscript까지의 경로를 완료했다.

핵심 지표

  • 평균 paper score 6.3, scalar feature만 쓴 blind variant와 비교한 head-to-head 승률 85%.
07

QuoteBench: 같은 점수 뒤에 숨은 명령 전달 경로 실패

QuoteBench: How Matched Scores Can Hide Command-Path Failures

Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang · arXiv cs.AI/cs.SE · 2026-08-13 목록

Coding agentEvaluationReliability

논문 개요

coding agent의 Bash 명령은 interface에서 serialize·wrap·reparse되므로, 실행 점수가 같아도 모델의 명령 생성 오류와 전송 경로 오류를 구분하지 못할 수 있다. QuoteBench는 의도적으로 unescaped parser를 하나 추가해 이 경계를 exact final-state validation으로 측정한다.

arXiv 원문 보기 ↗

연구 목표

  • 명령 생성 contract와 execution transport를 분리해 평가한다.

핵심 방법

  • 14개 incident-derived family의 56개 one-shot task와 replay·boundary disclosure 조건을 교차한다.

주요 결과

  • 추가 parser는 동일 응답의 성공률을 크게 낮췄고, 경계 공개 뒤 회복 정도는 모델 구성마다 달랐다.

핵심 지표

  • 8개 구성에서 성공률 55.4–73.2 percentage points 하락; 6개 구성은 공개 후 30.4–60.7 points 회복.
08

AlayaWorld v1.1: 조건 신호를 video latent의 시간 구조에 맞추다

AlayaWorld: Interactive Long-Horizon World Modeling - Full Technical Report (v1.1)

AlayaWorld Team: Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge 외 · arXiv cs.AI · 2026-08-13 목록

World modelVideo generationLong horizon

논문 개요

기존 backbone·chunk-wise autoregressive generation·학습 데이터는 유지한 채, conditioning signal이 생성 영상과 latent representation·temporal structure 모두에서 맞아야 한다는 원칙으로 v1.1을 개정했다. depth-warping spatial memory를 streaming 3D point-cache renderer로 바꾸고 조건을 causal-VAE latent space에서 인코딩한다.

arXiv 원문 보기 ↗

연구 목표

  • 장기 interactive world generation에서 공간 memory와 시간 조건의 정합성을 높인다.

핵심 방법

  • motion-aware latent conditioning, continuous re-rendered memory, hard memory dropout 등 6개 변경을 적용한다.

주요 결과

  • camera AdaLN branch를 제거하고, re-rendered spatial condition만으로 viewpoint control을 제공하도록 설계를 단순화했다.

핵심 지표

  • 초록에는 v1.1의 정량 비교 수치가 제시되지 않았다.
09

장기 AI R&D agent 평가: 최종 점수보다 과정 병목을 본다

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang 외 · arXiv cs.AI · 2026-08-13 목록

Agent evaluationLong horizonR&D

논문 개요

장기 실험으로 모델·시스템을 개선하는 agent는 최종 score만으로 평가하면 어느 단계에서 성과가 나거나 잃는지 알 수 없다. Solution Framing, Execution, Feedback Control의 rule-based process metric과 task 안팎의 경험 재사용 비교를 결합해 frontier model 7종을 분석한다.

arXiv 원문 보기 ↗

연구 목표

  • long-horizon AI R&D agent의 과정 품질과 경험 축적 능력을 체계적으로 파악한다.

핵심 방법

  • within-run 행동 분석과 controlled experience-reuse 비교를 함께 적용한다.

주요 결과

  • 현재 agent는 완전한 자율 연구자보다는 확립된 기법을 조합·적응하는 engineering optimizer에 가깝고, 방법론적 새로움은 드물었다.

핵심 지표

  • 7개 frontier model, 36개 long-horizon task를 평가했다.
10

StateBridge: 학습 없이 hidden state를 직접 잇는 에이전트 통신

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras · arXiv cs.AI · 2026-08-13 목록

Multi-agentLatent communicationTraining-free

논문 개요

다중 LLM agent가 text token으로 통신할 때 sender의 연속 hidden state 정보가 사라지는 문제를 다룬다. sender final-layer hidden state를 receiver input space에 closed-form orthogonal transformation으로 맞춘 뒤 continuous prefix로 넣어, 별도 projector 학습 없이 latent communication을 구현한다.

arXiv 원문 보기 ↗

연구 목표

  • 기존 pretrained model의 이식성을 해치지 않으면서 multi-agent 통신 병목을 줄인다.

핵심 방법

  • orthogonal alignment에 norm calibration과 vocabulary anchoring을 더해 입력 분포 호환성을 유지한다.

주요 결과

  • 수학 추론·코드 생성·질의응답에서 강한 baseline을 일관되게 앞섰다고 보고했다.

핵심 지표

  • 2개 model family의 4개 모델, 26개 model-task pair 중 22개에서 최고 또는 동률 최고 점수.

수집 메모

Hugging Face Daily Papers는 2026-08-01~2026-08-14(UTC) 공개 항목을 수집해 실제 논문 공개일이 이 기간인 20편을 대상으로 업보트 순으로 정렬했고, 상위 주목 논문 5편을 선정했다. arXiv는 cs.AI recent listing에서 2026-08-13 신규 목록을 확인해 5편을 선정했다. 정량 수치와 결과는 각 논문 저자가 초록에서 보고한 내용이며, 독립 재현 또는 외부 검증을 뜻하지 않는다.

생성 시각: 2026-08-15 09:00 KST · 외부 링크는 원문 초록으로 연결