← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.16 · 09:00 KST

오늘의 AI 리서치

논문 10편 · Hugging Face Daily Papers 최근 14일 트렌딩(업보트 순) 및 arXiv cs.AI 최신 목록

오늘의 데일리 브리핑

오늘은 장기 작업을 수행하는 AI를 ‘모델’이 아니라 검증 가능한 운영 시스템으로 만드는 연구가 중심이다. Spark-to-Paper·Ouroboros·LongHorizon-Harness는 실험 증거, 상태, 변경 이력을 실행 흐름 밖에서 관리하고 리뷰·감사 단계로 다시 연결한다.
에이전트 성능은 최종 점수만으로 판단하기 어려워지고 있다. QuoteBench는 같은 응답도 명령 전달 경로에 따라 성공률이 55.4–73.2%p 떨어질 수 있음을 보여준다.
한편 latent reasoning과 video diffusion은 각각 저비용 ARC 추론과 실시간 영상 편집으로 이어진다. 150M BDH-CQ의 비용 효율, 16B JoyAI-Video-Edit의 720p 30 FPS가 이를 상징한다.
AI scientist·디자인 자동화·형식검증은 실제 연구·제작·코드베이스 단위의 산출물을 평가 대상으로 끌어올리고 있다. 핵심은 그럴듯한 결과가 아니라, 근거·사양·과정을 추적 가능한 형태로 남기는 일이다.

Hugging Face 주목 논문 5편

01

BDH-CQ: 반복 latent reasoning으로 ARC 비용-성능 경계 갱신

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska 외 · HF 업보트 617 · 2026-08-10 공개

ReasoningLatent memoryARC-AGI

논문 개요

입력 예시가 추론 시점에 recurrent memory를 계속 갱신하고, 모델이 중간 사고를 언어로 풀지 않은 채 고차원 latent space에서 반복 계산하도록 만든 reasoning model이다. ARC-AGI-1과 통제된 ARC 유사 개입으로 데모에서 무엇을 학습하는지 분석한다.

arXiv 원문 보기 ↗

연구 목표

  • in-context learning과 latent iterative computation을 결합해 저비용 추론 성능을 높인다.

핵심 방법

  • 입력으로 갱신되는 recurrent memory와 비언어적 중간 계산을 사용한다.

주요 결과

  • 저자 보고 기준 ARC-AGI-1의 기존 비용-정확도 Pareto frontier를 넘었다.

핵심 지표

  • 150M parameter 구성에서 pass@2 29.5%, task당 계산 추론비용 US$0.0007.
02

Spark-to-Paper: 13개 조합형 skill로 연구 아이디어를 논문까지

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai 외 · HF 업보트 277 · 2026-08-12 공개

AI scientistResearch workflowEvidence

논문 개요

별도 agent platform 없이 기존 coding assistant 안에서 13개 composable skill로 문헌 검색, 실험 설계·실행, 근거 기반 주장 수정, 출판용 도표 생성을 잇는다. 결과를 보기 전에 필요한 증거를 정하고, 측정값에 맞춰 원고 주장을 고치도록 계획과 보고를 분리한다.

arXiv 원문 보기 ↗

연구 목표

  • 긴 연구 생성 과정에서 실험 증거를 중심으로 완결된 논문 생산을 구현한다.

핵심 방법

  • 결정론적 integrity check, self-critique, adversarial review와 벡터 도표 생성으로 장기 작업을 점검한다.

주요 결과

  • full integrity·review stack이 단일 초안보다 fabrication 탐지율을 크게 높였다고 보고한다.

핵심 지표

  • 8개 통제 연구 주제에서 citation validity 99.5%, figure editability 96.4%, 평균 3.2시간·US$8.1/원고.
03

LongHorizon-Harness: 장기 에이전트의 상태를 실행 바깥에서 검증

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang 외 · HF 업보트 171 · 2026-08-03 공개

Agent harnessState managementTool use

논문 개요

긴 작업에서 context 안에 누적된 task state와 자기평가가 오류를 증폭시키는 문제를 다룬다. task state를 실행과 분리하고 환경에서 독립 검증된 사실만 반영하는 Manage-Execute-Audit(MEA) loop를 구성한다.

arXiv 원문 보기 ↗

연구 목표

  • 상호 의존적인 장기 task에서 상태 추적과 완료 판정의 신뢰도를 높인다.

핵심 방법

  • manager, fresh-context executor, read-only auditor를 분리하고 AgentAdapter로 기존 agent loop에 연결한다.

주요 결과

  • 여러 모델·harness·상호작용 도메인에서 일관된 향상을 보고했다.

핵심 지표

  • Qwen 3.7-Plus: WeaveBench 51.8→80.7%, Terminal-Bench 2.1 69.7→77.2%, OSWorld 2.0 2.8→8.3%.
04

JoyAI-Video-Edit: 미래 프레임 없이 30 FPS로 영상 편집

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang 외 · HF 업보트 93 · 2026-08-04 공개

Video editingDiffusionReal-time

논문 개요

미래 프레임이나 사전 지정된 영상 길이 없이 저지연으로 편집하는 16B autoregressive diffusion framework다. chunk-wise adaptation, Source-Anchored Distribution Matching Distillation(SA-DMD), long-horizon autoregressive distillation으로 2-step 생성의 원본 충실도와 장기 시간 일관성을 겨냥한다.

arXiv 원문 보기 ↗

연구 목표

  • 제한된 계산 자원에서도 open-ended 영상 편집의 지연시간·시간 일관성 문제를 함께 해결한다.

핵심 방법

  • source-anchored distillation과 장기 autoregressive distillation으로 train–inference mismatch와 누적 drift를 줄인다.

주요 결과

  • 자동·인간 평가에서 기존 streaming editor를 크게 앞서고 강한 offline system과 경쟁적이었다고 보고한다.

핵심 지표

  • 단일 Nvidia B200 GPU에서 720p end-to-end 영상 편집 약 30 FPS.
05

Ouroboros: 리뷰된 commit으로 자기 개선하는 coding agent

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov 외 · HF 업보트 85 · 2026-08-08 공개

Coding agentSelf-improvementSafety

논문 개요

tools, prompts, context assembly, core implementation을 reviewed commit으로 개선하고, 승인된 변경이 다음 작업의 runtime이 되게 하는 self-developing agent harness다. 자유 진화와 일반 작업 경험에서 나온 결함 개선을 병행하되, 자기 코드·API 선택이 가능한 만큼 운영 안전성을 핵심 설계 문제로 둔다.

arXiv 원문 보기 ↗

연구 목표

  • 장기 작업의 경험을 agent core 개선으로 축적하면서 변경 통제 장치를 유지한다.

핵심 방법

  • reviewed structural change, frozen benchmark snapshot, 별도 live-evolution lineage를 사용한다.

주요 결과

  • 저자 보고 기준 Terminal-Bench·OSWorld-Verified·CL-Bench에서 최고 기록을 제시했다.

핵심 지표

  • Opus 5 run: Terminal-Bench 2.1 86.74%, OSWorld-Verified 90.69%; CL-Bench normalized reward 0.2301.

arXiv 최신 논문 5편

06

AutoDesign: 장기 design agent를 위한 meta-harness 최적화

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan 외 · arXiv cs.CV/cs.AI/cs.CL · 2026-08-13 목록

Agentic designMeta-harnessPoster generation

논문 개요

multimodal source를 구조화된 media로 압축하는 장기 agentic process에서, meta-harness optimizer가 rollout feedback으로 code agent의 harness를 재귀적으로 개선한다. 논문-포스터 생성에 적용하고 100편 규모 PosterBench를 제안했다.

arXiv 원문 보기 ↗

연구 목표

  • 사람의 디자인 선호와 경험 축적을 반영하는 재사용 가능한 design harness를 만든다.

핵심 방법

  • meta-harness optimizer가 rollout feedback을 이용해 DesignHarness를 개선하고 code agent에 적용한다.

주요 결과

  • 7개 통제 구성에서 learned DesignHarness가 일관되게 성능을 높였다고 보고한다.

핵심 지표

  • PosterBench 78.32, Claude Design 대비 +7.45; 평균 54.99→67.39(+12.4%); 40분·US$3 미만의 253 tool call.
07

OmniScientist: 원시 다중모달 증거에서 논문까지

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu · arXiv cs.AI/cs.CL · 2026-08-13 목록

AI scientistMultimodalScientific discovery

논문 개요

텍스트·코드·사전 계산 요약에만 의존하던 AI scientist를 넘어, 이미지·신호·오디오·영상·3D 구조 등 원시 증거를 직접 다루는 end-to-end system이다. perception layer와 ideation·experiment·writeup의 세 autonomous agent를 deterministic pipeline에 넣고 novelty·통계·provenance·수치 traceability를 코드로 확인한다.

arXiv 원문 보기 ↗

연구 목표

  • 연구 전 주기에 걸쳐 evidence-grounded scientific discovery를 자동화한다.

핵심 방법

  • raw evidence를 지각하고 아이디어·엄밀성·주장 점검을 결정론적 검증으로 묶는다.

주요 결과

  • 36개 실제 데이터 사례 모두에서 원시 데이터부터 compiled manuscript까지의 경로를 완료했다.

핵심 지표

  • 평균 paper score 6.3, scalar feature만 쓴 blind variant와 비교한 head-to-head 승률 85%.
08

QuoteBench: 같은 점수 뒤에 숨은 명령 전달 경로 실패

QuoteBench: How Matched Scores Can Hide Command-Path Failures

Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang · arXiv cs.AI/cs.SE · 2026-08-13 목록

Coding agentEvaluationReliability

논문 개요

coding agent의 Bash 명령은 interface에서 serialize·wrap·reparse되므로, 실행 점수가 같아도 모델의 명령 생성 오류와 전송 경로 오류를 구분하지 못할 수 있다. QuoteBench는 의도적으로 unescaped parser를 하나 추가해 이 경계를 exact final-state validation으로 측정한다.

arXiv 원문 보기 ↗

연구 목표

  • 명령 생성 contract와 execution transport를 분리해 평가한다.

핵심 방법

  • 14개 incident-derived family의 56개 one-shot task와 replay·boundary disclosure 조건을 교차한다.

주요 결과

  • 추가 parser는 동일 응답의 성공률을 크게 낮췄고, 경계 공개 뒤 회복 정도는 모델 구성마다 달랐다.

핵심 지표

  • 8개 구성에서 성공률 55.4–73.2 percentage points 하락; 6개 구성은 공개 후 30.4–60.7 points 회복.
09

Vero: AI agent는 형식검증된 repository를 만들 수 있는가

Vero: Can AI Agents Build Formally Verified Software Repositories?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan 외 · arXiv cs.LG/cs.AI/cs.LO/cs.PL/cs.SE · 2026-08-13 목록

Formal verificationCoding agentBenchmark

논문 개요

구현과 specification의 machine-checked proof를 함께 생성하는 repository-level benchmark다. 실제 repository에서 만든 43개 multi-module Lean 4 instance에 대해, 구현·proof 선택을 일관되게 할 수 있는지 평가하며 agent가 사양 불만족이나 reference code 오류를 형식적으로 증명할 수 있는 audit도 둔다.

arXiv 원문 보기 ↗

연구 목표

  • 함수 단위가 아닌 실제 다중 모듈 코드베이스의 검증된 software synthesis를 측정한다.

핵심 방법

  • Python·Dafny·Verus·Coq 도메인에서 수집한 Lean 4 repository와 code-and-proof/proof-only 모드를 제공한다.

주요 결과

  • 강한 agent도 가장 어려운 repository에서는 사양을 닫지 못해 현 수준의 한계를 보였다고 보고한다.

핵심 지표

  • 43개 instance 중 strongest agent가 완전히 푼 것은 27개.
10

Mimir v1: 허용 가능한 데이터만으로 학습한 1B HRM

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech 외 · arXiv cs.CL/cs.AI · 2026-08-13 목록

Open modelReasoningData governance

논문 개요

대규모 모델 개발에 쓰이는 비허용 데이터의 장벽을 겨냥해, 161개 dataset의 permissible post-training data만 사용한 1B-parameter Hierarchical Reasoning Model(HRM)을 제시한다. 영어·수학·코드·덴마크어를 포함한 20개 benchmark에서 평가했다.

arXiv 원문 보기 ↗

연구 목표

  • 개방형·윤리적 데이터 제약 아래에서도 경쟁력 있는 소형 reasoning model을 만든다.

핵심 방법

  • HRM architecture 기반 1B model을 161개 데이터셋 혼합으로 post-training한다.

주요 결과

  • 원래 HRM-Text 1B를 앞서고, 일부 더 큰 frontier model과 경쟁적 성능을 보였다고 보고한다.

핵심 지표

  • 1B parameters, 161 datasets, English·Math & Code·Danish 20개 benchmark 평가.

수집 메모

Hugging Face Daily Papers는 2026-08-02~2026-08-15(UTC) 공개 항목만 필터링한 뒤 업보트 순으로 정렬해 상위 주목 논문을 선정했다. arXiv는 cs.AI 최신 API 목록(2026-08-13 제출본)을 확인해 5편을 골랐다. 정량 수치와 결과는 각 논문 저자가 초록에서 보고한 내용이며, 독립 재현 또는 외부 검증을 뜻하지 않는다.

생성 시각: 2026-08-16 09:00 KST · 외부 링크는 원문 초록으로 연결