← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.17 · 09:00 KST

오늘의 AI 리서치

논문 9편 · Hugging Face Daily Papers 최근 14일 트렌딩(업보트 순) + arXiv cs.AI 최신 공개 목록

오늘의 데일리 브리핑

이번 흐름의 중심은 ‘장기 에이전트가 실제 산출물을 얼마나 신뢰성 있게 끝낼 수 있는가’다. AutoDesign과 OmniScientist는 디자인·과학 작업을 단일 프롬프트가 아닌 반복 실행, 검증, 추적 가능한 워크플로로 다룬다.
동시에 QuoteBench와 Vero는 에이전트의 높은 최종 점수가 실행 경로 오류나 형식적 정확성을 보장하지 않는다고 지적한다. 평가 단위가 답변에서 실행 경계와 repository 수준 사양으로 옮겨가고 있다.
모델 자체에서는 BDH-CQ의 저비용 latent reasoning, Mimir v1의 허용 데이터 기반 1B HRM처럼 비용·데이터 거버넌스를 함께 최적화하려는 시도가 눈에 띈다.
핵심은 더 많은 tool call이 아니라, 증거·상태·사양을 작업 흐름 밖에서도 점검할 수 있게 만드는 설계다.

Hugging Face 주목 논문 4편

01

BDH-CQ: 반복 latent reasoning으로 ARC 비용-성능 경계 갱신

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska 외 · HF 업보트 637 · 2026-08-10 공개

ReasoningLatent memoryARC-AGI

논문 개요

입력 예시가 추론 시점에 recurrent memory를 계속 갱신하고, 중간 사고를 언어로 풀지 않은 채 고차원 latent space에서 반복 계산하는 reasoning model이다. ARC-AGI-1 및 통제된 ARC 유사 개입으로 데모에서 무엇을 학습하는지도 분석했다.

arXiv 원문 보기 ↗

연구 목표

  • in-context learning과 반복 latent computation을 결합해 저비용 추론 성능을 높인다.

핵심 방법

  • 입력으로 갱신되는 recurrent memory와 비언어적 중간 계산을 사용한다.

주요 결과

  • 저자 보고 기준 ARC-AGI-1의 기존 비용-정확도 Pareto frontier를 넘었다.

핵심 지표

  • 150M parameters에서 pass@2 29.5%, task당 계산 추론비용 US$0.0007.
02

Spark-to-Paper: 13개 조합형 skill로 연구 아이디어를 논문까지

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai 외 · HF Daily Papers · 2026-08-12 공개

AI scientistResearch workflowEvidence

논문 개요

기존 coding assistant 안에서 13개 composable skill로 문헌 검색, 실험 설계·실행, 근거 기반 주장 수정, 출판용 도표 생성을 잇는 연구 생성 워크플로다. 결과를 보기 전 필요한 증거를 정하고, 측정값에 맞춰 원고의 주장을 고치도록 계획과 보고를 분리한다.

arXiv 원문 보기 ↗

연구 목표

  • 긴 연구 생성 과정에서 실험 증거를 중심으로 완결된 논문 생산을 구현한다.

핵심 방법

  • integrity check, self-critique, adversarial review, 벡터 도표 생성을 조합한다.

주요 결과

  • full integrity·review stack이 단일 초안보다 fabrication 탐지율을 높였다고 보고한다.

핵심 지표

  • 8개 통제 연구 주제에서 citation validity 99.5%, figure editability 96.4%, 평균 3.2시간·US$8.1/원고.
03

LongHorizon-Harness: 장기 에이전트의 상태를 실행 바깥에서 검증

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang 외 · HF Daily Papers · 2026-08-03 공개

Agent harnessState managementTool use

논문 개요

긴 작업에서 context에 누적된 task state와 자기평가가 오류를 증폭시키는 문제를 다룬다. task state를 실행과 분리하고, 환경에서 독립 검증된 사실만 반영하는 Manage-Execute-Audit(MEA) loop를 구성한다.

arXiv 원문 보기 ↗

연구 목표

  • 상호 의존적인 장기 task에서 상태 추적과 완료 판정의 신뢰도를 높인다.

핵심 방법

  • manager, fresh-context executor, read-only auditor를 분리하고 AgentAdapter로 기존 loop에 연결한다.

주요 결과

  • 여러 모델·harness·상호작용 도메인에서 일관된 향상을 보고했다.

핵심 지표

  • Qwen 3.7-Plus: WeaveBench 51.8→80.7%, Terminal-Bench 2.1 69.7→77.2%, OSWorld 2.0 2.8→8.3%.
04

JoyAI-Video-Edit: 미래 프레임 없이 30 FPS로 영상 편집

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang 외 · HF 업보트 94 · 2026-08-04 공개

Video editingDiffusionReal-time

논문 개요

미래 프레임이나 사전 지정된 영상 길이 없이 저지연으로 편집하는 16B autoregressive diffusion framework다. chunk-wise adaptation, Source-Anchored Distribution Matching Distillation(SA-DMD), long-horizon autoregressive distillation으로 원본 충실도와 장기 시간 일관성을 겨냥한다.

arXiv 원문 보기 ↗

연구 목표

  • 제한된 계산 자원에서도 open-ended 영상 편집의 지연시간·시간 일관성 문제를 함께 해결한다.

핵심 방법

  • source-anchored 및 장기 autoregressive distillation으로 train–inference mismatch와 누적 drift를 줄인다.

주요 결과

  • 자동·인간 평가에서 기존 streaming editor를 크게 앞서고 강한 offline system과 경쟁적이었다고 보고한다.

핵심 지표

  • 단일 Nvidia B200 GPU에서 720p end-to-end 영상 편집 약 30 FPS.

arXiv 최신 논문 5편

05

AutoDesign: 장기 design agent를 위한 meta-harness 최적화

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan 외 · arXiv cs.CV/cs.AI/cs.CL · 2026-08-13 제출

Agentic designMeta-harnessPoster generation

논문 개요

multimodal source를 구조화된 media로 압축하는 장기 agentic process에서, meta-harness optimizer가 rollout feedback으로 code agent의 harness를 재귀적으로 개선한다. 논문-포스터 생성에 적용하고 100편 규모 PosterBench를 제안했다.

arXiv 원문 보기 ↗

연구 목표

  • 사람의 디자인 선호와 경험 축적을 반영하는 재사용 가능한 design harness를 만든다.

핵심 방법

  • meta-harness optimizer가 rollout feedback을 이용해 DesignHarness를 개선하고 code agent에 적용한다.

주요 결과

  • 7개 통제 구성에서 learned DesignHarness가 일관되게 성능을 높였다고 보고한다.

핵심 지표

  • PosterBench 78.32, Claude Design 대비 +7.45; 평균 54.99→67.39(+12.4%); 253 tool call, 40분, US$3 미만.
06

OmniScientist: 원시 다중모달 증거에서 논문까지

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu · arXiv cs.AI/cs.CL · 2026-08-13 제출

AI scientistMultimodalScientific discovery

논문 개요

텍스트·코드·사전 계산 요약에만 의존하던 AI scientist를 넘어 이미지·신호·오디오·영상·3D 구조 등 원시 증거를 직접 다루는 end-to-end system이다. perception layer와 ideation·experiment·writeup agent를 deterministic pipeline에 넣고 novelty·통계·provenance·수치 traceability를 코드로 확인한다.

arXiv 원문 보기 ↗

연구 목표

  • 연구 전 주기에 걸쳐 evidence-grounded scientific discovery를 자동화한다.

핵심 방법

  • raw evidence를 지각하고 아이디어·엄밀성·주장 점검을 결정론적 검증으로 묶는다.

주요 결과

  • 36개 실제 데이터 사례 모두에서 원시 데이터부터 compiled manuscript까지의 경로를 완료했다.

핵심 지표

  • 5개 discipline family·4개 evidence family, 평균 paper score 6.3, blind scalar-feature variant 대비 head-to-head 승률 85%.
07

QuoteBench: 같은 점수 뒤에 숨은 명령 전달 경로 실패

QuoteBench: How Matched Scores Can Hide Command-Path Failures

Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang · arXiv cs.AI/cs.SE · 2026-08-13 제출

Coding agentEvaluationReliability

논문 개요

coding agent의 Bash 명령은 interface에서 serialize·wrap·reparse되므로, 실행 점수가 같아도 모델의 명령 생성 오류와 전송 경로 오류를 구분하지 못할 수 있다. QuoteBench는 의도적으로 unescaped parser를 하나 추가해 이 경계를 exact final-state validation으로 측정한다.

arXiv 원문 보기 ↗

연구 목표

  • 명령 생성 contract와 execution transport를 분리해 평가한다.

핵심 방법

  • 14개 incident-derived family의 56개 one-shot task와 replay·boundary disclosure 조건을 교차한다.

주요 결과

  • 추가 parser는 동일 응답의 성공률을 크게 낮췄고, 경계 공개 뒤 회복 정도는 모델 구성마다 달랐다.

핵심 지표

  • 8개 구성에서 성공률 55.4–73.2 percentage points 하락; 6개 구성은 공개 후 30.4–60.7 points 회복.
08

Vero: AI agent는 형식검증된 repository를 만들 수 있는가

Vero: Can AI Agents Build Formally Verified Software Repositories?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan 외 · arXiv cs.LG/cs.AI/cs.LO/cs.PL/cs.SE · 2026-08-13 제출

Formal verificationCoding agentBenchmark

논문 개요

구현과 specification의 machine-checked proof를 함께 생성하는 repository-level benchmark다. 실제 repository에서 만든 43개 multi-module Lean 4 instance에 대해 구현·proof 선택의 일관성을 평가하고, 사양 불만족이나 reference code 오류를 형식적으로 증명할 수 있는 audit도 둔다.

arXiv 원문 보기 ↗

연구 목표

  • 함수 단위가 아닌 실제 다중 모듈 코드베이스의 검증된 software synthesis를 측정한다.

핵심 방법

  • Python·Dafny·Verus·Coq 도메인에서 수집한 Lean 4 repository와 code-and-proof/proof-only 모드를 제공한다.

주요 결과

  • 강한 agent도 가장 어려운 repository에서는 사양을 닫지 못해 현 수준의 한계를 보였다.

핵심 지표

  • 43개 instance 중 strongest agent가 완전히 푼 것은 27개.
09

Mimir v1: 허용 가능한 데이터만으로 학습한 1B HRM

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech · arXiv cs.CL/cs.AI · 2026-08-13 제출

Open modelReasoningData governance

논문 개요

대규모 모델 개발에 쓰이는 비허용 데이터의 장벽을 겨냥해, 161개 dataset의 permissible post-training data만 사용한 1B-parameter Hierarchical Reasoning Model(HRM)을 제시한다. 영어·수학·코드·덴마크어를 포함한 20개 benchmark에서 평가했다.

arXiv 원문 보기 ↗

연구 목표

  • 개방형·윤리적 데이터 제약 아래에서도 경쟁력 있는 소형 reasoning model을 만든다.

핵심 방법

  • HRM architecture 기반 1B model을 161개 데이터셋 혼합으로 학습한다.

주요 결과

  • 원래 HRM-Text 1B를 앞서고, 일부 더 큰 frontier model과 경쟁적 성능을 보였다고 보고한다.

핵심 지표

  • 1B parameters, 161 datasets, English·Math & Code·Danish 20개 benchmark 평가.

수집 메모

Hugging Face Daily Papers는 API가 제공한 최신 공개일(2026-08-14 UTC)까지의 최근 14일 항목을 수집해 업보트/트렌딩 순으로 검토했다. 실행일인 2026-08-17 KST에는 2026-08-15~17 UTC Daily Papers 목록이 아직 제공되지 않았다. arXiv는 cs.AI submittedDate 내림차순 API 목록을 확인했다. 정량 수치와 결과는 모두 원문 초록에서 저자가 보고한 내용이며, 독립 재현 또는 외부 검증을 뜻하지 않는다.

생성 시각: 2026-08-17 09:00 KST · 외부 링크는 해당 논문의 arXiv 초록으로 연결