← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.14 · 09:00 KST

오늘의 AI 리서치

논문 10편 · Hugging Face Daily Papers 최근 14일 트렌딩(업보트 순) 및 arXiv 최신 AI 관련 제출

오늘의 데일리 브리핑

오늘의 키워드는 ‘에이전트의 능력을 모델 밖 구조로 옮기고, 그 구조를 검증 가능한 실행으로 묶는 일’이다. Spark-to-Paper와 AI4AI at Test-Time은 검색·실험·추론의 불안정한 부분을 코드와 harness로 분리해, 재학습 없이도 결과 신뢰도를 높이려 한다.
장기 실행에서는 외부 API·문서·환경 상태를 정확히 연결하는 능력이 여전히 병목이다. VAKRA는 합성 API 환경에서도 compositional task 성능이 50% 수준으로 떨어짐을 보여 준다.
생성 분야는 동영상의 실시간성과 제어 가능성으로 관심이 이동한다. JoyAI-Video-Edit은 단일 B200에서 720p 약 30 FPS를, AVA-Encoder는 영상 자체를 에이전트가 질의·편집 가능한 지식 그래프로 바꾸는 방식을 제안한다.
한편 자기진화·공진화 에이전트가 늘면서, 평가 가능한 스냅샷과 운영 중인 시스템을 분리하고 인간 통제를 어떻게 유지할지가 핵심 설계 과제가 되고 있다.

Hugging Face 주목 논문 5편

01

Spark-to-Paper: 논문 작성 전 과정을 조합 가능한 skill로

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan 외 · HF 업보트 176 · 2026-08-12 공개

Research agentSkillsIntegrity

논문 개요

아이디어를 논문으로 바꾸는 일은 문장 생성만으로 끝나지 않는다. 이 연구는 문헌 검색, 실험 설계·실행, 근거에 따른 주장 수정, 도식 제작을 기존 coding assistant 안의 13개 조합형 skill로 구성하고, 증거 중심의 장기 워크플로를 설계한다.

arXiv 원문 보기 ↗

연구 목표

  • 별도 agent platform 없이도 재현·점검 가능한 논문 생성 과정을 구현한다.

핵심 방법

  • 모델 판단과 결정론적 실행을 분리하고, 실험 결과를 보기 전에 필요한 근거를 명세한다.

주요 결과

  • integrity·review stack이 단일 초안보다 fabrication 탐지 성능을 높였다고 보고했다.

핵심 지표

  • 8개 주제에서 citation validity 99.5%, figure editability 96.4%, 평균 US$8.1·3.2시간/원고.
02

에이전트 공진화의 설계 지형도

Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang 외 · HF 업보트 124 · 2026-08-10 공개

SurveySelf-evolutionSafety

논문 개요

고정된 task와 feedback에 묶인 단일 agent 자기개선의 한계를 넘어, 여러 agent와 환경이 서로 적응 압력을 주는 공진화를 정리한 survey다. 인간이 설계한 제약이 점차 줄어드는 과정을 세 단계 분류로 제안한다.

arXiv 원문 보기 ↗

연구 목표

  • 개방형 agent evolution 연구를 공통 언어와 평가 과제로 정리한다.

핵심 방법

  • Agent–Agent, Agent–Environment, Meta Co-Evolution의 3단계 taxonomy를 구성한다.

주요 결과

  • 다중 구성요소 확장, 안전·통제, 평가가 공진화의 핵심 미해결 과제임을 제시한다.

핵심 지표

  • 정량 benchmark 제안 논문이 아닌 survey로, 세 단계 분류체계가 주요 산출물이다.
03

JoyAI-Video-Edit: 스트리밍 방식의 실시간 영상 편집

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song 외 · JD · HF 업보트 92 · 2026-08-04 공개

Video editingDiffusionReal-time

논문 개요

미래 프레임이나 사전 정의된 영상 길이 없이, 지속 입력되는 영상을 편집하는 16B autoregressive diffusion framework다. 실시간 처리에서 흔한 원본 충실도 저하와 시간 누적 drift를 함께 줄이는 데 초점을 둔다.

arXiv 원문 보기 ↗

연구 목표

  • 제한된 연산 자원에서도 긴 영상의 일관성을 유지하며 실시간 편집한다.

핵심 방법

  • chunk-wise adaptation, SA-DMD, long-horizon autoregressive distillation을 결합한다.

주요 결과

  • 기존 streaming editor를 크게 앞서고 강한 offline system과도 경쟁력 있는 결과를 보고했다.

핵심 지표

  • 단일 NVIDIA B200에서 end-to-end 720p 약 30 FPS.
04

Ouroboros: 리뷰된 변경으로 코어를 진화시키는 코딩 에이전트

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov 외 · HF 업보트 84 · 2026-08-08 공개

Coding agentSelf-evolutionGovernance

논문 개요

도구, prompt, context assembly, 핵심 구현을 reviewed commit으로 변경하고, 승인된 변경이 이후 agent 실행 환경이 되게 한다. 자기개선을 실행 과제로 삼는 방식과 일반 업무 경험에서 결함을 찾아 개선하는 방식을 병행한다.

arXiv 원문 보기 ↗

연구 목표

  • 자기 수정이 가능한 agent를 benchmark 성능과 운영 안전성 모두에서 검증한다.

핵심 방법

  • frozen snapshot benchmark와 live deployment를 분리하고, 구조 변경은 리뷰를 통과시킨다.

주요 결과

  • Terminal-Bench·OSWorld-Verified·CL-Bench에서 저자 보고 기준 최고 성능을 제시했다.

핵심 지표

  • Opus 5: Terminal-Bench 2.1 86.74%, OSWorld-Verified 90.69%; CL-Bench reward 0.2301.
05

Business Arena: 실제 시장 구조를 반영한 비즈니스 에이전트 평가

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li 외 · Alibaba · HF 업보트 20 · 2026-08-09 공개

BenchmarkBusiness agentLong horizon

논문 개요

AI agent가 공급처 구매부터 판매·규제 준수까지 cross-border shop을 운영하는 환경이다. 지연되고 서로 얽힌 의사결정의 결과를 이익으로 측정하되, 행동 단위의 수익·손실 원인도 추적한다.

arXiv 원문 보기 ↗

연구 목표

  • 현실적인 시장 조건에서 end-to-end business intelligence를 평가한다.

핵심 방법

  • Alibaba.com sourcing data와 보정된 시장 조건, skill-level·action-level attribution을 결합한다.

주요 결과

  • 최고 모델도 human-designed strategy에 뒤처졌으며, 모델별 운영 전략 차이를 확인했다.

핵심 지표

  • frontier model 15종의 평균 최종 순자산은 최대 9배 격차.

arXiv 최신 논문 5편

06

AVA-Encoder: 영화를 에이전트 친화적 지식 그래프로 인코딩

AVA-Encoder: Towards Agent-Native Video Representation Learning

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun 외 · arXiv cs.CL/cs.CV · 2026-08-12

Video representationKnowledge graphAgent

논문 개요

고품질 영화 영상을 agent가 이해·질의·수정 가능한 표현으로 바꾸기 위한 Agentic Video Auto-Encoder다. 영상은 계층·상태 노드의 텍스트와 이미지·오디오·영상 asset layer를 가진 지식 그래프로 변환된 뒤 다시 영상으로 복원된다.

arXiv 원문 보기 ↗

연구 목표

  • 콘텐츠 충실도와 agent 조작성를 함께 갖춘 영상 표현을 학습한다.

핵심 방법

  • 복원 오차를 자연어 업데이트 방향으로 바꾸는 textual-gradient optimization과 test-time KG refinement를 사용한다.

주요 결과

  • agentic video reconstruction benchmark와 영화 KG 데이터셋을 함께 공개한다.

핵심 지표

  • 가장 강한 외부 baseline 대비 20.7 percentage points 향상, policy-only 조건에서 prompt token 74.3% 절감.
07

DreamFly: 인과적 기억과 확산 계획을 쓰는 드론 언어 항법

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

Yan Deng, Fei Xu 외 · arXiv cs.AI/cs.CV · 2026-08-12

Embodied AIVLNDiffusion planning

논문 개요

부분 관측 상태에서 드론이 시각 증거를 누적하고, 행동을 계획하며, 목표 도착을 판정해야 하는 aerial VLN 문제를 다룬다. 미래 정보 누출 없이 과거 관측만 쓰는 memory와 매 step 재계획을 결합한다.

arXiv 원문 보기 ↗

연구 목표

  • 짧은 planning horizon과 불안정한 종료 판정을 개선한다.

핵심 방법

  • K-step action chunk 중 첫 행동만 실행하는 receding-horizon planning과 LiteStop을 적용한다.

주요 결과

  • OpenFly의 seen·unseen 환경 모두에서 비교 방법을 앞서고 navigation error를 낮췄다.

핵심 지표

  • test-seen/unseen SR 32.04%/29.46%, SPL 28.22%/23.54%.
08

AI4AI at Test-Time: 강한 모델이 약한 모델의 실행 구조를 설계

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang 외 · arXiv cs.LG/cs.AI/cs.CL · 2026-08-12

HarnessTest-time transferToM

논문 개요

큰 teacher가 작은 target의 parameter를 바꾸지 않고도, 추론 시점에 쓸 harness를 설계해 능력을 이전할 수 있는지 검증한다. 핵심은 reasoning을 길게 유도하는 대신 불안정한 판단을 결정론적 코드·routing·형식 검증으로 옮기는 것이다.

arXiv 원문 보기 ↗

연구 목표

  • 학습 기반 distillation을 보완할 inference-time capability transfer를 검증한다.

핵심 방법

  • builder가 validation data 5%로 다회차 harness를 개선한 뒤 전체 test set에 적용한다.

주요 결과

  • 특히 약한 target일수록 이득이 컸고, builder의 reasoning effort가 harness 품질을 단조롭게 개선했다.

핵심 지표

  • 4개 Theory-of-Mind benchmark 평균 성능 0.49→0.91.
09

VAKRA: API와 검색을 넘나드는 다단계 agent 평가

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo 외 · IBM Research · arXiv cs.AI · 2026-08-12

BenchmarkAPI agentRAG

논문 개요

기업 agent가 구조화된 API와 문서 컬렉션을 함께 넘나들며 추론하는 능력을 측정한다. 예측된 tool call을 live API에 재실행해 정답 경로가 여러 개여도 검증할 수 있게 설계했다.

arXiv 원문 보기 ↗

연구 목표

  • API interaction·다단계 reasoning·tool policy 준수를 하나의 benchmark에서 평가한다.

핵심 방법

  • 고정 ReAct harness로 agent architecture 영향은 줄이고, 3단계 난이도 task를 구성한다.

주요 결과

  • 실패는 tool 호출보다 entity disambiguation과 cross-source grounding에 집중됐다.

핵심 지표

  • 62개 도메인·8,000개 이상 executable API; 최고 모델도 single-hop 70.4%, compositional API 50–51%, unanswerable 2.4%.
10

Agentic Optimization: image-to-video 제어를 위한 폐루프 탐색

Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence

Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert 외 · arXiv cs.AI/cs.CV/cs.MM · 2026-08-12

Image-to-videoOptimizationMultimodal agent

논문 개요

black-box I2V 모델의 stochasticity 때문에 반복 시행착오가 필요한 문제를 목표 지향적 폐루프 최적화로 바꾼다. prompt와 seed·CFG scale을 별도 단계에서 탐색하며, 의미 충실도와 artifact를 자동 평가 신호로 활용한다.

arXiv 원문 보기 ↗

연구 목표

  • 전문 제작 워크플로에서 I2V 출력의 예측 가능성과 제어 가능성을 높인다.

핵심 방법

  • mLLM prompt refinement, DSG·CMQ 자동 평가, Bayesian optimization, VTA score를 결합한다.

주요 결과

  • unguided search보다 인간 선호도에서 뚜렷하게 우세했다고 보고했다.

핵심 지표

  • 인간 선호 비교에서 baseline 대비 최고 69% win rate.

수집 메모

Hugging Face Daily Papers는 2026-07-31~2026-08-13(UTC) 공개 항목을 수집한 뒤, 실제 논문 공개일이 해당 기간인 항목만 대상으로 업보트 순을 검토했다. 기존 리포트에 이미 다룬 항목은 우선 제외하고 5편을 선정했다. arXiv는 cs.AI·cs.CL·cs.LG 최신 제출을 중심으로, cross-list된 AI 관련 논문을 포함해 5편을 선정했다. 정량 수치와 결과는 각 논문 저자가 초록에서 보고한 내용이다.

생성 시각: 2026-08-14 09:00 KST · 외부 링크는 원문 초록으로 연결