← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.09 · 09:00 KST

오늘의 AI 리서치

논문 10편 · Hugging Face Daily Papers 최근 14일 트렌딩(업보트·관심도) 및 arXiv 최신 cs.AI

오늘의 데일리 브리핑

오늘의 핵심은 긴 실행을 위한 에이전트 데이터·학습 신호·환경 모델이다. Recursive Synthesis는 검증 가능한 터미널 과제를 재귀적으로 키우고, AgentOPSD는 최종 보상을 턴별 credit으로 나누며, EnvACE는 환경 응답 자체를 모델 안에서 rehearsal한다.
공간·시간 추론에서는 GST-Bench와 ChronoVision이 단일 장면 이해를 넘어, 긴 영상 관찰을 일관된 전역 표현으로 통합하는 능력을 시험한다. 최고 VLM의 GST-Bench 점수는 42.68로 인간 79.08과 아직 큰 격차가 있다.
신뢰성과 평가도 중요한 축이다. SCOPE는 유용한 문맥까지 버리지 않는 선택적 신뢰를, TrajDebug는 실패를 만든 최초의 치명 오류를 다룬다. 도입 단계에서는 모델 점수뿐 아니라 실행 궤적과 검증 방식까지 함께 설계해야 한다.

Hugging Face 주목 논문 6편

01

Recursive Synthesis: 장기 터미널 과제를 재귀적으로 합성

Recursive Synthesis for Long-Horizon Terminal Tasks

Zhongzhi Li 외 · Hugging Face 업보트 218 · 2026-08-05

Agent dataTerminal agent

논문 개요

장기 terminal agent 학습용 과제는 지시문·환경·정답 해법·verifier가 모두 맞물려야 해 제작비가 높다. RST는 검증된 seed task의 해법을 확장하고 verifier와 지시문을 새 workflow에 맞춘 뒤, 새 sandbox에서 검증해 통과한 과제를 다음 라운드 seed로 재사용한다.

arXiv 원문 보기 ↗

연구 목표

  • 검증 가능한 장기 terminal-agent 과제를 저비용으로 대량 생성한다.

핵심 방법

  • reference solution 확장→instruction·verifier 재정렬→fresh sandbox 검증의 재귀 합성.

주요 결과

  • 합성 궤적으로 fine-tuning 및 agentic PPO를 수행해 세 terminal benchmark에서 성능 향상을 보고.

핵심 수치

  • 15라운드에서 37,484개 과제, 과제당 약 $0.05. 해법 중앙 길이 67→374줄, DeepSeek-V4-Pro pass@4 90%→2.5%.
02

AgentOPSD: 긴 에이전트 실행의 턴별 공헌도 학습

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

Zi-Han Wang 외 · Hugging Face 업보트 75 · 2026-08-06

Agent RLCredit assignment

논문 개요

긴 다중 턴 작업에서는 소수의 핵심 결정이 결과를 가르지만, trajectory-level reward는 이를 제대로 배분하기 어렵다. AgentOPSD는 teacher–student log-probability gap을 턴별 증거로 모아 Bayesian belief state를 재귀적으로 갱신하고, 희소한 결과 보상을 턴별 credit 신호로 바꾼다.

arXiv 원문 보기 ↗

연구 목표

  • 장기 궤적에서 결과를 좌우한 결정 턴을 식별·학습한다.

핵심 방법

  • critic과 추가 rollout 없이 log-odds 공간의 recursive self-distillation을 적용.

주요 결과

  • ALFWorld, WebShop, Search-QA에서 GRPO 및 강한 self-distillation 기준선을 앞섰다.

핵심 수치

  • Qwen2.5-7B가 ALFWorld에서 89.1% 성공률.
03

WorldClaw: 에이전트 기반 대규모 3D 오픈월드 생성

WorldClaw: Agentic 3D Open-World Generation at Scale

Chunchao Guo 외 · Hugging Face 업보트 50 · 2026-08-05

3D generationWorld model

논문 개요

자유 텍스트에서 탐색 가능한 3D 세계를 만들려면 전역 공간 일관성, 지역 디테일, 재사용 가능한 자산을 함께 확보해야 한다. Planning agent가 지역·지형·자산·재질·공간 관계를 구조화하고, coarse-to-fine 생성과 render-based agent가 장면을 다듬는다.

arXiv 원문 보기 ↗

연구 목표

  • 전역 구조와 편집 가능한 instance-level 자산을 함께 생성한다.

핵심 방법

  • semantic layout, region-aware height field, terrain-conditioned composition, textured mesh를 결합.

주요 결과

  • 다양한 open-world prompt에서 일관된 전역 지형과 국소 콘텐츠·자산 편집성을 제시.

핵심 지표

  • 초록에는 통합 정량 benchmark 수치가 제시되지 않음.
04

GST-Bench: 영상에서 전역 공간 인식을 할 수 있는가

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

Qifeng Zhang 외 · Hugging Face 업보트 37 · 2026-08-06

VLMSpatial reasoning

논문 개요

기존 benchmark는 적은 시점의 국소 공간 지각에 치우쳐 있다. GST-Bench는 긴 영상에서 보지 못한 시점의 공간을 추론하고, egocentric 관찰을 전역 top-down 이미지로 옮기는 VQA 과제로 VLM의 global spatial intelligence를 측정한다.

arXiv 원문 보기 ↗

연구 목표

  • 연속적 장기 시각 관찰을 일관된 전역 장면 표현으로 통합하는 능력을 평가한다.

핵심 방법

  • 인간 검증 질문, 국소 진단판 GST-Bench-Local, 학습용 GST-Train을 구성.

주요 결과

  • 모델은 같은 형식의 local spatial understanding에는 강하지만 장기 관찰 통합에서 실패했다.

핵심 수치

  • 합성 영상 6,790분. 22개 VLM 중 최고 zero-shot 42.68, 인간 점수 79.08.
05

EnvACE: 환경을 내부 리허설하는 에이전트 RL

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

Zishan Xu 외 · Hugging Face 업보트 34 · 2026-08-06

World rehearsalTool use

논문 개요

실행 가능한 환경을 계속 호출해 학습하는 비용을 줄이기 위해, policy가 tool call 뒤 환경 응답을 스스로 rehearsal하도록 한다. 행동과 환경 역할을 task-success reward로 함께 최적화해 행동–응답 관계를 파라미터 안에 internalize한다.

arXiv 원문 보기 ↗

연구 목표

  • 비싼 외부 환경 상호작용 의존도를 낮추며 장기 tool-use 학습을 확장한다.

핵심 방법

  • act–rehearse 교대 정책과 private rehearsal을 end-to-end로 공동 최적화.

주요 결과

  • BFCL-v4, tau²-Bench, VitaBench, FinMCP-Bench에서 환경 확장 기준선을 종합적으로 앞섰다고 보고.

핵심 지표

  • 초록은 여러 모델 규모에서 일관된 개선을 보고하나 개별 점수는 공개하지 않음.
06

ChronoVision: latent state 재구성으로 시간 추론 강화

ChronoVision: Temporal Reasoning via Latent State Reconstruction

Yifan Shen 외 · Hugging Face 업보트 31 · 2026-08-06

MultimodalTemporal reasoning

논문 개요

복잡한 시각 인지 과제에서 언어만의 단계적 추론은 연속적 시각 변환을 정확히 표현하기 어렵다. ChronoVision은 변환 후 최종 상태의 latent representation을 예측하는 Reconstructive Visual Head와 핵심 증거에 집중하는 ROI Attention Locating을 결합한다.

arXiv 원문 보기 ↗

연구 목표

  • 시각 논리와 latent imagery를 정렬해 다단계 시간 추론을 높인다.

핵심 방법

  • SFT의 latent-state 예측과 RL의 outcome·process alignment·visual focus 복합 보상.

주요 결과

  • Vbvr-VQA와 교차 도메인 IntPhys2에서 강한 성능을 보고.

핵심 수치

  • Vbvr-VQA 74.8% in-domain, 71.6% out-of-domain, IntPhys2 55.0% 정확도.

arXiv 최신 논문 4편

07

SCOPE: 문맥을 무시하지 않고 선별적으로 신뢰하기

Learning When to Trust via Selective Context Preference Optimization

Xian Sun 외 · arXiv cs.AI · 2026-08-06

RobustnessDPO

논문 개요

오도 문맥에 저항하도록 학습하면 유용한 문맥까지 무시하는 모델이 될 수 있다. MIST는 reasoning item을 clean·misleading·correct-context·irrelevant-context 네 조건으로 맞추고, SCOPE는 clean에서 맞고 misleading에서 틀린 사례를 preference pair로 학습한다.

arXiv 원문 보기 ↗

연구 목표

  • 오도 문맥에는 흔들리지 않되 올바른 외부 정보는 활용한다.

핵심 방법

  • human-annotated MIST와 SC2W 지표를 사용한 selective context preference optimization.

주요 결과

  • 공개 모델에서 오도 문맥 취약성을 낮추면서 다른 조건의 정확도를 보존했다고 보고.

핵심 지표

  • 초록은 네 조건을 균형 있게 평가·학습하는 설계를 핵심 기여로 제시.
08

TrajDebug: 실패 궤적의 최초 치명 오류 추적

TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

Yunjia Qi 외 · arXiv cs.AI · 2026-08-06

DebuggingLong horizon

논문 개요

긴 agent trajectory에는 국소 오류가 여럿 섞이지만 최종 실패를 만든 오류는 일부다. TrajDebug는 multi-resolution history compression과 evidence-based error identification으로 오류를 찾고, 해소 상태와 마지막 영향을 추적해 critical failure를 가른다.

arXiv 원문 보기 ↗

연구 목표

  • 최종 실패에 책임 있는 가장 이른 오류 단계를 식별한다.

핵심 방법

  • error lifecycle tracing과 현실적 실패 궤적 주석 benchmark TrajErrBench.

주요 결과

  • 다양한 agent benchmark에서 기준선보다 높은 진단 성능과 실행 가능한 피드백을 보고.

핵심 수치

  • Tau2Bench·SWE-Bench Pro에서 수집한 수작업 주석 실패 궤적 486개.
09

Low Frequency Trap: Video Language Model의 사건 집계 실패

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

Sarvesh Baskar 외 · arXiv cs.AI · 2026-08-06

Video LLMEvaluation

논문 개요

사건 수·빈도·길이·복잡도가 얽힌 실제 영상 benchmark의 문제를 분리하기 위해 튀는 공·깜박임·상태 전환의 제어 과제를 만든다. 실행 가능한 event trace를 넣어 최종 답뿐 아니라 모델이 보고한 사건 시점도 ground truth와 대조한다.

arXiv 원문 보기 ↗

연구 목표

  • VLM이 시간적 사건을 언제부터 놓치는지 진단한다.

핵심 방법

  • event count N과 frequency F를 독립 조절하는 trace-grounded parametric profiling.

주요 결과

  • frame 수를 늘려도 충실한 사건 회복으로 곧바로 이어지지 않음을 보였다.

핵심 수치

  • 2,190개 영상. 고빈도·다사건 조건에서 최종 count 정답 0.2%, true event 회복 18.1%를 보고.
10

Beyond Top-K: 해석 가능한 agentic operation으로 RAG 대체

Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations

arXiv cs.AI · 2026-08-06

RAGRetrieval

논문 개요

긴 재무·감사·규제 문서에 chunk embedding과 top-k 검색을 적용하면, 표의 유사 수치가 한 embedding 공간에서 경쟁해 구조적으로 취약할 수 있다. 이 논문은 black-box retrieval 대신 문서 구조를 드러내는 해석 가능한 agentic operation을 제안한다.

arXiv 원문 보기 ↗

연구 목표

  • 표·숫자가 많은 긴 문서에서 근거 추적 가능한 검색·분석을 구현한다.

핵심 방법

  • 문서의 구조적 operation을 에이전트가 명시적으로 수행하도록 설계.

주요 결과

  • 정부 재무보고서 사례로 top-k embedding retrieval의 구조적 한계를 측정·논증한다.

핵심 수치

  • 780쪽 정부 재무보고서에서 내용 행의 86.8%가 표 행이라고 보고.

수집 메모

Hugging Face Daily Papers API에서 2026-07-27~2026-08-09 최근 14일 범위를 확인하고, 해당 기간에 게시된 논문을 업보트 순으로 정렬해 상위 6편을 선정했다. arXiv는 최신 cs.AI 제출 목록에서 신뢰성·에이전트 디버깅·영상 추론·검색 구조 주제 4편을 골랐다. 수치와 결과는 논문 초록 또는 Hugging Face paper metadata에 저자가 보고한 값이다.

생성 시각: 2026-08-09 09:00 KST · 외부 링크는 원문 초록으로 연결