← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.13 · 09:00 KST

오늘의 AI 리서치

논문 10편 · Hugging Face Daily Papers 최근 14일 트렌딩(업보트 순) 및 arXiv 최신 AI 관련 제출

오늘의 데일리 브리핑

오늘의 흐름은 ‘배포 뒤에도 학습하고, 그 행동을 검증 가능한 단위로 남기는 에이전트’다. GUI grounding은 실패 경험을 반영해 test-time에 적응하고, 다국어 agent 평가는 최종 답이 아닌 도구 실행 궤적을 비교 대상으로 끌어올린다.
Hugging Face 트렌딩에서는 반복 latent computation으로 작은 모델의 ARC 효율을 높인 BDH-CQ와, 검토된 커밋을 통해 스스로 진화하는 Ouroboros가 눈에 띈다. LongHorizon-Harness는 외부에서 검증된 상태만 다음 단계에 넘겨 장기 작업의 오류 전파를 줄인다.
현실 세계 적용도 빠르게 구체화되고 있다. Surgical WAM은 action-free 수술 영상을 제어 학습에 활용했고, VidForensics-M1은 조작 구간을 근거로 삼아 생성 비디오 탐지의 검증 가능성을 강화했다.
안전 측면에서는 확률 예측이 서로 모순되지 않는지 다항 시간으로 확인하는 이론적 토대가 제안됐다. ‘그럴듯한 답변’에서 ‘감사 가능한 실행·예측’으로 관심이 옮겨가는 신호다.

Hugging Face 주목 논문 5편

01

BDH-CQ: 말로 풀지 않는 반복 latent 추론

BDH-CQ: In-Context Learning with Recurrent Latent Reasoning

Björn Engdahl, Adrian Kosowski, Jan Chorowski 외 · Pathway · HF 업보트 552 · 2026-08-10 공개

ReasoningRecurrent memoryARC-AGI

논문 개요

추론 시점에 들어오는 예시가 recurrent memory를 계속 갱신하고, 모델은 중간 사고 과정을 텍스트로 드러내지 않은 채 고차원 latent space에서 반복 계산해 답을 낸다. in-context learning과 latent reasoning을 하나의 모델 안에서 연결한 접근이다.

arXiv 원문 보기 ↗

연구 목표

  • 작은 모델로 ARC류 규칙 추론의 비용-정확도 균형을 개선한다.

핵심 방법

  • 데모 입력을 recurrent memory에 축적하고, verbalized reasoning 없이 iterative latent computation을 수행한다.

주요 결과

  • ARC-AGI-1에서 기존 cost-accuracy Pareto frontier를 넘는 운용점을 보고했다.

핵심 지표

  • 150M parameters, ARC-AGI-1 pass@2 29.5%, task당 계산 추정 비용 US$0.0007.
02

Frontis-MA1: MLE를 개선하는 재귀적 AI4AI 에이전트

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Junlin Yang, Che Jiang, Yu Fu 외 · Frontis AI · HF 업보트 182 · 2026-07-30 공개

AI4AIMLERL

논문 개요

재귀적 자기개선을 추상적 능력이 아니라 실행 가능한 machine learning engineering 문제로 둔다. OpenMLE 위에서 35B Frontis-MA1을 program-evolution agent로 post-train하고, 학습과 장기 탐색을 하나의 loop로 묶는다.

arXiv 원문 보기 ↗

연구 목표

  • AI가 AI 개발 과정을 개선하는 RSI를 검증 가능한 MLE 환경에서 재현 가능하게 연구한다.

핵심 방법

  • OpenMLE-Gym·RL·Evo와 Draft, Improve, Debug, Crossover 네 operator를 execution-grounded SFT·RL로 학습한다.

주요 결과

  • held-out NatureBench Lite에서도 모델과 search framework의 전이 효과를 각각 보고했다.

핵심 지표

  • RTX 4090 1장·12시간/과제에서 Medal Average 39.39%→60.61%, Evo-Max 71.21%.
03

LongHorizon-Harness: 검증된 외부 상태로 긴 에이전트 실행 관리

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma, Hailang Huang, Shun Zou 외 · HF 업보트 168 · 2026-08-03 공개

Agent harnessState managementAudit

논문 개요

긴 과업의 병목을 모델 지능보다 context에 누적되는 task state 관리로 본다. 외부 상태는 환경에서 독립 검증한 사실로만 갱신해, 잘못된 자기평가가 다음 행동으로 전파되는 문제를 줄인다.

arXiv 원문 보기 ↗

연구 목표

  • 도구 사용과 수정이 얽힌 long-horizon task를 모델 교체 없이 더 안정적으로 수행한다.

핵심 방법

  • Manager가 subtask를 정하고 fresh-context executor가 수행한 뒤, read-only auditor가 환경 상태를 확인하는 MEA loop.

주요 결과

  • 여러 모델·harness·상호작용 도메인에서 일관된 성능 향상을 보고했다.

핵심 지표

  • Qwen 3.7-Plus: WeaveBench 51.8%→80.7%, Terminal-Bench 2.1 69.7%→77.2%, OSWorld 2.0 2.8%→8.3%.
04

Ouroboros: 리뷰된 커밋으로 자기 진화하는 코딩 에이전트

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev 외 · HF 업보트 79 · 2026-08-08 공개

Coding agentSelf-evolutionSafety

논문 개요

도구·prompt·context assembly·핵심 구현을 reviewed commit으로 바꾸고, 승인된 변경이 이후 실행의 runtime이 되게 하는 self-developing harness다. 자기개선이 시스템 변경을 뜻하는 만큼 운영 안전을 핵심 문제로 다룬다.

arXiv 원문 보기 ↗

연구 목표

  • 실제 작업에서 드러난 결함과 비효율을 통제된 방식으로 agent core 개선에 반영한다.

핵심 방법

  • 자기개선 자체를 과제로 삼는 recursive free evolution과 일반 작업 경험 기반 evolution을 병행하며, 변경은 리뷰를 거친다.

주요 결과

  • frozen snapshot benchmark와 계속 진화하는 live deployment를 분리해 평가 가능성과 운영성을 함께 확보한다.

핵심 지표

  • Opus 5 run: Terminal-Bench 2.1 86.74%, OSWorld-Verified 90.69%; CL-Bench normalized reward 0.2301.
05

MatrAIx: 83억 persona agent로 하는 대규모 사용자 평가

MatrAIx: Simulating the World with 8.3 Billion Persona Agents

Xiaomin Li, Yuexing Hao, Jianheng Hou 외 · MatrAIx · HF 업보트 33 · 2026-08-04 공개

Simulated usersEvaluationAgents

논문 개요

AI 시스템과 디지털 제품의 사람 대상 평가가 느리고 비싸다는 문제를 겨냥한 population-scale simulated-user infrastructure다. 상관관계를 보존한 대규모 persona와 Survey·AI Chatbot·Web·App 환경을 결합한다.

arXiv 원문 보기 ↗

연구 목표

  • 사용자 다양성과 상호작용 행동을 보존하면서 AI·제품 평가를 확장한다.

핵심 방법

  • 1,290개 categorical dimension의 Persona 8B, 4개 playground, 25개 이상 도메인의 1,010개 application task를 구성한다.

주요 결과

  • 배경에 따라 가격 인상 후 망설임, AI assistant 실패 뒤 지속 의향, 지연 허용도가 달라지는 피드백을 포착했다고 보고했다.

핵심 지표

  • 8개 과제 18,189회 평가; persona adherence 400회 검증에서 366회(91.5%) 표현 또는 올바른 억제.

arXiv 최신 논문 5편

06

Surgical WAM: action-free 영상에서 배우는 수술 로봇 제어

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Wenrui Bao, Tianyun Jiang, Zhiben Chen 외 · arXiv cs.AI · 2026-08-11

RoboticsWorld modelSurgery

논문 개요

동기화된 로봇 행동 라벨은 비싸지만 수술 내시경 영상은 상대적으로 풍부하다는 점을 이용한다. Surgical WAM은 action-free 영상으로 시각 동역학을 먼저 배우고, 제한된 행동 데이터로 fine-tuning해 폐루프 수술 조작을 수행한다.

arXiv 원문 보기 ↗

연구 목표

  • 고정된 action-labeled demonstration 예산에서 영상 사전학습이 수술 조작 제어를 개선하는지 검증한다.

핵심 방법

  • Cosmos Policy 기반 생성 모델이 미래 내시경 관찰과 executable action chunk를 함께 예측하고, receding-horizon 방식으로 재계획한다.

주요 결과

  • 접촉이 많고 양손 협응이 필요한 과제에서 특히 큰 개선을 보고했다.

핵심 지표

  • 4개 simulated task 평균 성공률 63.5%→77.8%; PegTransfer는 절대 20 percentage points 상승.
07

VidForensics-M1: 시간 구간 근거를 갖춘 생성 비디오 탐지

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

Bowei Liu, Zheng Lu, Yuhan Bian 외 · arXiv cs.CV · 2026-08-11

Video forensicsMLLMRL

논문 개요

생성 비디오가 실제와 구분하기 어려워지는 상황에서, 판정 라벨뿐 아니라 조작이 의심되는 시간 구간을 근거로 함께 최적화한다. 외부 모델의 텍스트 rationale보다 시간적 위치가 객관적으로 검증 가능하다는 점을 활용한다.

arXiv 원문 보기 ↗

연구 목표

  • 새로운 생성기에도 일반화되는 AI-generated video 탐지와 검증 가능한 근거 제시를 함께 달성한다.

핵심 방법

  • 실제 영상의 시간 구간을 boundary-frame-conditioned video generator로 교체해 paired real-fake data를 만들고, Evidence-Guided Reward Redistribution을 적용한다.

주요 결과

  • 정밀한 temporal evidence가 detector의 강건성과 일반화를 높인다고 보고했다.

핵심 지표

  • 초록에 단일 종합 성능 수치는 없으며, verifiable temporal localization을 동반한 탐지가 핵심 평가 대상이다.
08

확률 예측의 자기 일관성을 검증하는 interactive PCP

How to Verify Consistency of Probabilistic Claims

Orr Paradise, Oliver Richardson, Yoshua Bengio 외 · arXiv cs.AI · 2026-08-11

AI safetyVerificationTheory

논문 개요

예측 모델이 수많은 조건부 확률 질의에 답할 때 그 답변들이 서로 모순되지 않는지, 이를 다항 시간에 확인할 수 있는지를 묻는다. AI 행동이 초래할 위험에 대한 정직한 확률 예측을 안전의 기반으로 보는 관점이다.

arXiv 원문 보기 ↗

연구 목표

  • 확률 예측기의 self-consistency를 효율적으로 인증하는 complexity-theoretic 기반을 마련한다.

핵심 방법

  • 확률 회로 P와 confidence 회로 Q가 암묵적으로 정의하는 지수 개의 claim에 대해, 소수 지점만 읽는 verifier·proof oracle·untrusted prover의 interactive PCP를 구성한다.

주요 결과

  • (P,Q)의 approximate consistency를 polynomial-time verifier가 검증하는 protocol과 sparse witness 존재 조건을 제시한다.

핵심 지표

  • 명시적 m개 claim·n개 Boolean variable에서 certificate 길이 O(mn + log B); 작은 additive gap으로 B 의존성을 제거한다.
09

Reflection으로 배포 후 진화하는 GUI visual grounding

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

Shiyu Xuan, Zechao Li 외 · arXiv cs.CV · 2026-08-11

GUI agentTest-time adaptationSelf-distillation

논문 개요

배포 후 고정된 GUI agent가 처음 보는 인터페이스에 적응하지 못하는 문제를 다룬다. 사람 정답 없이 exploration, evaluation, reflection, internalization의 폐루프를 만들어 실패 탐색을 다음 행동 개선으로 전환한다.

arXiv 원문 보기 ↗

연구 목표

  • 미지의 UI에서 human-annotated ground truth 없이 GUI grounding 모델을 test-time에 개선한다.

핵심 방법

  • MLLM Reflector의 reasoning reflection을 conditioned self-teacher로 dense token supervision으로 바꾸고, Contrastive Calibration으로 실패 prefix의 오염을 막는다.

주요 결과

  • on-policy self-distillation을 GUI visual grounding의 test-time adaptation에 활용한 첫 사례라고 제시한다.

핵심 지표

  • 6개 benchmark 평균 정확도에서 base model 대비 7.4% 향상.
10

다국어 도구 사용 agent의 ‘행동 정책’을 직접 측정

Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram 외 · arXiv cs.CL · 2026-08-11

Multilingual agentsEvaluationTool use

논문 개요

같은 task를 다른 언어로 줬을 때 agent가 같은 도구 실행 단계를 밟는지 측정한다. 최종 답만 비교하는 기존 다국어 평가와 달리 비용·지연·실패 양식을 결정하는 action trace 자체를 평가 대상으로 삼는다.

arXiv 원문 보기 ↗

연구 목표

  • 언어가 바뀌어도 tool-using agent의 실제 action policy가 보존되는지, 교란 요인을 제거해 측정한다.

핵심 방법

  • trace 길이·빈 trace·우연 일치·모델 재현성·동일 언어 반복 응답이라는 5개 confound를 보정하고, English pivot의 인과적 역할을 분석한다.

주요 결과

  • 비영어 task를 영어로 경유하는 경향이 구조적으로 유지되며, 작은 모델에서는 정책 보존이 크게 무너진다고 보고했다.

핵심 지표

  • 8개 모델·6개 병렬 benchmark·41개 언어·2.38M rollout; frontier model 4종은 greedy decoding에서 자기 재현성 보정 후 71–73% policy retention.

수집 메모

Hugging Face Daily Papers는 2026-07-30~2026-08-12(UTC, 이용 가능한 최신 일자) 항목을 수집해 업보트 순으로 검토했다. AI 에이전트·추론·평가 주제의 5편을 선정했다. arXiv는 2026-08-11 최신 제출에서 robotics, video forensics, AI safety verification, GUI agent, multilingual tool use를 대표하는 5편을 선정했다. 정량 수치와 결과는 각 논문 초록 또는 Hugging Face metadata에서 저자가 보고한 내용이며, 초록에 수치가 없을 때는 이를 명시했다.

생성 시각: 2026-08-13 09:00 KST · 외부 링크는 원문 초록으로 연결