← 데일리 목록

AI 기술 데일리 리서치 · 2026.08.07 · 09:00 KST

오늘의 AI 리서치

논문 10편 · 수집 기준: Hugging Face Daily Papers 최근 14일 트렌딩(업보트 순) 및 arXiv 최신 cs.AI

오늘의 데일리 브리핑

오늘의 흐름은 긴 작업을 끝까지 운영하는 에이전트에 집중된다. Kimi K3·Frontis-MA1은 대규모 모델과 실행 피드백 기반의 AI4AI를, LongHorizon-Harness·Argus·ABSeeker는 상태 검증과 단계별 보상으로 장기 작업의 실패 전파를 줄이는 방식을 제시한다.
긴 문맥도 단순히 창을 늘리는 단계에서 벗어나, OctoLong의 저장소 의존성 문맥과 HiGram의 계층형 메모리처럼 필요한 증거를 구조적으로 꺼내고 갱신하는 방향으로 이동하고 있다.
동시에 TurboVLA와 JoyAI-Video-Edit은 로봇·영상에서 경량화와 실시간성을 전면에 둔다. 오늘의 핵심은 모델 성능 자체보다 검증 가능한 상태·메모리·실행 경로를 어떻게 운영 계층에 고정하느냐에 있다.

Hugging Face 주목 논문 6편

01

Kimi K3: 공개 프런티어 MoE 모델

Kimi K3: Open Frontier Intelligence

Kimi Team 외 · Moonshot AI · HF 업보트 478

MoE장문맥에이전트

논문 개요

Kimi K3는 native vision과 100만 토큰 문맥을 포함하는 대규모 MoE 모델이다. Kimi Delta Attention·Attention Residuals·Stable LatentMoE와 에이전트·코딩 강화학습을 결합해 장기 실행을 겨냥한다. 저자들은 가중치를 공개하고, 장기 코딩·에이전트·지식·추론·시각 과제에서 프런티어급 성능을 보고한다.

arXiv 원문 보기 ↗

연구 목표

  • 긴 문맥과 복합 에이전트 작업을 공개 모델로 확장한다.

핵심 방법

  • 토큰당 896개 routed expert 중 16개를 활성화하는 Stable LatentMoE.

주요 결과

  • 평가 묶음에서 다수 공개·비공개 모델보다 높은 성능을 보고.

핵심 수치

  • 총 2.8T, 활성 104B 파라미터 · 문맥 1M 토큰 · K2 대비 스케일링 효율 약 2.5배.
02

Frontis-MA1: ML 엔지니어링을 스스로 개선하는 AI4AI

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Junlin Yang 외 · Frontis AI · HF 업보트 181

논문 개요

OpenMLE는 실행 피드백이 있는 ML 엔지니어링 환경에서 재귀적 자기개선(RSI)을 연구하는 오픈 스택이다. Frontis-MA1은 Draft·Improve·Debug·Crossover 네 프로그램 진화 연산자를 실행 기반 SFT·RL로 학습하고 장기 탐색에 조합한다.

arXiv 원문 보기 ↗

연구 목표

  • AI가 AI 개발 과정을 개선하는 AI4AI의 재현 가능한 시험장을 만든다.

핵심 방법

  • OpenMLE-Gym/RL/Evo와 35B 메타 진화 에이전트의 단일 루프.

주요 결과

  • MLE-Bench Lite에서 base model보다 크게 향상됐다고 보고.

핵심 수치

  • Medal Average 39.39%→60.61%, Evo-Max에서 71.21%.
  • 1 RTX 4090·12GB VRAM·과제당 12시간 조건.
03

LongHorizon-Harness: 검증된 상태만 다음 단계로

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma 외 · HF 업보트 154

논문 개요

긴 작업에서 자기평가 오류가 다음 단계로 퍼지는 문제를 task-state management 문제로 다시 정의한다. Manager가 상태·하위 과제를 관리하고, fresh-context Executor가 수행하며, read-only Auditor가 환경 상태를 독립 검증하는 MEA 루프를 제안한다.

arXiv 원문 보기 ↗

연구 목표

  • 누적 컨텍스트와 잘못된 완료 판정이 만드는 장기 작업 실패를 줄인다.

핵심 방법

  • 검증된 환경 사실만 외부 task state에 반영하는 Manage-Execute-Audit.

주요 결과

  • 모델·하니스·상호작용 도메인 전반의 일관된 개선을 보고.

핵심 수치

  • WeaveBench 51.8%→80.7%, Terminal-Bench 2.1 69.7%→77.2% (Qwen 3.7-Plus).
  • OSWorld 2.0 2.8%→8.3%.
04

TurboVLA: LLM 경유를 줄인 실시간 로봇 제어

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Hengyi Xie 외 · HF 업보트 139

논문 개요

기존 V→L→A 경로 대신 시각 관측과 언어 지시를 독립 인코딩한 뒤 경량 양방향 상호작용으로 바로 행동 청크를 예측한다. 큰 LLM을 매 정책 호출의 중심 인터페이스로 두지 않아 로봇 추론의 메모리와 계산량을 낮춘다.

arXiv 원문 보기 ↗

연구 목표

  • VLA의 높은 호출 비용 없이 시각·언어 조건부 조작 성능을 유지한다.

핵심 방법

  • 직접 V+L→A 매핑, 경량 bidirectional vision-language interaction, compact decoder.

주요 결과

  • LIBERO에서 더 큰 VLA 정책과 맞먹거나 앞서는 성공률을 보고.

핵심 수치

  • 0.2B 파라미터 · 성공률 97.7% · 31.2ms · RTX 4090에서 0.9GB VRAM.
05

JarvisHub: 캔버스를 에이전트의 공유 상태로

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

Yunlong Lin 외 · HF 업보트 125

논문 개요

멀티모달 창작에서 초안·대안·수정·실패·버전·피드백이 누적되는 프로젝트 상태를 다룬다. JarvisHub는 편집 가능한 캔버스를 사용자 작업공간, 에이전트 외부 메모리, 행동 공간, 공유 프로젝트 상태로 함께 사용한다.

arXiv 원문 보기 ↗

연구 목표

  • 일회성 프롬프트 생성을 장기·사용자 조종 가능한 창작 자동화로 확장한다.

핵심 방법

  • typed canvas node/link와 canvas state·protocol bridge·agent runtime의 3계층.

주요 결과

  • 에이전트가 프로젝트 상태 안에서 계획·생성·수정·정리를 이어가는 오픈 하니스를 제시.

핵심 지표

  • 정량 벤치마크 수치는 초록에 제시되지 않음.
06

JoyAI-Video-Edit: 30 FPS의 스트리밍 영상 편집

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Yicheng Xiao 외 · Jingdong · HF 업보트 81

논문 개요

미래 프레임이나 정해진 영상 길이 없이 동작하는 16B autoregressive diffusion 영상 편집 프레임워크다. chunk-wise adaptation, Source-Anchored Distribution Matching Distillation, Long-Horizon Autoregressive Distillation으로 2-step 생성의 원본 충실도와 장기 시간 일관성을 다룬다.

arXiv 원문 보기 ↗

연구 목표

  • 제한된 연산량에서 저지연·인과적 영상 편집을 구현한다.

핵심 방법

  • 학습-추론 불일치와 누적 temporal drift를 세 가지 distillation 구성으로 완화.

주요 결과

  • 자동·사람 평가에서 기존 streaming editor를 앞서고 강한 offline system과 경쟁적이라고 보고.

핵심 수치

  • 단일 Nvidia B200에서 720p end-to-end 편집 약 30 FPS.

arXiv 최신 논문 4편

07

Argus: 고정 가중치로 진화하는 장기 에이전트 런타임

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

arXiv cs.AI · 2026-08-05

논문 개요

Argus는 Manager·Planner·Engineer·Reviewer가 durable project state 위에서 제한된 mission을 수행하는 persistent runtime이다. 사용자 의도와 운영 목표·제약·검증 기준을 분리하며, role-owned review와 task-native verification을 통과한 메모리·스킬·절차만 누적한다.

arXiv 원문 보기 ↗

연구 목표

  • 고정 모델 가중치로도 검증된 운영 상태와 제어 정책을 축적해 장기 작업을 개선한다.

핵심 방법

  • 검증 게이트 기반 self-evolution과 운영자 escalation point 사이의 자율 실행.

주요 결과

  • 7개 GPT-5.5 benchmark arena와 실제 커널·수학·논문 파이프라인 사례를 보고.

핵심 수치

  • SWE-Bench Pro 약 78% (Direct Copilot 59%).
  • 성숙 wave에서 solve-input token 21%, active workflow time 15% 감소.
08

OctoLong: 저장소 의존성으로 만든 장문맥 학습 데이터

OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

arXiv cs.AI · 2026-08-05

논문 개요

책·논문·저장소에 치우친 기존 장문맥 코퍼스의 한계를 겨냥한다. AST parser, language server, package manager로 코드 참조를 재귀적으로 찾고 수백만 토큰 길이의 의존성 풍부한 코드 문맥을 수집한 뒤, 이를 사용해 open long-context LM을 mid-training한다.

arXiv 원문 보기 ↗

연구 목표

  • 장거리 의존성이 풍부한 코드 문맥으로 장문맥·에이전트 성능을 높인다.

핵심 방법

  • OctoLong context engineering과 600M~14B base model의 context-extension mid-training.

주요 결과

  • 장거리 검색, 상태 추적, 저장소 수준 코드 이해, downstream agent task 향상을 보고.

핵심 수치

  • 약 50B-token 혼합물 중 OctoLong 코드 문맥 6.2B token, instruction tuning 약 10B token.
  • 기존 데이터 12% 대체만으로 개선 보고.
09

ABSeeker: 답에서 역추적하는 검색 에이전트 보상

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

Yijun Lu 외 · arXiv cs.AI · 2026-08-05

논문 개요

긴 검색 궤적의 모든 단계를 같은 비중으로 학습하는 문제에 Answer-Backtracked Credit Assignment(ABC)를 제안한다. 정답에서 필요한 중간 단서를 역추적하고, 각 검색 단계를 단서에 맞춰 채점해 희소한 성공·실패 신호를 조밀한 단계별 보상으로 바꾼다.

arXiv 원문 보기 ↗

연구 목표

  • 오류·중복 행동을 억제하면서 실패한 궤적의 유용한 행동도 학습에 살린다.

핵심 방법

  • Answer-Backtracked Clue Recovery, Clue-Anchored Step Scoring, ABC-SFT·ABC-GRPO.

주요 결과

  • 동일 규모 4B 에이전트를 크게 앞서고 약 30B급과 맞먹는 성능을 보고.

핵심 수치

  • Qwen3.5-4B, 학습 예시 8.5k개.
  • BrowseComp 37.3%→55.3%, BrowseComp-ZH 39.1%→52.9% (context management 적용).
10

HiGram: 경로 단위로 갱신하는 계층형 그래프 메모리

Hierarchical Graph Memory for LLM Agents with Path-level Localization and Rewrite

Xiawei Yue 외 · arXiv cs.AI · 2026-08-05

논문 개요

평면 그래프 메모리는 시간이 갈수록 무관한 문맥과 증거 선택 비용이 커지고, 관련 변경도 unit별로 반복 갱신해야 한다. HiGram은 coarse-to-fine 계층 그래프, MicroGraph 기반 path localization, unit 내외 의존성을 함께 수정하는 coordinated rewriting으로 이를 해결한다.

arXiv 원문 보기 ↗

연구 목표

  • 장기 에이전트 메모리의 검색 효율과 변화·충돌에 대한 갱신 품질을 높인다.

핵심 방법

  • query/update-conditioned MicroGraph가 support subgraph와 evidence path를 찾은 뒤 경로 전체를 갱신.

주요 결과

  • 장기 대화 QA·conflict-aware memory 평가에서 답 품질과 token 효율 개선을 보고.

핵심 지표

  • 초록에는 개별 수치가 없으며 dynamic·static·conditional conflict에서 정확도와 유효 증거 선택을 개선했다고 제시.

수집 메모

Hugging Face Daily Papers는 2026-07-24~2026-08-07 범위를 대상으로 트렌딩 정렬 후 업보트·관심도를 기준으로 선정했다. arXiv는 cs.AI 최신 제출 목록에서 장기 추론·코드 장문맥·검색·메모리 주제 4편을 골랐다. 모든 결과·수치는 각 논문 초록 또는 Hugging Face paper metadata의 저자 보고값이다.

생성 시각: 2026-08-07 09:00 KST · 외부 링크는 원문 초록으로 연결