← 데일리 목록

AI 기술 데일리 리서치

2026-08-04 · 09:00 KST · Hugging Face Daily Papers / arXiv / RSS

오늘의 데일리 브리핑

오늘의 연구 흐름은 거대 모델 자체의 확장과 이를 실제 작업·로봇·창작 과정에 연결하는 시스템 설계가 함께 두드러진다. Kimi K3와 Frontis-MA1은 장기 실행 및 모델 개발 자동화에 초점을 맞췄고, TurboVLA는 언어모델 중심 경로를 줄여 로봇 제어의 지연과 메모리 사용을 낮추려 한다. 제품·산업 소식에서는 Google의 Gemini Robotics 2 공개와 Microsoft의 실시간 양방향 음성 AI 테스트, NVIDIA의 Cosmos3 4단계 증류 모델 발표가 포착됐다. 연구 측면에서는 제한된 컨텍스트에서의 추론 재개와 과학 도구를 스스로 확장하는 에이전트가 새 과제로 제시됐다. 종합하면 오늘은 고성능 모델의 규모 경쟁보다, 실행 가능한 중간표현·도구·메모리를 통해 신뢰성 있는 작업 흐름을 만드는 방향이 선명하다.

Hugging Face 주요 논문

01

Kimi K3: 공개 프런티어 지능 모델

Kimi K3: Open Frontier Intelligence
저자: Kimi Team 외 401명 · 2026-07-27

논문 개요

2.8조 매개변수 MoE 모델 Kimi K3를 제시하며, 토큰마다 896개 전문가 중 16개를 활성화한다. Delta Attention·Attention Residuals와 Stable LatentMoE를 결합해 긴 시퀀스와 깊은 모델에서의 정보 흐름을 다룬다. 일반·에이전트·코딩 영역의 강화학습과 100만 토큰 컨텍스트를 함께 사용한다. 저자들은 장기 코딩, 에이전트, 지식·추론·비전 평가에서 프런티어 수준 성능을 보고하며 가중치를 공개한다.

원문 보기 ↗
연구 목표
  • 2.8T MoE, 활성 파라미터 104B
핵심 방법
  • 100만 토큰 컨텍스트와 비전 기능
주요 결과
  • Kimi K2 대비 전체 스케일링 효율 약 2.5배
핵심 수치·조건
  • 평가상 최강 독점 모델에는 뒤처진다고 명시
02

재귀적 ML 엔지니어링을 위한 AI4AI 모델

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
저자: Junlin Yang 외 23명 · 2026-07-30

논문 개요

Frontis-MA1은 머신러닝 엔지니어링을 AI가 개선하는 재귀적 자기개선 연구를 위한 35B 에이전트다. OpenMLE-Gym·RL·Evo로 구성한 실행 피드백 환경에서 Draft, Improve, Debug, Crossover 네 연산자를 학습·조합한다. 실행 기반 SFT와 RL, 장기 탐색을 한 루프로 연결해 프로그램 진화를 수행한다. 저자들은 제한된 하드웨어 예산의 벤치마크 및 별도 NatureBench Lite에서 성능 향상을 보고했다.

원문 보기 ↗
연구 목표
  • AI4AI용 실행 피드백·장기 탐색 스택
핵심 방법
  • 네 프로그램 진화 연산자를 RL/SFT로 학습
주요 결과
  • MLE-Bench Lite: 39.39%→60.61%, Evo-Max 71.21%
핵심 수치·조건
  • 과제당 12시간·RTX 4090 12GB 조건
03

경량 로봇 제어를 위한 실시간 VLA

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
저자: Hengyi Xie 외 9명 · 2026-07-29

논문 개요

TurboVLA는 영상·언어를 거대 언어모델의 표현 공간에 거치는 기존 V→L→A 경로 대신 V+L→A 직접 매핑을 제안한다. 시각 관측과 언어 지시를 독립적으로 인코딩하고, 가벼운 양방향 상호작용으로 정보를 교환한 뒤 연속 행동 청크를 예측한다. 이 구성은 정책 호출 시의 계산과 메모리 부담을 줄이는 것을 목표로 한다. LIBERO에서 훨씬 큰 VLA 정책과 맞먹거나 앞서는 결과를 보고한다.

원문 보기 ↗
연구 목표
  • 직접 V+L→A 매핑
핵심 방법
  • 양방향 비전-언어 상호작용·행동 청크 디코더
주요 결과
  • LIBERO 평균 성공률 97.7%
핵심 수치·조건
  • 0.2B·31.2ms·RTX 4090에서 VRAM 0.9GB
04

캔버스 기반 장기 창작 에이전트 실행 환경

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
저자: Yunlong Lin 외 25명 · 2026-07-26

논문 개요

JarvisHub는 단발성 생성이 아닌 장기 멀티모달 창작 프로젝트의 상태를 다루기 위한 오픈 실행 환경이다. 편집 가능한 캔버스를 작업공간·외부 메모리·행동 공간·공유 프로젝트 상태로 동시에 취급한다. 이미지·영상·오디오·UI 등 산출물과 의존성, 버전, 피드백을 타입이 있는 노드와 링크로 표현한다. 캔버스 상태·프로토콜 브리지·에이전트 런타임의 세 계층으로, 사용자가 과정에 개입할 수 있는 자동화를 지향한다.

캔버스 상태→프로토콜 브리지→에이전트 런타임
원문 보기 ↗
연구 목표
  • 장기 멀티모달 창작 상태 관리
핵심 방법
  • 캔버스에 산출물·버전·피드백을 노드화
주요 결과
  • 캔버스 상태→프로토콜 브리지→에이전트 런타임
핵심 수치·조건
  • 사용자 검토·지시·개입 가능
05

실행 코드로 물리 일관성을 높이는 영상 생성

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
저자: Haodong Li 외 27명 · 2026-07-29

논문 개요

VideoCoCo는 텍스트만으로 시간적 물리 변화를 추론하기 어려운 영상 생성 문제를 다룬다. 코딩 에이전트가 프롬프트에서 장면과 시간 변화를 명시한 Blender 프로그램을 만들고 시뮬레이터가 결정론적 초안을 생성한다. 생성형 비디오 엔진은 이 초안을 조건으로 사실적 영상으로 편집한다. 저자들은 실행 가능한 코드가 제어·검증 가능한 중간표현이 될 수 있음을 두 벤치마크 수치로 제시한다.

텍스트 지시→Blender 코드·시뮬레이션→초안 조건 영상 편집
원문 보기 ↗
연구 목표
  • Blender 코드가 과정 수준 CoT 역할
핵심 방법
  • 코드 생성→시뮬레이션 초안→영상 편집
주요 결과
  • PhyGenBench 0.475→0.558
핵심 수치·조건
  • VBench-2.0 52.18→77.88
06

이미지에서 편집 가능한 디자인 구조 복원

ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition
저자: Jooyeol Yun 외 5명 · 2026-07-28

논문 개요

ReDesign은 래스터 이미지로부터 타이포그래피, 벡터 도형, 색, 그룹, 레이어 순서를 포함한 편집 가능한 디자인 파일을 복원한다. 에이전트가 모달리티별 전문 도구를 선택·조합해 레이어 계층을 확장한다. 각 확장 단계에서 수용·제거·재시도 신호를 주는 검증으로 오류 누적과 대규모 재실행을 억제한다. 909개 Figma 원본과 14,796개 편집 지시로 만든 벤치마크에서 편집 가능성을 평가했다.

원문 보기 ↗
연구 목표
  • 전문 도구 조합으로 레이어 계층 복원
핵심 방법
  • 단계별 검증: 수용·제거·재시도
주요 결과
  • Figma Edit Replay: 원본 909개·지시 14,796개
핵심 수치·조건
  • 레이아웃·색·텍스트 편집 가능성에서 최고 보고

기타 Hugging Face 논문

07

코덱 네이티브 실시간 멀티모달 모델

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
저자: Senqiao Yang 외 22명 · 2026-07-27

논문 개요

Mage-VL은 오프라인 시각 추론에 비해 스트리밍 인지를 비효율적으로 처리하는 VLM의 한계를 겨냥한다. Mage-ViT는 균일한 프레임 샘플링 대신 모션 벡터와 잔차 에너지로 동적·정보량 높은 영역을 선택 인코딩한다. 가벼운 이벤트 게이트와 인과 디코더의 이중 시스템으로 스트리밍 인지를 구성한다. 저자들은 시각 토큰을 줄이면서 정적 과제와 비디오·공간 이해 평가를 제시한다.

원문 보기 ↗
연구 목표
  • 희소 I/P 프레임의 동적 영역 선택 인코딩
핵심 방법
  • System 1 이벤트 게이트 + System 2 디코더
주요 결과
  • 시각 토큰 소비 75% 이상 감소
핵심 수치·조건
  • Mage-VL-4B, 최대 3.5배 추론 속도 향상 보고
08

에이전트 강화학습을 위한 PyTorch 네이티브 학습 프레임워크

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
저자: Jian Hu 외 10명 · 2026-07-22

논문 개요

Molt는 에이전트 강화학습에서 알고리즘·추정기·롤아웃 단계를 자주 바꿔야 하는 연구자의 변경 비용을 낮추려는 PyTorch 네이티브 프레임워크다. 전체 알고리즘 흐름을 추적하고 바꾸기 쉬운 작은 코드베이스를 목표로 한다. 하나의 비동기 루프가 멀티모달 및 MoE 정책을 학습하며, 에이전트가 생성하지 않은 토큰으로 학습하지 않도록 설계했다. 저자들은 동일한 완전 비동기 프로토콜에서 Megatron 기반 최신 스택과 통계적으로 비슷한 성능을 보고한다.

원문 보기 ↗
연구 목표
  • 연구 변경 비용을 낮춘 PyTorch 네이티브 구성
핵심 방법
  • 단일 비동기 루프로 멀티모달·MoE 정책 학습
주요 결과
  • 생성하지 않은 토큰은 학습에 사용하지 않는 설계
핵심 수치·조건
  • 동일 프로토콜에서 최신 Megatron 스택과 통계적 비교

arXiv 신규 논문

09

AI 과학자 시스템을 AI로 평가할 수 있는가

Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review
저자: Mayank Kejriwal 외 1명 · 2026-08-03

논문 개요

이 연구는 자율 연구 생성 시스템이 만든 논문의 품질을 비교하기 위한 자동 동료심사 벤치마킹 절차를 제안한다. 독창성·과학적 엄밀성·명료성·중요성 네 차원에서 세 독립 LLM 심사자를 사용한다. 15개 연구 제안에서 생성한 60편과 FARS 벤치마크 15편을 함께 평가했다. 결과는 심사 모델 간 일치도와 모델별 차이를 함께 제시하며, 자동 평가의 범위와 한계를 드러낸다.

원문 보기 ↗
연구 목표
  • 독창성·엄밀성·명료성·중요성의 4차원 심사
핵심 방법
  • GPT-5.4·Gemini·Claude 독립 심사
주요 결과
  • FARS 평균 2.14–2.47, 비교 시스템 1.00–1.87 / 5점
핵심 수치·조건
  • Gemini–Claude 상관 ρ=0.907, GPT-5.4는 더 낮은 일치
10

제한된 컨텍스트에서 이어가는 장기 추론

ThinkReset: Learnable Intermediate Interface Construction for Bounded-Context Long-Horizon Reasoning
저자: Zijian Zeng 외 4명 · 2026-08-03

논문 개요

ThinkReset은 긴 추론이 컨텍스트 한계에 닿을 때 과거를 단순 압축하는 대신 재사용 가능한 중간 인터페이스를 쓰자는 접근이다. 인터페이스를 기록한 뒤 리셋하고, 리셋 이후의 문제 해결 성공을 직접 최적화한다. 저자들은 결과 보상 중심 장기 추론이 막판의 성급한 추측을 유도할 수 있다는 실패 양식을 지적한다. 여러 장기 추론 벤치마크에서 고정 컨텍스트 창 조건의 성공률 향상을 보고한다.

중간 인터페이스 기록→컨텍스트 리셋→추론 재개
원문 보기 ↗
연구 목표
  • 인터페이스 기록→리셋→추론 재개
핵심 방법
  • 리셋 후 계속 풀기 성공을 직접 최적화
주요 결과
  • 문제: 중복 누적·컨텍스트 초과·오류 고착
핵심 수치·조건
  • 여러 장기 추론 벤치마크, 고정 창 조건
11

과학 도구를 스스로 확장하는 온톨로지 인식 에이전트

SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition
저자: Huajun Chen 외 5명 · 2026-08-03

논문 개요

SciToolAgent-Evo는 고정된 도구 목록에 묶인 과학 에이전트 대신, 새 도구를 획득하고 지식을 갱신하는 구조를 제안한다. 스킬·경험·온톨로지화한 도구 그래프를 메모리로 축적하고, 대조적 궤적에서 일반화 가능한 지식을 뽑는다. 추론 때는 능동 요청과 LinUCB 기반 게이트로 탐색과 활용의 균형을 잡고, 새 도구의 과학 온톨로지를 온라인으로 완성한다. 4단계 난이도의 900개 현실형 과제로 구성한 OpenSciToolBench에서 결과를 보고한다.

스킬·도구 메모리→능동 요청·게이트→새 도구 온톨로지 통합
원문 보기 ↗
연구 목표
  • 스킬·경험·도구 그래프를 갱신하는 메모리
핵심 방법
  • 능동 요청 + LinUCB 게이트
주요 결과
  • 새 도구 획득 시 온톨로지 온라인 통합
핵심 수치·조건
  • OpenSciToolBench: 4단계·900개 과제

뉴스

국내

[8월3일] '후방 배치 엔지니어'의 등장...AI, 회사 자체를 다시 설계한다

AI타임스 · 2026-08-04 07:00
  • 요약 — [8월3일] '후방 배치 엔지니어'의 등장...AI, 회사 자체를 다시 설계한다
  • 세부 — 올해 초 "클로드 코드 사용량이 너무 많아 1년 예산을 몇달 만에 모두 소진했다"는 발언으로 '토큰맥싱(Tokenmaxxing)' 논란을 불러왔던 프라빈 나가 우버 최고 기술책임자(CTO)가 이번에는 기업의 AI 도입 방식이 어떻게 바뀌고 있는지를 보여주는 흥미로운 사례를 소개했습니다.그는 최근 X를 통해 우버가 최고의 AI 엔지니어들로 구성된 '에이전틱
원문 보기 ↗

구글이 로봇을 제어하는 방법… ‘제미나이 로보틱스2’ 공개

AI타임스 · 2026-08-04 06:55
  • 요약 — 구글이 로봇을 제어하는 방법… ‘제미나이 로보틱스2’ 공개
  • 세부 — AI타임스 AI타임스 news@aitimes.com
원문 보기 ↗

MS, 첫 실시간 양방향 음성 AI 'MAI 리얼타임' 테스트 중

AI타임스 · 2026-08-03 18:02
  • 요약 — MS, 첫 실시간 양방향 음성 AI 'MAI 리얼타임' 테스트 중
  • 세부 — 마이크로소프트(MS)가 자체 개발한 첫 실시간 양방향 음성 AI 모델 'MAI 리얼타임(Realtime)'의 비공개 테스트를 시작하며 대화형 음성 AI 시장 공략에 속도를 내는 것으로 확인됐다. 테스팅카탈로그는 2일(현지시간) MS가 최근 일부 비공개 파트너를 대상으로 MAI 플레이그라운드(Playground) 환경에서 ‘MAI 리얼타임’ 모델의 한정 테스
원문 보기 ↗

해외

How we built a realtime system for responsive voice AI in six months

OpenAI · 2026-08-03 16:00
  • 요약 — How we built a realtime system for responsive voice AI in six months
  • 세부 — GPT-Live enables continuous voice interaction with AI, using a turnless speech model and low-latency architecture for faster, more natural conversations.
원문 보기 ↗

Ten advances in mathematics and theoretical computer science

OpenAI · 2026-08-01 09:00
  • 요약 — Ten advances in mathematics and theoretical computer science
  • 세부 — OpenAI shares new results on long-standing open problems in mathematics and theoretical computer science, including advances in geometry, cryptography, and complexity.
원문 보기 ↗

Advancing responsible AI across Europe

OpenAI · 2026-08-01 00:00
  • 요약 — Advancing responsible AI across Europe
  • 세부 — OpenAI shares how its safety, security, transparency, and provenance practices support responsible AI governance in Europe. The work will continue as the EU AI Act advances.
원문 보기 ↗

Building abundant intelligence

OpenAI · 2026-08-01 00:00
  • 요약 — Building abundant intelligence
  • 세부 — A full-stack approach to making advanced AI more capable, more affordable, and more widely useful.
원문 보기 ↗

블로그·HN

Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)

Simon Willison · 2026-08-01 08:13
  • 요약 — Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)
  • 세부 — Tuesday was Stateless MCP day - the rollout of MCP 2.0, or the 2026-07-28 Model Context Protocol specification to use the more formal but less memorable name. This is the most significant change to th
원문 보기 ↗

After Orthogonality: Virtue-Ethical Agency and AI Alignment

The Gradient · 2026-02-19 08:25
  • 요약 — After Orthogonality: Virtue-Ethical Agency and AI Alignment
  • 세부 — Preface This essay argues that rational people don&#x2019;t have goals, and that rational AIs shouldn&#x2019;t have goals. Human actions are rational not because we direct them at some final &#x2018;g
원문 보기 ↗

LLMs reward expertise

Hacker News 100+ · 2026-08-04 06:13
  • 요약 — LLMs reward expertise
  • 세부 — Article URL: https://www.seangoedecke.com/llms-reward-expertise/ Comments URL: https://news.ycombinator.com/item?id=49161518 Points: 306 # Comments: 128
원문 보기 ↗

AI's debt binge can't last, hidden borrowing reaches $1.65T

Hacker News 100+ · 2026-08-04 05:02
  • 요약 — AI's debt binge can't last, hidden borrowing reaches $1.65T
  • 세부 — Article URL: https://fortune.com/2026/07/31/ai-debt-hypescalers-capex-capital-spending-hidden-borrowing-bond-issuance/ Comments URL: https://news.ycombinator.com/item?id=49160699 Points: 109 # Comment
원문 보기 ↗