← 데일리 목록

AI TECHNOLOGY DAILY RESEARCH · 2026.08.02 · KST

AI 기술 데일리 리서치

Hugging Face Daily Papers · arXiv 원문 링크 · RSS 수집 기준

오늘의 데일리 브리핑

오늘 연구 흐름은 대형 MoE의 효율 개선부터 물리 세계 모델, 로봇 행동, 영상·문서·3D를 다루는 스트리밍 모델까지 ‘표현을 줄이고 필요한 단계만 명시하는’ 설계가 두드러진다. Kimi K3는 선택적 전문가 활성화와 장문맥을, Frontis-MA1과 VideoCoCo는 실행 가능한 중간 연산·코드를 각각 AI 개발과 영상 생성의 작업 흐름에 넣는다. 제품·산업 소식에서는 K-EXAONE 2.0 공개, 멀티모달 영상 모델 H3, 에이전트의 보안·비용 관리가 함께 나왔고, OpenAI는 수학·이론 컴퓨터과학 결과와 GPT-5.6 가격 대비 성능 개선을 알렸다. 한 줄로 보면 오늘은 모델 자체의 규모 경쟁과 함께 실제 시간·비용·통제 가능한 작업 경로를 만드는 경쟁이 병행된 날이다.

Hugging Face 주목 논문 6편

01

Kimi K3: 개방형 프런티어 지능

Kimi K3: Open Frontier Intelligence

저자: Kimi Team 외 401명

논문 개요

Kimi K3는 비전 기능과 100만 토큰 문맥을 갖춘 2.8T MoE 모델을 제시한다. 논문은 Delta Attention과 Attention Residuals로 긴 시퀀스·깊은 층의 정보 흐름을 개선하는 설계를 설명한다. Stable LatentMoE는 토큰마다 896개 routed expert 중 16개를 활성화한다. 저자들은 학습·데이터 레시피를 함께 다듬어 Kimi K2 대비 전체 스케일링 효율이 약 2.5배 개선됐다고 보고한다.

원문 보기 ↗

02

머신러닝 엔지니어링을 스스로 개선하는 AI4AI

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

저자: Junlin Yang 외 23명

논문 개요

이 연구는 AI가 AI 개발 과정을 개선하는 재귀적 자기개선을 머신러닝 엔지니어링 과제로 시험한다. OpenMLE는 실행 피드백을 주는 환경, 연산자 학습, 장기 탐색을 하나의 스택으로 묶는다. Frontis-MA1은 Draft·Improve·Debug·Crossover 네 가지 프로그램 진화 연산자를 중심으로 후학습된다. 실행 근거 SFT와 RL을 사용해 학습과 추론을 같은 연산자 체계에 맞춘다.

흐름실행 과제→Draft·Improve·Debug·Crossover→실행 피드백

원문 보기 ↗

03

물리 언어로 세계 변화를 추론하는 월드 모델

PhiZero: A World Model Built Around Physical Language

저자: Shuyao Shang 외 6명

논문 개요

PhiZero는 픽셀에서 미래 영상을 바로 예측하는 대신, 세계 상태 전이를 압축한 이산 표현인 물리 언어를 사용한다. 야생 영상에서 자기지도 방식으로 물리 언어를 학습한다. 모델은 먼저 미래의 세계 변화를 추론하고 그다음 영상을 렌더링하는 reason-then-render 방식을 취한다. 논문은 이를 통해 물리 변화에 대한 명시적 추론을 목표로 한다.

흐름야생 영상→물리 언어→미래 변화 추론→렌더링

원문 보기 ↗

04

언어모델 경유를 줄인 실시간 로봇 행동 모델

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

저자: Hengyi Xie 외 9명

논문 개요

TurboVLA는 기존 V→L→A 구조가 매 정책 호출 때 큰 계산·메모리 비용을 유발한다는 문제에서 출발한다. 시각 관측과 언어 지시를 각각 인코딩한 뒤 두 표현 사이 정보를 직접 교환해 행동으로 연결한다. 즉 LLM을 지각과 행동 사이의 중앙 인터페이스로 두지 않는 V+L→A 매핑이다. 논문은 RTX 4090 환경에서 실시간 운용을 목표로 제시한다.

흐름시각 관측+언어 지시→직접 정보 교환→로봇 행동

원문 보기 ↗

05

캔버스에서 창작 과정을 유지하는 멀티모달 에이전트 기반

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

저자: Yunlong Lin 외 25명

논문 개요

JarvisHub는 한 번의 프롬프트 출력이 아닌 장기 멀티모달 제작 과정을 다룬다. 실제 창작에 포함되는 레퍼런스, 초안, 대안, 편집, 실패 시도, 버전 관계, 도구 행동과 피드백을 프로젝트 상태로 본다. 논문은 이런 상태가 기존 프롬프트·채팅·노드 기반 도구에서 부분적으로만 유지된다고 지적한다. 이를 위해 캔버스 중심의 개방형 실행 기반을 제안한다.

흐름레퍼런스·초안→캔버스 프로젝트 상태→도구·피드백

원문 보기 ↗

06

비디오 증류에서 분포 포괄성과 집중을 함께 맞추기

DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation

저자: Jiaxing Li 외 9명

논문 개요

DistillAlign은 자기회귀 비디오 증류의 DMD 파이프라인에서 초기화와 증류 단계가 서로 다른 분포를 향할 수 있다고 본다. 저자들은 mode-seeking 성격의 분포 정합 손실을 고려하면 초기화도 교사 모델의 mode coverage에 맞춰야 한다고 주장한다. 이를 분석하기 위해 정밀도와 coverage를 재는 분포 평가 프로토콜을 제안한다. 중간 학생 모델을 시각 점수만으로 판단하는 관행을 재검토한다.

원문 보기 ↗

기타 Hugging Face 논문

07

실행 가능한 Blender 코드를 사고 과정으로 쓰는 영상 생성

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

저자: Haodong Li 외 27명

논문 개요

VideoCoCo는 텍스트-비디오 모델이 압축된 텍스트만으로 물리적으로 일관된 시간 변화를 추론하기 어렵다는 문제를 다룬다. 기존 중간 계획은 실행 불가능하거나 시간적으로 성기다는 한계를 지적한다. 이 프레임워크에서는 코딩 에이전트가 Blender 코드를 합성하고, 그 실행 코드가 과정 수준의 chain-of-thought 역할을 한다. 논문은 이를 에이전트형 이중 엔진 시스템으로 제시한다.

흐름텍스트 프롬프트→Blender 코드 합성→실행 가능한 과정→영상 생성

원문 보기 ↗

08

교육과정 구조를 평가하는 K-12 지식그래프

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

저자: Hao Liang 외 7명

논문 개요

K12-KGraph는 학교 교육에서 LLM이 교육과정 지식의 구조와 시각적 제시를 이해하는지 평가·학습하기 위한 지식그래프다. 논문은 시험 문항 답변 위주의 기존 벤치마크가 선수 관계나 개념 분류, 실험-개념 연결을 충분히 다루지 못한다고 본다. 공식 교과서에서 수학·물리·화학·생물 데이터를 추출했다. 그래프는 교육과정 구조와 시각적 근거를 위한 노드·관계 유형을 포함한다.

원문 보기 ↗

arXiv 보충 3편

09

스트리밍 장면에서 토큰을 아끼는 멀티모달 모델

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

저자: Senqiao Yang 외 22명

논문 개요

Mage-VL은 오프라인 시각 추론에는 강하지만 스트리밍 지각에는 비효율적인 기존 VLM의 한계를 다룬다. Mage-ViT는 균일한 프레임 샘플링 대신 모션 벡터와 잔차 에너지로 동적·고엔트로피 영역을 선택해 인코딩한다. 가벼운 이벤트 게이트와 인과적 디코더로 구성한 이중 시스템이 능동적 스트리밍 지각을 지원한다. 평가에서 정적 과제 성능을 유지하면서 비디오 이해와 공간 추론의 향상을 보고한다.

흐름스트리밍 프레임→동적 영역 토큰화→이벤트 게이트→인과 디코더

원문 보기 ↗

10

전역 배치와 국소 인식을 분리한 고해상도 문서 파싱

MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing

저자: Junbo Niu 외 60명

논문 개요

MinerU2.5는 고해상도 문서를 전역 배치 분석과 국소 내용 인식으로 분리해 처리하는 1.2B VLM이다. 첫 단계는 축소 이미지에서 구조 요소를 찾아 고해상도 전체 처리 비용을 피한다. 두 번째 단계는 그 배치 정보를 따라 원본 해상도 크롭에서 텍스트·수식·표의 세부를 인식한다. 논문은 여러 벤치마크에서 낮은 계산 오버헤드와 강한 인식 성능을 보고한다.

흐름축소 이미지→전역 배치 분석→원본 크롭 인식

원문 보기 ↗

11

긴 영상 흐름에서 기하 맥락을 유지하는 3D 재구성

Geometric Context Transformer for Streaming 3D Reconstruction

저자: Lin-Zhuo Chen 외 10명

논문 개요

LingBot-Map은 영상 스트림에서 카메라 포즈와 포인트클라우드를 복원하는 feed-forward 3D 기반 모델이다. GCT의 주의 메커니즘은 anchor context, pose-reference window, trajectory memory를 결합한다. 각각 좌표 정합, 조밀한 기하 단서, 장기 드리프트 보정을 겨냥한다. 논문은 압축된 상태로 긴 시퀀스에서 안정적으로 추론하며 기존 스트리밍·반복 최적화 방법보다 높은 성능을 보였다고 보고한다.

흐름영상 스트림→기하 맥락·메모리→3D 재구성

원문 보기 ↗

뉴스

국내 · AI타임스 · 2026-08-01 19:10

문샷, 알리바바서 엔비디아 GPU 2만개 공급받아 ‘키미 K3’ 개발

  • 요약 — 문샷 AI가 알리바바의 2만 개 엔비디아 GPU 클러스터를 Kimi 시리즈 개발에 활용한다는 보도다.
  • 세부 — 블룸버그 보도를 인용했으며, 컴퓨팅 파워 공급 계약과 Kimi K3 개발의 연결을 전한다.
원문 보기 ↗

국내 · AI타임스 · 2026-08-01 17:54

미니맥스, 텍스트·오디오 통합 멀티모달 영상 AI ‘H3’ 공개

  • 요약 — 미니맥스가 텍스트·이미지·영상·오디오를 한 모델에서 처리하는 H3를 공개했다.
  • 세부 — 보도는 H3를 범용 멀티모달 생성 모델로 소개하고 Hailuo 서비스와의 연계를 전한다.
원문 보기 ↗

국내 · THE AI · 2026-07-31 15:39

AI 에이전트 통제 나선 스노우플레이크 “보안·비용 잡는다”

  • 요약 — 스노우플레이크가 AI 에이전트의 보안과 사용 비용을 중앙 관리하는 Cortex AI Gateway를 공개할 예정이다.
  • 세부 — 기사에 따르면 퍼블릭 프리뷰로 제공되며, 에이전트 상호운용성과 기업 확장을 위한 관리 기능을 내세운다.
원문 보기 ↗

국내 · THE AI · 2026-07-31 14:26

LG AI연구원, 국내 최대 7500억 파라미터 ‘K-엑사원 2.0’ 공개

  • 요약 — LG AI연구원이 K-EXAONE 2.0을 Hugging Face에 공개했다.
  • 세부 — 기사 기준 모델 규모는 750B 파라미터이며, 과기정통부 독자 AI 파운데이션 모델 프로젝트 2차수 모델로 소개된다.
원문 보기 ↗

해외 · OpenAI · 2026-08-01 09:00

Ten advances in mathematics and theoretical computer science

  • 요약 — OpenAI가 기하, 암호, 복잡도 이론의 오래된 미해결 문제에 관한 새 결과를 공개했다.
  • 세부 — 원문은 수학과 이론 컴퓨터과학의 10개 진전을 소개한다.
원문 보기 ↗

해외 · OpenAI · 2026-07-30 19:00

Advancing the price-performance frontier with GPT-5.6

  • 요약 — OpenAI가 Luna와 Terra의 GPT-5.6 가격 인하 및 효율 개선을 안내했다.
  • 세부 — 원문은 기업의 AI 워크플로 배포를 위한 가격 대비 성능 개선을 주제로 한다.
원문 보기 ↗

해외 · MIT Technology Review · 2026-07-30 19:15

A fundamental flaw leaves LLMs strikingly vulnerable to attack

  • 요약 — MIT Technology Review는 LLM을 해킹으로부터 완전히 안전하게 만들기 어렵다는 연구 주장을 소개했다.
  • 세부 — 기사는 국제 학회 발표 논문을 근거로 모델 작동 방식의 근본적 취약성을 다룬다.
원문 보기 ↗

해외 · TechCrunch AI · 2026-08-02 05:26

Judge denies xAI’s request to block Minnesota ban on ‘nudify’ apps

  • 요약 — 미네소타의 이른바 ‘nudify’ 앱 금지 조치가 xAI의 소송에도 진행될 수 있다는 보도다.
  • 세부 — 기사 제목 기준 법원이 xAI의 금지조치 차단 요청을 받아들이지 않았다.
원문 보기 ↗

블로그·HN · Simon Willison · 2026-08-01 08:13

Stateless MCP has recaptured my interest

  • 요약 — Simon Willison이 Stateless MCP와 mcp-explorer, datasette-mcp 작업을 소개했다.
  • 세부 — 글은 2026-07-28 MCP 사양을 MCP 2.0으로 부르며 그 변화를 다룬다.
원문 보기 ↗

블로그·HN · Last Week in AI · 2026-07-21 21:03

LWiAI Podcast #252 - GPT 5.6, Grok 4.5, Nemotron-Labs-Diffusion, AI 2040

  • 요약 — Last Week in AI가 GPT-5.6, Grok 4.5, Nemotron-Labs-Diffusion, 정책 이슈를 다룬 회차를 게시했다.
  • 세부 — 피드 설명에는 데이터센터와 해석가능성 연구, AI 정책 논의도 포함된다.
원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-08-02 03:32

Postmortem for Kernel Soundness Bug #14576

  • 요약 — Hacker News에서 kernel soundness bug 사후 분석 글이 높은 관심 항목으로 수집됐다.
  • 세부 — 피드 기준 104 포인트와 37개 댓글이 기록됐으며, 링크는 작성자의 사후 분석이다.
원문 보기 ↗