← 데일리 목록

AI 기술 데일리 리서치

2026-07-25 · KST 09:00 · 연구·제품·산업 동향

오늘의 데일리 브리핑

오늘 논문 흐름은 장기 상호작용 월드 모델과 비디오 이해·생성의 실시간화, 그리고 에이전트가 경험과 근거 상태를 축적하는 구조에 모인다. 단일 GPU 월드 롤아웃, 플레이 속도 렌더링, 대규모 실세계 로봇 궤적처럼 배포 조건을 수치로 드러낸 연구가 함께 제시됐다. 제품·산업 쪽에서는 OpenAI의 ChatGPT Health 출시와 음성 기능 확장, Anthropic의 Claude 음성 모드 강화, 업무 맥락을 저장하는 AI 워크스페이스 발표이 확인된다. 새 발표들은 모델 자체뿐 아니라 도구 연결·개인화·지속 메모리를 제품 표면으로 옮기고 있다. 결론적으로 오늘은 생성·이해 모델을 실제 상호작용과 작업 흐름에 붙이는 구현 조건이 핵심이다.

Hugging Face 주목 논문

01

단일 GPU에서 이어지는 인터랙티브 월드 생성

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

저자: Fan Jiang 외 40명 · Hugging Face

논문 개요

행동 조건 비디오 월드 모델을 실시간·장기 폐루프 상호작용에 적용한다. AAA 게임·시뮬레이션·인터넷 비디오를 아우르는 데이터로 제어 가능한 월드 동역학을 학습한다. 양방향 교사를 인과 학생으로 증류하고 LongForcing으로 긴 자기 롤아웃의 분포 이동과 드리프트를 줄인다. WorldRoamBench와 확장 롤아웃에서 제어성과 장기 일관성을 평가했다.

행동 입력→월드 모델 롤아웃→스트리밍 RGB 프레임
원문 보기 ↗
연구 목표
실시간 장기 상호작용 월드 모델
핵심 방법
행동 조건화·교사 강제·ODE 증류·LongForcing
주요 결과
경쟁력 있는 제어성과 장기 월드 진화를 보고
핵심 수치·조건
720P 최대 16 FPS, RTX 5090 1대, 첫 프레임 1.2초·약 19GiB
02

효율적 범용 비디오 이해를 위한 완전 공개 MLLM

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

저자: Xinhao Li 외 26명 · Hugging Face

논문 개요

VideoChat3는 일반·장편·스트리밍 비디오에서 모두 작동하는 완전 공개 비디오 중심 MLLM을 제시한다. I3D-ViT와 적응형 프레임 해상도로 시공간 표현 비용을 낮춘다. 데이터 합성 파이프라인은 서로 다른 세 시나리오를 포괄하는 학습 데이터셋을 구축한다. 일반·장편·스트리밍 벤치마크에서 동급 또는 더 큰 공개 모델을 앞섰다고 보고한다.

비디오 입력→적응형 시공간 표현→비디오 MLLM 추론
원문 보기 ↗
연구 목표
다양한 비디오 유형의 일반화와 효율
핵심 방법
I3D-ViT·적응형 프레임 해상도·합성 데이터
주요 결과
공개 모델 대비 우수 성능을 보고
핵심 수치·조건
4B 파라미터; 3개 데이터셋
03

사람이 만든 멀티모달 자료에서 에이전트 스킬 추출

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

저자: Yijia Fan 외 10명 · Hugging Face

논문 개요

RESOURCE2SKILL은 튜토리얼 영상·저장소·글·참고 산출물을 실행 가능한 소프트웨어 에이전트 스킬로 바꾼다. 스킬 위키에는 구조화 텍스트, 코드, 시각 예시, 메타데이터와 출처를 함께 저장한다. 추론 시 에이전트는 관련 스킬을 검색·조합하고, 부족하면 같은 연산자로 온라인 획득한다. 7개 저작 도메인에서 무스킬 에이전트보다 평균 점수가 올랐다고 보고한다.

자료 입력→스킬 위키 구성→검색·조합에이전트 실행
원문 보기 ↗
연구 목표
사람 제작 멀티모달 자원의 재사용
핵심 방법
계층형 멀티모달 스킬 위키·검색·조합·온라인 획득
주요 결과
28개 모델-도메인 집계 중 26개에서 강한 기준선 상회
핵심 수치·조건
무스킬 대비 평균 +11.9%p
04

기억과 스킬을 스스로 축적하는 개인 GUI 에이전트

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명 · Hugging Face

논문 개요

KnowAct-GUIClaw는 OpenClaw의 크로스플랫폼 GUI 조작과 지속적 자기개선 한계를 겨냥한다. Know-Route-Act-Reflect 구조가 사용자 상호작용 경험과 지식을 장기 과제 분해·배치에 사용한다. GUI 하위 에이전트는 경험 귀속 메모리와 진화형 스킬 라이브러리를 결합하며, 피드백을 계속 저장한다. Android·iOS·HarmonyOS·Windows 실험 결과를 제시한다.

경험·지식→과제 분해→GUI 실행피드백 메모리
원문 보기 ↗
연구 목표
다중 플랫폼 GUI 자동화와 경험 기반 개선
핵심 방법
Know-Route-Act-Reflect·메모리·진화형 스킬
주요 결과
MobileWorld 장기 과제에서 최고 성능을 보고
핵심 수치·조건
Kimi-2.6 기반 64.1%, 전이 개선 8.5%
05

플레이 속도의 생성형 월드 렌더러

Generative World Renderer at the Speed of Play

저자: Guixu Lin 외 5명 · Hugging Face

논문 개요

AlayaRenderer-Flash는 물리 엔진이 내보낸 구조화 월드 상태에서 RGB 프레임을 합성하는 렌더러를 실시간화한다. 원래 모델을 소수 단계 자기회귀 스트리밍 모델로 바꾸고 경량 증류 코덱을 사용한다. G-buffer와 텍스트 프롬프트 인터페이스를 유지하면서 길이 제한 없는 입력 스트림을 렌더링한다. 내용 보존·시간 일관성·실행 효율을 평가하고 물리 엔진과 결합한 플레이 가능 월드를 제시한다.

물리 월드 상태→스트리밍 렌더러→RGB 프레임
원문 보기 ↗
연구 목표
생성형 월드 렌더링의 실시간 배포
핵심 방법
소수 단계 자기회귀 스트리밍·경량 증류 코덱
주요 결과
핵심 렌더링 능력 보존과 비용 감소를 보고
핵심 수치·조건
0.56 FPS에서 31.54 FPS; 통합 시스템 30 FPS
06

근거 상태를 공유하는 정보탐색 멀티에이전트

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

저자: Yuyao Zhang 외 13명 · Hugging Face

논문 개요

SearchOS는 검색 이력이 길어질 때 반복 루프에 빠지는 정보탐색 에이전트 문제를 다룬다. 열린 도메인 탐색을 인용 근거를 갖춘 관계형 스키마 완성으로 정식화한다. Frontier Task·Evidence Graph·Coverage Map·Failure Memory로 진행 상태를 외부화하고, 병렬 스케줄링과 도구 미들웨어로 빈틈을 채운다. WideSearch와 GISA에서 평가한 단일·다중 에이전트 기준선보다 모든 지표에서 앞섰다고 보고한다.

질문→근거 상태 갱신→병렬 탐색인용 답변
원문 보기 ↗
연구 목표
반복 없는 근거 기반 열린 도메인 탐색
핵심 방법
SOCM 상태 관리·병렬 스케줄링·도구 미들웨어
주요 결과
두 벤치마크의 모든 평가 지표 선도 보고
핵심 수치·조건
Frontier Task·Evidence Graph·Coverage Map·Failure Memory

기타 Hugging Face 논문

07

10만 시간 실세계 궤적으로 확장한 로봇 VLA

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

저자: Xiaomi Robotics Team 외 33명 · Hugging Face

논문 개요

Xiaomi-Robotics-1은 보지 못한 환경에서 언어 지시를 따르고 적은 미세조정 데이터로 새 과제에 적응하는 VLA 모델이다. 사전학습에서 UMI 장치로 모은 10만 시간 이상 조작 궤적과 자동 언어 라벨을 사용한다. 사후학습은 로봇 몸체와 명령형 지시에 역량을 정렬한다. 시뮬레이션과 실제 로봇 실험에서 데이터·모델 규모 확장이 성능에 전이됨을 제시한다.

실세계 궤적→사전학습→지시 정렬로봇 행동
원문 보기 ↗
연구 목표
실세계 조작의 범용 행동 생성
핵심 방법
2단계 학습·자동 언어 라벨링
주요 결과
여러 벤치마크에서 기존 최고 성능을 상회
핵심 수치·조건
RoboCasa365 57.6% 대 46.6%; RoboDojo 20.07 대 13.07
08

원해상도 이미지 생성·편집을 위한 효율 흐름 모델

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

저자: Xinjie Zhang 외 23명 · Hugging Face

논문 개요

Mage-Flow는 원해상도 이미지 생성과 편집을 위한 기초 모델을 제안한다. 초록은 효율적인 생성과 편집을 목표로 하는 모델 설계를 설명한다. 제시된 실험은 해당 작업에서 모델을 평가하는 구성이다. 여기서는 초록에 명시된 범위를 넘는 성능 수치를 추가하지 않는다.

원문 보기 ↗
연구 목표
원해상도 이미지 생성·편집
핵심 방법
Mage-Flow 모델 설계
주요 결과
생성·편집 작업에서 평가 제시
핵심 수치·조건
초록 제공 범위 내 설명

새로 올라온 arXiv

09

암묵·명시 기하를 결합한 3D 인식 VLM

3D-Aware VLMs with Implicit and Explicit Geometries

저자: Gongjie Zhang 외 6명 · arXiv

논문 개요

VLM-IE3D는 2D 입력 기반 VLM의 세밀한 3D 공간 이해 한계를 다룬다. RGB 비디오에서 고수준 기하 사전을 담는 암묵 기하 토큰과 재구성 3D 속성의 명시 기하 토큰을 얻는다. 3D 인식 어댑터가 두 표현과 2D 시각 단서를 결합한다. 추가 3D 입력 없이 여러 3D 과제에서 우수 성능을 보고한다.

RGB 비디오→두 기하 토큰→3D 어댑터공간 추론
원문 보기 ↗
연구 목표
RGB만으로 3D 공간 이해 강화
핵심 방법
암묵·명시 기하 토큰과 3D 어댑터
주요 결과
3D 검출·그라운딩·캡션·추론에서 우수 성능 보고
핵심 수치·조건
추가 3D 입력 불필요
10

세계 상태 레지스터를 둔 스트리밍 멀티에이전트 확산

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

저자: Bolei Zhou 외 4명 · arXiv

논문 개요

WorldWeaver는 여러 에이전트와 시점에서 지속되는 세계 상태를 유지하는 비디오 확산 모델이다. 생성 청크마다 갱신되는 학습 가능 레지스터가 공유 세계 정보와 개별 에이전트 상태를 저장한다. 개별 상태·조감도·장면 텍스트의 감독 신호와 세계 상태·영상 모델링을 나눈 Mixture-of-Transformers를 사용한다. 두 에이전트 Minecraft 생성에서 논리적 일관성과 품질 개선을 보고한다.

생성 청크→상태 레지스터 갱신→다음 청크 생성
원문 보기 ↗
연구 목표
다중 시점·에이전트 간 지속 세계 상태
핵심 방법
상태 레지스터·다중 감독·Mixture-of-Transformers
주요 결과
Minecraft 생성의 일관성과 품질 개선 보고
핵심 수치·조건
2-에이전트 Minecraft 평가
11

분리된 데이터에서 배우는 통합 비디오 밀집 예측

Unified Video Dense Prediction from Disjoint Data

저자: Joon-Young Lee 외 4명 · arXiv

논문 개요

UniD는 서로 다른 데이터셋에 흩어진 장면 속성을 하나의 비디오 모델로 예측한다. 과제별 전문가가 경량 프로젝터를 통해 통합 백본을 감독해 공통 주석이나 의사라벨을 피한다. 사전학습 확산 모델의 시각 사전이 분리 데이터의 도메인 간극을 잇는다는 가설을 사용한다. 과제별 전문가와 다중과제 기준선에 경쟁력 있는 성능, OOD 일반화와 시간적 일관성을 보고한다.

분리 데이터→과제 전문가→통합 백본8개 속성 예측
원문 보기 ↗
연구 목표
분절된 주석으로부터 통합 장면 예측
핵심 방법
전문가 증류·경량 프로젝터·확산 사전
주요 결과
경쟁력·OOD 일반화·일관성 개선 보고
핵심 수치·조건
깊이 등 8개 밀집 장면 속성

뉴스

국내

오픈AI, 데스크톱 앱에 'GPT-라이브' 음성 제어 도입

AI타임스 · 2026-07-24 18:50

  • 요약 오픈AI가 자연스러운 음성 대화 모델 'GPT-라이브(GPT-Live)'를 맥(Mac)과 윈도우용 챗GPT 데스크톱 앱에 통합하며 음성 기반 AI 개발 환경을 본격화했다. 코딩 에이전트 '코덱스'와 '챗GPT 워크'를 음성으로 제어할 수 있게 되면서, 키보드 대신 대화만으로 개발 작업을 수행하는 음성 코딩 시대가 열렸다는 평가가 나온다.오픈AI는 23일(현
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗

앤트로픽, '클로드' 음성 모드 대폭 강화…오퍼스·소네트에도 탑재

AI타임스 · 2026-07-24 18:46

  • 요약 앤트로픽이 '클로드'의 음성 모드를 대폭 업그레이드하며 고성능 모델 지원과 외부 업무 도구 연동 기능을 추가했다.앤트로픽은 23일(현지시간) 클로드 음성 모드 업데이트를 발표하고, 사용자가 대화 중에도 모델 선택기를 통해 하이쿠, 소네트, 오퍼스 모델을 자유롭게 전환할 수 있다고 밝혔다.또 지메일, 구글 캘린더, 슬랙, 노션, 캔바 등 다양한 서비스와 연동
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗

젠스파크, 업무 맥락 기억하는 ‘AI 워크스페이스 6.0’ 공개

THE AI · 2026-07-24 18:06

  • 요약 젠스파크가 이메일과 문서, 회의, 업무 애플리케이션에 흩어진 업무 맥락을 지속형 메모리로 쌓고 AI 에이전트가 이를 실제 업무에 활용하는 ‘AI 워크스페이스 6.0’을 공개했다.이번 업데이트의 중심은 지속형 메모리 레이어 ‘세컨드브레인’이다. 여기에 젠스파크의 첫 하드웨어 ‘세컨드브레인 노트’와 이메일 AI 에이전트 ‘젠메일’, 디자인 기능 ‘AI 디자인’
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗

해외

Launching Health in ChatGPT

OpenAI · 2026-07-23 09:00

  • 요약 Health in ChatGPT now lets eligible U.S. users securely connect medical records and Apple Health to get more personalized insights and better understand their health.
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗

Prentis, new AI lab co-founded by Reid Hoffman, Mark Pincus in talks to raise $100M

TechCrunch AI · 2026-07-25 07:25

  • 요약 The neolab is betting that automating routine computer tasks will soon outpace coding as AI's biggest use case.
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗

Anthropic launches Opus 5

TechCrunch AI · 2026-07-25 02:00

  • 요약 Opus 5 will be both cheaper and less restrictive than Fable, likely making it preferable in most use cases.
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗

As US weighs response to Chinese AI, industry urges against broad open-weight restrictions

TechCrunch AI · 2026-07-25 00:51

  • 요약 AI companies, including Nvidia and Mistral, urge policymakers to avoid broad restrictions on open-weight AI models as Washington debates responses to Chinese AI and alleged model distillation.
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗

블로그·HN

OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened

Simon Willison · 2026-07-23 08:51

  • 요약 This story is wild. The short version: OpenAI were running a cybersecurity test against an unreleased model, with the model's guardrail features turned off. Rather than solve the test, the model broke
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗

LWiAI Podcast #252 - GPT 5.6, Grok 4.5, Nemotron-Labs-Diffusion, AI 2040

Last Week in AI · 2026-07-21 21:03

  • 요약 GPT-5.6 and Grok 4.5, Meta's Muse Spark 1.1, regulatory developments in AI and data centers, interpretability research from Anthropic, and the future of AI policy with AI 2040
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗

Claude Opus 5

Hacker News 100+ · 2026-07-25 01:57

  • 요약 https://www.anthropic.com/claude-opus-5-system-card Comments URL: https://news.ycombinator.com/item?id=49038433 Points: 1216 # Comments: 662
  • 세부 원문에 제시된 발표·사례·논의를 확인한다.
원문 보기 ↗