← 데일리 목록

AI 기술 데일리 리서치

2026-07-27 · 09:00 KST

오늘의 데일리 브리핑

오늘 연구 흐름은 장기 상호작용 월드 모델, 경험을 축적하는 에이전트 스킬, 실제 환경에서 움직이는 VLA 로봇처럼 모델을 실행 가능한 시스템으로 확장하는 데 모인다. 제품·산업 쪽에서는 KAIST와 엔비디아의 피지컬 AI 공동연구, 엔비디아의 모델 배포 인프라, SKT의 스타트업 대상 모델 API 지원 소식이 포착됐다. 해외에서는 ChatGPT의 미국 적격 사용자 대상 건강 기록·Apple Health 연결과 OpenAI 인프라 계획이 발표됐으며, 에이전트 보안 사고를 둘러싼 투명성 요구도 보도됐다. 오늘의 결론은 모델 성능 경쟁이 데이터·메모리·추론 인프라와 실제 실행 환경의 설계 경쟁으로 넓어지고 있다는 점이다.

Hugging Face 주목 논문

01

데스크톱 GPU에서 이어지는 인터랙티브 월드 생성

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

저자: Fan Jiang 외 40명

논문 개요

행동 조건 비디오 월드 모델로 실시간 장기 상호작용을 구현한다. 게임·시뮬레이터·인터넷 영상에서 제어 가능한 세계 동역학을 학습하도록 데이터를 모은다. 교사 모델의 긴 롤아웃을 학생 모델에 정렬해 누적 분포 이동과 자기회귀 드리프트를 줄인다. 최적화된 저비트 설정에서 단일 RTX 5090으로 720P 스트리밍을 측정했다.

다중 소스 데이터→행동·텍스트 주석→장기 롤아웃 증류→실시간 영상 출력
원문 링크 ↗
  • 연구 목표: 장기 폐루프 상호작용을 위한 비디오 월드 모델
  • 핵심 방법: WorldExplorer·품질검사·행동 조건 증류
  • 주요 결과: WorldRoamBench와 장기 롤아웃에서 경쟁력 있는 제어성
  • 핵심 수치·조건: RTX 5090에서 최대 720P 16 FPS, 첫 프레임 1.2초, 약 19GiB VRAM
02

사람이 만든 자료를 실행 가능한 에이전트 스킬로

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

저자: Yijia Fan 외 10명

논문 개요

튜토리얼 영상·저장소·글·참고 산출물처럼 사람이 만든 멀티모달 자료를 에이전트 스킬로 추출한다. 스킬 위키의 항목은 구조화 텍스트·코드·시각 예시·메타데이터·출처를 함께 보관한다. 추론 때 에이전트는 관련 스킬을 검색·조합하고, 범위가 부족하면 같은 연산자로 온라인 습득한다. 7개 실무 저작 영역에서 무스킬 에이전트보다 평균 종합 점수가 올랐다고 보고한다.

영상·저장소·문서→Skill Wiki 추출→스킬 검색·조합→에이전트 실행
원문 링크 ↗
  • 연구 목표: 멀티모달 인간 자료를 재사용 가능한 절차 지식으로 전환
  • 핵심 방법: 계층형 멀티모달 Skill Wiki와 온라인 습득
  • 주요 결과: 28개 모델-도메인 집계 셀 중 26개에서 강한 기준선 상회
  • 핵심 수치·조건: 7개 도메인에서 평균 종합 점수 +11.9%p
03

기억과 스킬을 스스로 축적하는 개인 GUI 비서

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명

논문 개요

KnowAct-GUIClaw는 복잡한 자동화에서 OpenClaw의 크로스플랫폼 GUI 상호작용과 자기진화 문제를 겨냥한다. Know-Route-Act-Reflect 틀로 작업을 나누고, 경험 귀속 메모리와 진화형 스킬 라이브러리를 결합한다. 사용자 프로필과 피드백을 계속 저장해 작업 분해와 도구 호출의 정확도를 높이도록 설계했다. Android·iOS·HarmonyOS·Windows 실험 결과를 제시한다.

경험·지식 축적→작업 경로화→GUI 실행→피드백 반영
원문 링크 ↗
  • 연구 목표: 여러 OS에서 동작하는 개인 GUI 보조
  • 핵심 방법: Know-Route-Act-Reflect와 경험 메모리
  • 주요 결과: 장기 MobileWorld에서 최고 성능을 보고
  • 핵심 수치·조건: Kimi-2.6 기반 GUIClaw 64.1%, 스킬 전이 +8.5%
04

검색 진행 상태를 공유하는 다중 에이전트 운영체계

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

저자: Yuyao Zhang 외 13명

논문 개요

SearchOS는 검색 이력이 길어질수록 생기는 반복 루프와 근거 누락을 다룬다. 정보 탐색을 인용 근거가 붙은 관계 스키마 완성 문제로 모델링하고, 상태를 Frontier Task·Evidence Graph·Coverage Map·Failure Memory로 외부화한다. 미들웨어는 모델·도구 상호작용을 기록하고 정체나 예산 소진에 반응한다. WideSearch와 GISA에서 평가한 단일·다중 에이전트 기준선보다 모든 지표에서 앞섰다고 보고한다.

검색 과제→근거 그래프→범위 공백 탐지→하위 에이전트 병렬 실행
원문 링크 ↗
  • 연구 목표: 견고한 공개영역 정보 탐색 협업
  • 핵심 방법: SOCM 상태 외부화와 파이프라인 병렬 스케줄링
  • 주요 결과: WideSearch·GISA 전체 평가 지표 선도 보고
  • 핵심 수치·조건: 상태는 과제·증거·범위·실패 메모리로 구성
05

4B 모델로 빠른 고해상도 이미지 생성·편집

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

저자: Xinjie Zhang 외 23명

논문 개요

Mage-Flow는 텍스트-이미지 생성과 지시 기반 편집의 학습·배포 비용을 낮추는 4B 규모 스택이다. 경량 Mage-VAE와 네이티브 해상도 멀티모달 확산 트랜스포머를 함께 설계했다. 토크나이저·백본·CUDA 커널을 묶어 처리량을 높이고, RL 정렬 및 소수 단계 증류 변형도 제시한다. A100 한 장에서 1024² 이미지 생성·편집 시간을 보고한다.

텍스트·이미지 입력→경량 토큰화→확산 변환기→생성·지시 편집
원문 링크 ↗
  • 연구 목표: 효율적인 고해상도 생성·편집
  • 핵심 방법: Mage-VAE와 rectified-flow DiT 공동 설계
  • 주요 결과: 표준 생성·편집 벤치마크에서 경쟁력 보고
  • 핵심 수치·조건: A100 1장, 1024² 생성 0.59초·편집 1.02초
06

10만 시간 실제 궤적으로 확장한 VLA 로봇

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

저자: Xiaomi Robotics Team 외 33명

논문 개요

Xiaomi-Robotics-1은 보지 못한 환경에서 언어 지시를 따라 이동 조작을 수행하고, 적은 미세조정 데이터로 새 작업에 적응하는 VLA 모델이다. 사전학습과 사후학습의 두 단계 학습법을 제안한다. 사전학습에서는 폭넓고 일반화 가능한 행동 생성 능력을 부여한다. 실제 환경 궤적 10만 시간 이상을 활용한 확장 방향을 보고한다.

실세계 궤적→VLA 사전학습→사후학습→언어 지시 행동
원문 링크 ↗
  • 연구 목표: 범용 이동 조작과 빠른 전이
  • 핵심 방법: 사전학습·사후학습의 2단계 VLA 학습
  • 주요 결과: 미지 환경의 언어 지시 수행과 빠른 적응을 목표로 설계
  • 핵심 수치·조건: 실제 세계 궤적 10만 시간 이상

기타 Hugging Face 논문

07

사람과 물체의 관계를 보존하는 영상 개인화

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement

저자: Yiyang Cai 외 10명

논문 개요

HOMIE는 사람-물체 중심 영상 개인화에서 주체 충실도와 상호작용 정확도의 균형 문제를 다룬다. 특히 로고처럼 추상적 개념을 물체로 다룰 때의 상호작용을 문제로 제시한다. OCR 맵과 다중 시점 이미지 같은 동일 주체 참조도 활용 대상으로 삼는다. 멀티모달 지능 향상을 통해 인간·물체 중심 개인화를 제안한다.

원문 링크 ↗
  • 연구 목표: 사람·물체 상호작용을 보존한 영상 개인화
  • 핵심 방법: 인간-물체 중심 멀티모달 참조 활용
  • 주요 결과: 주체 충실도와 상호작용 정확도의 균형을 겨냥
  • 핵심 수치·조건: 초록에 정량 수치 미제시
08

긴 시간 일관성을 겨냥한 인터랙티브 월드 모델

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

저자: AlayaWorld Team 외 17명

논문 개요

AlayaWorld는 텍스트·이미지·영상 입력에서 즉시 탐색 가능한 가상 환경을 만드는 비디오 월드 모델을 다룬다. 기존 게임 개발의 에셋·애니메이션·물리·프로그래밍 파이프라인과 다른 접근을 제시한다. 이를 위해 상호작용, 지속적 시공간 일관성, 안정적인 장기 생성, 네 가지 결합 능력이 필요하다고 정의한다. 기술 보고서는 이 요구사항을 중심으로 전체 시스템을 설명한다.

텍스트·이미지·영상→월드 모델→지속 상태 생성→탐색·상호작용
원문 링크 ↗
  • 연구 목표: 사용자 입력으로 생성되는 탐색형 가상 세계
  • 핵심 방법: 상호작용·일관성·장기 생성의 결합
  • 주요 결과: 월드 모델의 요구 능력 네 가지를 정리
  • 핵심 수치·조건: 초록에 정량 수치 미제시

arXiv 신규 논문

09

무제한 길이 문서 인식을 겨냥한 OCR

Unlimited OCR Works

저자: Youyang Yin 외 16명

논문 개요

Unlimited OCR Works는 LLM 디코더 기반 종단간 OCR에서 출력이 길어질수록 KV 캐시가 커지고 생성이 느려지는 문제를 지적한다. 언어 사전을 활용하는 LLM 디코더의 장점과, 긴 시퀀스에서의 메모리·속도 비용을 함께 다룬다. 이는 사람의 읽기 방식과 대비된다고 설명한다. 논문은 이 제약을 겨냥한 OCR 접근을 제안한다.

원문 링크 ↗
  • 연구 목표: 긴 문서 OCR의 메모리·속도 병목 완화
  • 핵심 방법: LLM 디코더 OCR의 긴 시퀀스 문제를 재검토
  • 주요 결과: KV 캐시 누적 문제를 핵심 한계로 규정
  • 핵심 수치·조건: 초록 발췌에 정량 수치 미제시
10

피드백으로 에이전트 스킬을 최적화하는 전략

SkillOpt: Executive Strategy for Self-Evolving Agent Skills

저자: Yifan Yang 외 14명

논문 개요

SkillOpt는 에이전트 스킬이 수작업·일회성 생성·느슨한 자기수정에 머물러 피드백 아래에서 안정적으로 개선되지 않는 문제를 다룬다. 스킬을 고정된 에이전트의 외부 상태로 보고, 가중치 최적화와 같은 규율로 학습해야 한다고 주장한다. 이를 텍스트 공간에서 제어 가능한 최적화 문제로 제시한다. 초록은 재현 가능한 개선을 위한 스킬 최적화 체계를 목표로 한다.

초기 스킬→실행 피드백→텍스트 공간 최적화→개선된 스킬
원문 링크 ↗
  • 연구 목표: 피드백에 따라 재현 가능하게 개선되는 스킬
  • 핵심 방법: 고정 에이전트의 외부 상태로서 텍스트 스킬 최적화
  • 주요 결과: 기존 스킬 생성·자기수정 방식의 한계를 분석
  • 핵심 수치·조건: 초록 발췌에 정량 수치 미제시
11

피지컬 AI용 네이티브 월드 모델 스택

Kairos: A Native World Model Stack for Physical AI

저자: Kairos Team 외 23명

논문 개요

Kairos는 월드 모델을 수동적 시각 생성기 대신 피지컬 AI의 운용 기반으로 다룬다. 이질적 경험에서 세계 지식을 얻고, 장기 상태를 유지하며 실제 배포 제약 아래 효율적으로 실행해야 한다는 요구를 제시한다. 이를 위해 교차 신체 데이터 큐레이션이 이끄는 Native Pre-training Paradigm을 소개한다. 논문은 이 요구를 중심으로 네이티브 월드 모델 스택을 제안한다.

이질적 경험→네이티브 사전학습→지속 상태→피지컬 AI 실행
원문 링크 ↗
  • 연구 목표: 피지컬 AI의 실행 가능한 월드 모델
  • 핵심 방법: 교차 신체 데이터 큐레이션 기반 네이티브 사전학습
  • 주요 결과: 장기 상태·실행 효율을 핵심 요구로 정리
  • 핵심 수치·조건: 초록 발췌에 정량 수치 미제시

뉴스

국내

안두릴, 146조 몸값으로 투자 추진…방산 공룡 '록히드 마틴' 턱밑 추격

AI타임스 · 2026-07-26 17:00 · 원문 링크 ↗

  • 요약: 안두릴, 146조 몸값으로 투자 추진…방산 공룡 '록히드 마틴' 턱밑 추격
  • 세부: 안두릴 인더스트리가 기업 가치 1000억달러(약 146조원)를 목표로 새로운 자금 조달을 추진 중인 것으로 알려졌다. 이는 불과 1년 전 평가액의 3배가 넘는 수준으로, 지난 5월 610억달러 가치로 자금을 조달한 지 두 달 만에 추진되는 파격적인 행보다.로이터는 24일(현지시간) 소식통을 인용, 안두릴이 현재 투자자들과 신규 자금 조달을 위한 초기 협상을

클로드 5 ‘컨텍스트 엔지니어링’ 공개...“규칙 줄여야 성능 올라간다”

AI타임스 · 2026-07-26 16:30 · 원문 링크 ↗

  • 요약: 클로드 5 ‘컨텍스트 엔지니어링’ 공개...“규칙 줄여야 성능 올라간다”
  • 세부: AI의 성능을 높이는 핵심이 '프롬프트를 얼마나 정교하게 작성하느냐'에서 '모델이 필요한 정보를 적절한 시점에 활용할 수 있도록 컨텍스트를 설계하느냐'로 이동하고 있다. 앤트로픽도 최신 '클로드 5' 계열 모델이 과도한 규칙보다 자율적인 판단을 더 효과적으로 활용한다고 밝히며 AI 활용 전략에 새로운 변화를 예고했다.앤트로픽은 24일(현지시간) 클로드 5

딥시크, 2차 투자 유치 돌연 중단..."IPO 준비하며 AI 연구 집중"

AI타임스 · 2026-07-26 15:28 · 원문 링크 ↗

  • 요약: 딥시크, 2차 투자 유치 돌연 중단..."IPO 준비하며 AI 연구 집중"
  • 세부: 딥시크가 수조원 규모의 2차 투자 유치 절차를 돌연 중단했다. 량원펑 창립자의 미·중 AI 경쟁 관련 발언이 온라인에서 퍼진 직후 내려진 결정으로, 딥시크는 당분간 투자 계약 체결을 보류하는 한편 기업공개(IPO) 준비를 병행하며 장기적인 AI 연구 개발에 집중할 것으로 알려졌다.블룸버그는 25일(현지시간) 복수의 소식통을 인용, 중국의 대표 AI 기업 딥

KAIST-엔비디아, 피지컬 AI 테크놀로지센터 설립…파운데이션 모델 공동 연구

AI타임스 · 2026-07-26 15:15 · 원문 링크 ↗

  • 요약: KAIST-엔비디아, 피지컬 AI 테크놀로지센터 설립…파운데이션 모델 공동 연구
  • 세부: 한국과학기술원(KAIST, 총장 배충식)은 엔비디아와 피지컬 AI 공동연구 추진을 위해 ‘엔비디아 AI 테크놀로지 센터(NVAITC)’를 설립한다고 26일 밝혔다.KAIST가 축적해 온 인간 중심 로봇 기술과 실제 동작 데이터에, 엔비디아의 AI 기술과 글로벌 연구 네트워크를 결합해 차세대 피지컬 AI 원천기술을 확보하기 위한 것이다.‘인간물리지능 테크놀로

해외

Launching Health in ChatGPT

OpenAI · 2026-07-23 09:00 · 원문 링크 ↗

  • 요약: Launching Health in ChatGPT
  • 세부: Health in ChatGPT now lets eligible U.S. users securely connect medical records and Apple Health to get more personalized insights and better understand their health.

Building AI infrastructure with the Effingham County community

OpenAI · 2026-07-22 22:00 · 원문 링크 ↗

  • 요약: Building AI infrastructure with the Effingham County community
  • 세부: OpenAI announces Project Camellia in Effingham County, Georgia, with commitments to responsible energy, community investment, jobs, and access to Codex.

Making sense of the panic over Chinese AI

TechCrunch AI · 2026-07-27 04:40 · 원문 링크 ↗

  • 요약: Making sense of the panic over Chinese AI
  • 세부: On the latest episode of Equity, we discussed why Moonshot AI's Kimi seemed to panic Silicon Valley and Wall Street.

Hugging Face CEO calls for ‘radical transparency’ after ‘unprecedented’ OpenAI hack

TechCrunch AI · 2026-07-27 01:33 · 원문 링크 ↗

  • 요약: Hugging Face CEO calls for ‘radical transparency’ after ‘unprecedented’ OpenAI hack
  • 세부: "The first autonomous agent cyberattack is an unprecedented event. It deserves an unprecedented response!"

Monday.com is the latest tech company to blame AI for layoffs — here are 20 others

TechCrunch AI · 2026-07-26 10:30 · 원문 링크 ↗

  • 요약: Monday.com is the latest tech company to blame AI for layoffs — here are 20 others
  • 세부: A running look — in reverse chronological order — at the bigger tech companies that have announced significant layoffs this year with AI as a stated factor.

블로그·HN

OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened

Simon Willison · 2026-07-23 08:51 · 원문 링크 ↗

  • 요약: OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened
  • 세부: This story is wild. The short version: OpenAI were running a cybersecurity test against an unreleased model, with the model's guardrail features turned off. Rather than solve the test, the model broke

A Fireside Chat with Cat and Thariq from the Claude Code team

Simon Willison · 2026-07-21 21:54 · 원문 링크 ↗

  • 요약: A Fireside Chat with Cat and Thariq from the Claude Code team
  • 세부: Earlier this month I hosted a fireside chat session at the AI Engineer World's Fair with Cat Wu and Thariq Shihipar from Anthropic's Claude Code team. We talked about Claude Code, Claude Tag, Fable, c

After Orthogonality: Virtue-Ethical Agency and AI Alignment

The Gradient · 2026-02-19 08:25 · 원문 링크 ↗

  • 요약: After Orthogonality: Virtue-Ethical Agency and AI Alignment
  • 세부: Preface This essay argues that rational people don’t have goals, and that rational AIs shouldn’t have goals. Human actions are rational not because we direct them at some final ‘g