← 데일리 목록

AI 기술 데일리 리서치 · 2026-07-26 · KST 09:00

AI 기술 데일리 리서치

Hugging Face Daily Papers · arXiv · RSS

오늘의 데일리 브리핑

오늘 연구 흐름은 장기 상호작용 월드 모델, 사람의 멀티모달 자료를 에이전트 기술로 바꾸는 방법, 검색·GUI·임상 검토처럼 실제 작업을 관리하는 에이전트 설계로 이어진다. 제품·산업 쪽에서는 OpenAI가 미국 대상 ChatGPT Health와 엔터프라이즈 음성·채팅 에이전트 플랫폼을 발표했고, 국내에서는 삼성SDS와 Anthropic의 엔터프라이즈 파트너십 및 AI 인프라 협력 소식이 나왔다. 새 논문은 실세계 로봇 궤적 기반 VLA, 네이티브 해상도 이미지 생성·편집, MoE 환각 완화 등 모델의 적용 범위를 넓히는 시도를 담았다. 오늘의 공통된 결론은 모델 단독 성능보다 데이터·기술·검토·인프라를 연결해 반복 가능한 작업 흐름을 만드는 데 있다.

Hugging Face 선정 논문

01

단일 데스크톱 GPU에서 이어지는 상호작용 세계

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

저자: Fan Jiang 외 40명

논문 개요

AAA 게임·시뮬레이터·인터넷 영상의 다원 데이터를 모아 행동 조건부 비디오 월드 모델을 학습한다. 에이전트 주도 수집과 14개 결정적 품질 검사, VLM 평가 및 동기화된 행동·텍스트 주석을 하나의 파이프라인으로 결합한다. 초록은 장기 폐루프 상호작용을 실시간으로 지원하는 방향을 제시한다.

다원 데이터→품질·VLM 검사→행동·텍스트 주석→월드 모델
arXiv 원문 ↗

연구 목표

  • 행동 조건부 월드 모델

핵심 방법

  • 다원 데이터 수집·품질 검사·행동 주석

주요 결과

  • 실시간·장기 폐루프 상호작용을 목표로 제시

핵심 수치·조건

  • 14개 결정적 품질 검사
02

사람이 만든 멀티모달 자료를 에이전트 기술로

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

저자: Yijia Fan 외 10명

논문 개요

기존 에이전트 기술 라이브러리는 손으로 쓴 텍스트나 에이전트 실행 흔적에 치우쳐 있다. 이 연구는 튜토리얼 영상, 저장소, 글, 참고 산출물을 실행 가능한 기술로 증류하는 RESOURCE2SKILL을 제안한다. 사람이 만든 멀티모달 자원을 재사용 가능한 절차 지식으로 바꾸는 것이 초록의 중심이다.

영상·저장소·글→자원 증류→실행 기술
arXiv 원문 ↗

연구 목표

  • 멀티모달 자원의 기술화

핵심 방법

  • 영상·저장소·글·참고물 증류

주요 결과

  • 실행 가능한 에이전트 기술 생성 제안

핵심 수치·조건

  • 입력: 4종의 멀티모달 자원
03

기억과 기술을 축적하는 개인 GUI 비서

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명

논문 개요

OpenClaw 계열 자동화는 플랫폼 간 GUI 상호작용과 실행 경험을 통한 자기 진화가 부족하다고 지적한다. KnowAct-GUIClaw는 사용자 상호작용과 작업 실행에서 쌓인 정보를 메모리와 기술로 축적하는 개인 비서 패러다임을 제안한다. 초록은 다양한 기기 환경 적응과 지속적 성능 향상을 목표로 든다.

arXiv 원문 ↗

연구 목표

  • 개인 GUI 자동화의 적응성

핵심 방법

  • 자기 진화 메모리·기술 축적

주요 결과

  • 다기기 환경 적응을 목표로 제시

핵심 수치·조건

  • 저자 표기 기준 10명
04

검색 실패를 관리하는 정보탐색 에이전트 협업

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

저자: Yuyao Zhang 외 13명

논문 개요

도구 통합 LLM이 웹 검색을 핵심 능력으로 삼으면서, 긴 상호작용 기록에서 작업 진척을 놓치는 문제가 커졌다고 설명한다. SearchOS는 실패한 검색이 반복 루프로 이어져 예산과 최종 답변의 완결성을 해치는 문제를 겨냥한 시스템 수준 다중 에이전트 접근이다. 초록은 강건한 오픈도메인 정보 탐색 협업을 목표로 한다.

arXiv 원문 ↗

연구 목표

  • 오픈도메인 탐색의 반복 방지

핵심 방법

  • 시스템 수준 다중 에이전트 협업

주요 결과

  • 검색 예산 낭비와 답변 불완전성 완화 목표

핵심 수치·조건

  • 긴 상호작용 이력 조건
05

10만 시간 이상 실세계 궤적으로 키운 VLA

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

저자: Xiaomi Robotics Team 외 33명

논문 개요

Xiaomi-Robotics-1은 낯선 환경에서 언어 지시를 따라 모바일 조작을 수행하고, 적은 미세조정 데이터로 새 작업에 적응하는 VLA 모델을 제안한다. 사전학습과 사후학습의 두 단계 레시피로 폭넓은 행동 생성 능력을 부여한다. 초록은 실세계 궤적 규모를 바탕으로 한 범용 조작을 목표로 한다.

실세계 궤적→사전학습→사후학습→행동 생성
arXiv 원문 ↗

연구 목표

  • 모바일 조작 VLA의 범용화

핵심 방법

  • 사전학습→사후학습 2단계

주요 결과

  • 미지 환경의 언어 지시 수행·적은 데이터 적응을 제시

핵심 수치·조건

  • 실세계 궤적 10만 시간 이상
06

네이티브 해상도 이미지 생성·편집을 위한 4B 스택

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

저자: Xinjie Zhang 외 23명

논문 개요

Mage-Flow는 텍스트-이미지 생성과 지시 기반 편집의 학습·미세조정·배포 비용을 줄이려는 4B 규모 생성 스택이다. 경량 고충실도 잠재 토크나이저 Mage-VAE와 rectified flow matching으로 훈련한 네이티브 해상도 멀티모달 확산 트랜스포머를 함께 설계한다. 초록은 효율과 이미지 생성·편집을 동시에 겨냥한다.

arXiv 원문 ↗

연구 목표

  • 효율적 생성·편집 기반 모델

핵심 방법

  • Mage-VAE + 네이티브 해상도 확산 트랜스포머

주요 결과

  • 텍스트 생성과 지시 편집을 함께 지원

핵심 수치·조건

  • 4B 규모

기타 Hugging Face 논문

07

사람과 물체의 관계를 보존하는 영상 개인화

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement

저자: Yiyang Cai 외 10명

논문 개요

사람-물체 중심 영상 개인화는 인물 충실도와 다양한 물체와의 정확한 상호작용을 함께 맞추기 어렵다는 문제를 안고 있다. HOMIE는 로고처럼 추상적인 물체까지 포함해 이 관계를 다루는 멀티모달 지능 강화 접근을 제시한다. 초록은 주체 간·주체 내 참조의 한계를 함께 겨냥한다.

arXiv 원문 ↗

연구 목표

  • 사람-물체 중심 영상 개인화

핵심 방법

  • 멀티모달 참조 기반 강화

주요 결과

  • 인물 충실도와 상호작용 정확도 균형을 목표로 제시

핵심 수치·조건

  • 로고 등 추상 물체 조건 포함
08

긴 시간 일관성을 겨냥한 상호작용 월드 모델

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

저자: AlayaWorld Team 외 17명

논문 개요

AlayaWorld는 텍스트·이미지·영상 입력에서 즉시 탐색 가능한 가상 환경을 생성하는 비디오 월드 모델의 비전을 설명한다. 이를 위해 상호작용, 지속적인 시공간 일관성, 안정적인 장기 생성, 그리고 다른 결합 능력이 함께 필요하다고 제시한다. 기존 게임 개발의 자산·애니메이션·물리·프로그래밍 중심 파이프라인과 대비한다.

arXiv 원문 ↗

연구 목표

  • 상호작용 비디오 월드 생성

핵심 방법

  • 입력 기반 환경 생성과 장기 일관성 결합

주요 결과

  • 탐색 가능하고 계속 진화하는 환경을 목표로 제시

핵심 수치·조건

  • 핵심 요구 능력 4가지

새 arXiv 논문

09

MoE의 전문가 인지 대비 디코딩으로 환각 줄이기

Knowledge Injection Exists in MoE? Exploring Expert-Aware Contrast Decoding in MoE for Mitigating LLMs'Hallucinations

저자: Xinyue Fang 외 7명

논문 개요

프롬프트나 모델 최적화 기반 환각 완화는 내부 지식을 바꾸기 어렵거나 도메인 일반화가 약할 수 있다고 문제를 설정한다. 이 논문은 transformer 중심의 기존 대비 디코딩을 MoE 구조로 확장해 expert-aware contrast decoding을 탐색한다. 초록은 MoE의 라우팅 특성을 고려해 LLM 환각 완화를 검토한다.

arXiv 원문 ↗

연구 목표

  • MoE 기반 환각 완화

핵심 방법

  • 전문가 인지 대비 디코딩

주요 결과

  • 기존 GPT 계열 중심 탐색을 MoE로 확장

핵심 수치·조건

  • 대상: MoE LLM
10

임상의가 함께 검토하는 피부 면역 이상반응 탐지

Human-in-the-Loop Large Language Model Framework for Identification of Cutaneous Immune-Related Adverse Events

저자: Charles Lu 외 16명

논문 개요

임상 기록에서 피부 면역 관련 이상반응을 식별하기 위해 검색증강·다중 에이전트 LLM과 사람 검토를 결합한 프레임워크를 평가했다. 비보조 수동 검토와 비교해 정확도와 평가자 간 일치도가 높고 평균 검토 시간이 약 절반으로 줄었다고 초록은 보고한다. 결과는 임상 워크플로에서 사람의 최종 참여를 유지한 조건의 평가다.

임상 기록→검색·다중 에이전트→사람 검토→cirAE 식별
arXiv 원문 ↗

연구 목표

  • 임상 기록의 cirAE 식별

핵심 방법

  • RAG·다중 에이전트 LLM + 사람 검토

주요 결과

  • F1·평가자 일치도 향상 및 검토 시간 감소 보고

핵심 수치·조건

  • F1 0.88 vs 0.77, κ 0.82 vs 0.50, 시간 약 절반
11

재료과학 문헌 분석을 위한 기술 계약 에이전트

Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis

저자: Bixuan Li 외 5명

논문 개요

재료과학 문헌 분석은 조성·공정·특성화·물성 관계를 동시에 다뤄야 해 단순 retrieve-then-generate 방식이 어렵다고 설명한다. AlphaAgent는 검색 기반 질의응답과 논문 수준 보고서 생성을 분리하는 기술 주도 에이전트 프레임워크를 제안한다. 초록은 이질적 작업을 하나의 파이프라인에 억지로 묶지 않는 구성을 다룬다.

문헌 질의→검색 QA→보고서 생성
arXiv 원문 ↗

연구 목표

  • 재료 문헌의 이질적 작업 분리

핵심 방법

  • 기술 주도 에이전트·검색 QA·보고서 생성 분리

주요 결과

  • 조성·공정·특성화·물성 관계 분석을 겨냥

핵심 수치·조건

  • 2개 기능 경로 분리

뉴스

국내

김동환 포티투마루 대표 "국내 AI, 단순 추격 넘어 전략적 AX 필요"

AI타임스 · 2026-07-26

  • 요약 김동환 포티투마루 대표 "국내 AI, 단순 추격 넘어 전략적 AX 필요"
  • 세부 과학기술정보통신부가 AI 데이터센터, 피지컬 AI, K-AI 반도체를 골자로 한 '3대 메가프로젝트'를 가동했다. 여기에 글로벌 프론티어급 독자 AI 모델 개발과 전 국민 무료 AI 서비스인 '모두의 AI'를 결합해 글로벌 AI 2위 도약이라는 출사표를 던졌다.다만 현장에서는 '시간과 자본력 싸움'에서 이길 실무적인 돌파구가 시급하다는 목소리가 나온다.이에
원문 ↗

삼성SDS, 앤트로픽과 파트너십 체결..."국내 엔터프라이즈 시장 공략"

AI타임스 · 2026-07-25

  • 요약 삼성SDS, 앤트로픽과 파트너십 체결..."국내 엔터프라이즈 시장 공략"
  • 세부 삼성SDS(대표 이준희)는 24일(현지시간) 미국 샌프란시스코 더 미드웨이에서 열린 '샌프란시스코 AI 서밋'에서 앤트로픽과 엔터프라이즈 AI 시장 확대를 위한 전략적 파트너십을 맺었다고 25일 밝혔다.양사는 ▲국내 신규 사업 기회 공동 발굴 및 시장 확대 ▲클로드 구축 및 운영을 위한 응용형 AI 엔지니어 양성 ▲삼성 관계사 대상 클로드 엔터프라이즈 제공
원문 ↗

많이 보도되는 기사보다 오래 인용되는 정보를 향해

ZDNet Korea · 2026-07-26

  • 요약 많이 보도되는 기사보다 오래 인용되는 정보를 향해
  • 세부 [지디넷코리아]상업용 부동산 시장의 변화와 기업이 보유한 데이터의 의미를 한참 설명한 뒤, 출입기자들로부터 "말씀만 들으면 당장 기사로 써야 할 것 같은데요"라는 얘기를 종종 듣는다. 하지만 이어진 이야기는 조금 달랐다. "기사를 올려도, 데스크에서는 '클릭이 나오겠느냐'고 묻는다"고 했다. 그 시간에 아파트나 전셋값 기사를 하나 더 쓰라고 한다는 것이다.
원문 ↗

해외

Launching Health in ChatGPT

OpenAI · 2026-07-23

  • 요약 Launching Health in ChatGPT
  • 세부 Health in ChatGPT now lets eligible U.S. users securely connect medical records and Apple Health to get more personalized insights and better understand their health.
원문 ↗

Introducing OpenAI Presence

OpenAI · 2026-07-22

  • 요약 Introducing OpenAI Presence
  • 세부 Introducing OpenAI Presence, a proven enterprise AI agent platform that helps organizations deploy trusted voice and chat agents for customer and internal workflows.
원문 ↗

Why Cognition bought Poke: AI personality is becoming a competitive advantage

TechCrunch AI · 2026-07-25

  • 요약 Why Cognition bought Poke: AI personality is becoming a competitive advantage
  • 세부 The acquisition brings Poke’s conversational style and interaction model to Cognition’s coding agent Devin, reflecting a growing belief that how AI assistants interact with users is as important as th
원문 ↗

Anthropic launches Opus 5

TechCrunch AI · 2026-07-25

  • 요약 Anthropic launches Opus 5
  • 세부 Opus 5 will be both cheaper and less restrictive than Fable, likely making it preferable in most use cases.
원문 ↗

블로그·HN

OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened

Simon Willison · 2026-07-23

  • 요약 OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened
  • 세부 This story is wild. The short version: OpenAI were running a cybersecurity test against an unreleased model, with the model's guardrail features turned off. Rather than solve the test, the model broke
원문 ↗

LWiAI Podcast #252 - GPT 5.6, Grok 4.5, Nemotron-Labs-Diffusion, AI 2040

Last Week in AI · 2026-07-21

  • 요약 LWiAI Podcast #252 - GPT 5.6, Grok 4.5, Nemotron-Labs-Diffusion, AI 2040
  • 세부 GPT-5.6 and Grok 4.5, Meta's Muse Spark 1.1, regulatory developments in AI and data centers, interpretability research from Anthropic, and the future of AI policy with AI 2040
원문 ↗

The new rules of context engineering for Claude 5 generation models

Hacker News 100+ · 2026-07-26

  • 요약 The new rules of context engineering for Claude 5 generation models
  • 세부 Article URL: https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models Comments URL: https://news.ycombinator.com/item?id=49051361 Points: 118 # Comments: 70
원문 ↗