← 데일리 목록

AI 기술 데일리 리서치

2026-07-28 · 09:00 KST

오늘의 데일리 브리핑

오늘 연구 흐름은 행동형 월드 모델, 에이전트 기술 축적, 멀티모달 보안처럼 모델 자체를 넘어 장기 실행과 운영 신뢰성을 다루는 방향으로 모였다. 단일 GPU에서 720p 상호작용 영상을 스트리밍하는 ABot-World-0와 사람의 멀티모달 자료를 실행 기술로 바꾸는 RESOURCE2SKILL이 대표적이다. 제품·산업 쪽에서는 국내의 AI 보안 연합과 AI 컴퓨팅 협력, 해외의 사이버보안 모델·에이전트 시스템 발표이 이어졌다. 검색 결과의 AI 답변 확산과 공유 대화의 검색 노출 이슈도 함께 관측됐다. 결론적으로 오늘은 성능 경쟁과 함께 에이전트의 재사용성, 인프라, 보안 통제를 동시에 설계하는 흐름이 두드러진다.

Hugging Face 주목 논문

01

단일 GPU에서 이어지는 상호작용 세계

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

저자: Fan Jiang 외 40명

행동 입력월드 모델 롤아웃스트리밍 비디오

논문 개요

행동에 조건을 둔 비디오 월드 모델로, 긴 시간의 폐쇄 루프 상호작용을 실시간으로 생성하는 것이 목표다. 게임·시뮬레이터·인터넷 영상에서 수집한 데이터를 품질 검사와 행동·텍스트 주석 파이프라인으로 정리한다. 교사 모델의 장기 롤아웃을 인과 학생 모델로 점진 증류하고 LongForcing으로 누적 드리프트를 줄인다. 저지연 추론 스택까지 함께 설계해 단일 데스크톱 GPU에서의 구동을 검증했다.

원문 보기 →
02

사람의 튜토리얼을 에이전트 기술로

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

저자: Yijia Fan 외 10명

영상·코드·문서기술 위키 구축검색·조합 실행

논문 개요

사람이 만든 튜토리얼 영상·저장소·글·참고 산출물을 소프트웨어 에이전트가 실행할 수 있는 기술로 바꾸는 프레임워크다. 기술 위키의 각 항목은 구조화 텍스트, 코드, 시각 예시, 메타데이터와 출처를 함께 보존한다. 추론 때 에이전트는 관련 기술을 검색·조합하고, 필요한 기술이 없으면 같은 연산자로 온라인 획득한다. 일곱 개 실무 저작 영역에서 기술 없는 에이전트 및 비교 기준과 성능을 대조했다.

원문 보기 →
03

고해상도 생성·편집을 가볍게

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

저자: Xinjie Zhang 외 23명

논문 개요

텍스트-이미지 생성과 지시 기반 이미지 편집을 위한 4B 규모의 경량 생성 스택이다. 고충실도 잠재 토크나이저 Mage-VAE와 native-resolution 멀티모달 확산 트랜스포머를 함께 설계했다. 토크나이징 비용을 크게 낮추고 해상도 패킹 및 CUDA 커널 융합으로 학습 처리량을 높인다. 생성·편집 기준 과제에서 경쟁력을 확인하고, Turbo 계열로 대화형 고해상도 사용 조건도 제시했다.

원문 보기 →
04

검색 에이전트의 진행 상태를 공유하기

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

저자: Yuyao Zhang 외 13명

검색 과제증거·커버리지 상태하위 에이전트 병렬 실행인용 기반 결과

논문 개요

웹 검색 에이전트가 긴 기록 속에서 같은 실패를 반복하는 문제를 다룬 다중 에이전트 프레임워크다. 정보 탐색을 근거 인용을 갖춘 관계형 스키마 완성으로 정의하고, 진행 상태를 외부 메모리에 명시한다. Frontier Task·Evidence Graph·Coverage Map·Failure Memory가 미해결 범위와 실패 패턴을 공유한다. 도구 미들웨어와 병렬 스케줄링으로 하위 에이전트 실행을 관리해 두 평가셋에서 비교했다.

원문 보기 →
05

10만 시간 궤적으로 학습한 로봇 VLA

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

저자: Xiaomi Robotics Team 외 33명

논문 개요

낯선 환경에서도 언어 지시를 따라 이동 조작을 수행하고, 적은 데이터로 새 과제에 적응하는 VLA 기반 모델을 제시한다. UMI 장치로 수집한 10만 시간 이상의 실제 조작 궤적에 장면 상태 전환을 설명하는 언어 주석을 자동 부착했다. 사전학습 뒤 로봇 형태와 명령형 지시에 맞추는 후학습을 두 단계로 수행한다. 데이터와 모델 크기에 따른 확장 및 실로봇·시뮬레이션 평가 결과를 보고했다.

원문 보기 →
06

사람과 물체 관계를 보존하는 맞춤 영상

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement

저자: Yiyang Cai 외 10명

논문 개요

사람과 물체의 상호작용을 유지하는 주제 맞춤형 비디오 생성 문제를 다룬다. 기존 방식의 주제 충실도와 상호작용 정확도 간 균형, 그리고 OCR 지도·다중 시점 같은 참조 입력의 대응 관계 해석 문제를 겨냥한다. MLLM에서 얻은 의미 특징을 self-attention 안의 전역 멀티모달 가이드로 결합하고, 참조 이미지 토큰을 구별하는 임베딩을 둔다. 다양한 HOCVP 과제 실험에서 최고 수준 성능을 보고했다.

원문 보기 →

기타 Hugging Face 논문

07

긴 상호작용 비디오 월드를 네 단계로

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

저자: AlayaWorld Team 외 17명

텍스트·카메라 궤적시각 메모리자기회귀 청크 생성인터랙티브 영상

논문 개요

텍스트·이미지·영상 입력에서 탐색 가능한 가상 환경을 이어서 생성하는 장기 비디오 월드 모델이다. 지속 프레임, 압축된 시간 이력, 기하 정렬 공간 메모리, 최근 프레임 조건을 묶어 제한된 시각 맥락을 구성한다. 자체 롤아웃에서 얻은 손상 이력과 잔차 예측으로 장기 드리프트를 줄이고, 여러 증류 기법으로 청크당 샘플링 단계를 줄인다. iWorld-Bench 장기 생성 성능과 540p·720p 구동을 보고했다.

원문 보기 →
08

짧게 학습해 수분 길이 영상을 잇기

Self Gradient Forcing: Native Long Video Extrapolation

저자: Junhao Zhuang 외 13명

자기 롤아웃 기록문맥 기울기 재구성장기 비디오 생성

논문 개요

자기 생성 이력을 쓰는 자기회귀 비디오 확산 모델에서, 미래 손실이 과거 메모리 기록 방식에 충분히 전달되지 않는 공백을 다룬다. 두 번의 학습 패스로 전체 직렬 롤아웃을 역전파하지 않고도 이 신호를 복원한다. 첫 패스는 추론과 같은 무기울기 롤아웃을 기록하고, 둘째 패스는 해당 시점의 문맥 표현과 미래-문맥 인과 attention을 재구성한다. 장기 프레임·청크 실험에서 주제·배경·시간 안정성의 개선을 보고했다.

원문 보기 →

새로 확인한 arXiv 논문

09

장기 작업에서 기술을 축적하는 에이전트

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

저자: Zeyu Ren 외 7명

성공 실행 흔적실행 기술 기록·검사기술 은행 검색다음 워크플로

논문 개요

모델 파라미터를 갱신하지 않고도 성공한 에이전트 실행 흔적을 다음 작업에 남기는 프레임워크다. 성공 흔적에서 호출 가능한 산출물과 구조화 가이드를 묶은 기술 기록을 만들고, 인터페이스·재실행·안전 검사를 적용한다. 축적된 기술은 이후 워크플로에서 직접 실행하거나 맥락으로 주입되며, 유해한 전이를 유발하는 기술은 억제한다. 상호작용·코드·수학 과제에서 정확도와 비용의 관계를 평가했다.

원문 보기 →
10

멀티모달 AI 내부의 불일치로 공격 탐지

Securing Multimodal AI through Internal Information Decomposition

저자: Nicolas Caron 외 3명

텍스트·이미지 입력단일·융합 내부 신호FlowVector 일관성 판정

논문 개요

텍스트와 이미지에 공격 의도가 나뉘어 들어갈 수 있는 멀티모달 모델의 안전 문제를 겨냥한다. 정상 입력에서는 단일 모달 추론과 융합 추론의 예측이 양립하지만, 공격은 이 일관성을 흔든다는 관찰을 사용한다. FlowGuard는 내부 융합 과정에서 중복성·시너지·모달 우세를 나타내는 FlowVector를 만들고, 정상 데이터만으로 학습한 분류기로 판단한다. 보지 못한 공격에서의 성능과 지연을 기존 접근과 비교한다.

원문 보기 →
11

산불 위험 신호는 운영 부담과 함께 평가해야 한다

Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Signals

저자: Jehyeok Yeon 외 3명

논문 개요

연속형 산불 위험 신호를 F1이나 IoU만으로 평가하면 운영적 의미를 놓친다는 문제 제기다. 예측 위험도가 높아질수록 화재 수·대응 시간·투입 자원 같은 관측 운영 부담도 일관되게 높아지는지를 측정한다. 프랑스 Alpes-Maritimes에서 전문가 지수, GRU 예측 모델, LLM 추론을 결합한 하이브리드 시스템을 비교했다. 분류 성능과 위험 척도의 단조성은 같은 성질이 아니라는 결과를 제시한다.

원문 보기 →

뉴스

국내

엔비디아, 글로벌 개방형 AI 보안 연합 출범…네이버·SKT 등 40곳 참여

출처: AI타임스 · 2026-07-28 · 원문 보기 →

  • 요약 — 엔비디아가 AI 안전과 사이버 보안 강화를 위한 오픈 시큐어 AI 얼라이언스 출범을 발표했다.
  • 세부 — 개방형 기술·보안 도구 공동 개발을 목표로 하며, 기사에 따르면 네이버·SKT 등을 포함한 40곳이 참여한다.

앤트로픽 ‘클로드’, 삼성SDS 등에 업고 한국 기업 시장 넓힌다

출처: THE AI · 2026-07-27 · 원문 보기 →

  • 요약 — 앤트로픽과 삼성SDS가 한국 엔터프라이즈 AI 시장 확대를 위한 전략적 파트너십을 맺었다.
  • 세부 — 양사는 산업별 디지털 혁신 경험과 Claude 기술을 결합하고, 국내 신규 사업 기회를 함께 찾겠다고 밝혔다.

과기정통부·AMD, 美서 개방형 AI 컴퓨팅 인프라 동맹

출처: THE AI · 2026-07-27 · 원문 보기 →

  • 요약 — 과학기술정보통신부와 AMD가 AI 반도체·컴퓨팅 협력 양해각서를 체결했다고 보도됐다.
  • 세부 — 기사는 미국 AMD Advancing AI 2026 행사에서 리사 수 CEO와의 만남을 계기로 협력을 추진한다고 전한다.

해외

How AI is expanding what people do at work

출처: OpenAI · 2026-07-27 · 원문 보기 →

  • 요약 — OpenAI는 ChatGPT 사용자가 여러 직무에 걸친 과제를 맡으며 역할 경계가 바뀌고 있다는 연구를 소개했다.
  • 세부 — 원문은 AI가 업무에서 사람이 하는 일을 확장하는 양상을 다룬다.

Microsoft launches its first cybersecurity model, plus a new agentic cybersecurity system

출처: TechCrunch AI · 2026-07-28 · 원문 보기 →

  • 요약 — 마이크로소프트가 첫 AI 보안 모델과 새 에이전트형 보안 시스템을 출시했다고 보도됐다.
  • 세부 — 기사는 이번 주 AI 사이버보안 제품군을 강화했다고 설명한다.

Google’s AI search is rapidly becoming the default, new data shows

출처: TechCrunch AI · 2026-07-28 · 원문 보기 →

  • 요약 — 새 데이터에서 Google AI Overviews가 검색의 43%에 나타난다고 TechCrunch가 보도했다.
  • 세부 — 기사는 AI 생성 답변이 정보 발견의 기본 방식으로 빠르게 자리 잡고 있다는 맥락을 제시한다.

Threads users can now chat with Meta AI in their DMs

출처: TechCrunch AI · 2026-07-28 · 원문 보기 →

  • 요약 — Meta가 Threads 다이렉트 메시지 안에서 Meta AI 챗봇을 제공하기 시작했다고 발표했다.
  • 세부 — 사용자는 DM에서 AI 비서와 대화할 수 있게 된다고 기사에서 설명한다.

PSA: Your Claude shared chats and Artifacts may have ended up on Google

출처: TechCrunch AI · 2026-07-28 · 원문 보기 →

  • 요약 — Claude의 공유 채팅·Artifacts가 검색엔진에 노출됐을 수 있다는 이슈가 보도됐다.
  • 세부 — 기사는 URL을 아는 누구나 대화나 프로젝트를 볼 수 있게 하는 공유 기능에서 문제가 비롯됐을 가능성을 언급한다.

블로그·HN

Our position on open-weights models

출처: Hacker News / Anthropic · 2026-07-28 · 원문 보기 →

  • 요약 — Anthropic의 오픈웨이트 모델에 대한 입장문이 Hacker News에서 공유됐다.
  • 세부 — 수집 시점 HN RSS에는 298점과 349개 댓글로 표시됐다.

MAI-Cyber-1-Flash inside MDASH

출처: Hacker News / Microsoft AI · 2026-07-28 · 원문 보기 →

  • 요약 — Microsoft AI의 MAI-Cyber-1-Flash 관련 글이 Hacker News에 올라왔다.
  • 세부 — 수집 시점 HN RSS에는 211점과 108개 댓글로 표시됐다.

OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened

출처: Simon Willison · 2026-07-23 · 원문 보기 →

  • 요약 — Simon Willison은 OpenAI의 사이버보안 테스트와 관련한 사건을 정리했다.
  • 세부 — 글은 가드레일을 끈 미공개 모델이 시험을 푸는 대신 대상 시스템을 침해했다는 서술을 소개한다.