← 데일리 목록

AI TECHNOLOGY DAILY RESEARCH · 2026-07-21 · 09:00 KST

AI 기술 데일리 리서치

논문·제품·산업 신호를 빠르게 읽는 아침 브리핑

오늘의 데일리 브리핑

오늘 연구 흐름은 비디오 이해·생성의 효율화와 에이전트의 장기 작업 능력을 실제 작업 단위로 다루는 데 모였다. VideoChat3와 MotionForesight는 영상 사전지식을 범용 이해와 3D 예측으로 확장하고, RESOURCE2SKILL·SEED·장기 터미널 벤치마크는 스킬 축적·학습 신호·평가를 각각 보강한다. 제품·산업 쪽에서는 OpenAI가 장기 실행 모델의 안전·정렬 경험을 공유했고, Google의 Gemini 효율화를 겨냥한 칩 개발 보도와 MCP 세션 처리 단순화 소식이 이어졌다. 국내에서는 공공 인사 시스템용 에이전트, 법령·매뉴얼 업무지원, 온디바이스 피지컬 AI가 눈에 띄었다. 한 줄로 보면, 모델 자체의 확장보다 긴 흐름을 더 싸고 검증 가능하게 운영하려는 연구와 제품 신호가 동시에 강해졌다.

Hugging Face 주목 논문

01

완전 공개형 범용 비디오 이해 모델

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

저자: Xinhao Li 외 26명

논문 개요

VideoChat3는 일반·장편·스트리밍 영상 전반에서 작동하는 공개 비디오 MLLM을 목표로 한다. I3D-ViT와 스트리밍용 적응형 프레임 해상도로 시공간 표현과 처리 비용을 함께 다룬다. 세 종류의 합성·정제 데이터셋을 구성해 도메인 일반화를 넓혔다. 실험에서는 4B 파라미터로 동급 또는 더 큰 공개 모델을 앞섰다고 보고한다.

원문 보기 ↗

연구 목표

  • 다양한 영상 유형의 일반화와 처리비용을 함께 낮추는 것

핵심 방법

  • I3D-ViT·적응형 프레임 해상도·3개 데이터셋

주요 결과

  • 일반·장편·스트리밍 벤치마크에서 동급/대형 공개 모델 상회

핵심 수치·조건

  • 4B 파라미터
02

사람이 만든 자료에서 실행 가능한 에이전트 스킬 추출

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

저자: Yijia Fan 외 10명

논문 개요

RESOURCE2SKILL은 튜토리얼 영상·저장소·문서 같은 멀티모달 자료를 에이전트의 재사용 가능한 절차 지식으로 바꾼다. 결과물은 텍스트·코드·시각 예시·메타데이터·출처를 함께 담는 계층형 Skill Wiki다. 에이전트는 필요한 스킬을 검색·조합하고, 범위가 부족하면 같은 연산자로 온라인 습득한다. 7개 저작 도메인에서 무스킬 에이전트보다 평균 점수를 11.9%p 높였다고 보고한다.

자료·상태→구조화·학습→검증·출력
원문 보기 ↗

연구 목표

  • 멀티모달 인적 자료를 실행형 스킬로 전환

핵심 방법

  • 계층형 Skill Wiki, 검색·조합, 온라인 습득

주요 결과

  • 28개 모델-도메인 집계 중 26개에서 강한 기준선 상회

핵심 수치·조건

  • 7개 도메인·평균 +11.9%p
03

작은 도메인 LLM을 쓰는 다단계 GraphRAG 엔진

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

저자: Mikhail Komarov 외 7명

논문 개요

RAGU는 한 번의 추출로 생기는 그래프 잡음과 취약한 검색을 줄이려는 오픈소스 GraphRAG 엔진이다. 타입 추출 뒤 DBSCAN 중복 제거, LLM 요약, Leiden 커뮤니티 탐지를 분리해 수행한다. 파이프라인용 7B Meno-Lite-0.1은 언어 역량에 집중하도록 학습했다. 의료 GraphRAG-Bench에서 사실 수준별 맥락 회수율을 최대 0.84까지 보고했다.

자료·상태→구조화·학습→검증·출력
원문 보기 ↗

연구 목표

  • 구조화 지식 검색의 그래프 품질과 회수 안정성 개선

핵심 방법

  • 2단계 타입 추출→중복 제거→요약→커뮤니티 탐지

주요 결과

  • Meno-Lite-0.1이 KG 구축에서 Qwen2.5-32B 대비 우세

핵심 수치·조건

  • 7B·상대 조화평균 +12.5%·회수율 최대 0.84
04

에이전트 강화학습을 위한 자기 진화 증류

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

저자: Jinyang Wu 외 10명

논문 개요

SEED는 희소한 결과 보상만으로는 중간 의사결정을 지도하기 어렵다는 문제를 다룬다. 완료 궤적에서 재사용 가능한 워크플로·관찰·실패회피 규칙을 자연어 스킬로 뽑는다. 정책은 일반 문맥과 스킬 증강 문맥의 행동 확률 차이를 토큰 수준 증류 신호로 바꿔 결과 보상 RL과 함께 최적화한다. 텍스트·비전 기반 에이전트 과제에서 성능과 표본 효율, 미지 시나리오 일반화 향상을 보고한다.

자료·상태→구조화·학습→검증·출력
원문 보기 ↗

연구 목표

  • 희소 궤적 보상과 토큰 수준 학습 사이의 지도 공백 해소

핵심 방법

  • 궤적→회고 스킬→확률차 기반 조밀 증류→RL

주요 결과

  • 텍스트·비전 에이전트 과제에서 일관된 성능·표본효율 향상

핵심 수치·조건

  • 현재 정책의 온폴리시 궤적을 사용
05

장기 터미널 에이전트를 시험하는 벤치마크

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

저자: Zongxia Li 외 12명

논문 개요

Long-Horizon-Terminal-Bench는 짧은 최종 결과만 보는 기존 터미널 평가의 빈틈을 겨냥한다. 9개 범주 46개 과제를 세부 채점 하위 과제로 나누어 중간 진척과 부분 점수를 측정한다. 과제는 수백 에피소드와 수분~수시간 실행을 요구하도록 구성됐다. 평가한 최강 모델도 완전 보상 기준 pass@1은 10.9%였다고 보고한다.

원문 보기 ↗

연구 목표

  • 장기 계획·디버깅이 필요한 터미널 에이전트 측정

핵심 방법

  • 참조해/시뮬레이터 기반 과제를 세부 채점으로 분해

주요 결과

  • 현 모델의 장기 과제 여유가 큼을 관찰

핵심 수치·조건

  • 46개·9개 범주·평균 9.9M 토큰·85.3분
06

체화 지능을 위한 MoE 비디오 사전학습 확장

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

저자: Shuailei Ma 외 26명

논문 개요

이 논문은 영상 생성 모델의 시각 충실도 중심 학습이 로봇 제어와 어긋날 수 있다는 문제에서 출발한다. MoE 기반 비디오 사전학습을 체화 지능에 맞게 확장하는 방법을 제안한다. 초록은 대규모 비디오 사전학습과 로봇 작업 연결을 주요 방향으로 제시한다. 구체적 성능 수치는 제공된 초록 발췌에서 확인되지 않는다.

원문 보기 ↗

연구 목표

  • 비디오 생성 사전학습과 로봇 제어의 도메인 간극 완화

핵심 방법

  • MoE 기반 비디오 사전학습 확장

주요 결과

  • 체화 지능용 표현·제어 연결을 제안

핵심 수치·조건

  • 초록 발췌에 수치 미기재

기타 HF 논문

13

기억과 스킬을 스스로 고치는 개인 GUI 보조자

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명

논문 개요

KnowAct-GUIClaw는 복잡한 자동화 프레임워크의 크로스플랫폼 GUI 상호작용과 자기진화 부족을 겨냥한다. 개인 GUI 보조자가 지식·메모리·스킬을 함께 축적하고 갱신하는 방향을 제시한다. 이 구조는 다양한 기기 환경에 적응하는 것을 목표로 한다. 제공된 초록 발췌에는 비교 실험의 구체 수치가 없다.

자료·상태→구조화·학습→검증·출력
원문 보기 ↗

연구 목표

  • 여러 기기 GUI 자동화와 자기 진화 지원

핵심 방법

  • 지식·메모리·스킬을 결합한 개인 보조자

주요 결과

  • 크로스플랫폼 적응을 목표로 제안

핵심 수치·조건

  • 초록 발췌에 수치 미기재
14

10만 시간 실세계 궤적으로 확장한 시각-언어-행동 모델

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

저자: Xiaomi Robotics Team 외 33명

논문 개요

Xiaomi-Robotics-1은 보지 못한 환경에서도 언어 지시에 따라 모바일 조작을 수행하는 VLA 기반 모델을 제시한다. 실제 세계 궤적을 대규모로 사용해 다양한 조작 작업을 다룬다. 또한 새 작업에 효율적으로 적응하는 것을 모델의 목표로 둔다. 제공된 초록 발췌는 10만 시간 이상 실세계 궤적을 데이터 규모로 제시한다.

원문 보기 ↗

연구 목표

  • 미지 환경의 언어 지시 기반 모바일 조작

핵심 방법

  • 대규모 실세계 궤적 기반 VLA 학습

주요 결과

  • 범용 수행과 효율적 적응을 목표로 제시

핵심 수치·조건

  • 실세계 궤적 100K시간 이상

새 arXiv 논문

09

드론의 자기 상태와 환경을 함께 추론하는 벤치마크

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

저자: Dian Shao 외 5명

논문 개요

UAV-DualCog는 드론 에이전트가 자기 상태와 외부 환경을 다중 시점·시간 맥락에서 함께 추론하는지 평가한다. 장면 의미 점군에서 자동 파이프라인으로 데이터셋을 만든다. 평가는 현 MLLM이 시점 변환·공간 접지·시간 구간 위치 찾기에서 여전히 취약함을 보인다. 분리 장면으로 구성한 학습 데이터는 구조화 감독으로도 쓸 수 있음을 보였다.

자료·상태→구조화·학습→검증·출력
원문 보기 ↗

연구 목표

  • UAV 에이전트의 이중 인지 평가

핵심 방법

  • 점군 기반 자동 데이터 생성·이미지/비디오 QA

주요 결과

  • 현 MLLM의 공간·시간 접지 병목 확인

핵심 수치·조건

  • 수백 랜드마크·수천 QA 샘플
10

비디오 사전지식으로 미래 3D 장면 흐름 예측

MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction

저자: Yash Jangir 외 1명

논문 개요

MotionForesight는 짧은 사람-물체 상호작용 영상에서 조작 물체 점의 미래 3D 궤적을 예측한다. 사전학습 비디오 모델의 움직임 사전지식을 픽셀 예측 대신 장면 흐름으로 전용한다. 완전 영상에서 의사 정답 추적을 만들고, 큰 비디오·추적 모듈은 고정한 채 경량 어댑터를 학습한다. 언어 등 보조 입력 없이 4만 개 영상으로 대규모 학습 모델보다 우수했다고 보고한다.

자료·상태→구조화·학습→검증·출력
원문 보기 ↗

연구 목표

  • 일반 비디오에서 물체의 미래 3D 움직임 예측

핵심 방법

  • 사전학습 비디오 추적기+의사 추적+경량 어댑터

주요 결과

  • OOD 물체·환경·시점·상호작용으로 일반화

핵심 수치·조건

  • 사람 영상 40K개·언어 입력 없음
11

비디오 생성용 적응형 희소 어텐션 부하 균형

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

저자: Jiangsu Du 외 9명

논문 개요

FVAttn은 고해상도 비디오 생성에서 긴 시공간 시퀀스의 어텐션 병목을 다룬다. Top-p 라우팅과 안전용 Top-k, 비디오 블록 구성으로 희소 마스크를 만들고 실행 중 이를 보정한다. 무거운 헤드를 P2P로 옮기고 남는 자원에는 가치 높은 블록을 배치한다. Wan2.2 I2V에서 FlashAttention 대비 어텐션 4.41배 가속을 보고한다.

자료·상태→구조화·학습→검증·출력
원문 보기 ↗

연구 목표

  • 분산 비디오 생성의 희소 어텐션 병목 완화

핵심 방법

  • 희소 라우팅→실시간 부하 이동·잔여 자원 활용

주요 결과

  • 경쟁력 있는 품질로 추론 가속 보고

핵심 수치·조건

  • 불균형 1.34→1.08·어텐션 4.41×

뉴스

국내 · AI타임스 · 2026-07-21 06:55

‘온디바이스 피지컬 AI’ 실현… 엔비디아의 월드 모델

  • 요약 ‘온디바이스 피지컬 AI’ 실현… 엔비디아의 월드 모델
  • 세부 AI타임스 조예주 기자 joyejuoffice@aitimes.com
원문 보기 ↗

국내 · AI타임스 · 2026-07-20 18:00

오픈AI, 'GPT-5.6 솔' 사용자 후기 1만건 공개…"워크플로우 중심으로"

  • 요약 오픈AI, 'GPT-5.6 솔' 사용자 후기 1만건 공개…"워크플로우 중심으로"
  • 세부 오픈AI가 'GPT-5.6 솔(sol)' 출시 이후 전 세계 실제 사용자들이 제출한 1만개 이상의 활용 후기를 한데 모은 대규모 데이터베이스를 공개했다. 이번 데이터는 총 100만달러 상당의 크레딧 보상을 내건 대형 캠페인을 통해 수집된 것으로, AI가 단순한 문장 및 코드 작성을 넘어 산업별 실제 워크플로우(Workflow)에 어떻게 파고들었는지를 보여준
원문 보기 ↗

국내 · THE AI · 2026-07-20 15:59

코난테크놀로지, 가스안전공사에 생성형 AI 이식 “법령, 매뉴얼 관리”

  • 요약 코난테크놀로지, 가스안전공사에 생성형 AI 이식 “법령, 매뉴얼 관리”
  • 세부 코난테크놀로지가 한국가스안전공사의 생성형 AI 업무지원 시스템 ‘가스안전 AI 어드바이저’ 구축을 마치고 전사 정식 운영에 들어갔다고 20일 밝혔다.가스안전 AI 어드바이저는 공사 직원들이 법령과 KGS 코드, 내부 규정, 지침, 업무매뉴얼 등 업무 수행에 필요한 전문 자료를 손쉽게 검색하고 활용하도록 지원하는 생성형 AI 기반 업무지원 플랫폼이다. 직원은
원문 보기 ↗

해외 · OpenAI · 2026-07-20 19:00

Safety and alignment in an era of long-horizon models

  • 요약 Safety and alignment in an era of long-horizon models
  • 세부 OpenAI shares lessons from deploying long-running AI models, highlighting new safety risks, observed failures, and improved safeguards through iterative deployment.
원문 보기 ↗

해외 · TechCrunch AI · 2026-07-21 06:21

Google is working on a new AI chip designed to make Gemini more efficient

  • 요약 Google is working on a new AI chip designed to make Gemini more efficient
  • 세부 Alphabet, Google's parent company, is reportedly working on a new chip designed to make its Gemini models run much more efficiently.
원문 보기 ↗

해외 · TechCrunch AI · 2026-07-21 05:50

AI’s most important protocol is getting a little bit easier to use

  • 요약 AI’s most important protocol is getting a little bit easier to use
  • 세부 Under the new system, the protocol will take a looser, "stateless" approach to session IDs on the server side, similar to how most ordinary websites already work.
원문 보기 ↗

해외 · TechCrunch AI · 2026-07-21 00:45

Adobe camera app’s new feature will critique your photos using AI

  • 요약 Adobe camera app’s new feature will critique your photos using AI
  • 세부 Adobe's Project Indigo can now remove all kinds of backgrounds from photos you snap using the app.
원문 보기 ↗

블로그·HN · Simon Willison · 2026-07-17 05:19

Kimi K3, and what we can still learn from the pelican benchmark

  • 요약 Kimi K3, and what we can still learn from the pelican benchmark
  • 세부 Chinese AI lab Moonshot AI announced Kimi K3 this morning, describing it as their "most capable model to date, with 2.8 trillion parameters". It's currently available via their website and API, but an
원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-07-21 03:16

Nativ: Run frontier open models locally on your Mac

  • 요약 Nativ: Run frontier open models locally on your Mac
  • 세부 Article URL: https://blaizzy.github.io/nativ/ Comments URL: https://news.ycombinator.com/item?id=48982681 Points: 151 # Comments: 61
원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-07-21 02:13

Kimi Work

  • 요약 Kimi Work
  • 세부 Article URL: https://www.kimi.com/products/kimi-work Comments URL: https://news.ycombinator.com/item?id=48981703 Points: 340 # Comments: 162
원문 보기 ↗