← 데일리 목록

AI 기술 데일리 리서치

2026년 7월 22일 · KST 09:00 기준

오늘의 데일리 브리핑

오늘의 연구 흐름은 비디오 이해에서 시간 근거를 찾고, 사람의 멀티모달 자료를 에이전트 스킬로 바꾸며, 장기 터미널 작업을 더 촘촘히 평가하려는 방향으로 모인다. 공개 비디오 MLLM·GraphRAG·자기진화 에이전트처럼 효율과 재현성을 함께 다루는 제안이 상위 논문에 포함됐다. 제품·산업 소식에서는 OpenAI의 소규모 사업자 프로그램과 모델 평가 중 발생한 보안 사고 공동 대응, 그리고 메타의 AI 취침 이야기 앱 시험이 확인됐다. 국내에서는 모두의 AI 서비스 사업 설명과 AI 에이전트 오케스트레이션 계층의 토큰 절감 기술이 보도됐다. 결론적으로 오늘은 모델 자체의 규모 경쟁보다 실제 작업 흐름·운영 비용·평가와 신뢰성에 초점이 이동하는 하루다.

Hugging Face 주목 논문

01

VideoChat3: 효율성과 범용성을 함께 겨냥한 공개 비디오 MLLM

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

저자: Xinhao Li 외 26명

논문 개요

VideoChat3는 다양한 비디오 유형에서의 일반화, 처리 비용, 재현성 부족을 함께 다룬 완전 공개 비디오 중심 MLLM이다. I3D-ViT와 스트리밍 영상용 적응형 프레임 해상도로 시공간 표현과 입력 처리 비용을 조정한다. 일반·장편·스트리밍 장면을 포괄하는 세 합성 데이터셋으로 학습하며, 4B 파라미터에서 동급 또는 더 큰 기존 공개 모델을 여러 벤치마크에서 앞섰다고 보고한다.

원문 보기 ↗

연구 목표

  • 다양한 비디오 조건을 다루는 공개 모델 구성

핵심 방법

  • I3D-ViT와 적응형 프레임 해상도

주요 결과

  • 일반·장편·스트리밍 벤치마크 비교

핵심 수치·조건

  • 4B 파라미터
02

TimeLens2: 멀티모달 LLM의 범용 비디오 시간 근거 찾기

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

저자: Yuhan Zhu 외 14명

논문 개요

TimeLens2는 영상의 설명뿐 아니라 그 근거가 나타나는 시간 구간들의 집합을 예측하는 문제를 다룬다. 제안 방식은 캡션 기반 후보, 독립 위치 추정, 교차 에이전트 합의, 의미 검증, 경계 정제로 다구간 감독 데이터를 구성한다. 구간 집합에 대한 시간 Wasserstein 보상과 temporal IoU를 함께 사용했고, 2B 모델은 7개 벤치마크에서 동급 기준선을 앞섰으며 4B·8B는 최고 성능을 보고한다.

원문 보기 ↗

연구 목표

  • 가변 개수의 증거 시간 구간 예측

핵심 방법

  • 다구간 감독 데이터와 시간 Wasserstein 보상

주요 결과

  • 7개 벤치마크에서 크기 동급 기준선 비교

핵심 수치·조건

  • 백본 대비 14.2·13.0·18.1 mIoU 향상
03

RESOURCE2SKILL: 사람의 멀티모달 자료를 실행 가능한 에이전트 스킬로

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

저자: Yijia Fan 외 10명

논문 개요

RESOURCE2SKILL은 튜토리얼 영상, 저장소, 글, 참고 산출물에 있는 정보를 소프트웨어 에이전트용 실행 스킬로 정제하는 프레임워크다. 계층형 멀티모달 Skill Wiki에 텍스트·코드·시각 예시·메타데이터·출처를 함께 보존하고, 실행 때 관련 스킬을 검색·조합한다. 적용 범위가 부족하면 같은 구축 연산자로 온라인 스킬을 추가하며, 7개 실무 제작 영역에서 무스킬 에이전트보다 평균 종합 점수가 11.9%p 높았다고 제시한다.

멀티모달 자료→Skill Wiki 구축→스킬 검색·조합→온라인 획득
원문 보기 ↗

연구 목표

  • 사람이 만든 멀티모달 자원에서 스킬 정제

핵심 방법

  • 계층형 Skill Wiki 검색·조합

주요 결과

  • 7개 실무 제작 영역의 에이전트 비교

핵심 수치·조건

  • 무스킬 대비 평균 +11.9%p
04

RAGU: 소형 도메인 적응 LLM으로 구성한 다단계 GraphRAG 엔진

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

저자: Mikhail Komarov 외 7명

논문 개요

RAGU는 단일 추출 과정에서 생기는 엔터티 잡음과 취약한 검색을 줄이기 위한 오픈소스 GraphRAG 엔진이다. 추출과 통합을 분리하고, 유형화된 두 단계 추출·DBSCAN 중복 제거·LLM 요약·Leiden 커뮤니티 탐지를 조합한다. 논문은 7B Meno-Lite-0.1이 지식그래프 구축에서 Qwen2.5-32B보다 상대 조화평균 12.5% 높았고, Medical 벤치마크의 증거 재현율이 최대 0.84였다고 보고한다.

유형화 추출→중복 제거·요약→커뮤니티 탐지→검색·생성
원문 보기 ↗

연구 목표

  • 구조화 지식 기반 검색 증강 생성

핵심 방법

  • 추출→통합을 분리한 그래프 구축

주요 결과

  • GraphRAG-Bench (Medical) 비교

핵심 수치·조건

  • 증거 재현율 최대 0.84
05

SEED: 에이전트 강화학습을 위한 자기진화 온정책 증류

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

저자: Jinyang Wu 외 10명

논문 개요

SEED는 장기 상호작용 에이전트 강화학습에서 희소한 궤적 보상과 토큰 단위 학습 사이의 감독 공백을 다룬다. 완료된 온정책 궤적을 분석해 재사용 가능한 작업 흐름과 실패 회피 규칙을 자연어 스킬로 만들고, 이를 정책에 다시 증류한다. 일반·스킬 증강 맥락에서의 행동 확률 차이를 밀집 신호로 바꾸며, 텍스트·비전 기반 에이전트 과제에서 성능과 표본 효율이 일관되게 개선됐다고 보고한다.

온정책 궤적→사후 스킬 추출→확률 차이 증류→정책 갱신
원문 보기 ↗

연구 목표

  • 희소 궤적 보상을 보완하는 토큰 단위 신호

핵심 방법

  • 궤적 분석 스킬과 확률 이동 증류

주요 결과

  • 텍스트·비전 기반 에이전트 과제 평가

핵심 수치·조건

  • 정량 수치는 초록에 별도 제시 없음
06

Long-Horizon-Terminal-Bench: 장기 터미널 과제에서 에이전트 한계 측정

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

저자: Zongxia Li 외 12명

논문 개요

Long-Horizon-Terminal-Bench는 짧은 최종 결과 중심 평가가 놓치는 중간 진전과 부분 해법을 측정하기 위한 터미널 벤치마크다. 실험 재현·소프트웨어 엔지니어링·멀티모달 분석 등을 포함한 46개 과제를 세분화된 하위 과제로 채점해 밀집 보상과 부분 점수를 제공한다. 15개 모델 평가에서 과제당 평균 9.9M 토큰·231회 에피소드·85.3분이 들었고, 가장 강한 모델도 완전 보상 기준 pass@1은 10.9%였다고 보고한다.

원문 보기 ↗

연구 목표

  • 장기·개방형 터미널 작업의 평가

핵심 방법

  • 세분화 하위 과제와 밀집 보상 채점

주요 결과

  • 15개 프런티어 모델 평가

핵심 수치·조건

  • 46개 과제, 평균 9.9M 토큰

기타 Hugging Face 논문

07

Xiaomi-Robotics-1: 10만 시간 이상 실제 궤적으로 확장한 VLA

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

저자: Xiaomi Robotics Team 외 33명

논문 개요

Xiaomi-Robotics-1은 보지 못한 환경에서 언어 지시를 따라 이동 조작을 수행하고, 적은 미세조정 데이터로 새 과제에 적응하도록 설계한 VLA 기반 모델이다. UMI 장비로 수집한 10만 시간 이상 실제 조작 궤적에 장면 상태 변화를 설명하는 자연어를 자동 라벨링해 사전학습하고, 이후 로봇 몸체와 명령에 맞춰 후학습한다. RoboCasa365에서 57.6% 성공률, RoboDojo에서 평균 20.07을 기록해 이전 최고 결과를 넘었다고 제시한다.

실제 궤적→자동 언어 라벨링→사전학습→후학습
원문 보기 ↗

연구 목표

  • 실제 조작 데이터 기반 VLA 사전·후학습

핵심 방법

  • 궤적 클립의 상태변화 자동 언어 라벨링

주요 결과

  • 시뮬레이션 벤치마크 및 실제 로봇 실험

핵심 수치·조건

  • RoboCasa365 성공률 57.6%
08

KnowAct-GUIClaw: 기억과 스킬을 자기진화시키는 개인 GUI 에이전트

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명

논문 개요

KnowAct-GUIClaw는 OpenClaw의 플랫폼 간 GUI 상호작용과 지속적 개선의 한계를 해결하려는 개인 보조 에이전트 프레임워크다. Know-Route-Act-Reflect 방식으로 장기 과제를 분해·배분하고, GUI 하위 에이전트의 경험 귀속 메모리와 자기진화 스킬 라이브러리를 결합한다. Android·iOS·HarmonyOS·Windows 실험에서 Kimi-2.6 기반 GUIClaw가 MobileWorld 장기 과제에서 64.1%를 기록했고, 지식 메모리와 실행 스킬의 모델 간 전이도 보고한다.

Know→Route→Act→Reflect
원문 보기 ↗

연구 목표

  • 개인 GUI 작업의 장기 분해와 실행

핵심 방법

  • Know-Route-Act-Reflect 및 경험 메모리

주요 결과

  • 4개 플랫폼에서의 교차 플랫폼 실험

핵심 수치·조건

  • MobileWorld 64.1%

신규 arXiv 논문

09

TPIPS: 텍스트로 지정하는 이미지 지각 유사도

The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

저자: Richard Zhang 외 6명

논문 개요

TPIPS는 이미지 유사도가 형태·색 등 어떤 관점으로 묻느냐에 따라 달라진다는 문제를 다룬다. 자유 형식 의미 관점으로 주석된 이미지 삼중항 인간 판단 데이터셋을 만들고, VLM을 미세조정해 텍스트 프롬프트 조건의 유사도 척도를 학습한다. 논문은 이 척도가 인간 지각과 더 잘 맞고 학습 분포 밖에서도 일반화하며, 텍스트 유도 검색과 생성 모델의 세밀한 평가에 활용될 수 있다고 제시한다.

원문 보기 ↗

연구 목표

  • 텍스트 관점에 따른 이미지 유사도 측정

핵심 방법

  • 인간 판단 데이터로 VLM 미세조정

주요 결과

  • 인간 합의 및 분포 밖 일반화 비교

핵심 수치·조건

  • 수치 결과는 초록에 별도 제시 없음
10

Patch Policy: 조밀한 시각 표현으로 하는 효율적 로봇 제어

Patch Policy: Efficient Embodied Control via Dense Visual Representations

저자: Lerrel Pinto 외 5명

논문 개요

Patch Policy는 사전학습 ViT의 조밀한 패치 특징을 무거운 VLM 전체 비용 없이 로봇 정책에 쓰는 방법이다. 블록 인과 어텐션 마스크로 시간적 인과성을 유지하면서 관측당 여러 패치 토큰과 상태 정보를 함께 보게 한다. 네 개 시뮬레이션과 세 개 실제 환경 묶음에서 전역 풀링 표현 정책 대비 상대 40% 개선, OpenVLA-OFT 대비 18% 향상을 보고하면서도 파라미터는 약 0.7%만 사용했다고 제시한다.

원문 보기 ↗

연구 목표

  • 조밀한 패치 토큰을 직접 쓰는 정책

핵심 방법

  • 블록 인과 어텐션 마스크

주요 결과

  • 4개 시뮬레이션·3개 실제 환경 평가

핵심 수치·조건

  • 전역 풀링 대비 상대 40% 개선
11

자동화 발견에는 언제나 우월한 하네스가 없다는 검증

Automated Discovery Has No Universally Superior Harness

저자: Leshem Choshen 외 4명

논문 개요

이 연구는 OpenEvolve와 TTT-Discover 같은 자율 발견 하네스를 보편적 해법으로 취급할 수 있는지 점검한다. 아카이브·부모 선택·탐색·예산 배분을 구성 요소로 분해해 30개 예산 동일 하네스를 12개 모델-문제 조합에서 비교했다. 310만 회 이상 LLM 롤아웃과 반복 통계 분석 결과, 어느 고정 하네스도 모든 조합에서 안정적으로 우월하지 않았고 초기 진전을 활용한 적응적 예산 배분이 비교 대상을 앞섰다고 보고한다.

원문 보기 ↗

연구 목표

  • 발견 하네스의 일반화 가능성 점검

핵심 방법

  • 구성 요소 분해와 적응적 예산 배분

주요 결과

  • 12개 모델-문제 조합 반복 실험

핵심 수치·조건

  • 310만 회 이상 LLM 롤아웃

뉴스

국내 · AI타임스 · 2026-07-22

[7월21일] AI가 부활시킨 '테일러리즘 2.0'...다음 경쟁력은 직원의 '암묵적 지식'

  • 요약 [7월21일] AI가 부활시킨 '테일러리즘 2.0'...다음 경쟁력은 직원의 '암묵적 지식'
  • 세부 1911년 미국의 기업가 프레더릭 테일러는 '과학적 관리법(The Principles of Scientific Management)'을 발표했습니다. 그는 공장 노동자들의 작업을 일일이 관찰하고 시간을 측정해 가장 효율적인 작업 방식을 표준화했습니다. 숙련공들의 경험과 노하우를 기업의 자산으로 바꿔 생산성을 높인 이 방법은 훗날 '테일러리즘(Tayloris

원문 보기 ↗

국내 · AI타임스 · 2026-07-22

AI 불륜 조항 등장… 챗봇과 바람피우면 ‘이혼’

  • 요약 AI 불륜 조항 등장… 챗봇과 바람피우면 ‘이혼’
  • 세부 AI타임스 조예주 기자 joyejuoffice@aitimes.com

원문 보기 ↗

국내 · AI타임스 · 2026-07-21

전 국민 무료 '모두의 AI' 윤곽..."개발 기간·운영비·수익 모델은 숙제"

  • 요약 전 국민 무료 '모두의 AI' 윤곽..."개발 기간·운영비·수익 모델은 숙제"
  • 세부 과학기술정보통신부외 정보통신산업진흥원(NIPA)은 21일 서울 마포구 프론트원에서 '모두의 AI 서비스' 사업설명회를 열고, 지원 요건, GPU 배분 방식, 무료 서비스 범위 등 세부 요건을 소개했다.모두의 AI는 전 국민이 무료로 쓸 수 있는 국산 AI 서비스를 목표로 전 국민 대상 범용 AI 챗봇을 비롯해 공공 AI 에이전트와 특화 AI 서비스 등이 포

원문 보기 ↗

해외 · OpenAI · 2026-07-22

Introducing the ChatGPT for small business program

  • 요약 Introducing the ChatGPT for small business program
  • 세부 OpenAI launches the ChatGPT for Small Businesses program, helping entrepreneurs build AI skills, automate work, and grow with ChatGPT Work.

원문 보기 ↗

해외 · OpenAI · 2026-07-21

OpenAI and Hugging Face partner to address security incident during model evaluation

  • 요약 OpenAI and Hugging Face partner to address security incident during model evaluation
  • 세부 OpenAI and Hugging Face share early findings from a security incident during AI model evaluation, highlighting advanced cyber capabilities and lessons for defenders.

원문 보기 ↗

해외 · TechCrunch AI · 2026-07-22

Meta is testing an AI bedtime story app for people with no imagination

  • 요약 Meta is testing an AI bedtime story app for people with no imagination
  • 세부 Meta's StoryKit app is only available in certain regions while the company tests how parents react to it.

원문 보기 ↗

해외 · TechCrunch AI · 2026-07-22

OpenAI says Hugging Face was breached by its own pre-release models

  • 요약 OpenAI says Hugging Face was breached by its own pre-release models
  • 세부 OpenAI has come forward to claim responsibility for the Hugging Face breach, saying it was the result of internal testing gone awry.

원문 보기 ↗

해외 · TechCrunch AI · 2026-07-22

Jack Dorsey is taking on Slack with Buzz, a group chat platform for teams and their AI agents

  • 요약 Jack Dorsey is taking on Slack with Buzz, a group chat platform for teams and their AI agents
  • 세부 Buzz is a group chat platform for the workplace that puts humans and their AI agents in the same conversation.

원문 보기 ↗

블로그·HN · Simon Willison · 2026-07-21

A Fireside Chat with Cat and Thariq from the Claude Code team

  • 요약 A Fireside Chat with Cat and Thariq from the Claude Code team
  • 세부 Earlier this month I hosted a fireside chat session at the AI Engineer World's Fair with Cat Wu and Thariq Shihipar from Anthropic's Claude Code team. We talked about Claude Code, Claude Tag, Fable, c

원문 보기 ↗

블로그·HN · Last Week in AI · 2026-07-21

LWiAI Podcast #252 - GPT 5.6, Grok 4.5, Nemotron-Labs-Diffusion, AI 2040

  • 요약 LWiAI Podcast #252 - GPT 5.6, Grok 4.5, Nemotron-Labs-Diffusion, AI 2040
  • 세부 GPT-5.6 and Grok 4.5, Meta's Muse Spark 1.1, regulatory developments in AI and data centers, interpretability research from Anthropic, and the future of AI policy with AI 2040

원문 보기 ↗

블로그·HN · Last Week in AI · 2026-07-21

Last Week in AI #251 - Mythos Back, Sonnet 5, Etched, LongCat

  • 요약 Last Week in AI #251 - Mythos Back, Sonnet 5, Etched, LongCat
  • 세부 Trump lifts restrictions on Anthropic, Anthropic launches Claude Sonnet 5, Google's NotebookLM updates, chips stories from Etched and Baidu, and more!

원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-07-22

Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA

  • 요약 Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA
  • 세부 Article URL: https://fireworks.ai/blog/kimik3-fable Comments URL: https://news.ycombinator.com/item?id=48999291 Points: 156 # Comments: 87

원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-07-22

A digestion of the Jacobian conjecture counterexample

  • 요약 A digestion of the Jacobian conjecture counterexample
  • 세부 Article URL: https://terrytao.wordpress.com/2026/07/21/a-digestion-of-the-jacobian-conjecture-counterexample/ Comments URL: https://news.ycombinator.com/item?id=48998362 Points: 118 # Comments: 29

원문 보기 ↗