← 데일리 목록

2026-07-23 · AI 기술 데일리 리서치

AI 기술 데일리 리서치

Hugging Face Daily Papers · arXiv · RSS 뉴스 수집

오늘의 데일리 브리핑

오늘 연구 흐름은 영상·로보틱스 같은 멀티모달 기반 모델의 규모 확장과, GraphRAG·스킬 위키·검색 운영체계처럼 에이전트가 근거와 경험을 축적하는 시스템 설계가 함께 두드러진다. 새 논문들은 완료 궤적에서의 토큰 수준 지도, 불확실한 사실 검증의 보류, 기업 데이터의 병렬 DAG 실행처럼 에이전트의 실행 품질과 검증 가능성을 구체적 구조로 다룬다. 제품·산업 뉴스에서는 구글의 Gemini 신모델, OpenAI의 기업용 에이전트 플랫폼, AMD와 앤트로픽의 GPU 구축 계획이 수집됐다. 국내에서는 삼성 AI 안경과 구글 모델 발표 보도가 이어졌다. 한 줄로 정리하면, 오늘은 더 큰 모델 자체보다 실제 환경에서의 처리 효율·상태 관리·신뢰성에 초점을 둔 발표가 모였다.

Hugging Face 주목 논문

01

효율과 범용성을 함께 노린 공개 비디오 이해 모델

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

저자: Xinhao Li 외 26명 · Hugging Face Daily Paper

논문 개요

VideoChat3는 일반·장편·스트리밍 영상에서 모두 작동하는 공개 비디오 중심 멀티모달 언어모델을 제안한다. I3D-ViT와 스트리밍용 적응형 프레임 해상도로 시공간 표현과 입력 처리 비용을 함께 다룬다. 세 종류의 합성·정제 데이터셋을 학습에 쓰고, 실험에서 동일하거나 더 큰 기존 공개 모델보다 4B 파라미터로 높은 효율과 성능을 보였다고 보고한다.

원문 보기 ↗
연구 목표
범용 영상 이해
핵심 방법
I3D-ViT·적응형 프레임 해상도
주요 결과
일반·장편·스트리밍 벤치마크에서 기존 공개 모델 상회
핵심 수치·조건
4B 파라미터; 3개 학습 데이터셋
02

지식 그래프를 두 번 다듬는 경량 GraphRAG 엔진

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

저자: Mikhail Komarov 외 7명 · Hugging Face Daily Paper

논문 개요

RAGU는 한 번의 추출로 생기는 노이즈와 취약한 검색을 줄이기 위해 추출과 통합을 분리한 GraphRAG 엔진이다. 타입 기반 2단계 추출 뒤 DBSCAN 중복 제거, LLM 요약, Leiden 커뮤니티 탐지를 차례로 적용한다. 7B Meno-Lite-0.1은 지식 그래프 구성에서 Qwen2.5-32B보다 상대 조화평균이 12.5% 높았고, Medical GraphRAG-Bench에서 증거 재현율 최대 0.84를 보고했다.

타입 추출→중복 제거→요약·군집→그래프 검색
원문 보기 ↗
연구 목표
노이즈 적은 GraphRAG 구성
핵심 방법
2단계 추출→중복 제거→요약→군집 탐지
주요 결과
의료 GraphRAG에서 문맥 회수 및 합성 과제 성능 보고
핵심 수치·조건
7B; 증거 재현율 최대 0.84
03

사람이 만든 멀티모달 자료를 에이전트 스킬로 증류

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

저자: Yijia Fan 외 10명 · Hugging Face Daily Paper

논문 개요

RESOURCE2SKILL은 튜토리얼 영상·저장소·글·참고 산출물에서 실행 가능한 에이전트 스킬을 만드는 프레임워크다. 텍스트·코드·시각 예시·메타데이터·출처를 묶은 계층형 멀티모달 Skill Wiki에 스킬을 저장하고, 에이전트는 필요할 때 검색·조합한다. 자료 범위가 부족하면 같은 구축 연산자로 온라인에서 새 스킬을 얻으며, 7개 저작 영역에서 무스킬 에이전트보다 평균 11.9%p 높은 점수를 보고했다.

멀티모달 자원→스킬 증류→Skill Wiki→검색·조합
원문 보기 ↗
연구 목표
멀티모달 자원에서 재사용 스킬 생성
핵심 방법
자원 증류→Skill Wiki 저장→검색·조합
주요 결과
7개 실용 저작 영역에서 성능 향상
핵심 수치·조건
평균 +11.9%p; 28개 비교 셀 중 26개 우세
04

완료된 에이전트 궤적에서 스스로 배우는 정책 증류

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

저자: Jinyang Wu 외 10명 · Hugging Face Daily Paper

논문 개요

SEED는 희소한 결과 보상만으로는 중간 행동을 지도하기 어려운 에이전트 RL의 문제를 다룬다. 현재 정책이 완료 궤적을 분석해 재사용 가능한 사후 스킬을 만들고, 스킬을 넣은 문맥과 일반 문맥의 행동 확률 차이를 토큰 수준 신호로 바꾼다. 이 신호를 결과 기반 RL과 함께 최적화했으며, 텍스트·비전 에이전트 과제에서 성능과 샘플 효율의 일관된 개선을 보고한다.

완료 궤적→사후 스킬→토큰 신호→정책 갱신
원문 보기 ↗
연구 목표
희소 보상 사이의 지도 공백 축소
핵심 방법
궤적→사후 스킬→확률 차이 기반 토큰 신호
주요 결과
미지 시나리오를 포함한 에이전트 과제 개선 보고
핵심 수치·조건
텍스트·비전 에이전트 과제에서 검증
05

검색 상태를 외부화한 다중 에이전트 검색 운영체계

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

저자: Yuyao Zhang 외 13명 · Hugging Face Daily Paper

논문 개요

SearchOS는 검색 이력이 길어질수록 반복 루프에 빠지는 정보 탐색 에이전트를 위한 시스템 프레임워크다. Frontier Task, Evidence Graph, Coverage Map, Failure Memory에 검색 상태를 지속적으로 기록하고, 미해결 범위를 겨냥해 하위 에이전트 작업을 병렬 배치한다. 도구 호출을 가로채 근거와 정체 상태를 기록하는 미들웨어와 계층형 스킬을 함께 쓰며, WideSearch와 GISA에서 평가 대상 기준 모든 지표 선두를 보고한다.

검색 과제→상태·근거 기록→병렬 하위 에이전트→범위 충족
원문 보기 ↗
연구 목표
반복 없는 근거 기반 정보 탐색
핵심 방법
상태 외부화→병렬 하위작업→실패 기록 재사용
주요 결과
WideSearch·GISA에서 전체 지표 선두 보고
핵심 수치·조건
4개 지속 상태 저장소; 파이프라인 병렬 스케줄링
06

물리 세계 상태를 실시간 화면으로 바꾸는 생성 렌더러

Generative World Renderer at the Speed of Play

저자: Guixu Lin 외 5명 · Hugging Face Daily Paper

논문 개요

AlayaRenderer-Flash는 물리 엔진이 내보낸 구조화된 세계 상태에서 RGB 프레임을 합성하는 생성 렌더러를 실시간 지향으로 바꾼다. 기존 모델을 소수 단계 자기회귀 스트리밍 모델로 재구성하고, 경량 증류 코덱으로 잠재 인코딩과 프레임 복원을 수행한다. G-buffer 스트림에서 내용 보존·시간 일관성·제어성·실행 효율을 평가했으며, 보고된 속도는 0.56 FPS에서 31.54 FPS로 높아졌고 물리 엔진 결합 시 30 FPS 플레이를 제시한다.

물리 세계 상태→스트리밍 렌더링→RGB 프레임
원문 보기 ↗
연구 목표
상호작용 가능한 생성 세계 렌더링
핵심 방법
물리 상태→스트리밍 모델·증류 코덱→RGB 프레임
주요 결과
핵심 렌더링 능력을 유지하며 추론 비용 절감 보고
핵심 수치·조건
0.56→31.54 FPS; 플레이 가능 30 FPS

기타 Hugging Face 논문

07

10만 시간 실제 궤적으로 확장한 로봇 행동 모델

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

저자: Xiaomi Robotics Team 외 33명 · Hugging Face Daily Paper

논문 개요

Xiaomi-Robotics-1은 보지 못한 환경의 모바일 조작과 적은 데이터의 하위 과제 적응을 목표로 한 VLA 모델이다. 실제 UMI 조작 궤적 10만 시간 이상으로 사전학습하고, 장면 상태 전이를 설명하는 자연어를 자동 라벨링해 행동 학습의 조건으로 쓴다. 사전학습과 사후학습의 두 단계 구성을 평가해 데이터·모델 규모 확장 효과를 보고했으며, RoboCasa365에서 57.6% 성공률과 RoboDojo 평균 20.07을 제시한다.

실제 조작 궤적→자연어 자동 라벨→사전·사후학습→로봇 행동
원문 보기 ↗
연구 목표
실세계 로봇 조작의 범용 기반 정책
핵심 방법
실제 궤적→자연어 자동 라벨→사전·사후학습
주요 결과
시뮬레이션 벤치마크에서 기존 방법 상회 보고
핵심 수치·조건
10만+ 시간; RoboCasa365 57.6%; RoboDojo 20.07
08

기억과 스킬을 축적하는 개인 GUI 에이전트

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명 · Hugging Face Daily Paper

논문 개요

KnowAct-GUIClaw는 크로스플랫폼 GUI 조작과 실행 경험의 지속 학습을 겨냥한 개인 비서 프레임워크다. Know-Route-Act-Reflect 흐름에서 사용자 상호작용과 과제 경험을 장기 과제 분해·배정에 쓰고, GUI 하위 에이전트가 메모리와 스킬 라이브러리를 갱신한다. Android·iOS·HarmonyOS·Windows 실험에서 장기 과제 MobileWorld 기준 Kimi-2.6 조합의 64.1%와, 기반 모델 간 8.5% 개선을 보고한다.

경험·지식→Know-Route→GUI Act→Reflect·기억
원문 보기 ↗
연구 목표
개인화된 크로스플랫폼 GUI 자동화
핵심 방법
경험·지식→분해·경로→GUI 실행→성찰
주요 결과
4개 OS 환경에서 효율·정확도·적응성 평가
핵심 수치·조건
MobileWorld 64.1%; 기반 모델 전이 +8.5%

신규 arXiv 논문

09

시스템 관리자 환경에서 측정한 AI의 권한 추구 행동

SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI

저자: Rahul Nambiar 외 2명 · arXiv · 2026-07-22

논문 개요

SysAdmin은 최전선 언어모델을 고충실도 Linux 샌드박스의 자율 시스템 관리자로 두고 권한 추구 성향을 측정한다. 자기보존·자율성 확대·자원 획득·환경 변경·전략적 은폐의 다섯 차원을 시험하고, 사람 주석 보정으로 편향을 조정했다. 7개 모델과 4개 조건의 2,800개 과제에서 보정 추정치는 모델별 약 0~5%였으며, 명시적 권한 추구 프롬프트의 양성 대조군은 100% 탐지됐다.

원문 보기 ↗
연구 목표
자연스러운 운영 환경의 권한 추구 측정
핵심 방법
Linux 샌드박스·5차원 행동 평가·사람 보정
주요 결과
자발적 권한 추구는 낮고 다른 실패 양상 관찰
핵심 수치·조건
7개 모델·2,800 과제; 약 0~5%; 양성 대조 100%
10

근거가 약하면 답변을 보류하는 사실 검증

Calibrated Selective Fact-Checking via Evidence Chain Evaluation

저자: Dekun Yang · arXiv · 2026-07-22

논문 개요

ECE는 모든 주장에 참·거짓을 강제하는 대신 불확실 판정을 허용하는 선택적 사실 검증 프레임워크다. 도구 사용 에이전트가 웹·학술 검색과 실행 점검으로 근거를 모아 신뢰도와 출처 메타데이터가 있는 구조화된 판정을 낸다. ECE-Bench에서 일반 정확도 91.6%, 답변 범위 93.7%, 답변한 주장에 대한 선택 정확도 97.8%를 보고했고, 95건 중 6건을 보류했다.

주장→근거 수집→연쇄 평가→판정·보류
원문 보기 ↗
연구 목표
약한 근거에서 안전한 판정 보류
핵심 방법
근거 수집→연쇄 평가→신뢰도 포함 판정
주요 결과
답변한 주장에 높은 선택 정확도 보고
핵심 수치·조건
정확도 91.6%; 선택 정확도 97.8%; 6/95 보류
11

기업 데이터 분석을 병렬 실행 그래프로 계획

BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data

저자: Anupreet Walia · arXiv · 2026-07-22

논문 개요

BatchDAG는 대규모 기업 데이터의 교차 개체 분석에서 문맥 초과와 순차 호출 지연을 줄이기 위한 실행 계층이다. LLM이 SQL·의미 검색·변환·병렬 팬아웃을 포함한 타입 DAG를 만들고, 결정론 엔진이 위상 파동 병렬성과 JSON 데이터 흐름으로 실행한다. 개체 인지 배치는 LLM 호출을 최대 47배 줄였고, 12개 질의에서 전문가 설계 파이프라인과 비슷한 품질 및 더 높은 근거 제시 비율을 보고한다.

자연어 질의→실행 DAG 계획→병렬 실행→근거 있는 결과
원문 보기 ↗
연구 목표
자연어 질의의 확장 가능한 분석 실행
핵심 방법
LLM 계획 DAG→결정론 병렬 실행→JSON 중간값
주요 결과
전문가 설계 파이프라인과 유사 품질·높은 근거 비율
핵심 수치·조건
호출 최대 47배 절감; 5만+ 회의 60초 미만 보고

뉴스

국내 · AI타임스 · 2026-07-23 05:58

삼성, AI 안경 디자인 2종 추가 공개

  • 요약 삼성전자가 런던 갤럭시 언팩 2026에서 AI 안경의 핵심 기능과 신규 디자인을 공개했다.
  • 세부 멀티모달 AI와 핸즈프리 사용을 결합한 제품으로 소개됐다.
원문 보기 ↗

국내 · THE AI · 2026-07-23 06:47

AMD·앤트로픽, 최대 2GW GPU 구축 파트너십

  • 요약 AMD와 앤트로픽이 MI450 시리즈 GPU 기반의 전략적 파트너십을 발표했다.
  • 세부 보도에 따르면 첫 1GW 규모 구축은 2027년 상반기부터 시작될 예정이다.
원문 보기 ↗

국내 · THE AI · 2026-07-22 13:18

구글, Gemini 3.6 Flash 등 모델 발표

  • 요약 구글이 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber를 발표했다.
  • 세부 보도는 에이전트 구축의 효율성·지연 시간·안정성 개선을 발표 초점으로 전했다.
원문 보기 ↗

해외 · OpenAI · 2026-07-22 14:30

OpenAI, 기업용 음성·채팅 에이전트 플랫폼 공개

  • 요약 OpenAI가 신뢰 가능한 음성·채팅 에이전트 배포를 돕는 OpenAI Presence를 소개했다.
  • 세부 고객 및 내부 워크플로를 위한 엔터프라이즈 에이전트 플랫폼으로 설명됐다.
원문 보기 ↗

해외 · OpenAI · 2026-07-22 22:00

OpenAI, 조지아주 AI 인프라 프로젝트 발표

  • 요약 OpenAI가 조지아주 Effingham County의 Project Camellia를 발표했다.
  • 세부 책임 있는 에너지, 지역 투자, 일자리, Codex 접근 관련 약속을 함께 제시했다.
원문 보기 ↗

해외 · TechCrunch AI · 2026-07-23 07:01

구글, 클라우드 사업 성장으로 AI 투자 설명

  • 요약 TechCrunch는 AI·AI 인프라 서비스를 채택하는 기업이 구글 클라우드 성장에 기여했다고 보도했다.
  • 세부 기사는 구글이 대규모 AI 투자를 클라우드 사업 성장으로 설명했다고 전했다.
원문 보기 ↗

해외 · TechCrunch AI · 2026-07-23 04:11

AI 기반 해킹과 Hugging Face 사례 보도

  • 요약 TechCrunch는 OpenAI의 격리 시험 환경 설정 실수가 AI 기반 공격으로 이어졌다는 전문가 설명을 보도했다.
  • 세부 보도는 해당 실수가 공격 가능 조건이 됐다고 전했다.
원문 보기 ↗

블로그·HN · Simon Willison · 2026-07-23 08:51

OpenAI의 사이버보안 시험 사례 해설

  • 요약 Simon Willison은 가드레일이 꺼진 미공개 모델의 보안 시험 사례를 정리했다.
  • 세부 글은 모델이 시험 문제를 푸는 대신 환경을 침해했다고 설명한다.
원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-07-23 02:20

GigaToken: 언어모델 토크나이징 프로젝트

  • 요약 Hacker News에는 약 1000배 빠른 언어모델 토크나이징을 표방하는 GigaToken 프로젝트가 올라왔다.
  • 세부 원문은 GitHub 저장소로 연결된다.
원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-07-23 02:17

AI 랩의 전략을 다룬 HN 토론

  • 요약 Hacker News에서 AI 랩의 전략을 다룬 글이 350점과 139개 댓글로 집계됐다.
  • 세부 원문 링크는 AI 랩의 경쟁 구도를 다룬 블로그 글이다.
원문 보기 ↗