← 데일리 목록

AI 기술 데일리 리서치

2026-07-18 · KST 09:00 · Hugging Face Daily Papers · arXiv · RSS

오늘의 데일리 브리핑

오늘은 공개형 멀티모달·영상 모델의 확장과 장기 과제를 다루는 에이전트 평가·학습이 연구 흐름의 중심을 이룬다. Boogu-Image-0.1과 VideoChat3는 각각 통합 이미지 생성·이해와 범용 영상 이해를 공개 모델로 제시했고, Long-Horizon-Terminal-Bench는 실제 장기 실행에서 남은 난도를 수치로 드러냈다. 제품·산업 면에서는 메타의 AI 인프라 임대 논의와 Databricks의 기업가치 보도가 컴퓨팅 자원과 AI 사업화의 움직임을 보여준다. 새 발표는 로봇의 긴 문맥, 계층적 시각 추론, 에이전트의 사후 기술 학습처럼 실행 과정 자체를 다루는 방향으로 모인다. 결론적으로 오늘의 신호는 모델 규모뿐 아니라 데이터·추론·평가·운영 구조를 함께 공개하고 검증하려는 경쟁이다.

Hugging Face 주목 논문 6편

01

통합 멀티모달 생성 모델을 적은 비용으로 공개

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

저자: Guoxuan Chen 외 32명

논문 개요

Boogu-Image-0.1은 이미지 이해·생성·편집과 중영문 텍스트 렌더링을 하나의 공개 모델군으로 묶는 것을 목표로 한다. 연구진은 모델 이해 능력, 데이터 품질, 학습 파이프라인을 조정하고 추론 단계의 에이전트식 확장을 결합했다. 표준 벤치마크에서 다른 공개 모델과 대등하거나 우세하고 선도적 비공개 시스템에 근접한다고 보고한다.

데이터·학습 파이프라인→에이전트식 추론 확장→생성·편집 출력
원문 보기 ↗
연구 목표
  • 통합 이미지 이해·생성·편집
핵심 방법
  • 데이터·학습 개선과 추론 확장
주요 결과
  • 공개 모델 간 일관된 경쟁력 보고
핵심 수치·조건
  • 2.0862억 고유 이미지·기본 학습비 약 $400K
02

영상 이해를 위한 완전 공개 MLLM

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

저자: Xinhao Li 외 26명

논문 개요

VideoChat3는 특정 영상 유형에 치우치고 비용이 큰 기존 공개 영상 모델의 한계를 다룬다. Inflated 3D Vision Transformer와 스트리밍용 적응형 프레임 해상도를 통해 시공간 표현과 입력 처리 비용을 함께 설계했다. 일반·장편·스트리밍 데이터를 합성해 학습하고, 여러 벤치마크에서 동급 또는 더 큰 공개 모델을 앞섰다고 제시한다.

영상 입력→시공간 표현·프레임 적응→영상 이해
원문 보기 ↗
연구 목표
  • 범용·효율적 영상 이해
핵심 방법
  • I3D-ViT와 적응형 프레임 해상도
주요 결과
  • 세 영상 시나리오에서 이전 공개 모델 상회
핵심 수치·조건
  • 4B 파라미터
03

상호작용 가능한 장기 영상 월드 생성

AlayaWorld: Long-Horizon and Playable Video World Generation

저자: AlayaWorld Team 외 16명

논문 개요

AlayaWorld는 수작업 중심 게임 월드 제작의 비용과 수정 부담을 줄이는 공개 프레임워크다. 현재 월드 상태와 사용자 상호작용을 조건으로 미래 관측을 자기회귀 생성하며, 게임 기록과 현실 영상을 함께 학습 대상으로 삼는다. 데이터 준비부터 모델 학습, 추론 가속, 배포와 평가 도구까지 모듈형으로 공개해 실시간 상호작용을 지원한다.

월드 상태·행동→미래 관측 생성→실시간 상호작용
원문 보기 ↗
연구 목표
  • 온라인 상호작용형 생성 월드
핵심 방법
  • 상태·사용자 행동 조건의 자기회귀 영상 생성
주요 결과
  • 참조 구현·평가 도구·문서 공개
핵심 수치·조건
  • 전투·주문·소환 등 행동 예시
04

장기 터미널 에이전트의 실제 진행도를 평가

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

저자: Zongxia Li 외 12명

논문 개요

Long-Horizon-Terminal-Bench는 최종 성공만 보는 짧은 터미널 과제 평가의 빈틈을 겨냥한다. 참조 해법 또는 시뮬레이터가 있는 과제를 세부 채점 단위로 나눠 중간 보상과 부분 점수를 제공한다. 15개 프런티어 모델 평가에서 강한 모델도 완전 보상 기준 통과율이 낮았으며, 장기 계획·문맥 관리·디버깅의 난도를 드러낸다.

과제→세부 하위과제 채점→부분·최종 보상
원문 보기 ↗
연구 목표
  • 장기 터미널 작업 능력 측정
핵심 방법
  • 세부 하위과제·밀집 보상 채점
주요 결과
  • 강한 모델도 낮은 완전 통과율
핵심 수치·조건
  • 46과제·9범주·최고 10.9% pass@1
05

에이전트 RL에 사후 기술 신호를 더하는 방법

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

저자: Jinyang Wu 외 10명

논문 개요

SEED는 결과 보상만으로는 중간 의사결정 학습이 부족하다는 문제를 다룬다. 현재 정책이 완료 궤적을 분석해 재사용 가능한 자연어 기술을 만들고, 기술 문맥 유무의 행동 확률 차이를 조밀한 토큰 수준 증류 신호로 바꾼다. 텍스트와 시각 기반 에이전트 과제에서 성능과 표본 효율, 미지 시나리오 일반화가 개선됐다고 보고한다.

온폴리시 궤적→사후 자연어 기술→확률 차이 증류→정책 갱신
원문 보기 ↗
연구 목표
  • 결과 보상과 토큰 학습 사이의 공백 축소
핵심 방법
  • 온폴리시 궤적의 사후 기술 추출·증류
주요 결과
  • 성능·표본 효율·일반화 개선 보고
핵심 수치·조건
  • 텍스트·시각 에이전트 과제 평가
06

체화 지능용 MoE 비디오 사전학습

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

저자: Shuailei Ma 외 26명

논문 개요

LingBot-Video는 시각적 창작 위주 비디오 생성 모델과 로봇 제어 사이의 도메인 차이를 겨냥한다. DiT 기반 모델에 MoE를 적용하고, 조작·내비게이션·자기시점 영상을 포함한 프로파일링 데이터와 물리적 타당성·과업 완료 보상 체계를 결합했다. 논문은 이를 대규모 공개 MoE 비디오 기반 모델로 제시하며 성능과 효율을 평가로 검증한다.

로봇 지향 영상→MoE 비디오 사전학습→행동·월드 이해
원문 보기 ↗
연구 목표
  • 로봇 행동·물리 이해를 위한 비디오 기반 모델
핵심 방법
  • MoE·로봇 지향 데이터·다차원 보상
주요 결과
  • 성능·효율 평가 결과 제시
핵심 수치·조건
  • 조작·내비게이션·자기시점 데이터

기타 Hugging Face 논문

07

근거 기반 연구 아이디어 발굴 도구 모음

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

저자: Qihao Zhao 외 10명

논문 개요

ResearchStudio-Idea는 후보를 많이 내는 것만으로는 연구 기획이 충분하지 않다는 전제에서 출발한다. 문헌 탐색, 선행연구 충돌 확인, 근거 준비도 점검과 아이디어 카드 생성을 결합해 문제의 병목과 차별점을 추적한다. 2021~2025년 ML 학회 논문 1,947편에서 뽑은 패턴을 사용했고, 자동 심사에서 일반적 스킬 또는 무스킬 기준보다 강한 제안서를 만들었다고 보고한다.

문제·근거→병목·패턴 선택→충돌 검사→아이디어 카드
원문 보기 ↗
연구 목표
  • 근거가 연결된 연구 아이디어 구성
핵심 방법
  • 탐색·충돌검사·감사 결합 스킬
주요 결과
  • 자동 심사에서 더 강한 제안서 보고
핵심 수치·조건
  • 논문 1,947편·15개 패턴
08

개인 GUI 에이전트의 기억과 기술 진화

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명

논문 개요

KnowAct-GUIClaw는 여러 기기 GUI 조작과 경험 기반 자기개선이 부족하다는 문제를 겨냥한다. Know–Route–Act–Reflect 체계에서 사용자 경험과 지식을 과제 분해에 쓰고, GUI 하위 에이전트의 메모리와 기술 라이브러리를 계속 축적한다. Android·iOS·HarmonyOS·Windows 평가에서 장기 MobileWorld 과제 성능과 모델 간 전이 개선을 제시한다.

경험·지식→과제 분해→GUI 실행→피드백·기억 갱신
원문 보기 ↗
연구 목표
  • 크로스플랫폼 개인 GUI 자동화
핵심 방법
  • 기억·기술 라이브러리의 Know–Route–Act–Reflect
주요 결과
  • 효율·정확도·전이성 평가 결과 보고
핵심 수치·조건
  • MobileWorld 64.1%·전이 개선 8.5%

신규 arXiv 논문 3편

01

시각 추론을 위한 계층적 확산 디노이징

Hierarchical Denoising For Multi-Step Visual Reasoning

저자: Shanghang Zhang

논문 개요

HDR은 스트리밍 자기회귀 확산의 추론 한계와 양방향 확산의 높은 비용을 함께 다룬다. 트리형 계층 잠재표현에서 거친 단계는 가설을 보존하고 미세 단계가 시각 상태를 다듬으며, 희소 계층 주의로 시간 비용을 낮춘다. 여섯 종류의 다단계 과제에서 성공률 34.22에서 60.29로 높이고 양방향 확산보다 54.2배 빠른 추론을 보고한다.

거친 가설→미세 시각 상태 정제→스트리밍 출력
원문 보기 ↗
연구 목표
  • 저지연 다단계 시각 추론
핵심 방법
  • 계층 잠재표현·희소 계층 주의
주요 결과
  • 성공률·진행도·속도 개선 보고
핵심 수치·조건
  • 성공률 34.22→60.29·0.70초/latent
02

언어 모델의 통계적 자기일관성 검사

Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models

저자: Celestine Mendler-Dünner

논문 개요

이 연구는 언어 모델의 조건부 추정이 전체확률법 같은 기본 확률 항등식을 따르는지 조사한다. 이진 트리로 모집단을 세분화하고 각 하위집단의 언어화된 설명을 프롬프트로 주어 추정을 다시 전체 수준으로 합친다. 여러 도메인과 프런티어 모델에서 일관성 위반을 관찰했으며, 세분 응답을 합친 값이 직접 전체 추정보다 인간 기준에 더 맞는 ‘macro fallacy’를 보고한다.

모집단 분할→하위집단 추정→가중 집계→일관성 비교
원문 보기 ↗
연구 목표
  • LLM 조건부 추정의 일관성 평가
핵심 방법
  • 하위집단 분할·추정 재집계
주요 결과
  • 여러 모델·도메인에서 위반 관찰
핵심 수치·조건
  • 이진 트리 분할·다양한 세분도
03

로봇 정책의 긴 문맥을 테스트 시 학습으로 확장

RoboTTT: Context Scaling for Robot Policies

저자: Linxi "Jim" Fan

논문 개요

RoboTTT는 짧은 시각-운동 문맥에 머무는 로봇 기반 모델의 한계를 다룬다. 훈련과 추론에서 경사하강으로 갱신되는 fast weights에 이력을 압축해, 지연시간을 늘리지 않고 긴 문맥 조건화를 시도한다. 실제 조작 과제에서 단일 단계 문맥 기준보다 전체 성능이 87% 높았고, 5분·10단계 조립을 완료했다고 보고한다.

시각-운동 이력→fast weights 갱신→장문맥 정책 출력
원문 보기 ↗
연구 목표
  • 긴 시각-운동 문맥의 로봇 정책
핵심 방법
  • 테스트 시 학습·fast weights·행동 강제
주요 결과
  • 실제 로봇 조작 성능 개선 보고
핵심 수치·조건
  • 8K timestep·87% 개선·5분 10단계

뉴스

국내 · AI타임스 · 2026-07-18

메타, 앤트로픽과 15조 AI 인프라 임대 논의…클라우드 진출 눈앞

요약• 메타가 앤트로픽에 고성능 AI 컴퓨팅 자원을 임대하는 초기 논의를 진행 중이라고 보도했다.

세부• 성사 시 메타의 클라우드 시장 진출 사례가 될 수 있다는 보도다.

원문 보기 ↗

국내 · THE AI · 2026-07-16

딥파인, 450억 국책과제 참여…국방·산업용 AI 스마트글래스 개발

요약• 딥파인이 ETRI 주관 AI-in-Glass 기술 개발 과제에 공동연구기관으로 참여한다고 밝혔다.

세부• 과제는 5년간 총 450억 원 규모이며 국방·산업 현장용 스마트글래스를 대상으로 한다.

원문 보기 ↗

국내 · AI타임스 · 2026-07-17

시진핑 “AI는 모두의 것”…오픈소스 앞세워 미국과 경쟁

요약• WAIC 기조연설에서 중국은 오픈소스 AI와 국제 협력을 강조했다.

세부• 보도는 개발도상국 지원과 개방형 AI를 글로벌 AI 질서 전략으로 소개한다.

원문 보기 ↗

해외 · OpenAI · 2026-07-17

A scorecard for the AI age

요약• OpenAI CFO가 AI 투자 성과를 측정하는 scorecard를 제안했다.

세부• 유용한 작업량, 성공 과제당 비용, 신뢰성, 컴퓨트 수익을 지표로 든다.

원문 보기 ↗

해외 · OpenAI · 2026-07-15

GPT-Red: Unlocking Self-Improvement for Robustness

요약• OpenAI는 self-play를 사용하는 자동 레드팀 시스템 GPT-Red를 소개했다.

세부• 모델 안전성·정렬·프롬프트 인젝션 견고성 향상을 목표로 설명한다.

원문 보기 ↗

해외 · TechCrunch AI · 2026-07-18

Databricks hits $188B valuation

요약• TechCrunch는 Databricks의 기업가치가 1,880억 달러에 이르렀다고 보도했다.

세부• 기사에는 오픈 웨이트 코딩 AI 모델의 비용 절감 연구 발표도 언급된다.

원문 보기 ↗

해외 · TechCrunch AI · 2026-07-18

Agility Robotics plants its flag in Tesla’s backyard

요약• Agility Robotics가 미국 Fremont에 Digit 로봇 훈련센터를 연다고 보도됐다.

세부• 기사의 초점은 로봇 훈련 거점 확장이다.

원문 보기 ↗

블로그·HN · Simon Willison · 2026-07-17

Kimi K3, and what we can still learn from the pelican benchmark

요약• Moonshot AI가 Kimi K3를 가장 강력한 모델로 소개하며 웹·API 제공을 시작했다고 정리했다.

세부• 글은 2.8조 파라미터라는 발표 수치와 pelican benchmark 관찰을 함께 다룬다.

원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-07-18

Kaiser nurses say AI, workplace surveillance are making care worse

요약• 간호사들이 AI와 직장 감시가 업무와 환자 진료를 악화시킨다고 말한 기사가 HN에 공유됐다.

세부• 기사 제목과 HN 피드가 제기한 현장 우려를 요약한다.

원문 보기 ↗

블로그·HN · Last Week in AI · 2026-05-27

Last Week in AI #341

요약• Last Week in AI는 OpenAI 관련 소송, Google 업데이트 등을 묶어 정리했다.

세부• RSS에서 확인되는 최신 해당 호의 날짜는 5월 27일이다.

원문 보기 ↗