← 데일리 목록

AI 기술 데일리 리서치

2026-07-19 · 09:00 KST · Hugging Face Daily Papers / RSS

오늘의 데일리 브리핑

오늘 논문 흐름은 이미지·비디오를 다루는 공개 멀티모달 모델과, 장기 과제를 수행하는 에이전트의 학습·평가·탐색 협업으로 나뉜다. 특히 VideoChat3와 Boogu-Image-0.1은 공개 범위와 통합 멀티모달 역량을, SEED·SearchOS·Long-Horizon-Terminal-Bench는 장기 상호작용의 감독·진척 관리·평가를 각각 겨냥한다. 제품·산업 뉴스에서는 OpenAI가 AI 투자 성과 측정과 청소년 보호, GPT-Red 기반 견고성 개선을 공개했고, 국내에서는 중국 오픈 모델의 보안 능력과 AI 기업 가치가 다뤄졌다. 이번 수집에서 arXiv 보충 API와 공식 RSS는 신규 항목을 반환하지 않아, 검증 가능한 HF 최근 논문 8편만 싣는다.

Hugging Face 선정 논문

01

Boogu-Image-0.1: 오픈소스 통합 멀티모달 이해·생성 강화

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

저자: Guoxuan Chen 외 32명

논문 개요

Boogu-Image-0.1은 이미지 이해와 생성을 하나의 오픈소스 모델군으로 묶는 것을 목표로 한다. 논문은 Base·Turbo·Edit·Edit-Turbo 변형을 제시하며, 텍스트-이미지 생성·지시 기반 편집·중영 텍스트 렌더링을 다룬다. 저자들은 폐쇄형 시스템의 통합 방식을 공개하기 어렵다는 문제를 출발점으로, 표적 개선으로 성능을 높이는 접근을 설명한다.

입력 이미지·텍스트→통합 모델→생성·편집 결과
원문 보기 ↗
연구 목표
  • 통합 멀티모달 모델군 제시
핵심 방법
  • Base·Turbo·Edit 변형
주요 결과
  • 텍스트-이미지·편집·이중언어 렌더링을 대상으로 설명
핵심 수치·조건
  • 초록 발췌본에 비교 수치 없음
02

VideoChat3: 효율적 범용 비디오 이해를 위한 완전 공개 Video MLLM

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

저자: Xinhao Li 외 26명

논문 개요

VideoChat3는 다양한 비디오 유형을 폭넓게 이해하는 공개 모델을 목표로 한다. 기존 공개 모델이 특정 영역에 치우치고 계산량이 크며, 학습 코드·전략·데이터가 일부만 공개된 문제를 짚는다. 논문은 재현성을 높이기 위해 완전 공개를 표방하는 비디오 MLLM을 제안한다.

비디오 입력→VideoChat3→비디오 이해 출력
원문 보기 ↗
연구 목표
  • 범용 비디오 이해
핵심 방법
  • 완전 공개 Video MLLM
주요 결과
  • 다양한 비디오·효율성·재현성 문제를 함께 다룸
핵심 수치·조건
  • 초록 발췌본에 비교 수치 없음
03

AlayaWorld: 장기 시계열의 플레이 가능한 비디오 월드 생성

AlayaWorld: Long-Horizon and Playable Video World Generation

저자: AlayaWorld Team 외 16명

논문 개요

AlayaWorld는 사용자가 조작할 수 있는 장기 비디오 월드를 온라인으로 생성하는 것을 목표로 한다. 논문은 모든 게임 요소를 수작업으로 제작하는 비용과 수정 난점을 출발점으로 삼는다. 현재 월드 상태와 사용자 상호작용을 조건으로 미래 관측을 자기회귀적으로 합성하고, 게임플레이 기록과 실제 비디오로 학습한다고 설명한다.

현재 상태·입력→자기회귀 합성→다음 관측
원문 보기 ↗
연구 목표
  • 플레이 가능한 장기 월드 생성
핵심 방법
  • 자기회귀 미래 관측 합성
주요 결과
  • 월드 상태·사용자 상호작용을 조건으로 사용
핵심 수치·조건
  • 게임플레이 기록과 실제 비디오로 학습
04

SEED: 에이전트 RL을 위한 자기진화 온정책 증류

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

저자: Jinyang Wu 외 10명

논문 개요

SEED는 장기 상호작용과 도구 사용을 수행하는 언어 에이전트의 강화학습을 다룬다. 결과 기반 보상은 실용적이지만 궤적 수준의 희소 보상만 제공해 중간 의사결정의 감독 공백이 남는다고 본다. 논문은 완료된 온정책 궤적을 훈련 시점의 사후 기술과 증류 신호로 바꾸는 자기진화 프레임워크를 제안한다.

에이전트 실행→완료 궤적→사후 기술→증류 학습
원문 보기 ↗
연구 목표
  • 장기 에이전트 RL의 중간 감독 보완
핵심 방법
  • 완료된 온정책 궤적을 사후 기술로 변환
주요 결과
  • 결과 보상과 토큰 수준 학습 사이 공백을 겨냥
핵심 수치·조건
  • 초록 발췌본에 비교 수치 없음
05

Long-Horizon-Terminal-Bench: 장기 터미널 과제 에이전트 벤치마크

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

저자: Zongxia Li 외 12명

논문 개요

Long-Horizon-Terminal-Bench는 짧고 잘 정의된 작업 위주의 기존 터미널 벤치마크를 보완하려 한다. 최종 결과만 평가하면 중간 진척과 부분 해법을 놓치고 보상 신호가 희소해진다는 문제의식이다. 논문은 실험 재현·소프트웨어 공학·멀티모달 분석·게임·과학을 포함한 9개 범주의 장기 과제 46개를 제시하고 조밀 보상 기반 채점을 사용한다.

과제 실행→단계별 채점→누적 평가
원문 보기 ↗
연구 목표
  • 장기 터미널 에이전트 평가
핵심 방법
  • 조밀 보상 기반 채점
주요 결과
  • 9개 범주, 46개 장기 과제
핵심 수치·조건
  • 최종 결과뿐 아니라 중간 진척을 겨냥
06

체화 지능을 위한 MoE 비디오 사전학습 확장

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

저자: Shuailei Ma 외 26명

논문 개요

LingBot-Video는 콘텐츠 생성 중심 비디오 생성 모델을 체화 지능에 맞추는 것을 목표로 한다. 논문은 시각 충실도와 창의성 중심 설계가 계산 효율·물리적 사실성과 어긋날 수 있다고 지적한다. DiT 기반 비디오 사전학습에 밀집형 대신 Mixture-of-Experts를 사용해 모델 용량과 추론 효율의 균형을 추구한다.

비디오 데이터→MoE 사전학습→체화 지능 표현
원문 보기 ↗
연구 목표
  • 체화 지능용 비디오 사전학습
핵심 방법
  • DiT 기반 MoE 구조
주요 결과
  • 모델 용량과 추론 효율의 균형을 목표
핵심 수치·조건
  • 초록 발췌본에 비교 수치 없음
07

SearchOS-V1: 견고한 개방형 정보탐색 에이전트 협업

SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

저자: Yuyao Zhang 외 13명

논문 개요

SearchOS는 웹 검색을 수행하는 에이전트가 긴 상호작용 이력을 관리하기 어려운 문제를 다룬다. 유용한 근거를 찾지 못할 때 단일·다중 에이전트가 반복 루프에 빠져 검색 예산과 최종 산출물 품질을 해칠 수 있다고 설명한다. 논문은 암묵적인 탐색 진척을 명시적이고 지속적이며 공유 가능한 상태로 전환하는 다중 에이전트 프레임워크를 제안한다.

질의→탐색 상태 공유→협업 검색→근거 기반 결과
원문 보기 ↗
연구 목표
  • 정보탐색 에이전트 협업
핵심 방법
  • 탐색 진척을 공유 상태로 명시화
주요 결과
  • 반복 검색 루프와 검색 예산 낭비를 겨냥
핵심 수치·조건
  • 초록 발췌본에 비교 수치 없음
08

KnowAct-GUIClaw: 자기진화 메모리·기술을 갖춘 개인 GUI 보조자

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명

논문 개요

KnowAct-GUIClaw는 복잡한 자동화용 OpenClaw의 교차 플랫폼 GUI 상호작용과 자기진화 장치를 보완하려 한다. 논문은 이런 한계가 여러 기기 생태계 적응과 실행 경험을 통한 개선을 막는다고 설명한다. 누적된 사용자 상호작용과 작업 실행 경험으로 정확도와 효율을 높이는 Know Deeply, Act Perfectly 패러다임을 제시한다.

사용자 요청→GUI 실행→경험 축적→다음 실행 개선
원문 보기 ↗
연구 목표
  • 개인 GUI 보조자의 적응성 강화
핵심 방법
  • 자기진화 메모리·기술
주요 결과
  • 교차 플랫폼 GUI 상호작용을 겨냥
핵심 수치·조건
  • 초록 발췌본에 비교 수치 없음

arXiv 신규 논문

arXiv API 및 공식 카테고리 RSS 보충 조회 결과 신규 항목 0편.

뉴스

국내 · AI타임스 · 2026-07-19 07:59

115년 상징의 추락...IBM 25% 폭락이 경고하는 'AI 블랙홀'

요약

  • 115년 상징의 추락...IBM 25% 폭락이 경고하는 'AI 블랙홀'

세부

  • 미국 기술의 상징이었던 IBM이 AI 시대의 첫 대형 희생양이 될 수 있다는 우려가 커지고 있다. 지난주 주가 폭락은 단순한 실적 쇼크를 넘어, IBM의 사업 모델 자체가 AI 시대에도 통할 수 있는지에 대한 근본적인 의문으로 이어지고 있다는 평이다.IBM은 지난 14일(현지시간) 2분기 실적이 시장 기대에 크게 못 미칠 것이라고 이례적인 사전 경고를 발표
원문 보기 ↗

국내 · AI타임스 · 2026-07-18 17:06

영국 AISI 경고 “중국 오픈 모델, 미국과 보안 격차 4개월로 단축”

요약

  • 영국 AISI 경고 “중국 오픈 모델, 미국과 보안 격차 4개월로 단축”

세부

  • 중국의 오픈웨이트 AI 모델이 사이버 보안 능력에서 미국 선도 AI 모델을 빠르게 따라잡고 있다는 연구 결과가 나왔다. 특히 중국 AI 모델과 미국 최첨단 모델 간 성능 격차가 불과 4개월 수준으로 좁혀지면서, 저렴하면서도 강력한 AI 모델이 사이버 공격에 악용될 위험이 커지고 있다는 경고도 제기됐다.영국 AI 보안연구소(AISI)는 17일(현지시간) 공개
원문 보기 ↗

국내 · AI타임스 · 2026-07-18 16:34

딥시크, 기업가치 77조 달해...공식 문서로 몸값 처음 확인

요약

  • 딥시크, 기업가치 77조 달해...공식 문서로 몸값 처음 확인

세부

  • 딥시크가 최근 창립 후 처음으로 외부 투자를 유치하며 3509억위안(약 77조원)의 기업 가치를 인정받은 것으로 나타났다. 이는 중국 정부에 제출된 투자사의 공시를 통해 처음 확인된 수치로, 딥시크의 몸값이 공식 문서를 통해 드러난 것은 이번이 처음이다.로이터에 따르면, 중국 여행가방 제조업체 안후이 커룬은 17일 공시를 통해 자회사 닝보푸룬이 투자한 펀드
원문 보기 ↗

해외 · OpenAI · 2026-07-17 19:00

A scorecard for the AI age

요약

  • A scorecard for the AI age

세부

  • Sarah Friar, CFO of OpenAI, introduces a practical AI scorecard to measure ROI through useful work, cost per successful task, dependability, and return on compute.
원문 보기 ↗

해외 · OpenAI · 2026-07-17 01:00

Why teens deserve access to safe AI

요약

  • Why teens deserve access to safe AI

세부

  • Learn how OpenAI is making ChatGPT safer for teens with age-appropriate protections, learning tools, parental controls, and expert partnerships.
원문 보기 ↗

해외 · OpenAI · 2026-07-16 09:00

How Cars24 scales conversations and builds faster with OpenAI

요약

  • How Cars24 scales conversations and builds faster with OpenAI

세부

  • Cars24 uses OpenAI-powered voice and chat agents to handle 1M+ monthly conversation minutes, recover 12% of lost leads, and bring agentic workflows to teams across the company.
원문 보기 ↗

해외 · OpenAI · 2026-07-15 19:00

GPT-Red: Unlocking Self-Improvement for Robustness

요약

  • GPT-Red: Unlocking Self-Improvement for Robustness

세부

  • Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.
원문 보기 ↗

블로그·HN · Simon Willison · 2026-07-17 05:19

Kimi K3, and what we can still learn from the pelican benchmark

요약

  • Kimi K3, and what we can still learn from the pelican benchmark

세부

  • Chinese AI lab Moonshot AI announced Kimi K3 this morning, describing it as their "most capable model to date, with 2.8 trillion parameters". It's currently available via their website and API, but an
원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-07-19 02:32

The Kimi K3 Moment

요약

  • The Kimi K3 Moment

세부

  • Article URL: https://stephen.bochinski.dev/blog/2026/07/18/the-kimi-k3-moment/ Comments URL: https://news.ycombinator.com/item?id=48960218 Points: 257 # Comments: 283
원문 보기 ↗

블로그·HN · Hacker News 100+ · 2026-07-19 01:12

Setting up your spare Mac for Claude Code to control, a step-by-step guide

요약

  • Setting up your spare Mac for Claude Code to control, a step-by-step guide

세부

  • Article URL: https://ykdojo.github.io/claude-controls-mac/ Comments URL: https://news.ycombinator.com/item?id=48959392 Points: 166 # Comments: 125
원문 보기 ↗