← 데일리 목록

AI 기술 데일리 리서치

2026-07-20 · 09:00 KST · Hugging Face Daily Papers · arXiv · RSS

오늘의 데일리 브리핑

오늘 연구 흐름은 비디오 이해·생성 모델을 범용화하면서도 실제 상호작용과 체화 지능으로 연결하려는 시도가 두드러진다. 에이전트 연구는 장기 작업의 희소 보상을 보완할 학습 신호와 평가 방식, GUI 조작의 경험 기반 개선을 함께 제시한다. 제품·산업 소식에서는 알리바바의 대형 모델 공개 예고와 삼성의 AI 안경 준비, OpenAI의 AI 투자수익 측정 프레임 제안이 포착됐다. 한편 HN에서는 Kimi K3 수요에 따른 신규 구독 중단 소식도 공유됐다. 오늘의 결론은 모델 크기 경쟁과 별개로, 실제 영상·도구·인터페이스 환경에서 효율적으로 작동하고 검증되는 AI가 연구와 제품 양쪽의 중심으로 이동하고 있다는 점이다.

Hugging Face 주요 논문 6편

01

효율과 범용성을 함께 겨냥한 완전 공개 비디오 모델

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

저자: Xinhao Li 외 26명

논문 개요

비디오 이해는 동작·장편·스트리밍 장면까지 다뤄야 하지만, 기존 공개 모델은 범용성과 계산 효율, 재현성에서 제약이 있었다. VideoChat3는 이를 해결하기 위해 완전 공개 비디오 중심 MLLM을 제안한다. I3D-ViT와 스트리밍용 적응형 프레임 해상도로 시공간 표현과 영상 처리 비용을 함께 다룬다. 일반·장편·스트리밍 데이터셋을 합성하는 파이프라인을 결합해, 4B 파라미터로 같거나 더 큰 기존 공개 모델을 여러 벤치마크에서 앞섰다고 보고한다.

비디오 입력→시공간 표현·적응형 해상도→비디오 이해
원문 링크 ↗
02

적은 학습 예산으로 통합 이미지 이해·생성 모델을 끌어올리기

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

저자: Guoxuan Chen 외 32명

논문 개요

Boogu-Image-0.1은 이미지 이해와 생성, 편집을 하나의 공개 모델 계열에서 제공하려는 연구다. Base·Turbo·Edit·Edit-Turbo 변형을 두고, 모델 이해·데이터 품질·학습 파이프라인과 추론 시점의 에이전트형 확장을 함께 개선한다. 평가에서는 표준 벤치마크에서 다른 공개 모델과 같거나 높은 성능을 보고하며, 선도 폐쇄형 시스템에 근접한 결과도 제시한다. 가중치·코드·레시피는 Apache 2.0으로 공개한다.

텍스트·이미지 지시→통합 모델·추론 확장→생성·편집·텍스트 렌더링
원문 링크 ↗
03

상호작용 가능한 장기 비디오 월드를 만드는 공개 프레임워크

AlayaWorld: Long-Horizon and Playable Video World Generation

저자: AlayaWorld Team 외 16명

논문 개요

AlayaWorld는 현재 월드 상태와 사용자 상호작용을 조건으로 다음 관측을 생성하는 비디오 월드 모델의 활용을 다룬다. 게임 녹화와 실제 세계 비디오를 학습해 시각적 외관과 물리적 동역학을 포착하는 방식을 제시한다. 데이터 준비부터 모델 구조·학습·추론 가속·배포까지를 모듈형 구조로 묶어, 사용자가 이동·전투·주문·소환 같은 동작을 실시간으로 수행할 수 있게 설계했다. 재현 가능한 파이프라인과 평가 도구·문서도 함께 공개한다.

현재 월드 상태·사용자 행동→다음 관측 생성→상호작용 가능한 월드
원문 링크 ↗
04

실행 궤적에서 스스로 학습 규칙을 뽑아내는 에이전트 RL

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

저자: Jinyang Wu 외 10명

논문 개요

SEED는 장기 과업에서 결과 보상만으로는 중간 의사결정의 학습 신호가 부족하다는 문제를 다룬다. 완료된 온폴리시 궤적을 분석해 재사용 가능한 작업 흐름·결정적 관찰·실패 회피 규칙을 자연어 기술로 추출한다. 이후 일반 문맥과 기술이 보강된 문맥에서 행동 확률을 다시 비교해, 그 차이를 토큰 수준의 조밀한 증류 신호로 바꾼다. 텍스트·비전 기반 에이전트 과업에서 성능과 표본 효율, 미지 시나리오 일반화의 향상을 보고한다.

온폴리시 궤적→후견 기술 추출→확률 차이 증류→정책 업데이트
원문 링크 ↗
05

긴 터미널 작업에서 에이전트의 실제 진행도를 재는 벤치마크

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

저자: Zongxia Li 외 12명

논문 개요

Long-Horizon-Terminal-Bench는 짧고 최종 결과만 평가하는 기존 터미널 벤치마크의 한계를 겨냥한다. 실험 재현·소프트웨어 공학·멀티모달 분석·과학 계산 등 9개 범주의 46개 장기 과업을 세분화된 하위 과업으로 채점한다. 이 구성은 최종 성공뿐 아니라 열린 작업 흐름에서 어디까지 진행했는지도 부분 점수로 포착한다. 15개 프런티어 모델 평가에서 강도가 가장 높은 모델도 완전 보상 기준 pass@1이 10.9%였다고 보고한다.

장기 터미널 과업→세분화된 하위 과업 채점→부분 점수·최종 점수
원문 링크 ↗
06

로봇 행동을 겨냥해 비디오 사전학습을 확장하기

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

저자: Shuailei Ma 외 26명

논문 개요

LingBot-Video는 콘텐츠 생성 중심 비디오 모델이 물리적 현실성과 효율 면에서 로봇 제어와 어긋날 수 있다는 문제에서 출발한다. DiT 기반 비디오 사전학습에 Mixture-of-Experts를 적용해 모델 용량과 추론 효율의 균형을 추구한다. 인터넷 영상에 조작·내비게이션·1인칭 관점의 로봇 지향 영상을 보강하고, 물리적 타당성과 과업 완료를 위한 다차원 보상도 사용한다. 평가는 비디오 기반 모델의 성능과 효율을 검증했다고 제시한다.

로봇 지향 비디오→MoE 비디오 사전학습→물리성·과업완료 보상→행동 이해
원문 링크 ↗

기타 Hugging Face 논문

07

기억과 기술 라이브러리로 GUI 에이전트를 자기 진화시키기

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명

논문 개요

KnowAct-GUIClaw는 복잡한 자동화 프레임워크가 여러 플랫폼의 GUI를 다루고 실행 경험에서 계속 개선되는 데 부족하다는 문제를 다룬다. Know-Route-Act-Reflect 구조에서 호스트 에이전트가 경험과 지식을 사용해 장기 과업을 분해·배정한다. GUI 하위 에이전트는 경험 귀속 메모리와 자기 진화 기술 라이브러리를 사용하고, 사용자 프로필·피드백을 저장해 도구 호출과 분해 정확도를 개선한다. Android·iOS·HarmonyOS·Windows 평가에서 효율·정확도·플랫폼 적응성을 보고했다.

사용자 과업·기억→계획·라우팅→GUI 실행→피드백 반영
원문 링크 ↗
08

컴퓨터 비전을 하나의 멀티모달 생성 문제로 통합하기

Vision as Unified Multimodal Generation

저자: Xiaoyang Han 외 16명

논문 개요

SenseNova-Vision은 서로 다른 컴퓨터 비전 과업을 과업별 구조 없이 통합 멀티모달 모델의 텍스트·이미지 생성 공간으로 표현한다. 자연어 지시와 선택적 시각 프롬프트로 과업·영역·뷰·복호화 규칙을 지정하고, 기호 결과는 텍스트로, 조밀한 공간 예측은 이미지로 생성한다. 다양한 주석을 지시-응답 예제로 바꾼 코퍼스를 중심으로 학습해 탐지·OCR·분할·깊이·포즈 등을 포괄한다. 단일 모델이 구조화된 시각 이해와 기하 예측 등에서 전문화 시스템과 맞먹는 결과를 보였다고 보고한다.

지시·시각 프롬프트→통합 멀티모달 모델→텍스트·이미지 예측
원문 링크 ↗

arXiv 신규 논문

arXiv API가 HTTP 429를 반환했고 공식 카테고리 RSS에도 신규 항목이 없어, 중복되거나 오래된 논문으로 보충하지 않았다.

뉴스

domestic

알리바바, 2.4조 매개변수 '큐원3.8' 공개..."페이블 5 이어 세계 2위"

AI타임스 · 2026-07-20 08:00

  • 요약: 알리바바, 2.4조 매개변수 '큐원3.8' 공개..."페이블 5 이어 세계 2위"
  • 세부: 알리바바가 차세대 플래그십 모델 '큐원 3.8'을 공개하며 프론티어 모델 성능 경쟁에 또 한번 지각변동을 예고했다.알리바바는 19일 X를 통해 2조4000억개의 매개변수를 갖춘 초대형 멀티모달 모델 큐원 3.8을 곧 오픈소스로 전환하고 모델 가중치를 개방할 예정이라고 발표했다.알리바바는 "큐원 3.8은 지속적으로 진화하고 있으며 현재 전 세계에서 사용 가능
원문 링크 ↗

삼성전자, 프리미엄 ‘폴드8 울트라'·AI 안경 출격 준비

AI타임스 · 2026-07-20 05:13

  • 요약: 삼성전자, 프리미엄 ‘폴드8 울트라'·AI 안경 출격 준비
  • 세부: 삼성전자는 22일(현지시간) 영국 런던에서 하반기 신제품 공개 행사인 ‘갤럭시 언팩 2026’을 열고 신형 폴더블 스마트폰과 스마트워치, 스마트안경 등을 공개한다.19일 업계에 따르면 삼성전자는 이번 언팩에서 폴더블 스마트폰 '갤럭시 Z' 시리즈 3종과 갤럭시 워치, 안드로이드 기반 '갤럭시 글래스' 등을 대거 선보일 예정이다.가장 큰 변화는 '갤럭시 Z'
원문 링크 ↗

씽킹AI, 한국 진출 후 보폭 확대…고객사 60곳 확보·기능 고도화 가속

AI타임스 · 2026-07-19 18:32

  • 요약: 씽킹AI, 한국 진출 후 보폭 확대…고객사 60곳 확보·기능 고도화 가속
  • 세부: 중국의 AI 에이전트 서비스가 국내 시장 진출을 확대해 나가는 추세다. 최근 마누스에 이어, 이번에는 씽킹AI가 지난 5월 한국 진출을 공식 선언한 이후 조직을 확대하고 핵심 기능을 고도화하는 등 구체적인 사업 확장에 가속도를 붙이고 있다.씽킹AI는 지난 5월 서울 코엑스에서 열린 직장인 컨퍼런스 '원티드 하이파이브 2026'을 통해 국내 진출을 공식 선언
원문 링크 ↗

"엔비디아 내부서도 GPU 확보 전쟁...젠슨 황이 직접 중재"

AI타임스 · 2026-07-19 16:35

  • 요약: "엔비디아 내부서도 GPU 확보 전쟁...젠슨 황이 직접 중재"
  • 세부: 엔비디아 내부에서도 GPU 확보를 위한 치열한 경쟁이 벌어지고 있는 것으로 확인됐다. 세계적인 AI 열풍으로 데이터센터용 칩 주문이 폭주하는 가운데, 정작 엔비디아의 미래 핵심 사업인 자율주행 사업부조차 컴퓨팅 자원을 배정받기 위해 젠슨 황 CEO의 중재를 거쳐야 하는 실정으로 알려졌다.신조 우 엔비디아 차량용 반도체 부문 부사장은 최근 '디코더(Decod
원문 링크 ↗

foreign

A scorecard for the AI age

OpenAI · 2026-07-17 19:00

  • 요약: A scorecard for the AI age
  • 세부: Sarah Friar, CFO of OpenAI, introduces a practical AI scorecard to measure ROI through useful work, cost per successful task, dependability, and return on compute.
원문 링크 ↗

Why teens deserve access to safe AI

OpenAI · 2026-07-17 01:00

  • 요약: Why teens deserve access to safe AI
  • 세부: Learn how OpenAI is making ChatGPT safer for teens with age-appropriate protections, learning tools, parental controls, and expert partnerships.
원문 링크 ↗

What to watch for after Jensen Huang’s Japan visit

TechCrunch AI · 2026-07-20 06:16

  • 요약: What to watch for after Jensen Huang’s Japan visit
  • 세부: Jensen Huang left Tokyo with deals spanning Japan's entire tech ecosystem.
원문 링크 ↗

Can an Apple lawsuit derail OpenAI’s hardware plans?

TechCrunch AI · 2026-07-20 04:24

  • 요약: Can an Apple lawsuit derail OpenAI’s hardware plans?
  • 세부: On the latest episode of Equity, we debate whether Apple's lawsuit will cast over OpenAi's much-discussed plans to get into hardware and go public.
원문 링크 ↗

‘Odyssey’ director Christopher Nolan calls AI an obvious ‘Trojan horse’

TechCrunch AI · 2026-07-19 23:52

  • 요약: ‘Odyssey’ director Christopher Nolan calls AI an obvious ‘Trojan horse’
  • 세부: "Everybody knows the Greeks are inside."
원문 링크 ↗

blog·HN

Kimi K3, and what we can still learn from the pelican benchmark

Simon Willison · 2026-07-17 05:19

  • 요약: Kimi K3, and what we can still learn from the pelican benchmark
  • 세부: Chinese AI lab Moonshot AI announced Kimi K3 this morning, describing it as their "most capable model to date, with 2.8 trillion parameters". It's currently available via their website and API, but an
원문 링크 ↗

AI advice made people 3x less accurate but 2x confident, researchers found

Hacker News 100+ · 2026-07-20 06:18

  • 요약: AI advice made people 3x less accurate but 2x confident, researchers found
  • 세부: Article URL: https://thenextweb.com/news/ai-advice-suppresses-critical-thinking-wrong-answers-study Comments URL: https://news.ycombinator.com/item?id=48971738 Points: 211 # Comments: 100
원문 링크 ↗

Moonshot AI suspends new subscriptions due to Kimi K3 demand

Hacker News 100+ · 2026-07-20 01:02

  • 요약: Moonshot AI suspends new subscriptions due to Kimi K3 demand
  • 세부: Article URL: https://twitter.com/kimi_moonshot/status/2078855608565207130 Comments URL: https://news.ycombinator.com/item?id=48969291 Points: 197 # Comments: 67
원문 링크 ↗