← 데일리 목록

AI 기술 데일리 리서치

2026-07-17 · Hugging Face Daily Papers · arXiv · RSS

오늘의 데일리 브리핑

오늘의 연구 흐름은 이미지·비전 모델을 통합 생성으로 묶고, 비디오 세계 모델을 실제 상호작용과 로봇 지능으로 연결하려는 시도가 두드러진다. 에이전트 쪽에서는 긴 터미널 작업의 부분 진척을 측정하는 벤치마크, 연구 아이디어의 근거 확인, 개인 GUI 작업의 경험 축적처럼 긴 작업 흐름을 다루는 방법이 함께 제시됐다. 제품·산업 뉴스에서는 구글의 Gemini 3.5 Pro 출시 지연 보도, OpenAI의 청소년 보호와 자동 레드팀 발표, 생성형 게임·비디오 기능 공개가 이어졌다. 한편 학습 데이터의 정밀 출처 추적과 CoT 전제 의존성 감사는 모델 성능 외에 삭제 요청과 추론 검증의 운영 문제를 다룬다. 오늘의 결론은 생성·행동·검증을 하나의 긴 실행 과정으로 연결하려는 연구와 제품 발표가 동시에 늘고 있다는 점이다.

Hugging Face 주목 논문

01

오픈 멀티모달 이해·생성을 끌어올린 Boogu-Image-0.1

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

저자: Guoxuan Chen 외 32명

논문 개요

Boogu-Image-0.1은 하나의 오픈 모델 계열로 이미지 이해와 생성·편집을 함께 다룬다. 연구진은 이해 성능, 데이터 품질, 학습 파이프라인과 추론 시 에이전트 확장을 조합했다. 표준 벤치마크에서 다른 오픈 모델과 같거나 더 높은 성능을 보고했고, 일부 결과는 선도 폐쇄형 시스템에 근접한다고 설명한다.

원문 보기 ↗
02

길게 이어지는 플레이형 비디오 세계 생성, AlayaWorld

AlayaWorld: Long-Horizon and Playable Video World Generation

저자: AlayaWorld Team 외 16명

논문 개요

AlayaWorld는 현재 세계 상태와 사용자 상호작용을 조건으로 다음 장면을 생성하는 플레이형 세계 모델 프레임워크다. 게임 플레이 기록과 실제 영상을 학습에 사용해 시각적 외형과 물리적 동역학을 포착하도록 설계했다. 데이터 준비부터 모델 학습, 추론 가속, 배포와 평가 도구까지 재현 가능한 오픈소스 구성을 제시한다.

현재 세계·입력→다음 장면 생성→실시간 플레이
원문 보기 ↗
03

긴 터미널 작업에서 에이전트의 한계를 시험하는 벤치마크

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

저자: Zongxia Li 외 12명

논문 개요

Long-Horizon-Terminal-Bench는 짧은 최종 결과 중심의 기존 터미널 평가가 중간 진척을 놓친다는 문제에서 출발한다. 46개 장기 과제를 세분화한 채점 항목으로 나누어 부분 점수와 조밀한 보상을 제공한다. 15개 프런티어 모델 평가에서 장기 계획과 문맥 관리, 반복 디버깅이 여전히 어렵다는 결과를 제시한다.

원문 보기 ↗
04

신체화 지능을 위한 MoE 비디오 사전학습 확장

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

저자: Shuailei Ma 외 26명

논문 개요

LingBot-Video는 콘텐츠 생성용 비디오 모델과 로봇 제어 사이의 도메인 차이를 겨냥한 DiT 기반 사전학습 방식이다. 조밀한 구조 대신 MoE를 사용하고, 조작·내비게이션·1인칭 로봇 영상을 보강한 데이터 엔진과 다차원 보상 체계를 결합했다. 논문은 비디오 기반 모델의 성능과 효율을 평가하며 대규모 오픈소스 MoE 비디오 기반 모델을 공개한다.

원문 보기 ↗
05

근거에 기반한 연구 아이디어 발굴 도구 묶음

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

저자: Qihao Zhao 외 10명

논문 개요

ResearchStudio-Idea는 연구 아이디어의 첫 단계를 문헌 근거와 함께 다루기 위한 재사용 가능 스킬 모음이다. 문헌 검색, 선행기술 충돌 확인, 근거 정립부터 후보 생성·감사·아이디어 카드 작성까지의 흐름을 조합한다. ICLR·ICML·NeurIPS 결과 논문 분석에서 얻은 패턴을 구조화해 추적 가능한 제안으로 바꾸는 것을 목표로 한다.

문헌·근거 수집→병목·패턴 선택→충돌 점검·아이디어 카드
원문 보기 ↗
06

통합 멀티모달 생성으로 재구성한 컴퓨터 비전

Vision as Unified Multimodal Generation

저자: Xiaoyang Han 외 16명

논문 개요

SenseNova-Vision은 서로 다른 비전 과제를 통합 멀티모달 모델의 텍스트·이미지 생성 공간에서 표현한다. 자연어 지시와 선택적 시각 프롬프트로 과제와 대상 영역을 지정하고, 기호 출력은 텍스트로 밀집 공간 예측은 이미지로 생성한다. 과제별 예측 헤드 없이 다양한 주석을 지시-응답 예제로 변환해 학습한 단일 모델의 평가 결과를 제시한다.

원문 보기 ↗

기타 Hugging Face 논문

07

스스로 진화하는 개인용 GUI 에이전트, KnowAct-GUIClaw

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

저자: Yunxin Li 외 9명

논문 개요

KnowAct-GUIClaw는 OpenClaw의 교차 플랫폼 GUI 상호작용과 지속적 자기개선 한계를 겨냥한 개인용 에이전트다. 사용자 상호작용 경험과 지식을 누적해 긴 작업을 분해·배분하고, GUI 하위 에이전트의 메모리와 스킬 라이브러리를 결합한다. Android·iOS·HarmonyOS·Windows 실험에서 효율과 정확도, 적응성을 비교 평가했다고 보고한다.

경험·지식 누적→작업 분해·GUI 실행→피드백으로 스킬 갱신
원문 보기 ↗
08

밀집 공간 지각을 위한 비전 사전학습

Vision Pretraining for Dense Spatial Perception

저자: Zelin Fu 외 8명

논문 개요

LingBot-Vision은 픽셀에서 구조화되고 측정 가능한 공간 표현을 복원하는 밀집 공간 지각을 목표로 한다. 경계와 형상 불연속성이 기하 정보를 준다는 관점에서, 서브픽셀 경계를 학습하고 경계 토큰을 마스킹 목표로 쓰는 자기지도 방식을 제안한다. DINOv3를 강한 기준선으로 둔 다양한 하위 과제 평가와 깊이 완성·추정 개선 결과를 보고한다.

원문 보기 ↗

새로 확인한 arXiv

09

AI 학습 데이터의 레코드·토큰 단위 출처 추적

OriginBlame: Record- and Token-Level Data Provenance for AI Training Datasets

저자: Haolin Xue

논문 개요

OriginBlame은 삭제를 요청한 기여자의 학습 데이터를 정확히 찾기 어려운 문제를 다룬다. 데이터 처리 파이프라인을 따라 저자 정체성을 레코드·토큰 수준으로 전파하고, 결정적 질의로 삭제용 집합을 만든다. 위키피디아 데이터와 1.7B 모델 실험에서 과도한 삭제를 줄이고 비학습 성능을 비교했다.

원문 보기 ↗
10

에이전트 AI로 로봇의 사이버-물리 간극 잇기

SPINE: Bridging the Cyber-Physical Gap with Agentic AI

저자: Minkyu Ham 외 9명

논문 개요

SPINE은 모델의 의사결정 능력을 실제 양팔 로봇에 배치할 때 필요한 보정·디버깅 부담을 줄이려는 에이전트 프레임워크다. 로봇별 문맥을 만드는 프로필 빌더와 진단·수정·검증을 반복하는 디버거라는 두 다중 에이전트 흐름을 조율한다. 초보자와 기준선 비교, 다른 플랫폼 실험을 통해 원격조작 성공과 오류 해결 결과를 보고한다.

로봇 문맥 구축→진단·수정→검증·원격조작
원문 보기 ↗
11

치환 개입으로 LLM 추론의 전제 의존성을 검사하기

Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution

저자: Hironao Nakamura

논문 개요

이 연구는 그럴듯한 CoT가 실제로 명시한 전제에 의존하는지 확인하는 블랙박스 검사를 제안한다. 한 전제의 술어를 새 기호로 바꾼 뒤 모델을 다시 실행하고, 각 추론 단계의 정규화된 결론 변화 여부를 확인한다. ProntoQA의 정답 증명 트리와 GPT-4o를 사용한 평가에서 자기일관성 기준선보다 높은 의존성 탐지 성능을 보고한다.

원문 보기 ↗

뉴스

국내

구글, '제미나이 3.5 프로' 출시 지연…"성능 목표 미달·코딩 한계"

AI타임스 · 2026-07-17 08:58

요약
  • 구글, '제미나이 3.5 프로' 출시 지연…"성능 목표 미달·코딩 한계"
세부
  • 구글의 차세대 플래그십 모델인 '제미나이 3.5 프로'의 출시가 당초 계획보다 수개월 지연되고 있는 것으로 알려졌다. 이는 코딩 능력을 비롯한 핵심 성능 부문에서 내부 기준을 충족하지 못했기 때문으로, 경쟁사인 오픈AI와 앤트로픽에 주도권을 완전히 빼앗길 수 있다는 구글 내부의 우려가 커지고 있다.블룸버그는 17일(현지시간) 관계자들을 인용, 구글의 엔지니
원문 보기 ↗

[7월16일] AI 비용 부담의 중심에 선 앤트로픽, 어떤 돌파구를 준비할까

AI타임스 · 2026-07-17 07:00

요약
  • [7월16일] AI 비용 부담의 중심에 선 앤트로픽, 어떤 돌파구를 준비할까
세부
  • 생성 AI가 기업 업무에 본격적으로 도입되면서 성능 못지않게 중요한 화두로 떠오른 것이 비용입니다. 최근에는 비용 부담을 이유로 고가의 폐쇄형 모델 대신 오픈소스나 저렴한 중국산 모델을 선택하는 사례가 잇따르고 있습니다.특히 최고 성능을 앞세운 앤트로픽은 이 문제에서 자유롭지 않습니다. 클로드나 페이블은 대표적인 고가 모델로 분류됩니다. 기업의 비용 부담이
원문 보기 ↗

스페이스X 품에 안긴 커서, 코딩 도구 넘어 "세계 최고 AI 개발" 선언

AI타임스 · 2026-07-16 18:20

요약
  • 스페이스X 품에 안긴 커서, 코딩 도구 넘어 "세계 최고 AI 개발" 선언
세부
  • '커서' 개발사인 애니스피어(Anysphere)가 스페이스X 피인수를 계기로 코딩 지원 서비스를 넘어 최첨단 AI 모델 개발사로 전환에 나선다. 협업형 AI 비서와 범용 AI 챗봇 개발을 추진하는 한편, 영업 조직도 대폭 확대하며 오픈AI와 앤트로픽 등 선두 AI 기업과의 경쟁에 본격적으로 뛰어들겠다는 전략이다.디 인포메이션에 따르면, 마이클 트루엘 커서
원문 보기 ↗

해외

Why teens deserve access to safe AI

OpenAI · 2026-07-17 01:00

요약
  • Why teens deserve access to safe AI
세부
  • Learn how OpenAI is making ChatGPT safer for teens with age-appropriate protections, learning tools, parental controls, and expert partnerships.
원문 보기 ↗

GPT-Red: Unlocking Self-Improvement for Robustness

OpenAI · 2026-07-15 19:00

요약
  • GPT-Red: Unlocking Self-Improvement for Robustness
세부
  • Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.
원문 보기 ↗

Google Vids now lets you star in your own AI videos

TechCrunch AI · 2026-07-17 03:32

요약
  • Google Vids now lets you star in your own AI videos
세부
  • Google is adding personalized AI avatars to Vids that let users create videos starring a digital version of themselves, alongside Gemini Omni-powered tools for generating and editing videos from promp
원문 보기 ↗

Roblox launches an AI-powered game-creation feature in its mobile app

TechCrunch AI · 2026-07-17 03:22

요약
  • Roblox launches an AI-powered game-creation feature in its mobile app
세부
  • Roblox's new "Build" feature lets users generate basic games using a single text prompt.
원문 보기 ↗

블로그·HN

Kimi K3, and what we can still learn from the pelican benchmark

Simon Willison · 2026-07-17 05:19

요약
  • Kimi K3, and what we can still learn from the pelican benchmark
세부
  • Chinese AI lab Moonshot AI announced Kimi K3 this morning, describing it as their "most capable model to date, with 2.8 trillion parameters". It's currently available via their website and API, but an
원문 보기 ↗

LM Studio Bionic: the AI agent for open models

Hacker News 100+ · 2026-07-17 05:18

요약
  • LM Studio Bionic: the AI agent for open models
세부
  • Article URL: https://lmstudio.ai/blog/introducing-lm-studio-bionic Comments URL: https://news.ycombinator.com/item?id=48939662 Points: 125 # Comments: 47
원문 보기 ↗

German AI consortium releases Soofi S, an open 30B model that tops benchmarks

Hacker News 100+ · 2026-07-17 02:44

요약
  • German AI consortium releases Soofi S, an open 30B model that tops benchmarks
세부
  • Article URL: https://the-decoder.com/german-ai-consortium-releases-soofi-s-an-open-30b-model-that-tops-benchmarks-in-both-english-and-german/ Comments URL: https://news.ycombinator.com/item?id=4893775
원문 보기 ↗