← 데일리 목록

AI 기술 데일리 리서치

2026-07-16 · KST 09:00 기준 수집

오늘의 데일리 브리핑

오늘 연구 흐름은 실시간 영상 생성, 월드 모델, 터미널 에이전트처럼 모델이 긴 상호작용을 수행·평가하는 기반으로 모인다. HF의 최근 논문은 음성 제어 영상, 물리 지능용 비디오 사전학습, 연구 아이디어 검증 도구와 통합 비전 생성까지 생성·에이전트·공간 인지를 함께 확장한다. 제품과 산업 쪽에서는 OpenAI의 GPT-Red 자동 레드팀, 산업 플랜트용 AI 투자, 공개 모델과 Codex 주변 하드웨어 소식이 이어졌다. 국내에서는 비전 AI 경량화, 로봇 그리퍼 교육, AI 스마트글래스 연구 참여가 확인됐다. 결론적으로 오늘은 더 긴 시간축에서 동작하는 모델과 이를 실제 환경에 배치하기 위한 안전성·효율성·도구화가 동시에 관찰되는 날이다.

Hugging Face 주목 논문

01

실시간 음성 제어 영상 생성

Vidu S1: A Real-Time Interactive Video Generation Model

저자: Jintao Zhang 외 26명

논문 개요

음성 지시로 디지털 캐릭터가 나오는 영상을 실시간 제어하는 생성 모델을 제안한다. 사용자는 생성 도중에도 음성으로 내용을 바꿀 수 있으며, 저자들은 장시간 생성에서 흐림·드리프트·시각 왜곡을 줄이는 것을 목표로 둔다. TurboDiffusion과 TurboServe를 결합해 일반 소비자 GPU에서의 실시간 출력을 겨냥했다.

음성 지시→실시간 생성→540p 영상
원문 링크 ↗
연구 목표
  • 음성 지시를 생성 중 입력으로 받아 영상 내용을 제어한다.
  • TurboDiffusion·TurboServe 기반 실시간 생성 구조를 사용한다.
핵심 방법
  • 무한 길이의 실시간 생성 지원을 주장한다.
  • 실인물·애니메이션·반려동물 이미지 업로드와 음성 톤 선택을 지원한다.
주요 결과
  • 일반 소비자 GPU에서 최대 540p·42 FPS로 제시됐다.
핵심 수치·조건
  • 평가 세부 수치는 초록 발췌 범위에 한정된다.
02

긴 터미널 작업을 위한 에이전트 평가

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

저자: Zongxia Li 외 12명

논문 개요

이 벤치마크는 수 분 내 끝나는 단순 터미널 과제와 최종 결과만 보는 평가의 한계를 다룬다. 재현 실험, 소프트웨어 공학, 멀티모달 분석, 게임, 과학 과제처럼 더 긴 작업을 포함한다. 과정의 부분 진전도 반영하는 밀집 보상 채점을 통해 에이전트의 중간 수행을 관찰하도록 설계했다.

원문 링크 ↗
연구 목표
  • 장기 터미널 과제를 여러 범주로 구성한다.
  • 최종 성공 여부뿐 아니라 중간 진전을 채점에 포함한다.
핵심 방법
  • 짧고 명확한 과제 중심 평가의 공백을 겨냥한다.
  • 작업 중 부분 해법을 평가 신호로 남긴다.
주요 결과
  • 46개 과제와 9개 범주로 구성됐다.
핵심 수치·조건
  • 각 과제의 세부 배점은 원문을 확인해야 한다.
03

로봇 지능을 위한 MoE 비디오 사전학습

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

저자: Shuailei Ma 외 26명

논문 개요

이 연구는 콘텐츠 생성에 치우친 비디오 생성 모델을 물리 지능용 사전학습으로 전환하려 한다. LingBot-Video는 DiT 기반 비디오 사전학습 패러다임에 Mixture-of-Experts 구조를 적용한다. 저자들은 모델 용량과 추론 효율의 절충, 그리고 물리적 현실성의 개선을 문제로 둔다.

비디오 데이터→MoE 사전학습→신체화 지능
원문 링크 ↗
연구 목표
  • DiT 기반 비디오 사전학습에 MoE를 적용한다.
  • 비디오 생성의 도메인 불일치를 로봇 제어 관점에서 다룬다.
핵심 방법
  • 콘텐츠 품질 중심 설계와 물리 지능 요구 사이의 간극을 지적한다.
  • 용량과 추론 효율의 균형을 목표로 한다.
주요 결과
  • 정량 결과는 제공된 초록 발췌에 명시되지 않았다.
핵심 수치·조건
  • 비디오 사전학습을 신체화 지능에 맞추는 범위다.
04

근거 기반 연구 아이디어 발굴 도구

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

저자: Qihao Zhao 외 10명

논문 개요

ResearchStudio-Idea는 연구 아이디어를 즉시 생성하는 대신 문헌 근거와 병목 검토를 앞단에 두는 스킬 모음이다. Paper-Search로 여러 출처를 탐색하고, Scoop-Check로 선행 연구와의 충돌을 점검한다. 후보 방향을 구현 전에 차별성 및 위험과 함께 검토하도록 구성했다.

문헌 탐색→선행연구 충돌 검사→아이디어 검토
원문 링크 ↗
연구 목표
  • 문헌 탐색과 선행연구 충돌 검사를 분리된 스킬로 제공한다.
  • 문제 설정·병목·차별성·위험 검토를 아이디어 단계에 포함한다.
핵심 방법
  • 단순 후보 생성보다 근거 기반 아이디어 개발을 목표로 한다.
  • 구현 전 검토를 위한 재사용형 스킬 묶음으로 제시된다.
주요 결과
  • 정량 성능 수치는 제공된 초록 발췌에 명시되지 않았다.
핵심 수치·조건
  • ML 학회 결과를 근거로 한 구성을 표방한다.
05

컴퓨터 비전을 통합 멀티모달 생성으로 다루기

Vision as Unified Multimodal Generation

저자: Xiaoyang Han 외 16명

논문 개요

이 연구는 서로 다른 컴퓨터 비전 과제를 통합 멀티모달 모델의 텍스트·이미지 생성 공간에서 표현한다. SenseNova-Vision은 자연어 지시와 선택적 시각 프롬프트로 과제, 목표 영역·시점, 디코딩 규칙을 지정한다. 출력은 기호적 과제에는 텍스트, 조밀한 공간 예측에는 이미지, 복합 과제에는 혼합 형식이 될 수 있다.

지시·시각 프롬프트→통합 모델→텍스트·이미지 출력
원문 링크 ↗
연구 목표
  • 자연어 지시와 시각 프롬프트로 비전 과제를 명세한다.
  • 텍스트·이미지·혼합 출력으로 서로 다른 과제를 처리한다.
핵심 방법
  • 과제별 전용 구조 없이 통합 생성을 목표로 한다.
  • 대규모 학습을 위해 다양한 비전 과제를 변환하는 방식을 제안한다.
주요 결과
  • 정량 성능 수치는 제공된 초록 발췌에 명시되지 않았다.
핵심 수치·조건
  • 출력 형식은 과제의 기호성·공간성에 따라 달라진다.
06

경계 중심의 조밀한 공간 인지 사전학습

Vision Pretraining for Dense Spatial Perception

저자: Zelin Fu 외 8명

논문 개요

물리 지능에서는 픽셀에서 구조적이고 거리감 있는 실행 가능한 표현을 얻는 일이 중요하다. 저자들은 기존 시각 파운데이션 모델이 의미적 불변성에 집중하면서 세부 공간 이해를 놓칠 수 있다고 본다. 이에 경계와 형태 불연속을 기하 단서로 활용하는 masked boundary modeling을 자기지도 사전학습 방식으로 제안한다.

원문 링크 ↗
연구 목표
  • 경계·형태 불연속을 기하 정보의 단서로 사용한다.
  • 마스킹된 경계 예측을 자기지도 사전학습으로 구성한다.
핵심 방법
  • 조밀한 공간 인지에 맞춘 시각 표현을 목표로 한다.
  • 의미 중심 표현이 잃을 수 있는 세부 공간 정보를 겨냥한다.
주요 결과
  • 정량 성능 수치는 제공된 초록 발췌에 명시되지 않았다.
핵심 수치·조건
  • 대상은 픽셀 기반의 구조·기하 표현 학습이다.

기타 Hugging Face 논문

07

상호작용을 이어가는 무한 월드 모델

Infinite Worlds with Versatile Interactions

저자: Zelin Gao 외 19명

논문 개요

LingBot-World 2.0은 장시간 상호작용에서도 출력 일관성을 유지하는 월드 모델을 제시한다. 저자들은 인과적 사전학습으로 상호작용 지평을 확장하고, 기반 모델에서 실시간 변형을 증류한다. 다양한 상호작용 요소를 추가해 인터랙티브 영상 스트림 구동을 목표로 한다.

상호작용 입력→인과적 월드 모델→실시간 영상
원문 링크 ↗
연구 목표
  • 인과적 사전학습으로 장기 상호작용을 다룬다.
  • 기반 모델에서 실시간 변형을 증류한다.
핵심 방법
  • 무한 상호작용 지평과 출력 일관성을 핵심 개선으로 제시한다.
  • 상호작용 요소의 다양성을 확장했다고 설명한다.
주요 결과
  • 720p·60fps 스트림 구동을 제시했다.
핵심 수치·조건
  • 세부 평가 조건은 원문 확인이 필요하다.
08

다중 플레이어 상호작용 월드 모델

Multiplayer Interactive World Models with Representation Autoencoders

저자: Anthony Hu 외 26명

논문 개요

이 논문은 복잡한 물리 상호작용이 있는 환경을 위한 다중 플레이어 월드 모델을 제안한다. 다른 에이전트를 환경의 일부로 처리하는 단일 플레이어 설정과 달리, 여러 플레이어의 행동 스트림을 조건으로 사용한다. Rocket League에서 각 플레이어에게 장면 변화를 귀속하고 조합된 행동에서도 일관성을 유지하는지를 다룬다.

여러 플레이어 행동→상호작용 월드 모델→일관된 장면
원문 링크 ↗
연구 목표
  • 여러 플레이어의 행동 스트림을 조건으로 장면 변화를 모델링한다.
  • 장면 변화의 책임을 플레이어별로 귀속하는 문제를 다룬다.
핵심 방법
  • 빠르고 결합된 경쟁·협력 환경을 대상으로 한다.
  • 임의 조합의 행동 아래 일관성 유지를 목표로 한다.
주요 결과
  • 공개 봇으로 수집한 1만 시간 게임플레이로 학습했다.
핵심 수치·조건
  • 평가 게임은 Rocket League다.

새로운 arXiv 논문

09

비디오 파운데이션 표현을 생성 잠재공간으로

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

저자: Zhihao Xie 외 4명

논문 개요

VideoRAE는 비디오 파운데이션 모델의 고정 표현을 생성 가능한 압축 잠재공간으로 바꿀 수 있는지 묻는다. 기존 3D-VAE는 픽셀 복원에 최적화돼 의미·시공간 구조를 충분히 담지 못할 수 있다는 문제에서 출발한다. V-JEPA 2와 VideoMAEv2 같은 표현을 representation autoencoder로 연결해 복원과 생성을 함께 겨냥한다.

비디오 표현→표현 오토인코더→생성 잠재공간
원문 링크 ↗
연구 목표
  • 고정 비디오 파운데이션 표현을 representation autoencoder에 연결한다.
  • 픽셀 복원 중심 잠재공간의 한계를 문제로 둔다.
핵심 방법
  • 압축 가능하면서 복원·생성에 쓸 수 있는 잠재표현을 탐색한다.
  • 의미 및 시공간 구조를 보존하는 것을 목표로 한다.
주요 결과
  • 비교 수치는 제공된 초록 발췌에 명시되지 않았다.
핵심 수치·조건
  • V-JEPA 2·VideoMAEv2를 예시 표현으로 든다.
10

픽셀에서 상태로: 게임 엔진으로서의 상호작용 월드 모델

From Pixels to States: Rethinking Interactive World Models as Game Engines

저자: Zhen Li 외 6명

논문 개요

이 연구는 사용자 행동에 따라 일관되게 반응하는 상호작용 세계를 게임 엔진 관점에서 다시 본다. 비디오 생성 모델이 행동 조건부 미래 관측을 예측하는 방식은 가능성을 보이지만, 게임 세계에는 규칙·지속 결과·실시간 생성 루프가 필요하다고 지적한다. 저자들은 픽셀 예측만이 아니라 상태와 조건 변화에 맞춘 상호작용을 문제의 중심에 둔다.

사용자 행동→상태 전이→실시간 세계 생성
원문 링크 ↗
연구 목표
  • 행동 조건부 미래 관측 예측을 출발점으로 삼는다.
  • 규칙·장기 결과·실시간 루프를 상호작용 게임 세계의 조건으로 둔다.
핵심 방법
  • 비디오 생성 모델을 차세대 게임 엔진 후보로 검토한다.
  • 픽셀 수준 출력보다 상태 기반 상호작용을 강조한다.
주요 결과
  • 정량 성능 수치는 제공된 초록 발췌에 명시되지 않았다.
핵심 수치·조건
  • 대상은 장기적 결과가 유지되는 상호작용 환경이다.
11

에이전트 최적화 성능은 누적되는가

Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0

저자: Wenxiao Wang 외 2명

논문 개요

이 논문은 에이전트 최적화의 일회성 향상이 새 과제에서도 누적되는지 평가한다. 고정 벤치마크에서 한 번 최적화한 결과를 안정적 성질로 간주하는 관행이 실제 배치 환경을 충분히 시험하지 못한다고 본다. 새 실패와 과제가 계속 들어오는 상황에서 재최적화가 기존 향상을 유지하는지를 Terminal-Bench 2.0으로 살핀다.

원문 링크 ↗
연구 목표
  • 새 실패·과제가 유입되는 연속 최적화 상황을 평가한다.
  • 기존 향상 보존과 새 과제 적응의 관계를 시험한다.
핵심 방법
  • 일회성 벤치마크 향상의 일반화를 문제로 제기한다.
  • 배치형 에이전트 최적화의 재귀적 적용을 대상으로 한다.
주요 결과
  • 평가 환경은 Terminal-Bench 2.0이다.
핵심 수치·조건
  • 세부 수치 결과는 제공된 초록 발췌에 명시되지 않았다.

뉴스

국내

씨이랩, ICML서 비전 AI 경량화 기술 공개…압축 성능 원본 92%까지 복원

출처: AI타임스 · 2026-07-16 15:46

  • 요약씨이랩이 ICML 2026 공식 워크숍에서 비전 AI 경량화 연구를 발표했다.
  • 세부언어 AI 압축 기법을 영상 AI에 그대로 적용할 때의 성능 저하 문제를 다루며, 기사에는 압축 성능을 원본의 92%까지 복원했다고 적혔다.
원문 링크 ↗

메가존·테솔로, 로봇 손 그리퍼 특화 피지컬 AI 인재 양성 협력

출처: AI타임스 · 2026-07-16 15:27

  • 요약메가존과 테솔로가 AI 그리퍼·로봇핸드 중심의 실무 교육 과정 공동 개발·운영에 나선다.
  • 세부메가존은 교육센터·환경을, 테솔로는 장비와 기술 지원을 맡는다고 기사에서 밝혔다.
원문 링크 ↗

딥파인, 국방·산업용 AI 스마트글래스 개발 국책과제 참여

출처: THE AI · 2026-07-16 15:23

  • 요약딥파인이 ETRI 주관 AI-in-Glass 기술 개발에 공동연구기관으로 참여한다고 밝혔다.
  • 세부기사에 따르면 착용자의 상황 이해와 판단 지원을 목표로 하며, 과제 규모는 5년간 총 450억원이다.
원문 링크 ↗

해외

GPT-Red: 견고성 향상을 위한 자동 레드팀

출처: OpenAI · 2026-07-15 19:00

  • 요약OpenAI는 GPT-Red를 자기대전을 이용하는 자동 레드팀 시스템으로 소개했다.
  • 세부출처는 이 시스템이 정렬과 프롬프트 인젝션 견고성 개선에 쓰인다고 설명한다.
원문 링크 ↗

Applied Computing, 석유·가스·석유화학 플랜트용 AI 모델 위해 2,000만 달러 투자 유치

출처: TechCrunch AI · 2026-07-16 13:00

  • 요약Applied Computing이 산업 플랜트용 기반 AI 모델을 만들기 위해 시리즈 A 투자를 유치했다고 TechCrunch가 보도했다.
  • 세부기사에 제시된 투자 규모는 2,000만 달러이며 대상 산업은 석유·가스·석유화학이다.
원문 링크 ↗

Thinking Machines, 첫 공개 모델 Inkling 발표

출처: TechCrunch AI · 2026-07-16 03:04

  • 요약TechCrunch는 Thinking Machines가 Inkling이라는 첫 공개 모델을 내놓았다고 보도했다.
  • 세부보도는 이 회사가 약 1년 반 동안 AI 인프라를 구축해 왔으며, 획일적 AI에 반대하는 접근을 강화한다고 전한다.
원문 링크 ↗

OpenAI, Codex용 230달러 키보드 공개

출처: TechCrunch AI · 2026-07-16 02:00

  • 요약TechCrunch는 OpenAI가 에이전틱 코딩 앱 Codex와 짝지을 조명 키보드를 출시했다고 보도했다.
  • 세부기사에 표시된 가격은 230달러이며, 하드웨어 관련 법적 분쟁 맥락도 함께 전한다.
원문 링크 ↗

블로그·HN

GPT-5.6 제품군: Luna, Terra, Sol

출처: Simon Willison · 2026-07-10 04:46

  • 요약Simon Willison은 GPT-5.6이 세 가지 크기로 일반 제공됐다고 정리했다.
  • 세부출처는 Luna·Terra·Sol을 작은 모델부터 큰 모델 순으로 소개하고, 입출력 토큰 기준 가격을 언급한다.
원문 링크 ↗

정부·기업·비영리단체의 자유·오픈소스 AI 투자 제안

출처: Hacker News 100+ · 2026-07-16 06:16

  • 요약Hacker News에 자유·오픈소스 AI 투자를 다룬 PDF가 공유됐다.
  • 세부수집 시점 피드에는 161포인트와 57개 댓글로 표시됐으며, 원문은 Siegel Endowment PDF다.
원문 링크 ↗

Grok Build 오픈소스 공개

출처: Hacker News 100+ · 2026-07-16 05:24

  • 요약Hacker News 피드에 Grok Build의 오픈소스 공개가 GitHub 링크와 함께 올라왔다.
  • 세부수집 시점 피드에는 394포인트와 420개 댓글로 표시됐고, 원문 링크는 xAI 조직의 저장소다.
원문 링크 ↗