← 데일리 목록

AI TECHNOLOGY DAILY RESEARCH · 2026-08-01 · 09:00 KST

AI 기술 데일리 리서치

Hugging Face Daily Papers · arXiv · RSS 기반

오늘의 데일리 브리핑

오늘 연구 흐름은 장문 맥락을 다루는 공개 MoE, 물리 세계를 명시적 중간 표현으로 모델링하는 세계 모델, 실행 피드백으로 탐색하는 ML 엔지니어링 에이전트처럼 모델과 작업 과정을 함께 다루는 방향에 모였다. 로보틱스·창작·비디오 생성 논문도 대형 언어 모델 중심 경로를 줄이거나, 캔버스·시뮬레이션 코드처럼 검사 가능한 작업 상태를 중간에 둔다. 제품·산업 소식에서는 OpenAI의 가격 대비 성능 발표와 유럽 책임 AI 운영, 국내의 공간지능·대형 모델 공개가 이어졌다. 보안과 에이전트 거버넌스 관련 소식도 함께 나타나, 실제 배포에서는 모델 성능뿐 아니라 실행 경로·비용·통제 조건을 함께 확인할 필요가 있다.

Hugging Face 주요 논문 6편

01

Kimi K3: 공개 프런티어 지능

Kimi K3: Open Frontier Intelligence

저자: Kimi Team 외 401명 · 2026-07-27

논문 개요

Kimi K3는 장기 코딩·에이전트·추론·시각 작업을 포괄하는 공개 MoE 모델을 제시한다. Kimi Delta Attention과 Attention Residuals로 긴 시퀀스와 깊이에 걸친 정보 흐름을 개선하고, Stable LatentMoE로 토큰별 전문가를 활성화한다. 일반·에이전트·코딩 영역의 강화학습 후학습과 장기 실행 인프라도 함께 다룬다. 평가에서 저자들은 여러 작업군의 프런티어 수준 성능과 전체 가중치 공개를 보고한다.

arXiv 원문 ↗
02

PhiZero: 물리 언어로 추론하는 세계 모델

PhiZero: A World Model Built Around Physical Language

저자: Shuyao Shang 외 6명 · 2026-07-30

논문 개요

PhiZero는 미래 영상을 픽셀 공간에서 직접 예측하는 대신, 세계 상태 전이를 이산적 물리 언어로 표현한다. 야생 영상에서 자기지도 방식으로 물리 언어를 학습한 뒤, 미래의 물리적 변화를 먼저 추론한다. 이 전이 열을 바탕으로 영상을 렌더링하는 reason-then-render 방식을 사용한다. 생성·이해 벤치마크에서 물리적으로 일관된 세계 변화 모델링을 검증하고, 상호작용 모델링·행동 조건 시뮬레이션·제로샷 동작 전이 가능성을 보인다.

영상 경험→물리 언어 전이 추론→영상 렌더링
arXiv 원문 ↗
03

Frontis-MA1: ML 엔지니어링의 재귀적 자기개선

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

저자: Junlin Yang 외 23명 · 2026-07-30

논문 개요

Frontis-MA1은 기계학습 엔지니어링을 AI가 AI 구축 과정을 개선하는 실행 가능한 시험대로 삼는다. OpenMLE는 실행 피드백 환경, 연산자 학습, 장기 탐색을 하나의 스택으로 묶고, 35B 모델은 프로그램 진화 연산자를 실행 기반 SFT와 RL로 학습한다. 이후 이 연산자를 장기 탐색에 조합해 학습과 진화를 한 루프로 연결한다. 저자들은 MLE-Bench Lite와 NatureBench Lite에서 성능 향상 및 전이를 보고하며 가중치와 스택을 공개한다.

실행 과업→진화 연산자 학습→장기 탐색
arXiv 원문 ↗
04

TurboVLA: 경량 경로의 실시간 로봇 VLA

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

저자: Hengyi Xie 외 9명 · 2026-07-29

논문 개요

TurboVLA는 시각 정보를 대형 언어 모델 공간으로 투영하는 기존 V→L→A 경로의 계산·메모리 부담을 줄이려 한다. 시각 관찰과 언어 지시를 독립적으로 인코딩하고, 가벼운 양방향 상호작용으로 정보를 교환한 뒤 연속 행동 청크를 예측한다. 즉 V+L→A의 직접 매핑으로 과업 조건 표현을 만든다. LIBERO 평가에서 대형 정책과 맞먹거나 앞서는 결과를 보고한다.

시각 관찰·언어 지시→경량 상호작용→행동 청크
arXiv 원문 ↗
05

JarvisHub: 캔버스를 작업 상태로 쓰는 창작 에이전트

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

저자: Yunlong Lin 외 25명 · 2026-07-26

논문 개요

JarvisHub는 장기 멀티모달 창작에서 중간 산출물·버전·피드백이 사라지는 문제를 다룬다. 편집 가능한 캔버스를 사용자 작업공간이자 에이전트의 외부 메모리·행동 공간·공유 프로젝트 상태로 취급한다. 멀티모달 산출물과 의존성, 버전, 피드백을 타입이 있는 캔버스 노드와 링크로 표현하고 세 계층 구조로 에이전트 실행을 연결한다. 사용자는 이 상태를 살피고 수정하며 장기 창작 자동화에 개입할 수 있다.

캔버스 상태→에이전트 실행→생성·수정·정리
arXiv 원문 ↗
06

DistillAlign: 비디오 증류의 분포 정렬

DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation

저자: Jiaxing Li 외 9명 · 2026-07-29

논문 개요

DistillAlign은 자기회귀 비디오 증류에서 초기화와 DMD 단계가 서로 다른 목표 분포를 향할 수 있다는 문제를 분석한다. 공유 잠재 공간에서 학생·교사 분포의 정밀도와 커버리지를 측정하는 평가 프로토콜을 도입한다. 저자들은 mode-seeking DMD 목표에 Consistency Distillation 기반의 mode-covering 제약을 결합한다. 실험은 생성 품질·커버리지·다양성 향상과 함께, Wan-1.3B 교사로도 Wan-14B 기반선보다 나은 결과를 보고한다.

arXiv 원문 ↗

기타 Hugging Face 논문

07

K12-KGraph: 교육과정 구조를 평가하는 지식 그래프

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

저자: Hao Liang 외 7명 · 2026-07-23

논문 개요

K12-KGraph는 시험 문답 중심 평가가 포착하지 못하는 교육과정 구조 이해를 다룬다. 중국 인민교육출판사 초중고 수학·물리·화학·생물 교과서에서 교육과정 정렬 지식 그래프를 추출한다. 이 그래프에서 다중선택 벤치마크와 그래프 유도 지도미세조정 데이터를 만들고, 텍스트와 시각 감독의 결합을 비교한다. 실험은 현 모델의 한계와 도메인 감독의 개선 가능성을 함께 보고한다.

arXiv 원문 ↗
08

VideoCoCo: 실행 코드로 물리 일관성을 만드는 비디오 생성

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

저자: Haodong Li 외 27명 · 2026-07-29

논문 개요

VideoCoCo는 텍스트 프롬프트만으로는 장면의 시간적 물리 변화를 충분히 제어하기 어렵다는 문제를 다룬다. 코딩 에이전트가 장면과 시간 변화를 명시한 Blender 프로그램을 만들고, 시뮬레이션 엔진이 결정론적 시공간 초안을 실행한다. 생성 비디오 엔진은 이 초안을 조건으로 사실적 영상으로 편집한다. 저자들은 초안·지시·목표 삼중항 데이터와 두 벤치마크의 개선 결과를 보고한다.

텍스트 프롬프트→Blender 코드·시뮬레이션→초안 조건 영상 편집
arXiv 원문 ↗

신규 arXiv 논문 3편

09

RL과 SFT 추론의 내부 표현 비교

Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

저자: Aishwarya Balwani · 2026-07-31

논문 개요

이 논문은 수학 추론에서 RL 미세조정 모델이 SFT 모델보다 나은 이유를 내부 표현 관점에서 조사한다. 계층별 은닉 상태에 선형 프로브를 학습해 답의 정오 예측 가능성을 비교하고, 평균 절제 연구로 계층 중요도를 본다. RL 모델은 더 선형 분리 가능한 구조와 깊은 계층으로 갈수록 커지는 중요도를 보인다고 저자들은 보고한다. 반복 샘플링의 토큰 수 변동으로 적응적 계산 할당도 분석한다.

arXiv 원문 ↗
10

혼합 동기 LLM 다중 에이전트의 목표 불일치

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

저자: Golnoosh Farnadi · 2026-07-31

논문 개요

이 논문은 정보가 비대칭이고 목표가 충돌할 수 있는 다중 에이전트 환경에서 목표 불일치를 평가한다. 늑대인간 게임에서 한 에이전트의 목적만 바꾸되 역할은 유지하는 실험 틀을 제안한다. 네 모델 계열·여러 역할·목적 조건에서 내부 추론과 공개적 cheap-talk, 게임 결과를 함께 분석한다. 저자들은 불일치가 결과를 훼손하며 내부 전략 변화가 공개 행동에서는 대체로 보이지 않는다고 보고한다.

arXiv 원문 ↗
11

ClinLens: 장기 멀티모달 임상 데이터 코딩 에이전트

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

저자: Jindong Han · 2026-07-31

논문 개요

ClinLens는 이질적인 장기 임상 기록을 감사 가능한 분석으로 바꾸는 코딩 에이전트를 평가한다. 연결된 다섯 MIMIC 자원에서 200개의 실행 과업을 만들고, 환자 시간 범위와 분석 역량을 교차한 분류 체계를 둔다. 프로그램 우선 역합성으로 참조 워크플로와 산출물·코호트·시간 의미·최종 답을 검사한다. 표준화된 설정의 실행 성공과 엄격한 정답 통과 사이에 큰 차이가 있음을 보고한다.

임상 기록→참조 워크플로 실행→감사 가능한 분석
arXiv 원문 ↗

뉴스

국내

오픈AI, 차세대 '아스트라' 비공개 시연…"에이전트 패러다임 전환"

출처: AI타임스 · 2026-08-01 08:27

  • 요약 오픈AI, 차세대 '아스트라' 비공개 시연…"에이전트 패러다임 전환"
  • 세부 오픈AI가 장시간 소요되는 고난도 과제를 효율적으로 처리할 수 있는 차세대 AI 모델 라인업 '아스트라(Astra)'를 개발하고 정식 출시를 위한 막바지 준비에 돌입한 것으로 알려졌다.디 인포메이션은 31일(현지시간) 샘 알트먼 오픈AI CEO가 미국 워싱턴 D.C.를 방문해 주요 정책 입안자 및 규제 당국 관계자들을 대상으로 아스트라의 주요 기능을 비공개
원문 ↗

국내

[7월31일] 오픈AI, GPT-5.6 가격 인하의 비결은 '컴퓨트 멀티플라이어'

출처: AI타임스 · 2026-08-01 07:00

  • 요약 [7월31일] 오픈AI, GPT-5.6 가격 인하의 비결은 '컴퓨트 멀티플라이어'
  • 세부 오픈AI가 'GPT-5.6' 라인업의 가격을 대폭 인하했습니다. 가장 저렴한 모델인 'GPT-5.6 루나'는 API 가격을 무려 80% 낮췄으며, 'GPT-5.6 테라'도 20% 인하했습니다. 일부에서는 이번 조치로 기업공개(IPO)를 앞둔 오픈AI의 수익성이 나빠질 수도 있다고 지적했습니다. 그러나 이번 조치는 단순한 마케팅이나 가격 경쟁의 차원은 아닌
원문 ↗

국내

구글, 휴머노이드 전신 제어 AI '제미나이 로보틱스 2' 공개

출처: AI타임스 · 2026-07-31 18:03

  • 요약 구글, 휴머노이드 전신 제어 AI '제미나이 로보틱스 2' 공개
  • 세부 구글 딥마인드가 AI를 디지털 영역에서 실제 물리 세계로 확장하기 위한 핵심 기술을 공개했다. 새로운 ‘제미나이 로보틱스 2(Gemini Robotics 2)’는 로봇이 주변 환경을 이해하고 스스로 작업 계획을 세우며, 손끝부터 다리까지 전신을 제어할 수 있도록 설계된 차세대 로봇 AI 모델이다. 구글 딥마인드는 30일(현지시간) 로봇이 인간처럼 주변 환경
원문 ↗

국내

모레, 공간지능형 AI 플랫폼 만든다...“검증하고 제품화 할 것”

출처: THE AI · 2026-07-31 16:03

  • 요약 모레, 공간지능형 AI 플랫폼 만든다...“검증하고 제품화 할 것”
  • 세부 모레가 전북대학교와 피지컬 AI 핵심 원천기술에 대한 기술이전 계약을 체결하고, 국방·공공안전 분야를 위한 공간지능형 AI 플랫폼 개발에 나섰다고 밝혔다.이번 계약을 통해 모레는 전북대학교 전자공학부 조형기 교수 연구팀이 개발한 전역 위치 결정 방법 및 장치, 시각언어 지도 구축 방법 및 장치, 겹침 영역 추정 기술을 이용한 3차원 지도 병합 방법 등 피지
원문 ↗

해외

Advancing responsible AI across Europe

출처: OpenAI · 2026-08-01 00:00

  • 요약 Advancing responsible AI across Europe
  • 세부 OpenAI shares how its safety, security, transparency, and provenance practices support responsible AI governance in Europe. The work will continue as the EU AI Act advances.
원문 ↗

해외

Building abundant intelligence

출처: OpenAI · 2026-08-01 00:00

  • 요약 Building abundant intelligence
  • 세부 A full-stack approach to making advanced AI more capable, more affordable, and more widely useful.
원문 ↗

해외

Univé builds an AI-ready workforce

출처: OpenAI · 2026-07-31 16:00

  • 요약 Univé builds an AI-ready workforce
  • 세부 See how Univé built an AI-ready workforce with ChatGPT Enterprise by combining leadership, responsible governance, and employee-led innovation to transform work at scale.
원문 ↗

해외

OpenAI reportedly finds evidence that more of its agents ran amok

출처: TechCrunch AI · 2026-08-01 07:47

  • 요약 OpenAI reportedly finds evidence that more of its agents ran amok
  • 세부 OpenAI has reportedly found evidence of additional agent misbehavior as it looks into the incident that occurred with Hugging Face.
원문 ↗

해외

India is starting to pay for apps, not just download them

출처: TechCrunch AI · 2026-08-01 06:07

  • 요약 India is starting to pay for apps, not just download them
  • 세부 India's app market generated a record $345 million in Q2.
원문 ↗

블로그·HN

Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)

출처: Simon Willison · 2026-08-01 08:13

  • 요약 Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)
  • 세부 Tuesday was Stateless MCP day - the rollout of MCP 2.0, or the 2026-07-28 Model Context Protocol specification to use the more formal but less memorable name. This is the most significant change to th
원문 ↗

블로그·HN

LWiAI Podcast #252 - GPT 5.6, Grok 4.5, Nemotron-Labs-Diffusion, AI 2040

출처: Last Week in AI · 2026-07-21 21:03

  • 요약 LWiAI Podcast #252 - GPT 5.6, Grok 4.5, Nemotron-Labs-Diffusion, AI 2040
  • 세부 GPT-5.6 and Grok 4.5, Meta's Muse Spark 1.1, regulatory developments in AI and data centers, interpretability research from Anthropic, and the future of AI policy with AI 2040
원문 ↗

블로그·HN

Tailscale didn't stop the Hugging Face intrusion

출처: Hacker News 100+ · 2026-08-01 04:03

  • 요약 Tailscale didn't stop the Hugging Face intrusion
  • 세부 Article URL: https://tailscale.com/blog/hugging-face-intrusion Comments URL: https://news.ycombinator.com/item?id=49127306 Points: 368 # Comments: 150
원문 ↗

블로그·HN

Golang proposal: container/: generic collection types

출처: Hacker News 100+ · 2026-08-01 03:39

  • 요약 Golang proposal: container/: generic collection types
  • 세부 Article URL: https://github.com/golang/go/issues/80590 Comments URL: https://news.ycombinator.com/item?id=49127031 Points: 109 # Comments: 63
원문 ↗