2026.09.29 - AI Research Paper

오늘의 데일리 브리핑

Hugging Face Daily Papers

실제 배포 로그로 에이전트 행동 시험 만들기

TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces

Hugging Face Daily Papers · 2026-09-27 · Dehai Min 외 · arXiv

쉽게 말하면

실제 서비스 로그에서 위험한 순간만 골라 다시 묻는 자동 채점입니다.

Before · 고정 시험미리 만든 문제만 통과하면 성공으로 칩니다.
After · TraceDance실제 서비스 로그에서 위험한 결정 시점을 뽑아 ‘그때 다음에 무엇을 할지’를 다시 묻습니다.

그 순간의 선택이 안전한지 다시 묻는 테스트입니다. 최신 대형 모델 평균 통과율 26.7%.

규모: 25만+ 세션 → 107개 벤치마크·4,125개 사례(구축 목표 충족 95.3%).

과학 이미지 생성 결과를 설명 가능하게 검증하기

SciGen-Verifier: A Multimodal Reasoner for Explainable Verification in Scientific Image Generation

Hugging Face Daily Papers · 2026-09-27 · Jiali Chen 외 · arXiv

쉽게 말하면

ChatGPT에게 코드 오류를 빨간펜으로 지적받듯, 생성한 회로도·그래프가 맞는지 이유와 고치는 법까지 적어 주는 검증기입니다.

한 줄로: O/X만 찍는 데서 끝나지 않고, 틀린 곳과 고치는 방법까지 바로 보여 줍니다.

악보 계획과 완곡 오디오를 하나로 잇는 음악 생성

YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality

Hugging Face Daily Papers · 2026-09-27 · Ruibin Yuan 외 · arXiv

쉽게 말하면

먼저 읽을 수 있는 악보를 쓰고, 그 계획을 따라 전체 곡 소리를 만드는 통합 음악 생성입니다.

  1. 악보 구성이 보이는 계획을 씁니다.
  2. 중간 표현 계획과 소리를 잇습니다.
  3. 완곡 오디오 들을 수 있는 곡으로 만듭니다.

숫자 한 줄: 전문가 선호는 계획이 있을 때 49.3% 대 없을 때 34.6%, SongBench 평균 6.73(8개 중 최고 6.96)입니다.

보상을 한 점이 아니라 분포로 추정하는 확산 보상 모델

Diffusion Reward Models

Hugging Face Daily Papers · 2026-09-27 · Xiangyang Wang 외 · arXiv

쉽게 말하면

앱스토어 별점처럼 평균 하나만 남기지 않고, 의견이 얼마나 갈리는지까지 남기는 보상 모델입니다.

쓸 때: 불확실하면 거절하거나 더 신중히 학습에 씁니다. 다섯 벤치마크에서 기존과 동등 이상을 보고했습니다.

뉴스·아티클

AMD, Fei-Fei Li의 World Labs를 82억 달러에 인수

AI타임스 · 9월 29일

전액 주식 약 11조 원 규모(Xilinx 다음으로 AMD 사상 두 번째). 공간·물리 시뮬레이션(월드 모델)을 칩 로드맵에 붙이려는 M&A로, 2026년 말 완료 예정입니다.

Gemini Live Avatar 공식 소개 이미지
Gemini Live Avatar · 원문

Gemini 3.8 Live에 Live Avatar 기능 추가

Google DeepMind · 9월 25일

실시간 대화에 입 모양·표정이 맞는 아바타를 붙입니다. 낮은 지연 스트리밍으로 Gemini Enterprise에서 제공됩니다.

Gemini 3.8 Flash TTS·Flash-Lite TTS 공개

Google DeepMind · 9월 24일

캐릭터·장면 대사용 음성 합성 두 모델. AI Studio·API·Enterprise와 보이스 스튜디오로 브랜드 보이스를 만들 수 있습니다.

더 보기 · 짧게 넘긴 3건