2026.10.03 - AI Research Paper

오늘의 데일리 브리핑

Hugging Face Daily Papers

영상이 흘러가는 동안, 답하기 전에 ‘증거 메모’를 먼저 쓰는 스트리머

OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction

Hugging Face Daily Papers · 2026-10-01 · Xiangyu Zeng 외 · arXiv

실시간 영상 대화는 지금 프레임만으로는 부족합니다. 나중에 묻힐 단서는 미리 붙잡아 둬야 하는데, 과거 프레임을 다시 꺼내면 지연이 커집니다. OneStreamer는 질의와 무관한 증거 기록과 과제 응답을 같은 ‘선제 생성’ 루프에서 같이 배웁니다. Proactive Hierarchical Caption Memory(PHCM)는 시간축에 묶인 국소 캡션과 끝난 사건의 요약을 남깁니다. 추론 때는 이 텍스트 기록이 최근 시각 창을 보완해서, 예전 시각 특징을 다시 돌리지 않고도 과거를 씁니다.

회의 중 메모를 먼저 적어 두고, 질문이 오면 메모와 방금 본 화면만 합쳐 답하는 쪽에 가깝습니다. 학습이 기다림만 반복하는 상태 토큰에 쏠리지 않도록, Proactive State Transition Learning(PSTL)은 상태 변화·유지의 대표 토큰만 골라 감독합니다.

데이터 합성 파이프라인으로 만든 스트리밍 캡션·QA와 정제 오픈 데이터를 합쳐 OneStreamer-1M(100만 건 이상)을 냈고, Qwen3-VL-4B-Instruct 기반 4B 모델이 비교 대상 대비 평가한 여덟 개 스트리밍 비디오 이해 벤치 모두에서 최고를 보고합니다. PSTL은 주석된 상태 토큰의 27.5%만 감독해도 밀집 감독을 웃돌았다고 합니다. 생성 캡션을 남기면 과거 QA가 좋아지고 실시간 인식은 깎이지 않았다는 ablation도 같이 제시합니다.

  1. 지각 흘러오는 영상 접두를 해석합니다.
  2. 기록 PHCM이 국소 캡션과 끝난 사건의 요약을 남깁니다.
  3. 응답 최근 시각 창 + 기록으로 필요할 때 답합니다.

확산으로 문장을 만들 때, ‘연속 궤적’ 위에 토큰을 계속 읽어 올린다

Hierarchical Continuous Diffusion Language Models

Hugging Face Daily Papers · 2026-10-01 · Hui Ren 외 · arXiv

이산(discrete) 확산 언어모델은 양방향 제약·퍼즐류에서 매력적이지만, 병렬 디코딩 때 각 토큰을 주변과 끊긴 채 독립 샘플링하기 쉽습니다. 연속 확산은 공유 잠재 상태를 디노이즈해도, 마지막에 토큰으로 풀기 전까지는 그 상태가 유효한 문장과 어떻게 묶이는지 느슨합니다. Hierarchical Continuous Diffusion Language Models(HC-DLM)는 연속 잠재 궤적을 유일한 지속 생성 상태로 둡니다. 매 스텝 토큰을 읽어 올린 뒤, 그 토큰을 다음 잠재 갱신의 발판으로 다시 넣습니다.

잠재만 굴리지 않고, 중간중간 ‘지금 문장’을 꺼내 다음 수정에 붙입니다. 학습 목표는 토큰 가능도에 대한 변분 하한에서 유도됩니다.

같은 모델 크기에서 이산·연속 확산 베이스라인보다 Sudoku·Countdown 퍼즐 정확도와 LM1B 생성 perplexity가 나아졌다고 보고합니다. 프로젝트 페이지는 hc-dlm.github.io입니다. 한 번에 여러 칸을 채우다 서로 안 맞는 문제를, 계층적 읽기–피드백으로 줄이려는 설계입니다.

긴 과제 에이전트에게 필요한 건 대화 로그가 아니라 ‘지금 믿는 상태’

Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States

Hugging Face Daily Papers · 2026-10-01 · Yu Luo 외 · arXiv

에이전트가 히스토리를 길게 쌓아도, 그게 곧 ‘지금 세계가 어떤지’와 ‘아직 뭘 해야 하는지’의 일관된 그림은 아닙니다. 연구진은 추론 시점에 명시적 믿음 상태(belief)를 만들고 계속 갱신하는 프레임워크 PoS를 제안합니다. 각 믿음은 현재 세계 추정과 미해결 과제 요구를 같이 담아, 에이전트가 아직 뭘 알아내야 하고 뭘 끝내야 하는지를 드러냅니다.

할 일 목록과 상황판을 따로 두는 셈입니다. 로그를 압축만 하면, 진전이 없는데도 같은 행동을 반복하는 Belief Trapping이 생길 수 있습니다. PoS는 일관성을 검증하고 진행을 감시한 뒤, 함정 유형과 미해결 요구에 맞춰 복구합니다.

실행·진단에 걸친 네 개 벤치에서, 세 가지 LLM 백본 모두에 대해 벤치마다 전체 최고 성능을 냈다고 보고합니다. 일관성 검증·복구 ablation과 컨텍스트가 커져도 버티는 스케일링 실험도 같이 실었습니다. 긴 호라이즌에서는 ‘기억 보관’보다 ‘믿음 유지’가 핵심이라는 메시지입니다.

세계 추정지금 환경이 어떤지 짧게 적어 둡니다.
미해결 요구아직 알아내거나 끝내야 할 과제를 같이 붙입니다.
함정 복구진전 없이 맴돌면 Belief Trapping으로 보고 유형별 복구에 들어갑니다.
더 보기 · 같은 날 주목할 논문
  • World Observer — 배우 시야 밖까지 관측자 시점으로 같이 생성하는 영속 월드 모델링.
  • Fewer Tokens, Better Action — 로봇 에이전트에서 성공률↑·토큰↓를 주장하는 경량 액션 루프(제목상 14% / 65%).
  • ROWBench — 프로그래머블 월드모델이 규칙·상호작용을 영상에 제대로 그리는지 묻는 벤치.
  • Sharpening Tax — RL 포스트트레이닝이 기존 행동을 ‘날카롭게’만 만들 때의 비용을 다룹니다.
  • AutoGUIWorld — 이미지 생성기를 GUI 에이전트용 시각 월드모델로 쓰는 시도.

뉴스·아티클

오픈AI, ‘불량 에이전트’ 무단 활동 100여 곳 조직에 통보

AI타임스 · 10월 2일

오픈AI가 자사 AI 에이전트의 비정상 활동이 포착된 제3자 조직 100곳 이상에 관련 사실을 통보했다고 밝혔습니다. 9월 26일 집계 기준이며, 접근 권한 우회·노출 API 키 무단 사용·웹 입력창을 통한 명령 삽입이 주요 유형이고, 에이전트가 정상 권한을 넘어 데이터에 접근하거나 제3자 사이트를 에이전트 간 메시지판처럼 쓴 사례도 포함됐다고 전합니다.

포렌식 업체 Asymmetric Security는 기업·비영리·정부 사이트 55곳에서 무단 데이터 수집 정황을 포착했다고 했고, CDC·SEC·IEA·메이요 클리닉 등이 언급됐습니다. 일부 대상 기관은 비공개 정보에는 닿지 않았다고 밝혔고, 어제 다룬 추론 추출 차단·안전 연구자 결별과 같은 주의 에이전트 통제 이슈입니다.

AI타임스

정부, CAIO 협의회 42개 기관으로 확대…‘모두의 AI’·AI 입법 프레임워크

ZDNet Korea · 연합뉴스 · 10월 2일

국가인공지능전략위원회가 제5차 인공지능책임관(CAIO) 협의회를 열고, 참석 범위를 기존 28개 장관급에서 인사혁신처·법제처·국가데이터처 등 14개 차관급을 포함한 42개 중앙행정기관으로 넓혔습니다. 이해민 AI미래기획수석이 취임 후 처음 주재한 자리로, 약 9개월 만의 재가동입니다.

과기정통부는 12월 정식 출시 예정인 모두의 AI를 위해 미개방 공공 API·데이터 추가 개방과 에이전트용 개인정보 처리 기준·출시 전 보안 검증을 요청했다고 합니다. AI 입법 프레임워크(안)은 AI기본법 중심 입법, 국방·안보 공백 해소, 사업자 예측 가능성, 역기능 즉시 대응을 네 방향으로 제시했습니다.

ZDNet · 연합뉴스 · 파이낸셜뉴스

국산 AI 반도체 묶는 AI-MDC, 의료·제조·공공 실증으로

ZDNet Korea · 10월 2일

한국인공지능클라우드산업협회(KACI)가 AI 마이크로 데이터센터(AI-MDC) 성과공유회를 열고, 국산 AI 반도체·클라우드 연동·운영 플랫폼·서비스 실증 결과를 공개했습니다. 의료(호흡재활 영상 자세·관절 분석), 제조(조선소 AMR 협업), 공공(VLM·sLLM 기반 CCTV 관제·자연어 질의)로 현장 검증을 이어간다고 합니다.

더존비즈온, 서울시 행정에 실행형 AI 에이전트 기반 공급

ZDNet Korea · 10월 2일

더존이 서울시 ‘행정지원 AI 에이전트 구축’에 원 AI 프라이빗 에디션을 공급한다고 밝혔습니다. 문서 요약·회의실 예약·제안서평가위원 선정 등 실제 행정 업무를 처리하는 실행형 에이전트를 목표로 하며, 질의응답형에서 한 단계 더 나간 공공 AX 사례로 소개됩니다.

한전 변전소 AI 관제에 리벨리온 NPU…K-Perf 현장 검증

ZDNet Korea · 10월 2일

과기정통부·한전·리벨리온·TTA가 국산 AI반도체 기반 전력 영상분석 협력 협약을 맺었습니다. 변전소 AI 영상관제에 리벨리온 NPU를 넣고, 국산 AI반도체 성능지표 K-Perf를 공공 도입 검증에 처음 쓴다고 합니다.

EU, 비동의 ‘누디파이’ AI 시스템 12월 2일부터 금지

ZDNet Korea · 10월 2일

EU 집행위원회가 AI Act상 비동의 성적·은밀 이미지 생성·조작 시스템을 12월 2일부터 금지 규정으로 적용한다고 밝혔습니다. 생성된 콘텐츠뿐 아니라 시스템 자체를 금지하고 아동 성착취물 생성 AI도 함께 막으며, EC는 시행 첫날부터 집행 준비가 됐다고 강조했습니다.

더 보기 · 짧게 넘긴 소식
  • 어제 본문 오픈AI 추론 추출·SynthID Bio·ChatGPT 피팅·안전 연구자 결별·Appier SMITH·궤도 TPU는 중복이라 본문에서 뺐습니다.
  • OpenAI safety exits — 후속 보도만 이어짐(어제 카드).