영상이 흘러가는 동안, 답하기 전에 ‘증거 메모’를 먼저 쓰는 스트리머
OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
실시간 영상 대화는 지금 프레임만으로는 부족합니다. 나중에 묻힐 단서는 미리 붙잡아 둬야 하는데, 과거 프레임을 다시 꺼내면 지연이 커집니다. OneStreamer는 질의와 무관한 증거 기록과 과제 응답을 같은 ‘선제 생성’ 루프에서 같이 배웁니다. Proactive Hierarchical Caption Memory(PHCM)는 시간축에 묶인 국소 캡션과 끝난 사건의 요약을 남깁니다. 추론 때는 이 텍스트 기록이 최근 시각 창을 보완해서, 예전 시각 특징을 다시 돌리지 않고도 과거를 씁니다.
회의 중 메모를 먼저 적어 두고, 질문이 오면 메모와 방금 본 화면만 합쳐 답하는 쪽에 가깝습니다. 학습이 기다림만 반복하는 상태 토큰에 쏠리지 않도록, Proactive State Transition Learning(PSTL)은 상태 변화·유지의 대표 토큰만 골라 감독합니다.
데이터 합성 파이프라인으로 만든 스트리밍 캡션·QA와 정제 오픈 데이터를 합쳐 OneStreamer-1M(100만 건 이상)을 냈고, Qwen3-VL-4B-Instruct 기반 4B 모델이 비교 대상 대비 평가한 여덟 개 스트리밍 비디오 이해 벤치 모두에서 최고를 보고합니다. PSTL은 주석된 상태 토큰의 27.5%만 감독해도 밀집 감독을 웃돌았다고 합니다. 생성 캡션을 남기면 과거 QA가 좋아지고 실시간 인식은 깎이지 않았다는 ablation도 같이 제시합니다.
- 지각 흘러오는 영상 접두를 해석합니다.
- 기록 PHCM이 국소 캡션과 끝난 사건의 요약을 남깁니다.
- 응답 최근 시각 창 + 기록으로 필요할 때 답합니다.