실시간 음성 제어 영상 생성
Vidu S1: A Real-Time Interactive Video Generation Model
논문 개요
음성 지시로 디지털 캐릭터가 나오는 영상을 실시간 제어하는 생성 모델을 제안한다. 사용자는 생성 도중에도 음성으로 내용을 바꿀 수 있으며, 저자들은 장시간 생성에서 흐림·드리프트·시각 왜곡을 줄이는 것을 목표로 둔다. TurboDiffusion과 TurboServe를 결합해 일반 소비자 GPU에서의 실시간 출력을 겨냥했다.
- 음성 지시를 생성 중 입력으로 받아 영상 내용을 제어한다.
- TurboDiffusion·TurboServe 기반 실시간 생성 구조를 사용한다.
- 무한 길이의 실시간 생성 지원을 주장한다.
- 실인물·애니메이션·반려동물 이미지 업로드와 음성 톤 선택을 지원한다.
- 일반 소비자 GPU에서 최대 540p·42 FPS로 제시됐다.
- 평가 세부 수치는 초록 발췌 범위에 한정된다.