효율과 범용성을 함께 겨냥한 완전 공개 비디오 모델
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
논문 개요
비디오 이해는 동작·장편·스트리밍 장면까지 다뤄야 하지만, 기존 공개 모델은 범용성과 계산 효율, 재현성에서 제약이 있었다. VideoChat3는 이를 해결하기 위해 완전 공개 비디오 중심 MLLM을 제안한다. I3D-ViT와 스트리밍용 적응형 프레임 해상도로 시공간 표현과 영상 처리 비용을 함께 다룬다. 일반·장편·스트리밍 데이터셋을 합성하는 파이프라인을 결합해, 4B 파라미터로 같거나 더 큰 기존 공개 모델을 여러 벤치마크에서 앞섰다고 보고한다.