완전 공개형 범용 비디오 이해 모델
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
논문 개요
VideoChat3는 일반·장편·스트리밍 영상 전반에서 작동하는 공개 비디오 MLLM을 목표로 한다. I3D-ViT와 스트리밍용 적응형 프레임 해상도로 시공간 표현과 처리 비용을 함께 다룬다. 세 종류의 합성·정제 데이터셋을 구성해 도메인 일반화를 넓혔다. 실험에서는 4B 파라미터로 동급 또는 더 큰 공개 모델을 앞섰다고 보고한다.
원문 보기 ↗연구 목표
- 다양한 영상 유형의 일반화와 처리비용을 함께 낮추는 것
핵심 방법
- I3D-ViT·적응형 프레임 해상도·3개 데이터셋
주요 결과
- 일반·장편·스트리밍 벤치마크에서 동급/대형 공개 모델 상회
핵심 수치·조건
- 4B 파라미터