VideoChat3: 효율성과 범용성을 함께 겨냥한 공개 비디오 MLLM
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
논문 개요
VideoChat3는 다양한 비디오 유형에서의 일반화, 처리 비용, 재현성 부족을 함께 다룬 완전 공개 비디오 중심 MLLM이다. I3D-ViT와 스트리밍 영상용 적응형 프레임 해상도로 시공간 표현과 입력 처리 비용을 조정한다. 일반·장편·스트리밍 장면을 포괄하는 세 합성 데이터셋으로 학습하며, 4B 파라미터에서 동급 또는 더 큰 기존 공개 모델을 여러 벤치마크에서 앞섰다고 보고한다.
원문 보기 ↗연구 목표
- 다양한 비디오 조건을 다루는 공개 모델 구성
핵심 방법
- I3D-ViT와 적응형 프레임 해상도
주요 결과
- 일반·장편·스트리밍 벤치마크 비교
핵심 수치·조건
- 4B 파라미터