효율과 범용성을 함께 노린 공개 비디오 이해 모델
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
논문 개요
VideoChat3는 일반·장편·스트리밍 영상에서 모두 작동하는 공개 비디오 중심 멀티모달 언어모델을 제안한다. I3D-ViT와 스트리밍용 적응형 프레임 해상도로 시공간 표현과 입력 처리 비용을 함께 다룬다. 세 종류의 합성·정제 데이터셋을 학습에 쓰고, 실험에서 동일하거나 더 큰 기존 공개 모델보다 4B 파라미터로 높은 효율과 성능을 보였다고 보고한다.
원문 보기 ↗- 연구 목표
- 범용 영상 이해
- 핵심 방법
- I3D-ViT·적응형 프레임 해상도
- 주요 결과
- 일반·장편·스트리밍 벤치마크에서 기존 공개 모델 상회
- 핵심 수치·조건
- 4B 파라미터; 3개 학습 데이터셋