Kimi K3: 대규모 희소 전문가 모델의 공개
Kimi K3: Open Frontier Intelligence
논문 개요
Kimi K3는 긴 문맥과 시각 입력을 포함하는 MoE 모델을 제시한다. Delta Attention·Attention Residuals와 Stable LatentMoE로 정보 흐름과 전문가 활성화를 구성한다. 사후학습은 일반·에이전트·코딩 영역의 강화학습과 여러 추론 노력 수준을 포함한다. 논문은 장기 코딩·에이전트·지식·추론·시각 평가에서 프런티어 수준 성능을 보고하며 가중치를 공개한다.
연구 목표
- 긴 문맥·에이전트·코딩·시각 과제를 한 모델에서 다룬다.
핵심 방법
- 2.8조 파라미터 MoE에서 토큰당 896명 중 16명 전문가를 활성화한다.
주요 결과
- 평가 묶음에서 다른 공개·비공개 모델들을 앞섰다고 보고한다.
핵심 수치·조건
- 활성 파라미터 1,040억, 문맥 창 100만 토큰.
- K2 대비 전체 스케일링 효율 약 2.5배 개선.