Kimi K3: 공개 프런티어 지능 모델
논문 개요
2.8조 매개변수 MoE 모델 Kimi K3를 제시하며, 토큰마다 896개 전문가 중 16개를 활성화한다. Delta Attention·Attention Residuals와 Stable LatentMoE를 결합해 긴 시퀀스와 깊은 모델에서의 정보 흐름을 다룬다. 일반·에이전트·코딩 영역의 강화학습과 100만 토큰 컨텍스트를 함께 사용한다. 저자들은 장기 코딩, 에이전트, 지식·추론·비전 평가에서 프런티어 수준 성능을 보고하며 가중치를 공개한다.
원문 보기 ↗- 2.8T MoE, 활성 파라미터 104B
- 100만 토큰 컨텍스트와 비전 기능
- Kimi K2 대비 전체 스케일링 효율 약 2.5배
- 평가상 최강 독점 모델에는 뒤처진다고 명시