1. 개방형 프런티어 지능을 겨냥한 Kimi K3
Kimi K3: Open Frontier Intelligence
논문 개요
Kimi K3는 2.8조 파라미터 MoE 모델에서 1,040억 파라미터를 활성화하고, 비전과 100만 토큰 문맥을 함께 다룬다. 저자들은 Kimi Delta Attention, Attention Residuals, Stable LatentMoE를 결합해 길이와 깊이에 따른 정보 흐름을 개선하는 방식을 제시한다. 일반·에이전트·코딩 영역의 강화학습과 장문맥 롤아웃 인프라를 후학습에 사용했다. 평가에서는 장기 코딩·에이전트·지식·추론·비전 과제의 프런티어 수준 성능을 보고하며, 모델 가중치 공개를 명시한다.
- 연구 목표
- 개방형 모델의 장문맥·에이전트 실행 성능 확장
- 핵심 방법
- Delta Attention·Stable LatentMoE·에이전트 RL
- 주요 결과
- 평가군에서 프런티어 수준 성능을 보고
- 핵심 수치·조건
- 2.8T 총량, 104B 활성, 100만 토큰