Kimi K3: 2.8T MoE 기반 오픈 프런티어 모델
Kimi K3: Open Frontier Intelligence
MoELong contextAgentic RL논문 개요
Kimi K3는 native vision과 100만 토큰 context를 갖춘 2.8T-parameter MoE 모델이다. Delta Attention·Attention Residuals와 Stable LatentMoE를 결합하고, 긴 agentic rollout 및 sandbox state를 포함한 RL 인프라까지 함께 설계해 long-horizon coding·agent·reasoning·vision 작업을 겨냥한다.
arXiv 원문 보기 ↗연구 목표
- 오픈 가중치 모델로 frontier 수준의 범용·장기 실행 성능을 확보한다.
핵심 방법
- KDA, Attention Residuals, Stable LatentMoE와 도메인별 RL을 알고리즘·시스템 공동 설계로 통합.
주요 결과
- 저자 평가에서 다수의 open·proprietary 비교 모델을 앞서며, 최상위 proprietary 모델과의 차이는 남아 있다고 보고.
핵심 수치
- 총 2.8T parameter, 활성 104B, routed expert 896개 중 토큰당 16개 활성, 1M context. Kimi K2 대비 종합 scaling efficiency 약 2.5× 개선.