Kimi K3: 개방형 프런티어 지능
Kimi K3: Open Frontier Intelligence
논문 개요
2.8조 파라미터 MoE Kimi K3를 제안한다. 토큰마다 896개 중 16개 전문가를 활성화하고, Delta Attention·Attention Residuals로 긴 시퀀스와 깊이 방향의 정보 흐름을 개선한다. 일반·에이전트·코딩 영역의 강화학습과 100만 토큰 에이전트 롤아웃을 결합해 장기 실행을 학습했다. 평가에서는 장기 코딩·에이전트·지식·추론·비전 과제에서 프런티어 수준 성능을 보고한다.
arXiv 원문 ↗- 연구 목표
- 대규모 개방형 MoE의 장기 작업 성능을 평가한다.
- 핵심 방법
- Delta Attention·Residuals와 Stable LatentMoE를 결합한다.
- 지속 롤아웃·샌드박스 상태를 쓰는 에이전트 RL을 적용한다.
- 주요 결과
- 평가군에서 다른 비교 대상보다 일관되게 높았다고 보고한다.
- 핵심 수치·조건
- 2.8T 파라미터, 활성 104B
- 문맥 창 100만 토큰, 토큰당 전문가 16/896