Kimi K3: 공개 프런티어 MoE 모델
Kimi K3: Open Frontier Intelligence
MoE장문맥에이전트논문 개요
Kimi K3는 native vision과 100만 토큰 문맥을 포함하는 대규모 MoE 모델이다. Kimi Delta Attention·Attention Residuals·Stable LatentMoE와 에이전트·코딩 강화학습을 결합해 장기 실행을 겨냥한다. 저자들은 가중치를 공개하고, 장기 코딩·에이전트·지식·추론·시각 과제에서 프런티어급 성능을 보고한다.
arXiv 원문 보기 ↗연구 목표
- 긴 문맥과 복합 에이전트 작업을 공개 모델로 확장한다.
핵심 방법
- 토큰당 896개 routed expert 중 16개를 활성화하는 Stable LatentMoE.
주요 결과
- 평가 묶음에서 다수 공개·비공개 모델보다 높은 성능을 보고.
핵심 수치
- 총 2.8T, 활성 104B 파라미터 · 문맥 1M 토큰 · K2 대비 스케일링 효율 약 2.5배.