01
Kimi K3: 개방형 프런티어 지능
Kimi K3: Open Frontier Intelligence
논문 개요
Kimi K3는 비전 기능과 100만 토큰 문맥을 갖춘 2.8T MoE 모델을 제시한다. 논문은 Delta Attention과 Attention Residuals로 긴 시퀀스·깊은 층의 정보 흐름을 개선하는 설계를 설명한다. Stable LatentMoE는 토큰마다 896개 routed expert 중 16개를 활성화한다. 저자들은 학습·데이터 레시피를 함께 다듬어 Kimi K2 대비 전체 스케일링 효율이 약 2.5배 개선됐다고 보고한다.