3T급 모델 제원과 아키텍처 최적화

Kimi는 2.8조 파라미터 규모와 100만 토큰의 컨텍스트 윈도우를 갖춘 공개 모델 Kimi K3를 출시했다. Kimi K3는 네이티브 비전 기능을 지원하며 장시간의 코딩, 지식 작업, 추론 수행을 목표로 설계되었다. 현재 Kimi.com, Kimi Work, Kimi Code 및 Kimi API를 통해 즉시 사용할 수 있으며, 출시 버전은 최대 추론 노력(max reasoning effort)을 기본값으로 설정했다. Kimi는 전체 모델 가중치와 상세 기술 보고서를 2026년 7월 27일까지 공개할 예정이다.

Kimi는 Stable LatentMoE 구조를 적용해 896개의 전문가 중 16개만 활성화함으로써 Kimi K2 대비 전체 스케일링 효율을 약 2.5배 높였다. 긴 시퀀스에서 어텐션을 효율적으로 확장하기 위해 Kimi Delta Attention(KDA)을 도입했으며, 모델 깊이 방향에서 필요한 표현을 선택적으로 가져오는 Attention Residuals(AttnRes)를 통해 계층 표현을 최적화했다. 또한 라우터 점수 분위수에서 전문가 배분을 직접 계산하는 Quantile Balancing을 적용해 휴리스틱 업데이트와 민감한 균형 하이퍼파라미터를 제거했다.

Kimi는 각 어텐션 헤드를 독립적으로 최적화하는 Per-Head Muon을 통해 대규모 학습의 적응성을 높였다. 활성값을 제어하는 Sigmoid Tanh Unit(SiTU)과 어텐션 선택성을 높이는 Gated MLA를 함께 적용해 모델의 정밀도를 개선했다. 이러한 구조적 변경과 학습 데이터 레시피 개선을 결합해 3T급 모델의 거대 규모에서도 효율적인 추론과 학습이 가능하도록 구현했다.

인프라 구현 및 벤치마크 성능 검증

Kimi는 SFT 단계부터 양자화 인지 학습을 적용하고 MXFP4 가중치와 MXFP8 활성값을 사용하여 넓은 하드웨어 호환성을 확보했다. 대규모 전문가 병렬화 과정에서 발생하는 처리량 저하를 막기 위해 고정된 텐서 형태와 핵심 경로의 호스트 동기화를 제거한 완전 균형 전문가 병렬 학습 방식을 도입했다. 추론 시에는 넓은 고대역폭 통신 영역이 필요하므로 64개 이상의 가속기를 연결한 supernode 구성을 권장한다. 또한 KDA가 기존 prefix caching에 제기하는 문제를 해결한 구현체를 vLLM 커뮤니티에 기여해 모델 규모와 긴 컨텍스트에서도 경쟁력 있는 토큰 가격으로 서비스할 수 있는 기반을 마련했다.

Kimi K3는 코딩 분야의 Program Bench와 SWE Marathon에서 비교 모델 중 가장 높은 점수를 기록했다. Terminal Bench 2.1에서는 88.3점을 기록해 GPT 5.6 Sol의 88.8점에 근접한 수치를 보였다. 에이전트 작업의 BrowseComp, DeepSearchQA, Automation Bench, SpreadsheetBench 2에서도 표에 포함된 모델 중 최고점을 달성했다. 비전 분야의 OmniDocBench에서는 91.1점을 기록하며 가장 높은 성능을 보였으나, HLE-Full(43.5점) 및 도구 사용 HLE-Full(56.0점)에서는 Claude Fable 5(각각 53.3점, 63.0점)보다 낮은 결과를 기록했다.

GPU 커널 최적화에서는 AttnRes 커널의 순전파 및 역전파 시간을 283.6ms에서 114.4ms로 단축했다. MLA-512 기준 커널을 처음부터 작성해 517.8 TFLOPS를 달성했으며, 이는 H200 이론상 BF16 최고치의 절반을 넘는 수치다. 또한 MLIR 위에 자체 타일 단위 중간 표현을 구축한 MiniTriton GPU 컴파일러를 개발해 일부 작업에서 Triton 및 torch.compile보다 높은 성능을 냈다. 대체 업체 범용 GPU 환경에서도 FLA Triton KDA 구현을 최적화해 순전파와 역전파 시간을 기준 구현 대비 73.6% 단축했다.

실무 적용 사례와 운영 제약 사항

Kimi K3는 Nangate 45nm 라이브러리와 오픈소스 EDA 도구를 사용해 48시간 연속 자율 작업으로 소형 모델 구동 칩을 설계했다. 설계된 칩은 면적 4mm² 안에서 100MHz 타이밍을 충족하며, 시뮬레이션 기준 초당 8,700토큰 이상의 디코딩 처리량을 기록했다. 계산과학 분야에서는 20편 이상의 논문을 검토하고 3,000줄 이상의 Python 코드를 생성해 천체물리학의 I–Love–Q 보편 관계 재현 작업을 약 2시간 만에 완료했다. 이는 숙련된 연구자가 통상 1~2주 소요하는 작업량과 비교된다.

멀티모달 능력을 활용해 Three.js WebGPU 기반의 브라우저 3D 오픈월드 게임을 제작했으며, 56개 원본 클립을 활용해 프레임 단위 박자 동기화가 포함된 티저 영상을 편집했다. 지식 작업에서는 11,000페이지 이상의 자료와 87개 분기 보고서를 분석해 AI ASIC 산업 42년 분석 인터랙티브 웹사이트를 제작했다. 또한 20개 이상의 동시 하위 에이전트를 사용해 391개 중력파 사건을 분석하는 GWTC-5 중력파 분석 작업을 수행했다. Kimi Work에는 인터랙티브 구성 요소를 생성하는 Widgets와 이를 프로젝트별로 구성하는 Dashboard 기능을 추가해 시각적 연구 환경을 제공한다.

운영 시 Kimi K3는 사고 기록(Thought log) 전달 방식에 민감하게 반응하며, 모호한 상황에서 사용자를 대신해 과도하게 판단하는 제한점이 있다. K3는 이전 사고 기록을 보존하며 학습되었으므로, 세션 중간에 모델을 전환하거나 과거 사고 내용을 누락하면 생성 품질이 불안정해질 수 있다. 따라서 개발자와 실무자는 세션 중간의 모델 전환을 피하고, 행동 범위를 엄격히 제한해야 하는 애플리케이션의 경우 시스템 프롬프트나 `AGENTS.md` 파일에 명시적인 제약 조건을 설정해 모델의 자율 판단 범위를 제어해야 한다.