기술 제원 및 공개 범위
전체 2.8T 매개변수 중 추론 시 104B를 활성화하는 MoE(Mixture of Experts) 구조의 Kimi K3가 오픈 웨이트로 공개됐다. 코딩, 에이전트, 장문 문맥 처리 및 채팅에 최적화된 이 모델은 네이티브 비전 기능을 탑재했으며, 최대 1,048,576토큰의 문맥 창을 지원한다. MoE 가중치에는 MXFP4 형식이 사용됐으며, 전체 정밀도(Full Precision) 상태로 추론하기 위해서는 1.56TB의 저장 공간과 메모리가 필요하다.
모델의 가중치는 Unsloth를 통해 GGUF 양자화 버전으로 제공되어 로컬 환경에서의 실행 가능성을 높였다. NVIDIA DGX Station이나 128GB RAM이 탑재된 Mac Studio 등 고사양 하드웨어에서 구동할 수 있으며, 사용자는 RAM과 VRAM 또는 통합 메모리의 합계가 양자화 파일 크기와 일치하는 환경을 구성해야 한다. 메모리가 부족할 경우 디스크 오프로딩이 작동하지만, 이 경우 추론 속도가 크게 저하된다.
양자화 메커니즘과 비전 구조
양자화 수준에 따라 모델의 정확도와 메모리 요구량이 크게 갈린다. Unsloth가 제공하는 UD-IQ1_S 버전은 594GB의 크기로 무손실 버전보다 62% 작지만, Top-1 정확도는 약 78.875%를 기록했다. 반면 UD-Q2_K_XL 버전은 861.3GB의 크기에서 약 90.39%의 정확도와 1.7359의 Perplexity(혼잡도)를 보였다. 특히 커뮤니티에서 제공한 IQ2_XXS 버전이 725GB 크기에서 Perplexity 96을 기록한 것과 달리, Unsloth의 UD-IQ2_XXS는 711GB 크기에서 2.12를 기록해 동적 양자화와 보정의 중요성을 입증했다.
비전 타워의 구조적 변화는 Kimi K2.5와 차별화된다. RMSNorm을 도입하고 bias를 제거했으며, 융합 QKV(Query-Key-Value)가 비정방형으로 설계되어 qkv width가 n_embd와 일치하지 않는다. 또한 projector 뒤에 정규화를 적용하고, 대규모 배치 처리 시 발생하는 실패를 방지하기 위해 메모리 예산을 n_tokens * 40에서 n_tokens * 160으로 확장했다.
추론 과정에서는 사고 흔적을 유지하는 thinking-only 방식이 적용된다. Instant 모드는 지원하지 않으며, API의 `reasoning_effort` 필드를 통해 "low", "high", "max" 중 사고 수준을 선택할 수 있다. 기본 설정은 `preserve_thinking`이 활성화된 상태이며, 사고 수준은 "max"로 지정된다. 추론 매개변수는 temperature=1.0, top_p=0.95 또는 1.0을 권장한다.
인프라 요구사항 및 실행 방법
하드웨어 성능의 경우, B200 GPU 환경에서 초당 약 20토큰의 생성 속도와 120토큰 이상의 처리량을 확보할 수 있다. 웹 기반의 Unsloth Studio를 이용하면 macOS, Windows, Linux 환경에서 RAM 오프로딩과 다중 GPU 구성을 자동으로 감지해 실행할 수 있다.
bash
macOS, Linux, WSL 설치
curl -fsSL https://unsloth.ai/install.sh | sh
Windows PowerShell 설치
irm https://unsloth.ai/install.ps1 | iex
unsloth studio
비전 기능을 포함한 로컬 추론을 위해서는 범용 llama.cpp가 아닌 Unsloth 전용 포크를 빌드해야 한다. 아래는 비전 지원을 위한 빌드 및 실행 절차다.
git clone https://github.com/unslothai/llama.cpp
cd llama.cpp
git fetch origin pull/48/head:kimi-k3-fullsize-vision
git checkout kimi-k3-fullsize-vision
cd ..
cmake llama.cpp -B llama.cpp/build -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp실행 예시
./llama.cpp/llama-cli \
--model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf \
--mmproj unsloth/Kimi-K3-GGUF/mmproj-BF16.gguf \
--temp 1.0 \
--top-p 0.95
실무자가 도입 시 고려해야 할 핵심은 비전 기능 사용 여부에 따른 llama.cpp 포크 빌드 필수성과, 79%와 90%라는 정확도 차이를 결정짓는 UD-IQ1_S와 UD-Q2_K_XL 사이의 메모리 가용량 확보 여부다.




