Unsloth(LLM 최적화 라이브러리)가 Qwen3.8-2.4T-A95B의 GGUF 양자화 모델과 로컬 실행 가이드를 공개했다. BF16 원본 4.89TB인 모델을 Dynamic 1-bit 버전으로 축소해 397GB까지 줄였다. 2-bit(657GB), 3-bit(956GB), 4-bit(1.31TB) 등 다양한 정밀도 버전을 함께 제공한다.
중요 레이어의 정밀도를 유지하는 Unsloth Dynamic 양자화 기술을 적용했다. 2.4T 파라미터 중 토큰당 95B를 활성화하는 MoE(전문가 혼합 모델) 구조다. 일반 PC가 아닌 수백 GB 메모리를 갖춘 고사양 워크스테이션에서 실행 가능하다.
Unsloth Desktop을 통해 Mac, Windows, Linux 환경에서 구동하며 RAM 오프로딩과 멀티 GPU를 지원한다. llama.cpp, Ollama, vLLM 등 주요 추론 엔진과 API 서빙이 가능하다. Qwen 개발팀은 이번 주 중 Qwen3.8-27B 모델을 공개할 예정이다.



