QAD 방식 적용으로 BF16 베이스라인 성능 최대 97.4% 보존
LFM 연구팀이 양자화 인식 증류(QAD, Quantization-Aware Distillation) 방식을 적용해 LFM2.5 모델 시리즈의 Q4_0 체크포인트를 공개했다. 이 방식은 기존 사후 훈련 양자화(PTQ, Post-Training Quantization) 대비 성능을 실질적으로 개선하며, BF16 베이스라인 성능을 모델별로 96.5%에서 97.4%까지 유지하는 결과를 보였다. 구체적인 성능 유지율은 LFM2.5-1.2B-Instruct가 97.4%로 가장 높았으며, LFM2.5-230M(97.1%), LFM2.5-2.6B(96.6%), LFM2.5-350M(96.5%) 순으로 기록됐다.
연구팀은 GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4 등 추론, 지시 이행, 도구 사용, 에이전트 능력을 측정하는 벤치마크 세트를 통해 성능을 검증했다. 수학 능력 평가의 경우 LFM2.5-230M과 350M 모델에는 GSM8K를, 1.2B-Instruct와 2.6B 모델에는 AIME25를 적용해 5회 반복 측정의 평균값을 산출했다.
배포된 체크포인트는 `llama.cpp` 및 GGUF Q4_0 아티팩트를 지원하는 런타임에서 즉시 사용 가능하며, Hugging Face를 통해 LFM2.5-230M, 350M, 1.2B-Instruct, 2.6B 모델 파일이 제공된다.
Arm CPU 환경에서 디코드 처리량 최대 33% 향상 및 품질 최적화
LFM 연구팀은 MacBook Pro, NucBox EVO-X2(GPU), Samsung Galaxy S26 Ultra, Raspberry Pi 5(Arm CPU) 4종의 타겟 기기에서 디코드 처리량을 측정했다. 측정 결과 230M 및 350M 모델의 QAD Q4_0 체크포인트는 Q5_K_M(5비트 양자화) 수준의 품질을 유지하면서도 디코드 처리량을 4~33% 향상시켰다. 1.2B 및 2.6B 모델 역시 Q4_K_M(4비트 양자화) 품질을 유지하며 처리량을 3~14% 높이는 성과를 거뒀다.
특히 230M과 1.2B 모델의 경우, 외부의 강력한 PTQ 체크포인트인 Unsloth UD-Q4_K_XL와 대등한 품질 수준을 확보한 것으로 확인됐다. 이는 저전력 Arm CPU 환경에서 메모리 점유율을 낮추면서도 고품질의 추론 속도를 확보할 수 있는 구체적인 수치 비교 근거를 제시한다.
따라서 갤럭시 S26 울트라나 라즈베리 파이 5와 같은 Arm CPU 기반 기기에서 메모리 사용량을 줄이면서 Q5_K_M급의 품질과 빠른 추론 속도를 동시에 확보하려는 사용자는 기존 PTQ 대신 QAD Q4_0 체크포인트를 선택하는 것이 가장 효율적이다.




