8비트 양자화 모델이 ARC-C 벤치마크 735점을 기록했다

144점이라는 큰 격차를 벌리며 ARC-C(추론 능력을 측정하는 시험) 735점을 기록했다. Qwen 3.8 Turbo GGUF 모델이 8비트 양자화(데이터 정밀도를 낮춰 모델 용량을 줄이는 압축 방식)를 통해 달성한 수치다. 기존 Qwen 3.8 27B 모델보다 훨씬 높은 점수를 기록하며, 무거운 모델 대신 압축된 모델을 선택해도 더 뛰어난 추론 성능을 얻을 수 있음을 보여줬다.

압축 강도를 더 높인 4비트 양자화 환경에서도 719점을 유지하며 성능 하락을 최소화했다. 일반적으로 데이터 정밀도를 낮춰 용량을 줄이면 모델의 지능이 함께 떨어지기 마련이지만, 이번 모델은 극한의 압축 후에도 높은 점수를 유지하는 효율성을 보였다. 이는 모델의 크기를 획기적으로 줄이면서도 핵심적인 추론 성능을 보존하는 성과다.

8비트 모델은 ARC-E에서도 880점을 기록하며 상위 버전들을 앞섰다. 기본 Qwen 3.8 27B는 물론 Qwen 3.6-35B-A3B, Qwen 3.6 27B, Qwen 3.5 27B 모델까지 7가지 핵심 벤치마크 모두에서 더 높은 점수를 기록했다. 모델 규모가 훨씬 더 큰 상위 버전들까지 모두 압도하며, 모델의 덩치보다 최적화된 구조가 더 강력한 성능을 낼 수 있다는 성능 우위를 입증했다.

기술이 실제로 작동하는 방식

수천 개의 생각하는 토큰을 소모하던 기존 처리 방식을 2분의 1에서 최대 10분의 1 수준으로 줄여 답변 속도를 높였다. 생각하는 토큰은 인공지능이 최종 답변을 출력하기 전 내부적으로 추론하는 과정에서 사용하는 데이터 단위다. 기존 Qwen 3.8 27B 모델은 정해진 답변 형식을 맞추기 위해 내부적으로 많은 시간을 소비하며 불필요하게 고민하는 단계가 있었다. 이러한 낭비되는 시간을 걷어내고 즉각적으로 고품질의 결과물을 내놓도록 튜닝해 효율을 높였다.

거대 서버 팜이 아닌 일반 소비자용 하드웨어 환경에서 이 모델을 구축했다. 학습 속도를 높이고 메모리 사용량을 줄여주는 가속화 라이브러리인 Unsloth(언슬롯)를 활용해 고가의 기업용 GPU가 없는 개인 PC 환경에서도 개발을 진행했다. 여기에 COLD FUSION과 FABLE FUSION 711이라는 특수 학습 방법론을 적용해 모델의 성능을 최적화했다. 다단계 미세 조정과 다단계 병합 과정을 거쳐 GGUF(거대언어모델을 효율적으로 실행하는 파일 형식) 포맷으로 제공된다.

고가의 API 비용이나 클라우드 의존 없이 개인

매번 청구되는 API 비용과 클라우드 서버의 제약 없이 개인용 워크스테이션만으로 폐쇄형 모델 수준의 추론 능력을 확보할 수 있다. 거대 기업의 클라우드 인프라에 의존하지 않고도 고성능 AI를 직접 운용하고 최적화하는 환경이 갖춰졌기 때문이다. 특히 추론 과정에서 불필요하게 소모되는 토큰(AI가 텍스트를 처리하는 최소 단위) 낭비를 막아 응답 속도를 높이고 운영 비용을 낮추는 실질적인 효율을 확보했다.

NEO-CODER MAX(코딩 성능 극대화 설정)를 적용해 프로그래밍 관련 성능을 최고 수준으로 끌어올렸고, Uncensored(검열 제거) 상태를 통해 지시 수행 능력을 보강했다. 모델이 도덕적 가이드라인이라는 내부 제약 때문에 답변을 회피하며 성능을 제한하던 기존의 한계를 완전히 없앴다. 사용자가 의도한 지시사항을 그대로 수행하여 정교한 결과물을 얻을 수 있는 환경이다.

고가의 API 비용이나 클라우드 의존 없이 개인 워크스테이션에서 폐쇄형 모델급 추론 능력을 직접 제어하고 최적화할 수 있는 환경을 구축했는지가 실질적인 운용 기준이 된다.