발표에서 확인된 핵심 사실

61점이라는 점수로 170개 모델 중 1위를 차지한 Claude Opus 5 (Adaptive Reasoning, Max Effort)가 추론 성능의 최상위 지표를 기록했다. 전체 평가 대상인 170개 모델을 통틀어 가장 높은 지능 지수를 기록한 결과다. 특히 답변을 출력하기 전 복잡한 문제를 처리하기 위해 확장 사고를 수행하는 126개 추론 모델 그룹 내에서도 Max Effort 구성이 1위를 기록하며 기술적 우위를 증명했다. 추론 모델은 일반적인 모델과 달리 최종 답변을 내놓기 전 단계에서 복잡한 문제 해결을 위한 확장 사고 과정을 거친다. 이러한 사고 과정의 확장이 Intelligence Index의 고득점으로 이어진다.

10M 토큰의 최대 문맥 창을 제공하는 Llama 4 Scout는 평가 대상 모델 중 가장 넓은 데이터 처리 범위를 지원한다. 문맥 창은 모델이 한 번에 수용할 수 있는 입력 토큰과 출력 토큰의 합산 최대 한도를 의미하며, 입력과 출력의 합산 한도가 클수록 더 많은 문서를 한 번에 참조할 수 있다. 다만 출력 토큰 한도는 일반적으로 전체 문맥 창 규모보다 훨씬 작게 설정되며 모델마다 개별적인 기준을 따른다. 대량의 데이터셋에서 필요한 정보를 검색하고 이를 바탕으로 추론하는 RAG(Retrieval-Augmented Generation, 검색 증강 생성) 워크플로에서 처리 가능한 정보의 양을 결정한다.

기술이 실제로 작동하는 방식

공개 가중치 모델(모델의 내부 파라미터를 외부에 공개한 형태)을 선택할 경우 전체 1위 모델보다 최대 10점 낮은 지능 점수를 감수해야 한다. 평가 대상인 170개 모델 중 94개가 공개 가중치 모델로 분류되며, 이 중 GLM-5.2 (max)가 51점을 획득하며 공개 모델 중 가장 높은 지능 점수를 기록했다. 공개 모델의 비중이 평가 대상의 절반을 넘어서는 상황에서도 최상위 모델과의 성능 간극은 여전히 존재한다.

Intelligence Index v4.1(AI 지능 측정 지표)은 에이전트 작업, 코딩, 과학 추론, 지식 신뢰성, 장문맥 추론을 다루는 9개 평가를 결합해 지능을 측정한다. 세부 항목으로는 GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR가 포함된다. 서로 다른 성격의 벤치마크를 통합해 모델의 종합 지능을 단일 수치로 환산한다.

특히 추론 모델이 정답을 도출하기 위해 사용하는 확장 사고 시간(Reasoning time)을 성능 측정에 직접 반영한다. 단순한 출력 결과뿐 아니라 모델이 사고 과정을 확장하며 정답에 접근하는 시간적 효율성을 함께 평가한다. 이 방식은 추론 모델의 특성을 점수화하여 지능 측정의 변별력을 높이는 장치로 작동한다.

확인해야 할 핵심 지점

61점을 기록한 Claude Opus 5 (Adaptive Reasoning, Max Effort)가 Intelligence Index 1위를 차지했다. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)와 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)가 각각 60점을 기록하며 최상위권에 이름을 올렸다. GPT-5.6 Sol (max)와 Claude Opus 5 (Adaptive Reasoning, High Effort)는 59점을 기록하며 상위 5개 모델의 지능 지수 분포를 형성했다. 모델의 추론 노력(Effort) 설정을 어떻게 조정하느냐에 따라 실제 지능 점수가 변동하는 계층적 성능 구조를 가진다.

901.6 tokens/s의 출력 속도를 기록한 Mercury 2가 테스트 대상 모델 중 가장 빠른 텍스트 생성 속도를 보였다. Gemini 2.5 Flash-Lite (Non-reasoning)는 첫 답변 토큰이 도착하는 시간을 0.34초까지 단축해 응답 지연 시간을 최단 수준으로 낮췄다. 지능 지수가 높은 모델이 반드시 빠른 응답을 보장하지 않으므로, 실시간 인터랙션이 필수적인 서비스 환경에서는 토큰 생성 속도와 첫 토큰 지연 시간을 지능 점수와 분리된 독립적인 선택 기준으로 삼는다.

최상위 폐쇄형 모델과 최상위 공개 가중치 모델인 GLM-5.2 (General Language Model 5.2) 간의 지능 점수 차이가 10점 이내인지 확인하여 인프라 제어권 확보와 성능 유지 사이의 트레이드오프를 결정한다.