발표에서 확인된 핵심 사실

93%의 정확도는 약 1,030개 에이전트 작업에서 Kimi K3와 Fable 5를 작업 성격에 따라 배정하는 라우팅(Routing) 방식을 적용했을 때 기록된 수치다. 이는 Kimi K3나 Fable 5 중 하나의 단일 모델만을 사용해 작업을 수행했을 때보다 더 높은 품질을 확보할 수 있음을 수치로 증명한다. 오라클 라우팅(정답을 미리 알고 최적의 모델에 배정하는 방식)을 통해 검증한 결과, 전체 작업의 72%에서 최대 96%까지 Kimi K3에 배정되는 결과가 도출되었다. 작업별 최적 모델을 선택해 분배하는 전략이 개별 모델이 가진 성능 제약을 보완하는 실질적인 방안이 된다.

SWE(소프트웨어 엔지니어링) 작업에서 Kimi K3는 Fable 5보다 약 10배 많은 토큰을 읽었으나 실제 실행 비용은 오히려 더 낮게 측정되었다. 프롬프트 캐싱(이전 입력 데이터를 저장해 재사용하는 기술) 적중률이 높게 유지되면서 토큰 읽기 양의 증가가 비용 상승으로 이어지지 않은 결과다. 다만 실행 단계가 많아지는 작업 구조에서는 실제 처리 시간이 길어질 수 있다는 특성이 함께 확인되었다. 비용 효율성을 극대화하는 캐싱 기술의 이점과 처리 지연 시간의 증가라는 제약 사항을 동시에 고려해야 한다.

5개 작업군 모두에서 Fable 5보다 비용 효율적이며, 특정

최대 50배의 비용 효율 차이는 긴 에이전트 루프(에이전트가 목표 달성을 위해 스스로 판단하고 행동을 반복하는 과정)에서 발생했다. Kimi K3는 5개 작업군 전체에서 Fable 5보다 비용 효율적인 수행 능력을 보였다. 특히 긴 루프가 반복되는 환경에서 Fable 단독 사용 대비 비용을 대폭 낮춘 점이 확인된다. 이러한 우위는 토큰 가격의 차이와 프롬프트 캐싱(이전 요청의 데이터를 저장해 재사용함으로써 연산량을 줄이는 기술), 그리고 작업별 투입량의 차이에서 비롯되었다.

작업 영역별 성능 우위는 모델의 특성에 따라 분리되었다. Fable 5는 Java, Python, C++를 포함한 다중 언어 코딩 범위에서 Kimi K3보다 앞선 성능을 보였다. SWE(소프트웨어 엔지니어링) 작업을 문제 영역별로 세분화해 분석한 결과, Fable 5는 웹 구축과 데이터 시각화 작업에서 우위를 점했다. 이와 대조적으로 Kimi K3는 기호 수학과 개발 도구 관련 작업에서 더 높은 우세함을 기록했다. 특정 작업군에서의 성능 우위가 전체 비용 효율성으로 직결되지는 않았다.

워크로드 맞춤형 라우터를 통해 저렴한 오픈 모델과 고성능

단일 제공자의 모델만 사용하는 것보다 저렴한 오픈 모델과 고성능 모델을 조합하는 라우터 방식이 품질과 비용 효율을 동시에 높인다. Kimi K3(중국 AI 모델) 같은 비용 최적화 오픈 모델을 기본으로 배치하고, 난도가 높은 작업만 상위 모델로 전송하는 전략이 유효하다. 모델마다 가격과 전문 영역이 다르기 때문에 단일 모델 운용보다 여러 모델의 조합이 최적의 성능을 낼 가능성이 크며, 이를 통해 품질과 비용을 함께 개선할 수 있다.

수십 차례의 셸 조작이 필요한 장기 터미널 작업과 법률 분야에서는 Kimi K3가 우세한 성능을 보였다. Fable 5가 해결하지 못한 7z 해시, FEAL 암호 분석, 유출된 비밀정보, 실제 취약점 및 통제 불능 비동기 작업을 K3가 처리했다. 반면 다중 언어 코딩과 웹 작업, 데이터 시각화 영역에서는 Fable 5가 더 높은 정확도를 기록하며 모델별 전문 영역의 차이를 드러냈다.

실제 라우터 구현을 위한 성능 검증에는 현재보다 10배 수준의 추가 라우팅 데이터가 필요하다. 실시간 응답이 필요한 2초 이내 작업은 Fable 5를, 비용 최적화가 핵심인 대규모 백그라운드 에이전트는 K3 기반 라우팅을 선택하되, 세부적으로 터미널·법률·기호수학은 K3, 다중 언어(Java/Python/C++)·웹·데이터 시각화는 Fable 5를 배정하는 것이 최적의 선택 기준이다.