코딩 및 에이전트 작업 성능이 크게 향상된 Muse Spark
지능 지수(Intelligence Index) 61을 기록해 GPT-5.6 Sol max, Claude Opus 5 high와 동률을 이룬 xhigh 버전의 태스크당 실행 비용은 0.55달러로 동일 지능 수준 모델 중 가장 낮다. 고성능 모델의 운영 비용을 최적화하려는 개발자와 기업은 이제 성능 저하 없이 지출을 줄일 수 있는 구체적인 선택지를 갖게 됐다.
메타(Meta)가 공개한 Muse Spark 1.3은 이전 버전인 Muse Spark 1.2보다 처리 속도가 빠르고 제3자 벤치마크 성능이 향상됐다. 마크 저커버그(Mark Zuckerberg) CEO는 이번 모델이 코딩과 에이전트 작업(Agentic work, 스스로 목표를 설정하고 실행하는 작업)에서 가장 큰 도약을 이뤘다고 설명하며 즉시 배포를 시작했다.
세부 설정에 따른 성능은 벤치마크 항목별로 차이를 보인다. GDPval-AA v2에서는 max 설정이 1,754 Elo를 기록해 xhigh의 1,709보다 우세했으며, OSWorld 2.0에서도 max가 66.9점으로 xhigh의 57.2점보다 앞섰다. JobBench에서는 max가 64.9점, xhigh가 61.2점을 기록했다. 반면 DeepSearchQA는 양측 모두 89.4점으로 동률을 이뤘고, Terminal-Bench 2.1에서는 xhigh가 89.2점을 기록하며 max의 88.8점을 소폭 상회했다.
프런티어 모델 수준의 지능과 강화된 에이전트 기능
이러한 벤치마크 성능은 실제 지능 지수와 에이전트 실행 능력의 향상으로 이어진다. Artificial Analysis의 측정 결과 xhigh 버전은 Grok 4.6 high와 동일한 점수를 기록했으며, 최대 66점의 max 버전과 65점의 xhigh 버전을 기록한 Claude Fable 5.1, 그리고 63점의 Claude Opus 5 max보다는 낮은 수준이다.
코딩 작업 시 도구 호출(Tool Call, 모델이 외부 기능을 실행하도록 요청하는 과정) 횟수는 약 20%, 토큰 사용량은 약 25% 줄어들었다. 이는 Muse Spark 1.2보다 자원 소모를 낮춘 수치다. 긴 대화 흐름 속에서 여러 워크플로우를 동시에 유지하고 도구를 통해 컨텍스트를 수집하는 능력이 강화되었다. 스스로 세운 계획의 결함을 감지해 사용자에게 명확한 설명을 요구하거나, 결과에 영향을 주는 중요한 실행 전에는 확인 절차를 거치는 동작이 추가됐다.
확인해야 할 핵심 지점
입력 100만 토큰당 1.25달러, 출력 100만 토큰당 4.25달러의 표준 가격은 Muse Spark 1.2와 동일하게 유지했다. 초당 235.2개의 출력 토큰을 생성하며 해당 지능 수준에서 가장 낮은 작업 비용을 구현했다.
가장 높은 벤치마크 점수를 기록한 max 구성은 추가 안전 테스트를 위해 제한적 파트너 프리뷰 상태로 운영된다. 일반 사용자에게 배포되는 버전은 Muse Code(코드 생성 도구) 하네스와 Meta Model API를 통해 xhigh를 포함한 기존 추론 설정을 사용한다. max 설정의 API 제공 일정은 아직 공개되지 않았다.
지능 61에 작업당 비용 0.55달러인 Muse Spark 1.3 xhigh와 지능 59에 작업당 비용 0.58달러인 Gemini 3.8 Flash의 수치를 비교해, 지능 대비 태스크 비용을 우선하면 Meta를, 초당 토큰 생성량과 API 단가를 우선하면 Google 모델을 선택한다.
지능 지수 61의 xhigh 버전은 성능과 비용의 균형을 맞춘 전략적 선택지다. 특히 에이전트 작업의 정밀도를 높이면서도 운영 비용을 낮춘 점이 실무 개발자들에게 유용한 지점이 될 것이다.



