LLM 라우터 기능을 중단하고 제거했다

9월 1일부로 LLM 라우터 기능이 완전히 종료되며, 대부분의 유스케이스에서 검증된 단일 모델을 사용하는 것이 최선이라는 판단이 내려졌다. Manifest(LLM 게이트웨이 서비스)는 지난 3월 LLM 라우터를 게이트웨이의 핵심 기능으로 출시했으나, 출시 3개월 만인 6월에 중단 결정을 내리고 9월 1일에 서비스를 완전히 제거했다. 라우팅을 통해 여러 모델을 분배하는 전략보다, 이미 성능이 검증된 하나의 모델을 일관되게 사용하는 것이 실무 운영 효율을 높인다는 점을 확인했다. 이는 모델 간의 미세한 성능 차이보다 단일 모델의 예측 가능성과 관리 편의성이 더 큰 가치를 가진다는 판단에 근거한다.

모델 라우팅의 실효성을 떨어뜨리는 구체적인 이유는 캐시 효율성에서 기인한다. 캐시 읽기 비용은 캐시되지 않은 입력 비용보다 75%에서 90% 더 저렴하게 발생한다. 비용 최적화를 목표로 설계된 캐시 인식 라우터는 이 비용 차이를 연산에 반영하며, 결과적으로 처음에 선택한 모델을 계속 유지하려는 성질을 갖게 된다.

이러한 모델 고착 현상은 라우터가 새로운 모델을 탐색하거나 작업에 따라 분배하는 본연의 기능을 상실하게 만든다. 라우터가 비용 절감을 위해 처음에 선택한 모델에 계속해서 쿼리를 보내는 방식으로 작동하면서, 이는 라우팅 기능을 아예 사용하지 않는 것과 동일한 상태가 된다. 캐시 비용의 이점이 라우팅의 유연성보다 압도적으로 크기 때문에 라우터의 실질적인 존재 이유가 사라졌다.

확인해야 할 핵심 지점

simple, standard, complex, reasoning으로 구분한 네 단계의 복잡도 분류 체계가 비용 절감의 핵심 장치였다. Manifest(매니페스트, LLM 라우팅 서비스)의 라우터는 대부분의 LLM 라우터와 마찬가지로 비용 절감을 목적으로 설계되었다. 단순한 작업에 고비용의 강력한 모델을 호출하는 낭비를 방지해 추론 비용을 줄이는 구조다. 이 분류 기준에 따라 각 요청을 네 가지 계층으로 분류하고 그에 맞는 모델로 연결해 운영 비용을 낮추려 했다.

작업 세션 중에 모델이 계속 바뀌는 환경은 전체적인 작업 품질을 떨어뜨린다. 사용자가 특정 모델의 특성을 파악해 도구를 마스터하는 과정을 방해하기 때문이다. 엔지니어는 작업의 목적과 자신의 의도에 따라 모델과 파라미터를 직접 선택해 제어해야 한다. 잦은 모델 전환은 도구 숙련도 결여로 이어져 작업 결과물의 완성도를 낮춘다.

프롬프트만으로는 작업의 실제 복잡도를 완전히 파악할 수 없다

프롬프트는 작업의 시작을 알리는 트리거일 뿐 전체 과업의 내용을 모두 담지 않는다. 실제 복잡도를 결정하는 핵심 문맥은 툴 호출(tool calls)이나 웹 검색을 수행하는 실행 단계에서 뒤늦게 발견된다. 리포지토리 개선 작업이 대표적이다. 대상 리포지토리가 가진 구조와 성격에 따라 난이도가 극명하게 달라지지만, 이는 프롬프트만으로는 파악할 수 없는 영역이다. 프롬프트 기반의 라우팅은 실행 시점에 발생하는 이러한 변수를 사전에 예측하지 못하고 부적절한 모델을 배정한다.

자동화된 에이전트 워크플로우에 라우팅 계층을 추가하면 시스템 전체의 불확실성이 함께 증가한다. 라우터의 판단 기준을 세우기 위한 시스템 프롬프트 수정과 정밀한 평가(evals), 그리고 실행 경로를 추적하는 관찰 가능성(observability) 관리에 더 많은 공수가 투입된다. 특히 에이전트가 자율적으로 움직이는 환경일수록 라우팅 단계의 오판이 전체 워크플로우의 실패로 직결된다. 이렇게 추가된 관리 비용은 라우팅을 통해 절감한 추론 비용보다 더 큰 지출을 야기한다.

작업 복잡도가 프롬프트 단계에서 확정되는지, 아니면 실행 중 도구 호출을 통해 결정되는지에 따라 라우터 도입 여부를 결정한다.