고급 분석 및 장기 에이전트 작업에 특화된 모델이다
100만 토큰당 입력 가격이 공급 경로에 따라 $5에서 $20까지 최대 4배 차이 나는 상황에서, 약 100만 토큰의 컨텍스트를 지원하는 모델의 효율적 운용은 필수적이다. OpenRouter(오픈라우터, AI 모델 통합 게이트웨이)에서는 `openai/gpt-6-astra`라는 모델 ID를 통해 고급 분석과 장기 에이전트 작업에 특화된 GPT-6 Astra를 호출한다. 이 모델은 소프트웨어 엔지니어링과 심층 연구, 과학 연구 및 문서 제작을 수행하는 데 최적화되어 있으며, 특히 컴퓨터와 브라우저를 직접 제어하는 장기 에이전트 작업 수행에 초점을 맞춘다.
OpenRouter는 공급자별로 실제 요청에 기반한 운영 지표를 실시간으로 공개하여 호출 경로의 최적화를 돕는다. 처리량과 응답 지연뿐 아니라 도구 호출 오류율, 구조화 출력 오류율, 캐시 적중률을 세부 지표로 제공하며 이를 실제 요청 데이터로 계속 갱신한다. 벤치마크가 모델의 문제 해결 능력을 측정한다면, 이러한 운영 지표는 호출 경로의 속도와 안정성을 비교하는 자료로 활용된다. 이를 통해 사용자는 모델의 지능과는 별개로 실제 요청 시 발생하는 지연 시간과 오류율을 고려해 공급자를 선택한다.
기술이 실제로 작동하는 방식
100만 토큰당 입력 비용이 $5에서 $20까지 차이 나는 구조는 공급 경로 선택에 따라 결정된다. OpenAI Flex는 입력 $5, 출력 $25, 캐시 읽기 $0.50를 책정해 가장 경제적인 경로를 제공한다. 일반 OpenAI는 입력 $10, 출력 $50, 캐시 읽기 $1이며, Azure (US)는 입력 $11, 출력 $55, 캐시 읽기 $1.10로 설정되어 있다. 반면 OpenAI Fast는 입력 $20, 출력 $100, 캐시 읽기 $2로 가장 높은 비용이 발생한다. 캐시 읽기 비용 역시 $0.50에서 $2까지 경로별로 차등 적용되며, 경로 설정 하나로 입력과 출력 모두에서 최대 4배의 비용 차이가 발생한다.
사용자는 목적에 따라 세 가지 요청 분배 모드(공급자를 자동으로 선택하는 설정)를 선택해 운영 효율을 조정한다. Balanced 모드는 가격과 속도를 함께 고려해 최적의 경로를 찾는다. Nitro 모드는 속도를 최우선으로 하여 응답 시간을 단축하고, Exacto 모드는 도구 호출(LLM이 외부 API 등을 사용하는 기능)의 정확도를 최우선으로 설정한다. 사용자가 선택한 모드에 따라 OpenRouter가 요청을 전달할 공급자를 자동으로 선택하며, 이 선택 결과에 따라 앞서 언급한 경로별 단가가 최종 청구액에 적용된다.
확인해야 할 핵심 지점
492억 토큰의 프롬프트와 2억 5,900만 토큰의 출력, 1억 5,100만 토큰의 추론량이 누적되며 실무 적용 규모가 확인됐다. Codex(코드 생성 도구)가 154억 토큰으로 가장 많은 트래픽을 기록하며 전체 사용량을 견인한다. 이어 Hermes Agent(AI 에이전트 프레임워크)가 103억 토큰, omp(운영 관리 플랫폼)가 21.2억 토큰, Cursor(AI 코드 에디터)가 20.9억 토큰, Claude Code(터미널 기반 코딩 도구)가 17.5억 토큰 순으로 트래픽이 집중된다. 개발 환경의 핵심 도구들이 대규모 트래픽을 처리하며 모델의 실제 가동 능력을 증명한다.
OpenRouter(LLM 통합 API 플랫폼)는 특정 공급자에서 오류가 발생할 때 다른 공급자로 요청을 넘겨 복구하는 자동 전환 기능을 제공한다. 요청 시 설정한 공급자 제한 범위 내에서 정상 동작하는 경로를 찾아 연결함으로써 응답 실패율을 낮춘다. 특정 공급자를 고정하거나 제외한 요청에서는 해당 설정이 허용한 공급자 범위 안에서만 전환이 가능하다. 공급망의 가용성을 확보해 API 호출 실패로 인한 서비스 중단 위험을 제거한다.
단순 응답 작업과 정밀한 도구 호출 작업의 성격에 맞춰 공급 경로를 다르게 설정하면 성능 저하 없이 API 비용을 절감한다.




