10억 명의 사용자와 'Doing'으로의 업무 전환

OpenAI의 모델들은 현재 10억 명 이상의 활성 사용자와 200만 개 이상의 기업에 보급되었다. 가입 후 6개월이 지난 사용자는 일일 메시지 전송량을 약 50% 늘렸으며, ChatGPT를 활용하는 작업의 종류를 2배로 확장했다. ChatGPT Work는 단순한 질의응답인 'Asking' 단계를 넘어 복잡한 다단계 작업을 직접 수행하는 'Doing' 단계로 서비스 성격을 전환했다. 지식 노동자는 이제 아이디어 단계에서 최종 결과물에 이르는 공백을 모델이 직접 메우고 도구 간 조율을 수행하는 방식으로 업무를 처리한다. 이러한 변화는 모델의 지능 수준과 서빙 비용의 균형이 최적화되면서 사용자가 느끼는 마찰이 줄어든 결과다.

GPT-5.6 라인업의 가격 체계와 선택 기준

OpenAI는 GPT-5.6 Luna의 가격을 80% 인하하여 100만 입력 토큰당 0.20달러, 100만 출력 토큰당 1.20달러로 책정했다. GPT-5.6 Terra의 가격은 20% 인하되어 100만 입력 토큰당 2달러, 100만 출력 토큰당 12달러에 제공된다. GPT-5.6 Sol의 Fast 모드는 표준 처리 방식 대비 최대 2.5배의 속도를 제공하며, 가격은 표준 모드의 2배로 설정하되 지능 수준은 동일하게 유지했다. 사용자는 작업의 난이도, 요구 속도, 가용 예산에 따라 아래의 기준을 통해 모델을 선택한다.

- **GPT-5.6 Luna ($0.20 / $1.20):** 고성능 추론이 필요하지만 비용 효율성이 최우선인 대규모 작업

- **GPT-5.6 Terra ($2 / $12):** Luna보다 높은 지능 수준이 요구되는 정밀 작업

- **GPT-5.6 Sol (Fast 모드):** 지능 수준은 유지하면서 실시간 응답 속도가 필수적인 긴급 작업

서빙 비용 20% 절감과 추측 디코딩 최적화

OpenAI 기술팀은 GPT-5.6 Sol을 활용해 모델 서빙에 사용되는 프로덕션 소프트웨어를 최적화하여 엔드투엔드 서빙 비용을 20% 절감했다. 모델이 스스로 서빙 시스템의 코드를 분석하고 병목 구간을 해결하는 코드를 적용함으로써 컴퓨팅 자원의 생산성을 높였다. 또한 추측 디코딩(Speculative Decoding) 기술을 개선하여 토큰 생성 효율을 15% 이상 향상시켰다. 추측 디코딩은 가벼운 보조 모델이 다음 토큰을 미리 예측하고 거대 모델이 이를 한꺼번에 검증하는 방식으로, 이번 최적화를 통해 보조 모델의 예측 정확도를 높이고 데이터 이동 효율을 개선했다. 이를 통해 동일한 하드웨어 자원으로 더 많은 토큰을 빠르게 생성하는 구조를 구현했다.

모델 변경 없는 ARC-AGI-3 점수 향상과 시스템 엔지니어링

OpenAI는 라우팅과 컨텍스트 관리 시스템을 개선하여 GPT-5.6 Sol의 ARC-AGI-3 벤치마크 점수를 13.3%에서 38.3%로 높였다. 이 과정에서 모델의 가중치나 구조는 전혀 변경하지 않고, 보존된 추론(Retained Reasoning)과 컨텍스트 관리 방식만을 수정했다. 특히 시스템 최적화를 통해 동일한 추론 과제를 수행할 때 발생하는 출력 토큰 양을 기존 대비 6배 감소시켰다. 라우팅 최적화는 요청의 복잡도에 따라 적절한 연산 자원을 배분해 하드웨어 유휴 시간을 최소화했다. 컨텍스트 관리 최적화는 에이전트가 이전 작업 단계를 효율적으로 기억하게 하여 불필요한 추론 반복과 토큰 생성을 억제했다.

Codex 에이전트 비중 99.8%와 성공 결과 비용 판단 기준

Codex의 주간 출력 토큰 중 에이전트 작업(Agentic work)이 차지하는 비중은 99.8%에 도달했다. OpenAI 내부의 금융 팀(Finance team)은 이러한 에이전트 도구를 기본 업무 방식으로 채택하여 자율적인 작업 수행 프로세스를 운영하고 있다. 이제 AI 도입의 경제성은 단순한 토큰 단가가 아니라 '성공적인 결과 도출 비용'으로 판단해야 한다. 성공 결과 비용은 [토큰 비용 + 재시도 횟수 + 인간의 검토 시간 + 오류 수정 비용]의 합산으로 계산한다. 정답을 한 번에 정확히 도출하는 강력한 모델이, 저렴하지만 반복적인 재시도와 광범위한 인간 개입이 필요한 모델보다 최종적으로 더 경제적이다. 실무자는 API 호출 비용보다 지능 수준 부족으로 인해 발생하는 재작업 시간의 비용이 더 크다는 점을 주의하여 모델을 선택해야 한다.