75% 자동 해결률이 증명한 OpenAI Presence의 실효성
OpenAI는 영어 전화 지원 채널인 1-888-GPT-0090에 AI 에이전트를 적용해 인바운드 이슈의 75%를 사람의 도움 없이 해결했다. 실제 고객 응대 현장에서 인간 상담원의 품질 벤치마크를 충족하거나 초과하는 성능을 기록하며 실제 운영 가능성을 수치로 입증했다. 이러한 성과는 OpenAI Presence라는 관리형 제품을 통해 구현된다. Presence는 정책과 가드레일(Guardrails, AI의 응답 범위를 제한하는 안전장치), Codex 기반의 개선 루프를 결합해 기업 환경에서 AI 에이전트를 배포하고 관리하는 도구다.
이 제품은 음성(Voice)과 채팅(Chat)을 통한 실시간 경험을 모두 지원한다. 적용 범위는 단순한 고객 지원을 넘어 아웃바운드 영업(Outbound Sales, 기업이 잠재 고객에게 먼저 연락하는 영업 방식)과 고위험 내부 워크플로우까지 포함한다. Presence는 단순한 모델 제공을 넘어 시스템과 평가 체계, 배포 전문성을 통합해 에이전트가 실제 워크플로우에서 안정적으로 작동하게 만든다.
Presence는 기업의 제품 사양, 내부 정책, 사용자 행동 변화에 따라 에이전트의 행동이 유연하게 적응해야 하는 실무적 제약을 해결하는 데 집중했다. 운영 통제권을 유지하면서도 변화하는 환경에 맞춰 에이전트를 지속적으로 개선하는 시스템을 구축한 것이 핵심이다.
배포 전 신뢰성을 확보하는 시뮬레이션과 가드레일
에이전트 배포는 결제 이슈 해결, 보험 청구 지원, IT 서비스 요청 같은 특정 직무 단위로 제한하여 수행된다. 에이전트는 해당 직무 수행에 필요한 지식과 시스템 접근 권한만 부여받아 불필요한 데이터 접근이나 의도치 않은 기능 실행을 차단한다. 회사는 에이전트가 수행 가능한 작업 범위, 관리자 승인 시점, 상담원에게 업무를 넘겨야 하는 에스컬레이션(Escalation, 상위 담당자에게 연결하는 단계) 기준을 구체적인 정책으로 정의한다.
실제 사용자에게 노출하기 전에는 시뮬레이션과 그레이더(Grader, 모델의 응답을 정해진 기준에 따라 자동 평가하는 도구)를 통해 검증한다. 일반적인 요청뿐 아니라 엣지 케이스(Edge Case, 발생 빈도는 낮지만 치명적인 예외 상황)와 고위험 시나리오를 집중적으로 테스트한다. 그레이더는 에이전트가 올바른 결과에 도달했는지, 내부 정책을 준수했는지, API 도구를 정확한 파라미터로 호출했는지를 확인한다. 특히 복잡한 요청 상황에서 적절한 시점에 인간 상담원 연결 신호를 보냈는지를 검증한다.
상호작용이 설정된 운영 경계를 벗어나면 가드레일이 즉각 개입해 권한 밖의 내부 정보 유출이나 정책에 어긋나는 답변 생성을 실시간으로 차단한다. 직무 단위의 권한 제한, 시뮬레이션 기반의 정량적 검증, 실시간 가드레일이 결합되어 기업이 요구하는 수준의 신뢰성을 확보한다.
Codex 기반 개선 루프로 구현한 15%p 핸드오프 감소
OpenAI 전화 지원 사례에서 Codex 기반 개선 루프를 적용해 10일 만에 인간 상담원 연결 비율인 핸드오프(Handoff)를 15%p 낮췄다. 이 루프는 운영 중 발생하는 실패 신호를 학습 데이터로 전환해 에이전트를 업데이트하는 자동화 구조다. Codex는 Presence 플러그인을 통해 실제 운영 세션 데이터를 조사하고, 응답이 부적절했거나 해결에 실패한 지점을 찾아 구체적인 업데이트 방안을 제안한다.
개선 프로세스는 운영 세션의 로그, 에스컬레이션, 품질 신호를 종합해 분석하는 갭(Gap) 분석에서 시작한다. Codex는 수집된 신호를 추적해 에이전트가 특정 질문에 답하지 못했거나 잘못된 시스템 도구를 사용한 원인을 파악한다. 이후 해당 실패 사례를 해결할 수 있는 새로운 지침이나 로직 수정안을 생성해 운영자에게 제시함으로써 대응 정확도를 높인다.
제안된 변경 사항은 기존 운영 버전과 대비하여 성능 변화를 확인하는 테스트를 거친다. 검증이 완료된 업데이트는 통제된 롤아웃(Rollout, 일부 사용자에게 먼저 적용 후 점진적으로 확대하는 단계적 배포) 방식을 통해 실제 환경에 순차적으로 반영된다. 이를 통해 제품 기능 변경, 정책 수정, 새로운 사용자 행동 패턴이 나타났을 때 에이전트가 빠르게 적응하며, 특히 정책 변화로 인한 오답 상황을 빠르게 포착해 수정한다.
FDE 중심의 제한적 배포와 엔터프라이즈 도입 조건
OpenAI Presence는 셀프 서비스 제품이 아니며, 자격 요건을 갖춘 엔터프라이즈 고객을 대상으로 한 제한적 일반 가용성(Limited General Availability) 프로그램으로만 배포된다. 배포 과정은 OpenAI의 FDE(Forward Deployed Engineers, 현장 배치 엔지니어)와 선정된 글로벌 시스템 통합 사업자가 주도하여 기업별 최적화를 수행한다. 기존에 API 기반으로 음성 기능을 사용하던 고객은 계속해서 프론티어 모델(Frontier Model, 최첨단 성능을 가진 대형 모델)을 사용할 수 있으나, Presence의 관리 기능을 쓰려면 담당 OpenAI 계정 팀을 통해 신청하고 심사 과정을 거쳐야 한다.
배포 단계에서 OpenAI는 고객사와 협력해 핵심 업무 워크플로우를 식별하고, 에이전트가 참조해야 할 내부 지식 베이스와 시스템을 연결한다. 이후 세부 접근 권한과 보안 정책을 설정하고, 실제 운영 환경 투입 전 응답 정확도를 테스트한다. 이는 엔지니어가 직접 개입해 기업의 복잡한 레거시 시스템과의 정밀한 통합을 지원하는 구조다.
제품은 기업의 비즈니스 모델이나 고객 응대 방식, 내부 직원의 역할 변화에 맞춰 함께 학습하도록 설계되었다. 특정 사용 사례가 현재 지원 범위를 벗어날 경우, FDE와 파트너사가 요구사항을 분석해 실제 운영 가능한 수준으로 구현한다. 모든 개별 배포 사례에서 도출된 일반화된 통찰은 OpenAI 연구팀으로 전달되어 제품의 전반적인 성능 향상과 다음 버전의 기능 개발에 반영된다.
단순히 API를 연결해 기능을 구현하는 에이전트와 달리, Presence는 정책 설정과 시뮬레이션, 루프 기반의 제어 장치를 통해 운영 신뢰성을 확보하는 관리형 제품이다. 따라서 기업은 단순 기능 구현을 넘어 장애 대응과 정책 준수 같은 운영 안정성이 필수적인 핵심 업무일수록 API 단독 연동보다는 Presence와 같은 제어 체계가 포함된 관리형 솔루션을 선택해야 한다.




