응답 시간 90% 단축과 95% 정확도, Mobileye의 지원 운영 자동화

Mobileye는 Amazon Bedrock AgentCore(에이전트 핵심 엔진)를 도입해 지원 티켓 응답 시간을 90% 단축하고 95% 이상의 정확도를 달성했다. 이 수치는 루틴한 상태 확인 작업에 매몰되어 있던 엔지니어들이 더 복잡한 기술적 난제에 집중할 수 있도록 업무 우선순위를 바꾸는 결과로 이어졌다. 단순 반복 문의를 AI가 처리함으로써 내부 운영 효율을 극대화하고 사용자 경험을 개선했다.

데이터 수집 처리 파이프라인(데이터를 수집하고 가공하는 일련의 과정) 규모가 확장됨에 따라 매일 수천 개의 주행 기록 세션이 유입되었고, 엔지니어와 데이터 팀으로부터 상태 확인 문의가 끊임없이 쏟아졌다. 분석 결과 전체 지원 티켓의 66%가 루틴한 상태 확인 문의였으며, 이를 처리하기 위해 엔지니어는 여러 백엔드 시스템을 오가며 15번의 클릭을 수행해야 했다. 구체적으로는 세션을 식별하고 시각화 도구와 대조하며 출력값을 검증하고 로그를 검토하는 수작업 과정이 매번 반복되었다. 숙련된 엔지니어의 리소스가 단순 작업에 과도하게 투입되면서 내부 사용자의 대기 시간은 계속해서 늘어나는 구조였다.

정식 프로덕션 배포에 앞서 진행한 개념 증명(PoC, 아이디어의 실현 가능성을 검증하는 단계)에서는 티켓 분류 정확도 95% 달성과 응답 시간 2분 미만 진입을 핵심 성능 지표로 설정했다. 특히 Mobileye의 내부 티켓팅 시스템은 온프레미스(자체 서버 시설)에서 작동하여 AWS 클라우드 환경에서 직접 접근이 불가능했다. 보안 규정과 컴플라이언스(법규 준수)를 위반하지 않으면서 클라우드 기반 AI 모델과 온프레미스 데이터를 안전하게 연결하는 브릿지 구조를 설계하는 것이 가장 중요한 기술적 관건이었다.

최종 배포된 AI 지원 에이전트는 설정한 목표치를 일관되게 충족하거나 상회하는 성능을 기록했다. 특히 별도의 인프라 관리 비용인 오버헤드(추가적인 자원 소모)를 제로로 유지하면서도 고성능의 자동화 환경을 구축했다. 수작업 기반의 티켓 처리 프로세스를 지능형 자동화로 전환한 결과, 응답 시간을 90% 단축하고 정확도를 95% 이상으로 끌어올리는 성과를 냈다. 이는 단순한 도구 도입을 넘어 엔지니어의 리소스 낭비를 막고 운영 체계의 효율성을 실질적으로 입증한 사례가 되었다.

MCP와 하이브리드 아키텍처를 통한 온프레미스-클라우드 연결

Anthropic Claude 모델을 기반으로 하되, Amazon Bedrock의 파운데이션 모델에 대한 거버넌스와 쿼터 관리를 수행하는 내부 LLM 게이트웨이를 통해 접근한다. LLM 게이트웨이는 기업 내부의 보안 정책을 적용하고 모델 사용량을 제어하는 통합 진입점 역할을 수행한다. 이를 통해 개별 엔지니어가 모델 API에 직접 접근하는 대신 표준화된 경로를 거치게 하여 보안 리스크를 줄인다. 모델 접근 권한과 사용 한도를 중앙에서 제어함으로써 자원 낭비를 막고 전사적으로 일관된 보안 수준을 유지하며 효율적인 자원 배분을 가능케 한다.

실시간 데이터 접근은 MCP(Model Context Protocol, 모델이 외부 데이터나 도구에 접근하는 표준 규격)로 구현했다. 이 프로토콜은 에이전트가 드라이브 데이터 처리 플랫폼 API에 실시간으로 접근하여 필요한 정보를 가져오는 핵심 통로가 된다. 에이전트는 추론 과정에서 현재 세션의 상태를 조회하고 시스템 처리 로그와 상세 진단 정보를 직접 추출한다. 정적인 데이터셋을 학습시키는 대신 MCP를 통해 최신 운영 데이터를 즉시 참조함으로써 변화하는 시스템 상태를 정확하게 반영한다.

시스템 인프라는 온프레미스와 AWS 클라우드를 결합한 하이브리드 구조를 취한다. 티켓팅 운영 시스템과 데이터 브릿지 기능은 보안 구역인 온프레미스 환경 내에 배치하여 내부 데이터 유출 가능성을 원천적으로 차단한다. 반면 서버리스 컴퓨팅과 보안 관리, 시스템 관찰성 기능은 AWS 클라우드 환경에서 처리하여 유연한 자원 확장을 가능하게 한다. 보안이 필수적인 데이터 저장소와 고성능 연산이 필요한 LLM 환경을 물리적으로 분리하고 논리적으로 연결하여 기업급 보안 표준을 정밀하게 충족했다.

실제 요청 처리 과정은 4단계 워크플로우로 작동한다. 먼저 사용자가 접수한 티켓을 시스템이 수신하면 이를 내부 LLM 게이트웨이로 전달한다. 게이트웨이를 통과한 요청은 Amazon Bedrock AgentCore에서 구체적인 프로세싱 단계를 거치며 최적의 실행 계획을 수립한다. 이 과정에서 MCP가 드라이브 데이터 플랫폼 API와 실시간으로 통신하여 로그와 진단 정보를 수집한다. 최종적으로 수집된 실시간 데이터와 모델의 추론 결과가 결합되어 사용자에게 최적화된 응답을 생성하여 전달하는 방식으로 마무리된다.

단일 PoC에서 전사적 셀프 서비스 에이전트 플랫폼으로의 확장

사내 개발자 대부분이 AWS 자격 증명이나 인프라 접근 권한을 가지고 있지 않아 AgentCore에 에이전트를 직접 배포하지 못하는 제약이 발생했다. 특정 팀의 성공적인 사례를 전사로 확산하기 위해 Mobileye Cloud Infra 팀은 내부 에이전트 배포 플랫폼을 직접 구축했다. 이 플랫폼은 개발자가 AWS 전문 지식이나 개별 클라우드 자격 증명 없이도 프로덕션급 AI 에이전트를 즉시 배포할 수 있게 돕는 내부 관리형 서비스다. 인프라 접근 권한이라는 물리적 장벽을 플랫폼화하여 해결함으로써 비즈니스 로직을 가장 잘 아는 개발자가 인프라 팀의 개입 없이 직접 에이전트를 배포하고 수정하는 환경을 구현했다.

제공되는 인프라는 보안, 비용 거버넌스, 운영 효율성이라는 기업 표준을 엄격하게 준수하도록 설계되었다. 특히 CloudWatch Alarms(클라우드 자원 상태를 실시간 감시해 이상 징후를 알리는 서비스)를 통해 코드 예외 상황이 발생하면 운영자가 즉시 확인하고 대응할 수 있는 관찰성 체계를 갖췄다. 비용 거버넌스 기능을 통해 각 에이전트가 사용하는 자원과 비용을 투명하게 추적하여 예산 초과 위험을 방지한다. 개발자는 복잡한 클라우드 설정이나 네트워크 구성 대신 플랫폼이 제공하는 표준화된 인터페이스를 통해 에이전트를 배포하고 실시간 운영 상태를 모니터링한다. 이는 개별 개발자의 클라우드 숙련도와 상관없이 전사적으로 동일한 수준의 보안성과 안정성을 유지하며 에이전트를 운영할 수 있는 기술적 기반이 된다.

단일 PoC(Proof of Concept, 개념 검증) 단계에서 시작된 소규모 시도는 이제 전사적인 셀프 서비스 플랫폼으로 진화했다. 이를 통해 과거 에이전트 하나를 프로덕션 환경에 배포하기 위해 거쳐야 했던 복잡한 승인 절차와 설정 과정으로 수 주(weeks)가 소요되던 기간이 이제는 수 분(minutes) 단위로 단축되었다. 보안 설정과 비용 추적이 자동화된 환경 덕분에 여러 팀이 독립적으로 에이전트를 배포하고 빠르게 검증하는 사이클이 가능해졌다. 이는 단순한 도구의 도입을 넘어 조직 전체가 AI 에이전트를 제품 개발의 기본 단위로 활용할 수 있는 운영 체계를 갖췄음을 의미한다. 온프레미스 보안을 유지하면서 AI 에이전트를 전사적으로 확산하려면, 개발자에게 개별 클라우드 권한을 부여하는 대신 거버넌스가 통합된 내부 셀프 서비스 배포 플랫폼을 구축해야 한다.