유사 용어의 함정과 보험 문서 분류의 실무적 한계

보험사는 매일 정책서, 진술서, 배서, 규제 양식 등 수천 건의 문서를 분류해 컴플라이언스와 청구 처리 및 고객 서비스에 활용한다. 수작업 분류 방식은 시간이 많이 소요되고 오류가 발생하기 쉬우며, 기존 자동화 방식은 외관이 비슷하지만 목적이 다른 문서를 구분하는 데 어려움을 겪는다. 특히 정책 배서와 규제 진술서는 사용하는 법률 용어가 매우 유사해, 단일 모델 기반의 분류 체계에서는 이를 오분류하여 컴플라이언스 위반이나 처리 지연을 초래하는 사례가 빈번하다.

단일 모델 접근 방식은 텍스트 내용과 시각적 분석이 동시에 필요한 복잡한 문서의 엣지 케이스를 처리하는 데 한계를 보였다. 텍스트 기반의 단일 모델은 법률 용어의 중복이 심한 문서에서 정체성을 완벽히 정의하지 못해 분류 실패가 반복적으로 발생한다. 이러한 한계는 규제 민감도가 높은 워크로드에서 정확도 요구사항을 충족하는 새로운 아키텍처의 필요성을 증명한다.

Strands Agents SDK 기반의 멀티에이전트 오케스트레이션

개발자는 Strands Agents SDK를 사용해 개별 에이전트를 호출 가능한 도구(tools) 형태로 구현하고 이를 오케스트레이터가 관리하는 구조를 설계했다. 이 시스템은 텍스트 추론, 시각적 패턴 인식, 품질 보증이라는 세 가지 전문 영역을 가진 에이전트를 유기적으로 결합한다. 각 에이전트는 자신의 전문 분야 내에서 자율적으로 작동하며, 오케스트레이터를 통해 협업하여 최종 결과를 도출한다.

Validation Agent는 전체 시스템의 오케스트레이터로서 Strands Agents SDK의 'agents as tools' 패턴을 구현한다. 이 에이전트는 전문 에이전트들을 호출해 결과를 수집하고, 서로 다른 분류 결과가 나왔을 때 이를 조정하여 최종 분류값과 신뢰도 점수(confidence score)를 생성한다. 별도의 커스텀 오케스트레이션 코드 없이도 교차 검증과 신뢰도 점수 산출을 통해 품질 보증을 수행하며, 신뢰도가 낮은 엣지 케이스는 사람이 직접 검토하도록 플래그를 지정해 시스템의 안정성을 확보한다.

텍스트 추론과 시각적 패턴 인식의 분리 처리 구조

Document Analysis Agent는 Amazon Bedrock의 Claude Haiku 4.5를 사용해 법률 언어 해석과 정밀한 텍스트 추론을 수행한다. 이 에이전트는 문서의 내용, 메타데이터, 언어적 특징을 분석해 분류 가설을 생성하며, 특히 복잡한 법률 문서에서 핵심 정보를 추출하고 미세한 텍스트 패턴을 식별하는 데 특화되어 있다. 결과값은 구조화된 출력(Structured Output) 형식을 통해 기계가 즉시 해석할 수 있는 일관된 형태로 반환된다.

Vector Similarity Search Agent는 Amazon Titan Multimodal Embeddings G1을 사용해 문서를 고차원 벡터로 변환하고 시각적 유사도를 검색한다. 이 에이전트는 FAISS(Facebook AI Similarity Search) 라이브러리를 활용해 `perform_vector_classification` 함수로 문서의 레이아웃, 표 구조, 서식 관습 등 시각적 특징을 분석한다. 텍스트 내용이 비슷하더라도 양식의 차이를 통해 문서를 구분함으로써, '무엇을 말하는가'가 아닌 '어떻게 보이는가'에 집중해 텍스트 분석의 빈틈을 보완한다.

분류 방식별 정확도 벤치마크 및 성능 비교

Amazon Textract와 Amazon Comprehend를 결합한 기존 텍스트 추출 및 개체 인식 방식은 유사 용어가 포함된 문서 분류에서 25%의 정확도를 기록했다. Amazon Bedrock Data Automation(BDA)은 진술서 등 상당수 문서를 처리하며 70%의 정확도를 보였으나, 전체 문서의 약 3분의 1을 오분류하며 실무 투입에 한계를 드러냈다. 특히 법률 텍스트가 밀집된 정책 문서와 진술서 영역에서 단일 모델 방식의 정확도 저하가 극명하게 나타났다.

텍스트 추론과 시각적 구조 분석을 분리하고 검증 에이전트가 이를 통합하는 멀티에이전트 시스템은 모든 문서 클래스에서 100%의 정확도를 달성했다. 이는 단일 모델이 해결하지 못한 텍스트와 시각 정보의 결합 분석 문제를 전문 에이전트 간의 협업과 교차 검증으로 해결한 결과다. 벤치마크 결과, 규제 민감도가 높은 워크로드에서 정확도 100%를 달성한 유일한 접근 방식은 텍스트 분석과 벡터 유사도 검색을 결합한 멀티에이전트 구조였다.

운영 지표 최적화 및 모델 선택 판단 기준

Claude Haiku 4.5는 문서 1건당 평균 19.3초의 처리 시간과 93%의 신뢰도 수준을 기록하며 생산성과 비용 효율성을 동시에 확보했다. 운영자는 Amazon Bedrock의 추론 프로필(inference profile)을 설정하고, 모델 ID 앞에 `us.`, `eu.`, `ap.`와 같은 지리적 접두사를 추가한 교차 리전 추론 프로필을 구성해 지연 시간을 낮추고 가용성을 높일 수 있다. 전체 구현 코드는 GitHub 저장소에서 확인할 수 있다.

실무자가 문서 분류 시스템을 도입할 때, Amazon Textract/Comprehend(25%) < BDA(70%) < 멀티에이전트(100%) 순으로 정확도가 상승한다는 수치 비교를 기준으로 아키텍처를 선택해야 한다. 특히 문서의 텍스트 내용이 비슷하더라도 레이아웃(양식)이 다른 경우라면, 단일 모델보다 '텍스트 추론 + 벡터 유사도'를 결합한 멀티에이전트 모델을 선택하는 것이 가장 확실한 판단 기준이 된다.