단순 RAG의 한계와 Amazon Textract의 구조적 추출
매월 수천 건의 공공요금 고지서를 처리하는 고객 서비스 팀은 일관되지 않은 포맷과 밀집된 표, 다양한 레이아웃으로 인해 정확한 정보 추출에 어려움을 겪는다. 상담원은 PDF, DOCX, TXT, HTML, XLSX, PNG 등 다양한 형식의 문서에서 필요한 정보를 수동으로 찾아내야 하며, 이 과정에서 발생하는 시간 소모와 휴먼 에러는 응답 지연과 청구 오류라는 결과로 이어진다. 초기 구현 단계에서 고객사는 원본 문서를 그대로 로드하여 RAG(Retrieval Augmented Generation) 모델을 구축했으나, LLM이 핵심 세부 정보를 누락하거나 근거 없는 허위 정보를 생성하는 환각 현상을 경험했다.
Amazon Textract는 구조적 콘텐츠와 비구조적 콘텐츠를 모두 고정밀도로 추출하는 기능을 통해 이러한 데이터 인식 문제를 해결한다. Textract는 단순한 텍스트 읽기를 넘어 문서의 레이아웃을 분석하므로, 밀집된 표나 복잡한 서식 속에서도 데이터 간의 관계를 유지하며 정보를 추출한다. 이는 RAG 모델이 텍스트를 단순 파편화하여 읽을 때 발생하는 정보 왜곡을 방지하고, LLM이 참조할 수 있는 고품질의 전처리 데이터를 제공하는 기반이 된다.
Amazon Bedrock의 생성형 AI 능력과 Textract의 추출 기능을 결합하면, 조직은 사람이 수동으로 문서를 검색하던 방식에서 프로그램이 직접 데이터를 질의(Query)하는 방식으로 전환한다. 시스템은 청구, 사용량, 결제, 고객 서비스 등 다양한 도메인의 다페이지 문서에서 필요한 정보를 프로그램 방식으로 식별하고 추출한다. 결과적으로 텍스트 추출의 정확도가 확보된 상태에서 생성형 AI가 답변을 구성하게 되어, 고객 응답 속도가 빨라지고 답변의 신뢰도가 높아지는 운영 효율을 달성한다.
CloudFormation 기반의 자동화 배포 인프라
개발자는 쉘 스크립트를 실행하여 AWS CloudFormation 스택을 생성함으로써 문서 처리 파이프라인에 필요한 모든 인프라를 자동으로 배포한다. CloudFormation은 인프라를 코드로 정의하여 수동 설정 없이 동일한 환경을 반복해서 구축할 수 있게 하며, 사용자는 GitHub 저장소에서 제공하는 구현 코드를 통해 배포 과정을 시작한다. 이 자동화 프로세스는 개별 서비스 간의 복잡한 연결 설정을 한 번에 완료하여 배포 시간을 단축하고 설정 오류를 제거한다.
CloudFormation 스택이 배포되면 사용자의 AWS 계정 내에 네 가지 핵심 리소스가 생성된다. 서버리스 컴퓨팅을 담당하는 Lambda 함수, 원본 문서가 저장되는 S3 버킷, 벡터 검색 및 분석을 수행하는 OpenSearch Serverless 클러스터, 그리고 LLM이 외부 데이터를 참조하도록 돕는 Amazon Bedrock 지식 기반(Knowledge Base)이 그 대상이다. 이 리소스들은 S3에 업로드된 데이터가 전처리를 거쳐 OpenSearch Serverless로 흐르도록 유기적으로 연결된다.
전체 워크플로우는 사용자가 S3 버킷에 파일을 업로드하는 시점부터 자동으로 작동한다. 업로드된 원시 문서는 자동 처리 파이프라인을 거쳐 지식 기반이 인식할 수 있는 최적의 형식으로 변환된다. 변환된 데이터는 OpenSearch Serverless에 저장되어 Bedrock 지식 기반과 통합되며, 사용자는 파일 업로드라는 단순한 동작만으로 데이터 변환부터 검색 가능 상태로의 전환까지 이어지는 전체 과정을 경험한다.
이러한 코드 기반의 배포 방식은 서로 다른 개발 및 운영 환경에서도 일관된 인프라를 생성하여 시스템의 신뢰도를 높인다. 수동 리소스 생성 시 발생할 수 있는 구성 누락을 원천적으로 차단하며, 처리해야 할 문서의 양이 급증하는 대규모 환경에서도 인프라를 효율적으로 확장하고 관리할 수 있는 유연성을 제공한다.
Bedrock Guardrails와 Grounding을 통한 신뢰성 확보
Amazon Bedrock Guardrails는 AI 모델의 응답 범위를 제한하는 제어 도구로서, 사용자의 입력과 모델의 출력 양방향에 필터링 설정을 적용한다. 시스템은 유해 콘텐츠를 자동으로 필터링하고 운영자가 정의한 거부 주제가 답변에 포함되지 않도록 차단한다. 특히 개인정보와 같은 민감 정보를 식별하여 가리는 Redact 처리를 통해 기업의 데이터 보안 규정을 준수하고 정보 유출 위험을 낮춘다. 이는 입력 단계의 부적절한 요청 차단과 출력 단계의 검증이라는 이중 구조를 통해 모델의 예측 불가능한 답변 생성 위험을 최소화한다.
Grounding Validation은 모델이 생성한 응답이 실제로 검색된 소스 문서의 내용에 기반하고 있는지 실시간으로 검증하는 기능이다. 이 기능은 모델이 학습 데이터의 편향이나 확률적 생성 특성으로 인해 허위 정보를 만들어내는 환각 현상을 감지하고 감소시킨다. 시스템은 모델의 답변이 참조 문서의 구체적인 구절과 일치하는지 평가하여, 근거가 부족한 응답을 걸러내고 검색된 사실에만 기반해 답변하도록 강제한다.
운영 조직은 실제 프로덕션 환경에서 정확도와 컴플라이언스 유지를 위해 이러한 제어 장치들을 활성화하는 것이 권장된다. 지식 기반 상호작용 전 과정에 필터링과 근거 검증 체계를 배치함으로써 일관된 응답 품질을 유지할 수 있다. 엄격한 제약 조건 내에서 도출된 정확한 응답은 AI 모델을 단순한 챗봇 수준을 넘어 신뢰 가능한 기업용 지식 엔진으로 활용할 수 있게 하는 핵심 장치가 된다.
대규모 정형 문서 처리 자동화의 실무 적용 기준
구조적 추출을 통해 데이터 정확도를 확보한 조직은 계좌 번호, 청구 세부 정보, 결제 지침과 같은 핵심 정보를 정확하게 추출하여 상담원의 수동 대조 시간을 제거한다. 이는 데이터 기반의 즉각적인 조치를 가능하게 하여 청구 프로세스의 신뢰도를 높이고 고객 만족도를 직접적으로 향상시키는 결과로 이어진다. 단순한 텍스트 로딩 방식에서 벗어나 전처리 파이프라인을 구축함으로써, 대규모 문서 세트에서도 확장 가능하고 효율적인 처리 능력을 갖추게 된다.
향후 시스템 확장 단계에서는 처리 가능한 문서 유형을 확대하고 추가적인 AWS 서비스를 연동하여 더 복잡한 분석 기능을 구현할 수 있다. 현재의 고지서 처리 모델을 다른 형태의 정형 문서로 확대 적용하거나, AWS의 데이터 분석 도구들을 파이프라인에 결합하여 고도화된 인사이트를 도출하는 방향으로 발전 가능하다. 또한 사용자가 지식 기반과 더 쉽게 상호작용할 수 있도록 전용 프런트엔드 인터페이스를 개발하여 내부 운영 도구로서의 실무 활용도를 극대화할 수 있다.
실무자가 전처리 방식을 선택할 때 고려해야 할 판단 기준은 데이터의 복잡도와 물량이다. 표가 밀집되어 있고 레이아웃이 다양하며 처리 물량이 월 수천 건 이상인 정형 문서 데이터셋이라면 단순 로딩 대신 Textract 기반의 전처리 파이프라인을 도입해야 한다. 반면, 문서 구조가 단순하고 정형화되어 있으며 처리 물량이 적은 경우에는 단순 로딩 방식이 효율적일 수 있다.
결론적으로 본 솔루션은 AWS CloudFormation을 통해 Lambda, S3, OpenSearch Serverless, Bedrock 지식 기반이라는 일관된 인프라를 구축하고, Textract의 정밀 추출과 Bedrock의 생성 능력을 결합하여 지능형 문서 처리 시스템을 구현하는 표준 모델을 제시한다.




