문서 오류 46% 감소와 시설당 40만 달러 ROI 달성

의료 문서 처리 오류를 46% 줄이고 단일 시설 기준 연간 40만 달러 이상의 투자 대비 수익(ROI, 투자한 비용 대비 얻은 이익)을 달성했다. 이는 미국 전역에서 수동 문서 처리에 매년 수억 달러의 비용을 지출하던 의료 기관들이 자동화 시스템으로 전환했을 때 얻을 수 있는 실질적인 이득을 보여준다. Guardoc Health(가도크 헬스)는 Amazon Nova(아마존의 파운데이션 모델 제품군)를 도입해 숙련 간호 시설과 보조 생활 센터의 복잡한 문서 추출 및 분류 속도를 높였다. 수동 검토에 의존하던 기존 방식에서 벗어나 대규모 의료 데이터를 정확하고 완전하게 처리하는 체계를 구축했다.

BMJ Quality and Safety(영국 의학 저널의 품질 및 안전 섹션) 연구에 따르면 정보 처리 실패는 미국 성인 연간 약 1,200만 명의 외래 진료 진단 오류에 기여하는 주요 요인으로 확인된다. 의료 데이터의 부정확성과 파편화는 단순한 행정 실수를 넘어 환자의 안전을 위협하는 직접적인 위험 요소가 된다. Guardoc Health는 이러한 정보 처리의 변수를 제거해 임상 문서의 정확성과 규제 준수 수준을 높였다. 이를 통해 간호사와 케어 팀이 서류 작업의 부담을 덜고 환자에게 더 안전한 고품질 케어를 제공하는 환경을 만든다.

시스템이 해결해야 할 핵심은 처리 규모와 정밀도의 동시 확보였다. 피크 타임 기준 일일 처리량은 100만 건 이상의 문서에 달한다. 이 정도 규모에서는 상태 감지 오류율이 단 1%만 발생해도 매일 수천 건의 잘못된 기록이 생성된다. 각 기록의 오류는 환자 안전 리스크나 법적 규제 준수 책임으로 직결되므로 극도로 낮은 오류율 유지가 필수적이다. 대량의 문서를 처리하면서도 개별 데이터의 정밀도를 유지하는 것이 자동화의 성패를 가르는 기준이 된다.

실제 적용 결과 감사 벌금은 70% 감소했다. Amazon Bedrock(아마존의 생성형 AI 구축 및 확장 플랫폼)을 통해 제공되는 Nova 모델들을 활용해 정형화된 표, 의사 노트의 비정형 텍스트, 인쇄물에 추가된 필기 내용, 팩스로 전송된 스캔 페이지 등 다양한 형태의 문서를 처리한다. 단일 환자 차트에 혼재된 여러 포맷을 정확하게 분류하고 추출함으로써 수동 검토 시간을 줄이고 데이터의 신뢰도를 높였다. 이는 파편화된 의료 기록을 통합된 가치로 전환하는 기반이 된다.

비용 계층화 RAG와 Nova Pro의 멀티모달 추론 구조

작업 부하에 따라 모델을 차등 배치하는 비용 계층화(Cost-tiering) 원칙을 적용해, 고볼륨의 단순 필터링에는 저비용 모델을 쓰고 복잡한 추론에만 고성능 모델을 배치했다. 이를 위해 RAG(검색 증강 생성: 외부 소스에서 정보를 먼저 찾고 이를 바탕으로 답변하는 기술) 파이프라인을 구축했다. Amazon Titan Text Embeddings와 Amazon Nova 2 Lite가 이 과정의 전반부를 담당하며 임베딩(텍스트를 수치 벡터로 변환하는 과정), 인덱싱(빠른 검색을 위한 색인 생성), 거친 필터링 같은 가벼운 작업을 처리한다. 각 단계에서 해당 작업을 수행할 수 있는 가장 저렴한 구성 요소를 우선적으로 선택해 전체 인프라 비용을 최적화하며, 대량의 문서 데이터가 유입되어도 초기 단계에서 효율적으로 데이터 양을 줄이는 구조다.

최종 단계에서만 Amazon Nova Pro를 배치해 원본 PDF 바이트(컴퓨터가 읽는 이진 데이터 단위)에 대한 멀티모달 추론을 수행한다. 멀티모달 추론이란 텍스트뿐 아니라 이미지, 레이아웃 등 다양한 형태의 데이터를 동시에 처리하는 방식이다. PDF 문서가 스캔본이나 사진, 디지털 생성본 등 다양한 형태로 들어오기 때문에, 단순 텍스트 추출이 아닌 시각적 분석이 필요한 지점에서만 Nova Pro가 작동하도록 설계했다. 특히 PDF의 원본 바이트를 직접 읽는 방식은 텍스트 층이 손상된 문서에서도 정확한 정보를 추출하는 기반이 된다. 모든 단계에 고성능 모델을 투입하는 낭비를 줄이고, 정밀한 판단이 필요한 최종 검증 단계에만 자원을 집중 배치했다.

시스템이 도출한 모든 분류 결과는 원본 문서의 특정 페이지로 즉시 연결되는 Traceability(추적 가능성)를 갖춘다. 이는 AI가 내린 결론의 근거가 되는 원본 데이터를 사용자가 즉각 확인할 수 있도록 하는 추적 구조다. 환자 안전과 직결되는 의료 도메인의 특성상, AI의 판단 결과가 원본의 어느 페이지, 어느 부분에서 기인했는지 명확히 밝히는 것은 타협 불가능한 필수 요구사항으로 정의되었다. 이러한 추적 가능성 확보를 통해 모델의 추론 결과에 대한 검증 가능성을 높이고 의료 현장의 실질적인 신뢰도를 확보했다.

필기체 인식과 Textract 하이브리드 기반의 약물 데이터 추출

의료 기록을 처리하는 엔지니어는 인쇄물 위에 겹쳐진 필기체나 임상 약어 같은 비정형 데이터를 정확하게 읽어내는 과제에 직면한다. Amazon Nova Pro는 레이아웃 해석과 체크박스 상태, 서명, 필기 주석 및 필드 간 공간 관계를 인식하는 능력을 갖췄다. 특히 흘려 쓰는 필기체(Cursive)와 의료진이 사용하는 임상 약어, 인쇄물과 필기체가 혼재된 페이지를 정확하게 처리한다. 이는 단순한 텍스트 변환을 넘어 문서의 시각적 구조를 이해하는 멀티모달 추론 능력을 활용한 결과다. 수정 사항이 수기로 적힌 보완 필드나 서명란의 유효성까지 판단하여 데이터 손실을 최소화한다.

대규모 문서 처리의 비용과 정확도를 동시에 잡기 위해 Amazon Textract와 Amazon Nova 모델을 결합한 하이브리드 구조를 채택했다. Amazon Textract(문서 내 텍스트와 표 데이터를 자동으로 추출하는 서비스)는 고볼륨의 정형 데이터 추출을 전담하며 전체 파이프라인의 처리 효율을 높인다. 반면 정형화되지 않은 복잡한 케이스는 Amazon Nova가 담당하여 멀티모달 추론(텍스트와 이미지 정보를 동시에 분석해 맥락을 파악하는 방식)을 수행한다. 각 구성 요소가 최적의 성능을 내는 영역을 분담함으로써, 사람이 직접 대조하고 수정하는 수동 조정 과정 없이도 임상 워크플로우에 즉시 투입 가능한 수준의 약물 데이터를 생성한다.

이 시스템을 2개 시설의 환자 200명을 대상으로 실제 적용한 결과 총 847건의 문서 수정이 이루어졌다. 특히 Medicare 지불 모델인 PDPM(Patient-Driven Payment Model, 임상 기록의 정확도에 따라 환급금이 결정되는 제도)과 관련하여 환급금에 영향을 줄 수 있는 이슈 86건을 찾아내 해결했다. 정확한 데이터 추출은 단순한 기록 정정을 넘어 실제 의료 현장의 운영 지표 변화로 이어졌다. 100건의 입원당 병원 전원율이 74% 감소하는 성과를 거두며, 기록 누락이나 오류가 초래하는 임상적 위험과 재정적 손실을 동시에 낮췄다.

비정형 의료 문서 자동화의 실무적 판단 기준

의사 확인란의 인쇄된 체크박스 설정을 필기 주석이 무효화하는 사례는 의료 문서 자동화의 핵심 제약이다. Guardoc Health는 사전 승인 양식의 의사 확인란처럼 필기 노트가 인쇄된 설정을 덮어쓰는 경우를 처리하기 위해 문서를 단순한 텍스트 스트림(문자를 순차적으로 나열한 흐름)이 아니라 시각적 문서(Visual Documents)로 읽는 방식을 채택했다. 이 방식은 체크박스, 필기체, 다단 약물 목록, 직인, 취소선 등의 레이아웃 단서를 그대로 보존한다. 시각적 맥락을 유지해야만 필기 주석이 기존 설정을 변경했다는 사실을 정확히 인지하며 정보 누락을 방지할 수 있다.

약물 데이터 추출은 환자 안전과 직결되기에 가장 높은 정밀도가 요구되는 영역이다. 약물 이름, 용량, 투여 경로, 빈도는 임상 의사결정에 직접 반영되며, 단 하나의 오기입이나 누락이 환자 안전 리스크로 이어진다. 특히 환자가 직접 작성한 증상 섹션의 필기체는 다른 기록에 없는 핵심 정보를 포함하는 경우가 많아 이를 정확히 읽어내는 능력이 필수적이다. 단순 텍스트 추출 방식에서 이러한 비정형 필기 정보를 놓치는 것은 의료 도메인에서 치명적인 정보 손실을 의미한다.

비용과 성능을 동시에 잡기 위해 구조화된 추출 도구와 추론 모델의 역할을 분담한 하이브리드 파이프라인을 구성한다. 먼저 Amazon Titan을 통해 임베딩(데이터를 수치 벡터로 변환하는 과정)과 인덱싱(빠른 검색을 위해 데이터를 정렬하는 작업)을 수행하여 데이터를 구조화한다. 이후 Amazon Nova Lite를 활용해 저비용으로 거친 필터링을 수행하며 처리 대상을 압축한다. 최종 단계에서만 Amazon Nova Pro를 배치해 원본 PDF 바이트에 대한 멀티모달(텍스트와 이미지를 동시에 처리하는 방식) 추론을 수행함으로써 정밀도를 확보한다. 고비용의 정밀 추론 모델을 최종 단계에만 배치해 운영 효율을 극대화한 구조다.

의료 AI 실무자는 정형 데이터의 대량 추출은 전용 OCR 도구에 맡기되, 필기 주석과 레이아웃의 상충 관계를 해석해야 하는 복잡한 구간에만 멀티모달 LLM을 배치하는 하이브리드 구성 기준을 적용해야 한다.