모델 성능의 침묵하는 저하와 거버넌스 계층의 필요성

사기 탐지나 신용 평가 모델을 운영하는 팀은 배포 후 몇 주가 지나서야 오탐지(False Positive)가 급증하는 현상을 발견한다. 사기 사례 처리 담당자는 갑자기 늘어난 오탐지 건수를 확인하고, 대출 심사역은 이전에 걸러졌어야 할 신청서가 승인되는 상황을 마주하며 모델의 성능 저하를 뒤늦게 인지한다. 기업의 자원 계획 담당자 역시 수요 예측 모델의 과대평가로 인해 재고가 과잉 축적되는 결과를 얻는다. 이러한 성능 저하는 고객 신뢰를 훼손하며, 운영자가 표본 점검을 수행하거나 고객 불만이 접수되기 전까지는 인지하기 어려운 '침묵하는 저하'의 특성을 가진다.

Amazon SageMaker AI는 추론 메타 모니터링 시스템을 통해 예측 및 데이터 품질 지표를 지속적으로 추적하는 거버넌스 계층을 구축했다. 이 시스템은 프로덕션 ML 추론 파이프라인 상단에 위치하여 데이터 드리프트 탐지, 지연된 정답 데이터 통합, 자동화된 성능 대시보드 기능을 제공한다. AWS 관리형 서비스인 Amazon SageMaker AI, Amazon Athena, AWS Lambda, Amazon EventBridge, Amazon QuickSight를 결합하여 인프라 관리 부담을 최소화했다. 여기에 오픈소스 도구인 Evidently AI와 SageMaker AI MLflow Apps를 통합하여 실험 기록과 데이터 분포 분석의 정밀도를 높였다.

구축된 거버넌스 레이어는 모델의 예측값이 실제 정답과 동떨어지는 현상을 실시간으로 감지하여 알림을 보낸다. ML 팀은 이 알림을 통해 모델 성능이 일관되게 유지되도록 조기에 조치를 취할 수 있다. 모든 데이터 흐름은 중앙의 Athena Iceberg 테이블을 통해 통합 관리되며, 이를 통해 학습 단계의 메트릭과 추론 단계의 아티팩트를 단일 지점에서 비교 분석한다.

80:20 데이터 분할과 결정론적 해시 기반 베이스라인 설정

Amazon SageMaker AI는 S3에 저장된 예측 데이터를 5개의 Athena Iceberg 테이블로 구성된 중앙 데이터 레이크로 로드한다. 시스템은 전체 데이터를 80%의 학습 데이터(`training_data`)와 20%의 평가 데이터(`evaluation_data`)로 분리하여 관리한다. 이때 `transaction_id`를 기반으로 한 결정론적 해시 분할(Deterministic Hash Split) 방식을 적용한다. 이 방식은 동일한 식별자에 대해 항상 같은 해시값을 생성하므로, 파이프라인을 반복 실행해도 행 단위의 파티션 결과가 동일하게 유지되는 멱등성을 보장한다.

드리프트 모니터링의 기준점인 베이스라인은 학습에 사용되지 않은 20%의 홀드아웃(Hold-out) 슬라이스인 `evaluation_data` 테이블을 사용한다. 모델이 이미 학습한 데이터를 기준으로 삼으면 객관적인 성능 저하를 측정할 수 없기 때문에, 고정된 평가 데이터셋을 통해 모든 등록 모델의 지표를 측정한다. `SeedAthenaTrainingData` 단계는 S3의 예측 CSV 파일을 읽어 이 규칙에 따라 두 테이블에 데이터를 배분하는 단일 시드 단계로 작동한다.

사용자는 쿼리 에디터를 통해 생성된 레코드를 직접 검증하거나, 'Bring your own dataset' 가이드에 따라 자신의 데이터셋으로 학습 데이터를 교체할 수 있다. 이렇게 설정된 고정 베이스라인은 모델 버전이 업데이트되어도 일관된 환경에서 성능 차이를 비교할 수 있는 근거가 된다.

SQS-Lambda 기반의 비동기 추론 데이터 수집 파이프라인

Amazon SageMaker AI의 커스텀 핸들러는 발생한 모든 추론 결과를 Amazon Simple Queue Service(SQS)로 전송한다. 추론 엔드포인트가 저장소에 직접 데이터를 쓰는 대신 메시지 큐를 사용하는 비동기 구조를 채택하여, 추론 응답 속도에 미치는 영향을 최소화했다. 사용자의 애플리케이션이 엔드포인트를 호출하면 추론 요청 데이터가 SQS로 전달되고, 이를 `inference-logger` Lambda 함수가 소비하는 구조다.

`inference-logger` Lambda 함수는 최대 10개의 예측 데이터가 모이거나 30초가 경과하는 시점 중 먼저 도달하는 조건에 따라 데이터를 배치 처리한다. 처리된 데이터는 Athena Iceberg 테이블의 `inference_responses` 테이블에 기록된다. 개별 추론 건마다 데이터베이스에 접근하지 않고 배치 방식을 적용함으로써 쓰기 부하를 줄이고 처리 효율을 높였다.

`inference_responses` 테이블은 추론 요청의 Feature(입력 변수 값), Confidence Score(신뢰도 점수), 타임스탬프, 그리고 고유 식별자인 `inference_id`를 포함한다. 수집된 데이터는 실제 레이블이 업데이트되기 전까지 미결합 상태로 유지된다. 이후 정답 데이터 테이블과 조인되어 모델의 예측 품질을 분석하고 데이터 분포의 변화를 계산하는 기초 자료로 활용된다.

KS 테스트를 활용한 데이터 드리프트 판별과 정답 결합

시스템은 `inference_responses` 테이블과 실제 정답이 담긴 `ground_truth_updates` 테이블을 `inference_id` 기준으로 조인하여 모델 성능을 측정한다. 신용카드 부정 결제 탐지 사례처럼 추론 즉시 결과가 나오지만 정답은 며칠 뒤 조사 결과가 나와야 확정되는 경우, 고유 식별자를 통해 나중에 도착한 정답 데이터를 매칭하는 비동기 결합 방식을 사용한다. 정답이 아직 도착하지 않은 레코드는 `ground_truth` 값을 NULL로 표시하며, 정답이 업데이트되는 즉시 상태를 갱신해 지표에 반영한다.

데이터 분포의 변화를 감지하기 위해 KS 테스트(Kolmogorov-Smirnov test)를 수행한다. 이 통계 검정은 모델 학습 당시의 기준 데이터와 현재 추론 데이터의 누적 분포 함수 차이를 측정한다. 예를 들어, 학습 데이터의 거래 금액 평균이 50달러였으나 최근 추론 데이터의 평균이 500달러로 급증했다면, KS 테스트는 이를 유의미한 분포 변화로 인식하고 드리프트 플래그를 발생시킨다. 이를 통해 모델이 학습하지 못한 새로운 패턴의 데이터 유입을 감지하고 재학습 시점을 정량적으로 결정한다.

분석 대상 기간은 환경 변수인 `DATA_DRIFT_LOOKBACK_DAYS` 설정을 통해 제어한다.

bash
DATA_DRIFT_LOOKBACK_DAYS: 1

위 설정에 따라 최근 1일 동안의 추론 데이터를 기준으로 드리프트를 분석하며, 사용자는 이 수치를 조정해 분석 민감도를 설정할 수 있다.

인프라 자동화 구현 및 운영 환경 적용 기준

AWS는 전체 인프라 설정을 자동화하는 CloudFormation 템플릿과 환경 변수 설정 파일(`.env`)을 제공한다. 사용자는 CloudFormation 템플릿을 실행하여 모니터링에 필요한 모든 리소스 생성과 변수 초기화를 자동으로 완료할 수 있다. 기존에 구축된 SageMaker AI 도메인을 사용하려는 경우, `.env.example` 파일을 `.env`로 복사한 뒤 특정 환경 변수를 업데이트하면 된다. `.env` 파일의 설정값은 `config.yaml`의 기본 설정보다 우선 적용되며, 이후 제공된 노트북 파일들을 순차적으로 실행하여 파이프라인을 활성화한다.

운영 환경 적용 시 주의할 점은 정답 데이터 생성 단계(Step 4)의 성격이다. 제공된 솔루션의 Step 4는 정답 필드 값을 무작위로 반전시켜 15%의 부정확성을 강제로 주입하는 시뮬레이션 과정이다. 실제 운영 환경에서는 이 단계를 실제 비즈니스 프로세스로 대체해야 한다. 사기 탐지 모델의 경우, 자동 승인된 거래 내역, 고객의 결제 취소 요청, 또는 은행이 최종 확인한 사기 여부 데이터가 `ground_truth_updates` 테이블에 기록되는 실제 레이블 피드 구조를 구축해야 한다.

결론적으로, 정답 확인에 시간이 소요되는 도메인은 추론 ID를 식별자로 하여 나중에 도착하는 실제 레이블을 조인하는 비동기 구조를 적용해야 한다. 이는 정답 확정 주기와 성능 측정 주기를 분리하여, 정답이 확보되는 시점에 정확한 성능 저하 폭을 계산할 수 있게 한다. 이를 통해 실무자는 대출 심사역이나 사기 처리 담당자가 뒤늦게 발견하는 오탐지 급증 문제를 기술적으로 해결하고 모델의 침묵하는 성능 저하를 선제적으로 포착할 수 있다.