RAG 추론 비용 절감을 위한 3단계 캐스케이드 구조

추론 비용을 낮추는 핵심은 모든 사례를 LLM(대규모 언어 모델)으로 보내지 않고 처리 단계를 분리하는 것이다. 제안된 캐스케이드 아키텍처는 전체 파이프라인을 결정론적 단계, 검색 단계, LLM 단계의 3단계로 구성한다.

첫 번째 단계는 결정론적(Deterministic) 처리 구간이다. 정확한 일치(Exact match)나 구조화된 필드 비교, 명확한 규칙 기반 로직을 통해 처리하며, 이 과정에서 LLM 호출은 전혀 발생하지 않는다. 데이터 품질에 따라 전체 처리량의 절반 이상을 이 단계에서 해결할 수 있으며, 모든 결정은 추론이 아닌 룩업(Lookup) 결과이므로 완전한 설명이 가능하다.

두 번째 단계는 검색(Retrieval) 레이어다. 1단계에서 해결되지 않은 모호한 사례에 대해 관련 증거를 추출한다. 유사 사례에 대한 이전 검토자의 결정, 상충하는 내용을 설명하는 문맥 문서, 예외 사례를 명확히 하는 과거 판례 등이 여기에 해당한다. 이 단계의 목적은 생성(Generation)보다 정확한 문맥을 확보하는 데 집중하는 것이다.

마지막 세 번째 단계에서만 LLM을 호출한다. 앞선 두 단계를 통과한 잔여 사례만 처리하며, 실제 적용 사례에서 모호한 10~15%의 케이스만 LLM으로 라우팅했을 때 전체 추론 비용이 베이스라인 대비 약 6배 절감되는 결과가 확인됐다. 동시에 결정론적 처리가 가능한 다수 사례에 대해서는 일관성을 사실상 완벽한 수준으로 끌어올렸다.

비대칭 위험 프롬프팅과 평가 메커니즘

프롬프트 설계 단계에서는 오류의 유형에 따라 가중치를 다르게 두는 비대칭 위험 프롬프팅(Asymmetric risk prompt)을 적용한다. 고위험 분류 작업에서는 '주의가 필요한 사례를 놓치는 것'과 '정상 사례를 잘못 플래그하는 것'의 비용이 서로 다르기 때문이다. 모델이 불확실성을 느낄 때 임의로 결정하지 않고 상위 단계로 에스컬레이션(Escalation)하도록 지시하며, 두 가지 오류 유형의 결과와 그에 따른 영향을 구체적으로 명시한 캘리브레이션 예시를 제공한다.

출력 값으로는 이진 답변이 아닌 분류 결과와 함께 신뢰도 점수(Confidence score)를 요구한다. 이 점수는 두 번째 캐스케이드 지점으로 작동하며, 설정된 임계값 미만의 결과는 모델의 분류 내용과 상관없이 자동으로 인간 검토자에게 전달된다.

평가 방식 또한 일반적인 RAG 지표와 다르게 접근한다. 검색 품질(Retrieval quality)과 최종 분류 정확도를 분리해 측정하며, 생성 단계에서 증거의 가중치를 잘못 설정해 발생하는 오류를 추적한다. 특히 평가 데이터셋 구성 시, 시스템의 판단력이 실제로 시험되는 3단계(LLM) 도달 사례를 의도적으로 오버샘플링한다. 운영 환경의 분포를 그대로 반영할 경우, 이미 잘 처리되는 결정론적 사례가 지표를 지배해 정작 중요한 실패 지점을 발견하지 못하기 때문이다.

LLM을 판정자로 사용하는 'LLM-as-judge' 평가를 수행할 때도 판정자 프롬프트에 운영 프롬프트와 동일한 비대칭 위험 프레임워크를 인코딩해야 한다. 두 오류 유형을 동일하게 취급하는 판정자는 튜닝 과정에서 잘못된 트레이드오프를 선택하게 만든다. 최종적으로 인간 검토자가 모델의 결정을 뒤집은 사례와 정답을 다시 검색 코퍼스에 반영하는 피드백 루프를 구축해 모호한 사례에 대한 처리 능력을 지속적으로 개선한다.

규제 환경에서의 운영 제약과 도입 판단

감사 가능성(Auditability)은 규제 산업 RAG 시스템의 필수 조건이다. "모델이 검색된 문맥을 바탕으로 결정했다"는 설명은 감사 기관이나 컴플라이언스 담당자에게 수용되지 않는다. 추론을 다시 실행해 동일한 결과가 나오길 기대하는 것이 아니라, 인간이 추론 없이도 재구성할 수 있는 결정 경로(Decision path)가 확보되어야 한다.

모델 드리프트(Model drift) 문제 역시 쉬운 사례에서 두드러진다. LLM은 미묘한 판단에는 능숙하지만, 결정론적인 답변이 나와야 하는 명확한 구조적 일치 사례에서 일관성을 잃는 경우가 있다. 이러한 일관성 결여는 탐지가 어렵기 때문에, 명확한 기준에 따른 매칭 작업은 모델의 상태에 의존하지 않는 독립적인 로직으로 분리해야 한다.

따라서 고위험 도메인의 시스템을 설계하는 개발자는 프롬프트를 작성하기 전, 전체 결정 과정 중 어떤 부분이 모델의 역할이 아니어야 하는지를 먼저 정의하고 이를 결정론적 단계로 격리하는 설계를 우선해야 한다.