CUR 2.0 IAM 주체 데이터 활성화와 비용 추적의 시작

Amazon Bedrock의 전체 비용만 확인 가능하던 상태에서 CUR 2.0의 IAM 주체 데이터를 활성화하면 요청자별 비용을 식별할 수 있다. 관리자는 비용이 급증한 지점이 특정 사용자나 서비스 역할인지 구분하여 불필요한 리소스 낭비를 제거할 수 있다.

비용 분석을 위해 Data Exports 도구로 CUR 2.0 설정을 완료하고 Amazon Athena에 연결해야 한다. 내보내기 설정에서 IAM 주체 데이터를 활성화하면 보고서 내 `line_item_iam_principal` 컬럼과 IAM 주체 태그 정보가 생성된다. 이를 통해 API 요청을 보낸 사용자나 역할의 신원을 특정하고 개별 추론 요청의 주인을 확인할 수 있다.

IAM 주체 데이터를 활성화하면 사용량 데이터가 각 IAM 주체별 개별 행으로 확장 기록되어 CUR 파일 크기가 증가한다. 호출 주체가 많은 환경에서는 데이터 양이 빠르게 늘어나므로 Amazon S3 저장 공간을 사전에 계획해야 한다. 저장 비용 관리를 위해 S3 수명 주기 정책(Lifecycle policies)으로 오래된 파일을 자동 삭제하거나 저렴한 저장소 계층으로 이동시키는 설정이 필요하다.

설정 후 첫 번째 CUR 2.0 보고서가 S3 버킷에 적재되기까지 최대 24시간이 소요된다. 데이터 적재 이후부터 Athena 쿼리를 통해 `line_item_iam_principal` 기반의 비용 분해가 가능하며, 이는 세부 쿼리 분석과 대시보드 시각화의 기초 데이터가 된다.

Amazon Athena를 활용한 SQL 기반의 정밀 비용 분석

Amazon Athena는 S3에 저장된 데이터를 SQL로 분석하는 서버리스 쿼리 서비스로, 스캔한 데이터 1TB당 5달러의 비용이 발생한다. 이 서비스는 `billing_period` 컬럼에 하이브 파티션 프로젝션을 적용하여, 쿼리에 특정 월 필터를 포함하면 해당 월의 파케이(Parquet) 파일만 스캔한다. 대부분의 분석 쿼리는 스캔량이 10MB 미만으로 유지되어 쿼리당 약 0.00005달러가 청구된다. 비용을 낮추려면 `SELECT *` 대신 필요한 컬럼만 선택하고 `WHERE billing_period` 필터로 스캔 범위를 제한해야 한다.

특정 호출자가 사용한 모델과 비용을 확인하려면 SQL 쿼리로 Bedrock 제품 코드만 필터링한다. 플랫폼 팀은 이 결과를 통해 모델별 사용량 추이를 확인하고 비용 최적화 대상을 식별한다.

sql

SELECT line_item_iam_principal, line_item_usage_type, sum(line_item_unblended_cost) FROM your_cur_table_name WHERE line_item_product_code = 'AmazonBedrock' GROUP BY 1, 2

쿼리 실행 시 `your_cur_table_name`을 `cid_data_export.cur2`와 같은 실제 Athena 테이블 이름으로 대체해야 한다.

다양한 태그 키와 값의 쌍을 분석할 때는 `UNNEST` 함수를 사용해 배열 형태의 데이터를 개별 행으로 풀어내어 팀별 비용을 배분한다. 이러한 Athena 환경과 CUR 데이터 연결 과정을 자동화하기 위해 `agent.md` 스킬 저장소를 활용할 수 있다. Claude Code, Kiro-CLI, Codex 같은 AI 어시스턴트로 해당 저장소를 연결하면 환경 설정부터 데이터 연결까지의 전 과정을 자동화하여 분석 준비 시간을 단축한다.

CUDOS 대시보드 v5.8의 시각적 비용 관리 효율성

CUDOS v5.8 버전은 AI/ML 탭 내에 Amazon Bedrock 전용 섹션을 추가하여 IAM 주체별 비용 추적 기능을 통합했다. CUDOS는 오픈 소스 기반의 CID(Cloud Intelligence Dashboards) 프레임워크를 통해 제공되는 시각화 도구다. 사용자는 SQL 쿼리 작성 없이 대시보드에서 Bedrock의 비용 지출 현황을 즉각적으로 확인하고 인프라 비용을 관리할 수 있다.

AI/ML 탭에서는 IAM 주체별로 비용을 분해하여 분석하며, 100만 토큰당 비용 추세를 시각적으로 제공해 모델 사용량 변화에 따른 단가 변동을 추적한다. 이를 통해 어떤 주체가 토큰을 과다 소비하는지, 특정 시점에 비용이 왜 급증했는지 수치로 확인하여 모델 선택의 적절성을 판단한다.

IAM Principal Tag Project 필터를 사용하면 조직 내 특정 프로젝트 단위로 비용을 분리할 수 있다. 예를 들어 `chatbot-v2`라는 프로젝트 태그를 설정한 경우, 해당 프로젝트에서 사용한 모델별 비용과 사용 유형별 지출액만 필터링하여 출력한다. 여러 팀이 하나의 AWS 계정을 공유하는 환경에서 각 프로젝트가 점유하는 비용 비중을 빠르게 산출하여 예산 집행 효율성을 판단하는 방식이다.

대시보드와 Athena 쿼리 데이터베이스는 AWS CloudFormation 템플릿을 통해 일괄 배포된다. 이를 통해 분석에 필요한 데이터베이스 구조와 시각화 레이아웃이 자동으로 구성되어 수동 설정 시 발생하는 휴먼 에러를 방지하고, 대규모 조직에서도 동일한 분석 기준을 빠르게 적용할 수 있다.

모델 교체 판단 근거가 되는 서비스별 비용 데이터

ChatApp은 Claude 4.6 Sonnet을 사용하여 80달러 이상의 비용을 발생시키는 반면, DocProcessor는 Nova Lite를 사용하여 5달러 미만의 비용을 기록한다. 두 서비스는 각각 서로 다른 IAM 역할을 할당받아 운영되므로, 플랫폼 팀은 서비스별로 분리된 비용 데이터를 통해 어떤 애플리케이션이 Bedrock 지출의 가장 큰 비중을 차지하는지 파악할 수 있다.

ChatApp의 세부 지출 내역을 분석하면 전체 비용 중 출력 토큰(Output token) 비용이 72달러로 과다하게 측정되었다. 이는 모델이 생성하는 답변의 양이 많거나 고비용 모델인 Claude 4.6 Sonnet의 단가가 높게 적용된 결과다. 단순 인사나 반복 안내 문구에도 고성능 모델을 일괄 적용했을 때 발생하는 비용 낭비 지점이며, 출력 토큰 비용의 비중이 높다는 사실은 모델 교체 시 즉각적인 절감 효과를 기대할 수 있음을 보여준다.

반면 단순 요약 작업을 수행하는 DocProcessor는 Nova Lite를 사용하여 5달러 미만의 비용을 유지하고 있다. Nova Lite는 처리 속도가 빠르고 비용이 낮은 경량 모델로, 정형화된 텍스트 요약 작업에 적합하다. 해당 서비스의 낮은 비용은 작업 난이도에 맞는 모델이 배치되었음을 수치로 증명한다.

이 데이터는 고비용 모델을 저비용 모델로 교체하는 의사결정 근거가 된다. ChatApp의 일부 단순 질의 응답 과정을 Nova Lite로 전환하면 72달러에 달하는 출력 토큰 비용을 낮출 수 있다. 이는 서비스별 비용 데이터라는 객관적 지표를 바탕으로 워크로드별 최적의 모델 조합을 찾는 전략적 접근이다.

한국 AI 실무자를 위한 멀티테넌트 비용 회수 전략

서비스별로 독립적인 IAM 역할을 할당하고 team, project, costcenter 같은 비용 할당 태그(Cost Allocation Tags)를 결합하면 비용 격리가 가능하다. 여러 팀이 하나의 Bedrock 계정을 공유하는 환경에서 이 체계는 사용 부서에 비용을 청구하는 비용 회수(Chargeback)의 기초가 된다. 권한 분리와 태그 지정이 선행되어야 개별 서비스의 자원 소비를 추적하고 부서별 예산 집행 내역을 증빙할 수 있다.

태그가 활성화되면 CUR 2.0 데이터의 태그 컬럼에 `iamPrincipal/` 접두사가 붙어 기록된다. 예를 들어 프로젝트 태그 키가 project라면 데이터상에는 `iamPrincipal/project` 형태로 나타난다. 실무자는 Athena 쿼리로 이 접두사 기반 데이터를 그룹화하여 특정 팀의 월간 지출액이나 챗봇 프로젝트의 총비용을 산출한다. 이는 IAM 주체별로 세분화된 데이터를 기반으로 하여 오차 없는 비용 배분을 가능하게 한다.

멀티테넌트 AI 플랫폼 운영자는 프로젝트별로 예산 한도를 설정하고 초과 알림 기준을 마련해 비용 폭주를 방지한다. 각 팀의 사용 패턴을 분석해 낭비 지점을 찾고 적절한 쿼터(Quota)를 배정하는 운영 체계를 구축하여, 특정 팀의 과도한 모델 호출이 전체 플랫폼 예산을 잠식하는 리스크를 제어한다. 비용 데이터의 가시성이 확보되면 데이터 기반의 자원 배분이 가능해지며 전사적 AI 도입 비용을 최적화할 수 있다.

특정 애플리케이션의 출력 토큰 비용이 예산을 초과해 과다하게 발생할 경우, 모델을 Claude 4.6 Sonnet에서 Nova Lite로 변경하여 비용을 절감한다.