인도 리전 내 데이터 처리를 보장하는 GPT-5.6 모델

Amazon Bedrock은 인도 내 데이터 주권 요구사항을 충족하기 위해 GPT-5.6 모델인 Terra와 Luna를 아시아 태평양(뭄바이) ap-south-1 리전과 아시아 태평양(하이데라바드) ap-south-2 리전에서 제공한다. 이번 업데이트를 통해 금융 서비스, 의료, 공공 부문과 같이 엄격한 데이터 거주지 규제를 준수해야 하는 조직은 인도 지리적 경계 내에서 모델 추론을 수행할 수 있다. 추론 요청은 오직 인도 내 두 리전 사이에서만 처리되며, 국경 밖으로 데이터가 유출되지 않도록 설계되었다.

해당 모델은 100만 토큰의 컨텍스트 윈도우(모델이 한 번에 처리할 수 있는 정보의 양)를 지원한다. 사용자가 ap-south-1 또는 ap-south-2를 소스 리전으로 설정하여 요청을 보내면, Amazon Bedrock은 가용 용량에 따라 인도 내의 다른 리전으로 요청을 라우팅한다. 이 과정에서 입력된 프롬프트와 출력 결과는 두 리전 사이를 이동할 수 있으나, 모든 데이터는 Amazon 네트워크를 통해 전송되는 동안 암호화된다.

보안 모델은 기본적으로 데이터 미저장(Zero Data Retention) 원칙을 따른다. 이는 Amazon Bedrock이 모델의 입력값이나 출력값을 별도로 저장하지 않음을 의미한다. 다만 GPT-5.6 모델의 경우, Amazon Bedrock의 자동 남용 탐지 분류기에 의해 부적절한 콘텐츠로 플래그된 데이터는 오프라인 분석을 위해 예외적으로 보관될 수 있다. 남용 탐지에 관한 상세한 정책은 Amazon Bedrock User Guide의 Abuse detection 항목에서 확인할 수 있다. 모델별 리전 가용성에 대한 최신 정보는 다음 공식 가이드를 참조한다.

https://docs.aws.amazon.com/bedrock/latest/userguide/

교차 리전 추론을 통한 성능 최적화 메커니즘

교차 리전 추론은 특정 리전의 용량 제한을 넘어 가용 리전 풀을 활용함으로써 트래픽 급증 시에도 안정적인 처리량을 유지하도록 설계된 용량 확보 메커니즘이다. 사용자가 직접 각 리전의 가용 용량을 관리할 필요 없이, 요청이 발생하면 시스템이 자동으로 리전 간 부하 분산을 수행한다. 이는 요청이 단일 리전의 컴퓨팅 자원에 종속되지 않고 더 넓은 범위의 자원을 공유하게 함으로써, 데이터 처리 부하가 집중되는 시점에도 일관된 성능을 보장하는 방식이다. 인도 전용 프로필을 사용하는 경우, 해당 요청은 ap-south-1과 ap-south-2 리전 사이에서만 라우팅되어 데이터가 인도 지리적 경계를 벗어나지 않도록 제어된다.

추론 프로필을 활용한 작업 환경에서는 청구 및 쿼터 관리가 요청을 보낸 소스 리전을 기준으로 통합 관리된다. 백엔드에서 실제로 어떤 리전이 요청을 처리했는지와 관계없이, 사용자의 계정 내 소스 리전에서 모든 비용과 할당량이 추적되는 구조다. 모니터링 데이터 또한 소스 리전에만 기록되므로 관리 효율성을 확보할 수 있다. 구체적인 기록 체계는 다음과 같다.

text
Amazon CloudWatch 및 AWS CloudTrail 로그는 소스 리전에만 기록됨

이러한 통합 기록 체계는 여러 리전에 걸쳐 분산된 인프라를 운영하더라도 모니터링 지점을 하나로 집중할 수 있게 한다. 결과적으로 개발자는 리전별 복잡한 로그 취합 과정 없이 소스 리전의 대시보드만으로 전체적인 호출 상태와 비용을 파악할 수 있다. 만약 대화 맥락을 유지하기 위해 이전 응답을 연결하여 호출하는 경우에는 반드시 store=True 설정이 적용된 응답을 사용해야 하며, 그렇지 않은 응답을 참조하면 오류가 발생한다.

글로벌 프로필과 인도 전용 프로필의 선택 기준

Amazon Bedrock은 인도 내 데이터 처리를 보장하는 전용 프로필과 전 세계 상업용 AWS 리전으로 요청을 분산하는 글로벌 프로필을 구분하여 제공한다. 인도 전용 프로필은 식별자 앞에 in. 접두사를 사용하여 데이터가 인도 국경을 벗어나지 않도록 제어한다. 반면 글로벌 프로필은 global. 접두사를 사용하며, 뭄바이(ap-south-1)나 하이데라바드(ap-south-2) 리전으로 들어온 요청을 전 세계 가용 리전으로 라우팅하여 추론 용량을 극대화한다. 사용자는 자신의 워크로드가 요구하는 데이터 주권 수준에 따라 이 두 가지 프로필 중 하나를 선택해야 한다.

글로벌 프로필을 사용할 경우 Sol, Terra, Luna를 포함한 GPT-5.6 모델군을 활용할 수 있다. 이 프로필은 트래픽 급증 시 Amazon Bedrock이 자동으로 최적의 리전을 선택하여 추론을 수행하므로, 특정 리전의 부하를 분산하고 가용성을 확보하는 데 유리하다. 그러나 법적 규제나 내부 정책에 따라 데이터가 반드시 인도 지리적 경계 내에서 처리되어야 하는 경우에는 반드시 in. 접두사가 붙은 인도 전용 프로필을 선택해야 한다. 인도 전용 프로필은 요청을 ap-south-1과 ap-south-2 리전 사이에서만 라우팅하여 데이터 이탈을 원천적으로 차단한다.

인증 방식은 두 프로필 모두 동일하게 표준 AWS 자격 증명 또는 Amazon Bedrock API 키를 지원한다. 특히 OpenAI SDK를 사용하는 환경에서는 API 키를 베어러 토큰(Bearer token, 인증을 위해 헤더에 포함하는 임시 접근 권한)으로 전달하는 방식이 적합하다. 운영 환경에서는 정적 키를 저장하는 대신 aws-bedrock-token-generator 패키지를 사용하여 기존 AWS 자격 증명으로부터 단기 API 키를 생성하는 방식이 권장된다. 이는 보안성을 높이면서도 개발 편의성을 유지하기 위한 조치다. 상세한 교차 리전 추론 메커니즘과 설정 방법은 Amazon Bedrock User Guide에서 확인할 수 있다.

결과적으로 데이터 주권 준수가 최우선인 워크로드는 in. 접두사 프로필을 통해 데이터의 물리적 위치를 고정하고, 성능과 가용성이 중요한 상업적 서비스는 global. 접두사 프로필을 통해 전 세계 리전의 자원을 활용하는 것이 효율적이다. 이러한 선택은 모델의 추론 성능 자체에는 영향을 미치지 않으나, 데이터 거버넌스 요구사항을 충족하는 핵심적인 설정 기준이 된다. 사용자는 프로젝트 배포 전 각 프로필의 라우팅 범위를 확인하여 적절한 모델 식별자를 지정해야 한다.

기존 OpenAI SDK와의 연동 및 API 호출

추론 파라미터 내 reasoning 값을 조정하면 모델의 사고 깊이를 none, low, medium, high, xhigh, max 단계로 제어할 수 있어 작업의 복잡도에 최적화된 응답을 얻을 수 있다. 기존 OpenAI SDK를 사용하는 환경이라면 별도의 코드 재작성 없이도 엔드포인트와 모델 ID만 변경하여 Amazon Bedrock의 인도 리전 인프라를 즉시 활용 가능하다. 이는 기존 애플리케이션의 호환성을 유지하면서도 데이터 주권이 보장되는 환경으로 전환하려는 개발자에게 유효한 경로를 제공한다.

기존 OpenAI SDK 클라이언트를 활용할 경우, Amazon Bedrock의 엔드포인트를 지정하고 모델 파라미터에 인도 지리적 추론 프로필 ID를 입력하면 연동이 완료된다. 지원되는 API는 OpenAI Responses API, Chat Completions API, 그리고 Amazon Bedrock Converse API를 포함한다. 특히 Responses API는 단일 입력 필드를 사용하며, 생성된 텍스트는 output_text를 통해 반환되고 max_output_tokens로 출력 길이를 제한할 수 있다. 다음은 추론 깊이를 low로 설정하여 호출하는 예시 코드다.

python
client.chat.completions.create(
 model="in.model-id-example",
 messages=[{"role": "user", "content": "Hello!"}],
 reasoning={"effort": "low"}
)

대화 맥락을 유지해야 하는 경우, store=True 설정을 활성화하고 이전 응답 식별자인 previous_response_id를 활용하여 연속적인 대화 흐름을 구성할 수 있다. 인증은 표준 AWS 자격 증명을 사용하거나 Bedrock API 키인 Bearer 토큰을 통해 수행한다. 이러한 설정과 상세한 매개변수 목록은 Amazon Bedrock User Guide(https://docs.aws.amazon.com/bedrock/latest/userguide/)에서 확인할 수 있다.

시스템은 추론 프로필 ID를 통해 요청을 라우팅하며, 인도 지리적 추론 프로필을 사용하면 요청이 인도 내 리전으로만 제한된다. 모델의 추론 깊이 파라미터를 생략할 경우 모델의 기본 설정값이 적용된다. 추가적인 기술 사양과 파라미터별 상세 동작 방식은 공식 문서를 참조하여 구현 환경에 맞게 조정할 수 있다.

프롬프트 캐싱을 통한 비용 효율성 확보

프롬프트 캐싱은 최소 1,024 토큰 이상의 접두사(Prefix)를 가진 반복적인 요청에 대해 90%의 비용 절감 혜택을 제공하며, 이는 인도 지리적 추론 프로필 내에서도 동일하게 적용된다. 데이터 주권 규제를 준수해야 하는 환경에서 시스템 명령어, 지식 베이스 추출물, 또는 소량의 예시 데이터(Few-shot examples)를 반복적으로 입력할 때 발생하는 비용 부담을 획기적으로 낮출 수 있는 기술적 장치다. 특히 검색 증강 생성(RAG)이나 다수의 턴을 거치며 동일한 컨텍스트를 공유하는 에이전트 워크로드에서 그 효율성이 극대화된다.

캐싱 모드는 크게 명시적(Explicit) 방식과 암시적(Implicit) 방식으로 나뉜다. 명시적 캐싱은 사용자가 직접 캐시 경계를 지정하여 제어권을 확보하는 방식이며, 암시적 캐싱은 Amazon Bedrock이 자동으로 캐시 중단점(Breakpoint)을 설정하여 운영 편의성을 높인다. 인도 지리적 추론 프로필을 사용하는 경우, 이러한 캐싱 작업은 모두 인도 데이터 상주 경계 내에서 처리되므로 데이터 주권 정책을 위반하지 않고도 성능과 비용 최적화를 동시에 달성할 수 있다. 관련 상세 사양은 Amazon Bedrock 프롬프트 캐싱 공식 문서를 통해 확인할 수 있다.

실제 구현 시에는 OpenAI SDK를 활용하여 엔드포인트를 뭄바이(ap-south-1) 또는 하이데라바드(ap-south-2)로 설정하고, 인도 지리적 추론 프로필 ID를 모델 파라미터에 입력하여 호출한다. 다음은 Amazon Bedrock에서 GPT-5.6 Terra 모델을 호출할 때의 기본적인 설정 예시다.

python
import boto3

client = boto3.client('bedrock-runtime', region_name='ap-south-1')

response = client.invoke_model(
 modelId='arn:aws:bedrock:ap-south-1::foundation-model/gpt-5-6-terra',
 body=json.dumps({
 "prompt": "캐시될 시스템 명령어 및 지식 베이스",
 "inferenceConfig": {
 "cache": {
 "mode": "explicit"
 }
 }
 })
)

서버 측에서 응답을 보관하려면 `store=True` 옵션을 설정하고, 다음 턴에서 `previous_response_id`를 참조하여 전체 대화 이력을 재전송하지 않고 새로운 입력값만 전달하면 된다. 스트리밍 처리가 필요한 경우 `stream=True`를 사용하여 이벤트 단위로 반복 처리할 수 있다. 데이터 주권 규제를 준수하는 환경에서는 인도 지리적 추론 프로필을 사용하여 교차 리전 라우팅을 수행함으로써, 트래픽 급증 시에도 일관된 처리량을 유지하며 비용 효율적인 추론 환경을 운영할 수 있다.