처리량 4배 향상한 Nemotron 3.5 Lightning의 출시

처리량이 최대 4배 향상하고 작업 완료 속도가 최대 30% 단축된 Nemotron 3.5 Lightning이 공개됐다. 이 수치는 대량의 요청을 처리해야 하는 에이전트 워크플로우, 즉 AI가 목표 달성을 위해 스스로 단계를 계획하고 실행하는 작업 환경을 운영하는 개발자가 인프라 비용과 지연 시간 사이에서 내리는 선택지를 바꾼다. 특히 고부하 에이전트 작업에 최적화된 이 모델은 Amazon SageMaker JumpStart(클라우드 기반 파운데이션 모델 배포 허브)를 통해 제공되어 별도의 복잡한 설정 없이 즉시 배포할 수 있다. 처리량은 단위 시간당 모델이 처리하는 데이터의 양을 의미하며, 이 수치의 상승은 동일 자원으로 더 많은 사용자 요청을 처리할 수 있음을 뜻한다.

NVIDIA는 Nemotron 3.5 Lightning을 상시 가동되는 에이전트를 구동하기 위한 해당 체급 내 가장 빠른 오픈 모델로 정의한다. 이 모델은 단일 지원 GPU(그래픽 처리 장치)에서 실행 가능하도록 설계되어 하드웨어 진입 장벽을 낮췄다. 기존에는 전문화된 에이전트 단계를 수행하기 위해 수많은 GPU가 연결된 프론티어 모델급 인프라, 즉 최첨단 대규모 모델을 위한 거대 연산 자원이 필요했다. 하지만 이제는 단일 GPU 환경에서도 반복적이고 전문적인 에이전트 워크플로우 단계를 효율적으로 처리할 수 있다. 이는 전체 시스템의 운영 비용 구조를 개선하면서도 에이전트의 최종 응답 속도를 높이는 결과로 이어진다.

실제 적용 범위는 개인 비서부터 금융 서비스, 보안 운영, 통신, 리테일에 이르기까지 다양한 전문 에이전트 워크로드로 확장된다. 사용자는 Amazon SageMaker JumpStart에서 Nemotron 3.5 Lightning을 검색해 즉시 배포 프로세스를 시작할 수 있다. 구체적인 배포 방법과 운영 가이드는 Amazon SageMaker AI Developer Guide의 JumpStart 파운데이션 모델 사용 섹션에서 확인할 수 있다. 서빙 프레임워크, 즉 모델을 실제 서비스 형태로 제공하기 위한 소프트웨어 환경을 수동으로 구성하는 과정이 생략되므로 인프라 엔지니어링 공수를 줄이면서도 고성능 에이전트 기능을 서비스에 통합하는 것이 가능하다.

3B 활성 파라미터와 1M 컨텍스트의 작동 원리

고빈도 에이전트 워크플로우를 설계하는 개발자는 전체 30B 파라미터 중 3B만 활성화하는 하이브리드 MoE 구조를 통해 추론 효율을 높일 수 있다. MoE(Mixture-of-Experts, 전문가 혼합 구조)는 모든 파라미터를 사용하는 대신 입력값의 특성에 맞는 일부 전문가 네트워크만 선택적으로 사용하는 방식이다. 순전파(Forward Pass, 입력 데이터가 신경망의 층을 통과하며 결과값을 계산하는 과정) 시 3B의 파라미터만 작동하므로 연산 비용을 낮추면서도 30B 규모의 광범위한 지식을 활용한다. 이 모델은 Nemotron 3 Ultra 모델로부터 증류(Distillation, 큰 모델의 지식을 작은 모델로 전이하는 기법)되어 개발되었다. 대형 모델이 가진 복잡한 추론 능력을 작은 모델의 구조에 효율적으로 압축해 넣음으로써 모델 크기를 줄이면서도 성능 하락을 최소화했다.

토큰 생성 시 발생하는 지연시간을 줄이기 위해 DFlash 추측적 디코딩 기술을 적용했다. 추측적 디코딩(Speculative Decoding, 다음 토큰을 미리 예측해 생성 속도를 높이는 기술)은 작은 보조 모델이 다음에 올 토큰들을 빠르게 추측하고, 메인 모델이 이를 한꺼번에 검증하는 메커니즘이다. 검증 결과가 일치하면 여러 개의 토큰을 한 번에 확정하므로 개별 토큰을 하나씩 순차적으로 생성할 때보다 처리 속도가 빨라진다. DFlash는 이러한 추측과 검증 과정을 최적화해 토큰당 지연시간을 낮추며, 특히 요청량이 많은 고부하 환경에서 응답 속도를 일정하게 유지한다.

1M(100만) 토큰의 컨텍스트 윈도우는 긴 세션 동안의 상태 유지 능력을 결정한다. 컨텍스트 윈도우(Context Window, 모델이 한 번에 처리할 수 있는 텍스트의 양)가 넓으면 수십만 단어에 달하는 이전 대화 기록이나 방대한 기술 문서를 한꺼번에 메모리에 올릴 수 있다. 이 구조 덕분에 반복적인 재접지(Re-grounding, 모델이 맥락을 잊지 않도록 관련 정보를 다시 입력하는 과정)를 수행하지 않고도 작업의 흐름을 끊김 없이 이어간다. 에이전트가 장기적인 작업을 수행하며 누적된 상태(Accumulated State, 이전 단계에서 결정된 값이나 정보의 집합)를 계속 유지할 수 있어, 세션이 길어져도 정보 손실 없이 일관된 결과물을 생성하며 복잡한 워크플로우를 완수한다.

BF16과 NVFP4 변체 및 모델 시스템 전략

Nemotron 3.5 Lightning은 BF16과 NVFP4라는 두 가지 정밀도 변체를 제공한다. BF16은 딥러닝 학습과 추론에 최적화된 Bfloat16 수치 형식을 의미하며, NVFP4는 메모리 사용량을 줄이고 연산 속도를 높이는 NVIDIA FP4 양자화 기술을 적용한 버전이다. 양자화는 모델의 가중치를 더 낮은 비트로 표현해 계산 효율을 높이는 과정이다. NeMo Gym 레시피를 기준으로 분석했을 때, NVFP4는 많은 작업에서 BF16과 유사한 수준의 정확도를 유지한다. 이는 정밀도를 낮추더라도 실제 추론 결과의 품질 저하가 적다는 것을 의미한다. 사용자는 작업의 정밀도 요구 수준에 따라 두 변체 중 하나를 선택해 인프라 자원 소모와 성능 사이의 균형을 맞출 수 있다. 정밀도 변체 선택은 하드웨어의 메모리 제약과 추론 속도 목표에 따라 결정된다.

모델 시스템 접근법은 작업의 복잡도에 따라 처리 모델을 다르게 배치하는 전략이다. 다단계 워크플로우를 계획하거나 하위 에이전트를 조율하는 복잡한 추론 작업은 프론티어 모델이 담당한다. 프론티어 모델은 최첨단 성능을 가진 대규모 모델을 뜻한다. 반면 알람 분류, 양식 내 필드 추출, 기록의 정책 준수 여부 확인 같은 단순 작업은 Lightning 모델이 처리한다. 이러한 단순 작업들은 전체 모델 호출 횟수에서 매우 큰 비중을 차지하며, 굳이 거대 모델의 추론 능력을 전부 사용할 필요가 없는 영역이다. 모든 단계에 고성능 모델을 투입하는 대신 작업 성격에 맞는 모델을 배치해 전체 시스템의 연산 비용을 최적화하는 구조다. 작업의 성격에 따라 모델을 분리하면 개별 모델의 전문성을 높이면서 운영 효율을 동시에 챙길 수 있다.

NVIDIA NeMo Switchyard는 워크플로우의 개별 단계를 선택한 모델 풀로 라우팅한다. NeMo Switchyard는 요청이 들어왔을 때 어떤 모델이 처리할지 결정해 전달하는 라우팅 계층이다. 속도와 도메인 특화 정확도가 중요한 고볼륨 전문 작업 단계에서 Lightning 모델을 선택해 배치할 수 있다. 이를 통해 전체 워크플로우 내에서 각 단계가 요구하는 성능 수준에 최적화된 모델이 실시간으로 할당된다. 단순 반복 작업은 가벼운 모델로 빠르게 처리하고, 고도의 판단이 필요한 지점에서만 무거운 모델을 사용하는 방식이다. 이는 불필요한 연산 낭비를 줄이면서도 최종 결과물의 품질을 유지하는 엔지니어링 전략이며, 전체 시스템의 응답 속도를 개선하는 결과로 이어진다.

현장에서 달라지는 비용과 판단

사용자는 모델의 배포 경로를 SageMaker JumpStart(AWS의 사전 학습 모델 저장소)와 Hugging Face(오픈소스 모델 공유 플랫폼) 중 하나로 선택한다. JumpStart를 이용하면 저장소 내에서 모델을 검색한 뒤, 워크로드에 맞는 인스턴스 유형을 선택해 배포하는 과정을 거친다. Hugging Face 모델 페이지에서 Deploy 버튼을 누르고 Amazon SageMaker AI를 선택하는 경로도 제공된다. 이 선택은 SageMaker AI 배포 워크플로우로 연결되며, 여기서 모델의 세부 설정을 구성하고 최종적으로 배포를 완료한다. 개발자는 자신이 사용하는 모델 관리 도구에 따라 인프라 구축 시작점을 결정할 수 있다.

배포 단계에서 입력하는 모델 ID는 연산 정밀도와 하드웨어 자원 효율을 결정하는 핵심 식별자다. NVFP4(NVIDIA FP4 양자화, 데이터 표현 비트를 줄여 메모리 사용량을 낮추는 기술) 변체를 사용해 자원 효율을 높이려면 다음 식별자를 사용한다.

huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4

상대적으로 높은 정밀도가 필요한 BF16(Bfloat16, 딥러닝 학습에 최적화된 부동소수점 형식) 모델을 배포할 때는 아래 식별자를 입력한다.

huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16

사용자는 처리해야 할 작업의 정확도 요구치와 가용 GPU 메모리 상황을 고려해 두 가지 변체 중 하나를 선택한다.

인프라 운영 단계에서는 생성된 엔드포인트의 생명주기를 관리하는 것이 운영 비용과 직결된다. SageMaker AI 엔드포인트는 모델이 배포되어 실행 중인 상태에서 시간당 비용이 발생하는 구조다. 구체적인 과금 체계는 Amazon SageMaker AI pricing 페이지에서 확인할 수 있다. 테스트나 특정 작업 완료 후 엔드포인트를 삭제하지 않으면 사용 여부와 관계없이 비용이 계속 청구된다. 따라서 배포 후 검증이 끝나면 리소스를 즉시 삭제하는 습관이 실제 운영 비용을 줄이는 유일한 방법이다.

이러한 배포 경로와 모델 변체의 선택은 시스템-오브-모델(System-of-models, 작업별로 최적화된 여러 모델을 조합해 사용하는 방식) 전략을 실현하는 구체적인 수단이 된다. 모든 추론 단계를 거대 모델 하나로 처리하면 프론티어 모델(최첨단 대규모 모델) 특유의 높은 비용과 지연시간이 발생한다. 반면 단순 분류나 정책 확인 같은 하위 작업은 Lightning 모델에 할당하고, 복잡한 계획 수립 단계만 거대 모델이 처리하게 하여 전체 효율을 높인다. 결국 어떤 모델 ID를 선택하고 엔드포인트를 어떻게 운용하느냐가 AI 서비스의 경제적 타당성을 결정한다.

도메인 특화 사후 학습과 산업별 적용 가능성

Nemotron 3.5 Lightning은 가중치를 직접 소유하고 배포 위치를 자유롭게 결정할 수 있는 오픈 모델로 출시되었다. 오픈 모델은 모델의 지능을 결정하는 수치 집합인 가중치를 공개하여 사용자가 이를 내려받아 수정하거나 폐쇄망에 설치할 수 있게 한 형태다. 사용자는 `huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4` 또는 `huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16` 모델 ID를 통해 목적에 맞는 변체를 선택해 사용할 수 있다. 이는 기업이 데이터 보안을 위해 외부 API 호출을 제한하고 자체 인프라 내에서 모델을 완전히 통제하며 운영해야 하는 요구사항을 충족한다.

NVIDIA NeMo를 이용하면 특정 산업의 도구와 워크플로우 그리고 내부 정책에 맞춘 사후 학습을 수행할 수 있다. 사후 학습은 기초 모델이 일반적인 지식을 습득한 후 특정 도메인의 데이터를 추가로 학습시켜 전문성을 높이는 과정이다. NVIDIA NeMo는 이러한 생성형 AI 모델의 구축과 최적화를 지원하는 전용 프레임워크다. 이를 적용하면 금융 서비스의 복잡한 규정 준수나 보안 운영을 뜻하는 SecOps의 위협 대응 절차를 모델에 내재화할 수 있다. 개인 비서 서비스나 통신 그리고 리테일 분야에서도 각 기업이 보유한 고유의 API 도구 사용법과 업무 흐름을 학습시켜 실무에 즉시 투입 가능한 에이전트를 구현하는 것이 가능하다.

현재 Amazon SageMaker JumpStart 모델 카드 내에서는 직접적인 커스터마이징 기능을 노출하지 않는다. SageMaker JumpStart는 검증된 모델을 선택해 즉시 인스턴스에 배포할 수 있도록 돕는 AWS의 모델 허브 서비스다. 따라서 모델 카드 상의 인터페이스만으로는 사후 학습을 진행할 수 없으며 별도의 학습 파이프라인을 구축해야 한다. 도메인 특화 최적화가 필요한 경우 NVIDIA NeMo를 통해 학습을 완료한 뒤 해당 가중치를 배포 환경에 적용하는 방식을 사용한다. 배포 이후에는 자원 낭비를 막기 위해 사용이 완료된 SageMaker AI 엔드포인트를 삭제하여 불필요한 과금을 방지해야 한다.

복잡한 계획 수립은 프론티어 모델이 담당하고 단순 분류나 정책 확인 같은 전문 작업은 특화 모델에 배치하는 모델 시스템 전략을 통해 추론 비용을 절감하라.