Nemotron 3.5 Lightning: 30B MoE 모델의 성능과 개방성

NVIDIA는 8월 11일 Nemotron 3.5 Lightning을 공개하며 상시 가동 에이전트를 위한 30B 규모의 MoE(Mixture-of-Experts) 오픈 가중치 모델을 선보였다. 이 모델은 동급의 다른 오픈 모델들과 비교했을 때 토큰 생성 속도를 최대 4배까지 높였으며, 전체 작업 완료 시간은 30% 단축하는 성과를 거두었다. 개발자는 오픈 가중치 방식을 통해 모델의 내부 파라미터에 접근할 수 있으며, 이를 바탕으로 특정 도메인에 최적화된 추론 성능을 구현할 수 있다. MoE 구조는 모든 파라미터를 사용하는 대신 입력값에 적합한 전문가 네트워크만 선택적으로 활성화함으로써 연산 효율을 극대화하고 로컬 환경에서의 추론 지연 시간을 최소화한다.

맞춤형 파인튜닝을 통한 로컬 에이전트의 개인화

AI 개발자와 연구자는 Nemotron 3.5 Lightning의 오픈 가중치를 활용해 자신의 고유한 예시 데이터로 모델을 파인튜닝할 수 있다. 이러한 최적화 과정을 거친 모델은 사용자의 특정 작업, 관심사, 그리고 개별적인 워크플로우에 정밀하게 맞춤화된 응답을 생성한다. 파인튜닝된 모델이 로컬 앱, 파일, 외부 도구의 접근 권한과 결합되면 이메일 및 캘린더를 관리하는 개인 비서나 일상 루틴을 처리하는 스마트홈 에이전트로 작동한다. 또한 개발자는 로컬 코드베이스에 직접 접근하는 코딩 컴패니언을 구축하여 보안이 중요한 내부 소스 코드 분석 및 개발 보조 작업을 수행할 수 있다.

NVFP4와 GGUF 포맷 기반의 배포 생태계

NVIDIA는 vLLM, Ollama, llama.cpp, LM Studio와 협력하여 Nemotron 3.5 Lightning의 로컬 배포 경험을 최적화하고 NVFP4 및 GGUF 모델 포맷을 제공한다. NVFP4 포맷은 엔비디아 하드웨어에서 연산 효율을 높이도록 설계된 4비트 부동소수점 형식이며, GGUF는 다양한 하드웨어 환경에서 범용적으로 사용되는 개방형 포맷이다. Unsloth는 Unsloth Studio를 통해 모델 출시와 동시에 최적화된 양자화 모델을 지원함으로써 로컬 배포 시의 메모리 점유율을 낮추고 실행 속도를 높였다. 사용자는 build.nvidia.com에서 NVIDIA NIM 마이크로서비스 형태로 모델을 이용하거나, OpenRouter 및 다양한 클라우드 파트너사의 추론 플랫폼을 통해 모델 성능을 검증할 수 있다.

Jetson부터 Blackwell까지의 하드웨어 확장성

Nemotron 3.5 Lightning은 NVIDIA Jetson, RTX PC, DGX Spark, OEM GB10 시스템과 같은 엣지 및 엔트리급 하드웨어에서 로컬로 구동된다. 더 높은 연산 성능이 필요한 환경에서는 RTX PRO 워크스테이션, NVIDIA DGX Station, GB300 데스크사이드 시스템으로 확장하여 대규모 데이터 처리와 복잡한 추론을 수행할 수 있다. 엔터프라이즈급 인프라를 구축하려는 기업은 Acer, ASUS, Dell Technologies, Exxact, GIGABYTE, HP, Lenovo, MSI, Supermicro가 공급하는 NVIDIA Blackwell 시스템을 선택할 수 있다. 사용자는 자신의 서비스 규모와 예산, 물리적 설치 공간에 맞춰 엣지 디바이스부터 데이터센터 서버까지 다양한 폼 팩터를 조합해 인프라를 구성한다.

NeMo Switchyard를 활용한 비용 최적화 및 선택 기준

NVIDIA는 에이전트 워크플로우의 각 단계를 정확도, 속도, 비용에 따라 최적의 모델로 자동 배정하는 오픈 소스 라우팅 라이브러리인 NeMo Switchyard를 GitHub에 공개했다. NeMo Switchyard는 개발자가 서로 다른 모델과 제공자를 작업 성격에 맞춰 유연하게 조합할 수 있게 하여 특정 벤더에 대한 종속성을 줄이고 운영 효율을 높인다. 내부 벤치마크 결과에 따르면, 이 라우팅 전략을 적용했을 때 프런티어 수준의 작업 완료도를 유지하면서도 전체 비용을 Opus 4.8 단독 사용 시의 약 1/3 수준으로 절감했다. 실무자는 단일 고성능 모델의 단순 사용과 라우팅 기반의 소형 모델 조합 사이에서 비용과 성능의 균형점을 분석하여 도입 여부를 결정해야 한다. NeMo Switchyard의 소스 코드는 아래 링크에서 확인할 수 있다.

GitHub