기술 제원 및 입력 제어 방식

DeepSeek-V4-Flash-DSpark와 동일한 모델 구조를 채택한 이번 버전은 기존 프리뷰 모델을 완전히 대체한다. 가장 먼저 바뀐 점은 모델이 답변을 생성하기 전 숙고하는 깊이를 조절하는 `reasoning_effort` 파라미터의 도입이다. 개발자는 이를 `low`, `high`, `max` 세 단계로 설정해 추론 자원 투입량과 답변의 정밀도를 제어할 수 있다.

입출력 처리 방식에서도 일반적인 Jinja 형식의 채팅 템플릿을 사용하지 않는 점이 특징이다. 대신 전용 인코딩 폴더에 포함된 파이썬 스크립트를 통해 OpenAI 호환 형식의 메시지를 모델 입력 문자열로 변환하고 출력 텍스트를 파싱해야 한다. 아래는 `encoding_dsv4` 라이브러리를 활용해 메시지를 인코딩하고 토큰화하는 과정이다.

python
from encoding_dsv4 import encode_messages, parse_message_from_completion_text

messages = [
 {"role": "user", "content": "hello"},
 {"role": "assistant", "content": "Hello! I am DeepSeek.", "reasoning_content": "thinking..."},
 {"role": "user", "content": "1+1=?"}
]

messages -> string

prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max")

string -> tokens

import transformers

tokenizer = transformers.AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V4-Flash-0731")

tokens = tokenizer.encode(prompt)

추론 메커니즘 및 벤치마크 결과

추론 속도 개선을 위해 작은 모델이 토큰을 먼저 예측하고 큰 모델이 이를 검증하는 추측적 디코딩(Speculative Decoding) 모듈이 기본 탑재됐다. 이 구조는 정확도를 유지하면서 생성 지연시간을 낮추는 역할을 한다. 특히 활성화 파라미터 수가 적은 플래시 모델임에도 불구하고, 특정 과업에서는 더 큰 규모의 DeepSeek-V4-Pro 프리뷰 버전을 상회하는 수치를 보였다.

터미널 벤치 2.1(Terminal Bench 2.1)에서 82.7점을 기록해 Pro 버전의 72.1점보다 높았으며, 자연어를 저장소 코드로 변환하는 NL2Repo에서는 54.2점을 기록해 Pro 버전(38.5점)과 격차를 벌렸다. 에이전트의 도구 사용 능력을 측정하는 툴라슬론(Toolathlon-Verified)에서는 70.3점을, 사이버짐(Cybergym)에서는 76.7점을 기록했다. 내부 평가 지표인 DSBench-FullStack(68.7점)과 DSBench-Hard(59.6점) 결과는 복잡한 풀스택 개발 및 고난도 코딩 과제 수행 능력을 뒷받침한다.

vLLM 배포 설정과 실무 적용

실제 서비스 배포 시에는 대규모 언어 모델 추론 최적화 라이브러리인 vLLM 사용이 권장된다. 특히 DSpark 추측적 디코딩을 활성화하려면 `--speculative-config` 플래그를 반드시 추가해야 한다. 4개의 GB300 노드 환경에서 메모리 효율과 연산 속도를 최적화하기 위한 설정 예시는 다음과 같다.

bash
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
 --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
 --data-parallel-size 4 --enable-expert-parallel \
 --moe-backend deep_gemm_mega_moe \
 --attention-config '{"use_fp4_indexer_cache": true}' \
 --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

위 설정에서 `--kv-cache-dtype fp8`은 이전 계산 값을 저장하는 키-값 캐시를 8비트 부동소수점으로 처리해 메모리 점유율을 낮춘다. 전문가 혼합 모델(MoE) 연산을 최적화하는 `deep_gemm_mega_moe` 백엔드와 어텐션 과정의 메모리를 줄이는 `fp4_indexer_cache` 설정이 함께 적용된다.

개발자는 기존 Jinja 템플릿 기반의 워크플로우를 `encoding_dsv4` 스크립트로 교체하고, vLLM 배포 시 `spec-config`와 `fp8` 캐시 설정을 통해 추론 지연시간과 메모리 비용을 최적화해야 한다.