open-model 제품군 중 가장 성능이 뛰어난

추론 깊이를 조절해 연산 비용을 직접 제어하는 설정이 가능해졌다. `reasoning_effort`라는 파라미터(매개변수)를 공식 지원해 답변의 정밀도와 비용 사이의 균형을 선택할 수 있다. 모델을 배포하는 운영자는 작업의 난이도에 따라 추론의 깊이를 조정함으로써 자원 소모량을 결정하고 운영 예산을 효율적으로 관리할 수 있다.

Qwen open-model 제품군 중 현재까지 가장 성능이 뛰어난 Qwen3.8-27B가 공개되었다. Qwen3.5 아키텍처(설계 구조)를 기반으로 구축해 코딩과 전문 업무, 연구 및 장기 에이전트 작업에서 상당한 성능 향상을 이뤄냈다. 특히 모든 파라미터를 전부 사용하는 dense(밀집) 모델 형태로 설계해 콤팩트한 구성과 용이한 배포라는 실무적 이점을 챙겼다.

이 모델은 기본적으로 사고 모드로 작동하며 추론 과정을 외부에 드러낸다. 최종 답변을 내놓기 전 `<think>\n...</think>\n\n` 태그 안에 사고 내용을 먼저 생성해 사용자에게 보여주는 방식이다. 사용자는 모델이 정답에 도달하기 위해 거치는 논리적 단계를 투명하게 확인하며 결과의 신뢰도를 직접 판단할 수 있다.

이미지와 비디오를 이해하는 네이티브 시각-언어

262,144개라는 방대한 토큰을 한 번에 처리하며 이미지와 비디오까지 읽어내는 능력을 갖췄다. Qwen3.8-27B는 시각 정보와 언어를 통합해 처리하는 네이티브 시각-언어 모델(vision-language model)이다. 텍스트를 읽는 기능과 이미지를 보는 기능이 분리되지 않고, 하나의 신경망이 두 정보를 동시에 처리하는 구조다. 여기에 유연한 사고 제어(flexible thinking control) 기능을 더했다. 복잡한 매뉴얼을 읽고 여러 단계를 거쳐 답을 내야 하는 작업처럼, 사고의 흐름을 스스로 조절해 끝까지 완수하는 신뢰도를 높였다.

기본적으로 지원하는 컨텍스트 길이는 최대 262,144 토큰이다. 토큰은 AI가 글자를 인식하는 최소 단위이며, 컨텍스트 길이는 한 번에 기억하고 처리할 수 있는 정보의 양을 뜻한다. 수십 권의 책 분량을 한 번에 펼쳐놓고 필요한 정보를 찾아내는 것과 같다. 만약 입력과 출력을 합친 전체 길이가 이 한도를 넘어가면 위치 정보를 조정해 긴 문맥을 효율적으로 다루는 YaRN 같은 RoPE 스케일링 기술을 사용해야 한다. 이는 아주 긴 문장에서 단어들의 상대적인 위치를 다시 계산해 AI가 맥락을 놓치지 않게 돕는 장치다. 이 방식은 vLLM, SGLang, TokenSpeed 같은 추론 프레임워크(AI 모델을 실제로 구동하는 소프트웨어 환경)에서 지원한다.

를 통해 호스팅 버전의 Qwen3.8-27B 서비스가 출시될

128개 단위로 묶어 정밀하게 깎아낸 FP8 양자화(데이터 용량을 줄여 계산 속도를 높이는 기술) 가중치와 설정 파일이 Hugging Face Transformers 형식으로 제공된다. 원본 모델과 성능 지표가 거의 동일하면서도 vLLM(고성능 모델 추론 엔진)이나 SGLang, TokenSpeed 같은 라이브러리와 폭넓게 호환된다. 고가의 장비 없이도 효율적으로 모델을 구동할 수 있는 실무적 기반이 마련됐다.

기본 1M(약 100만 개)의 컨텍스트 길이(AI가 한 번에 기억하고 처리하는 정보량)와 공식 내장 도구를 갖춘 서비스가 Qwen Cloud를 통해 출시될 예정이다. 사용자는 복잡한 인프라 구축 과정 없이 대규모 데이터를 처리하는 프로덕션 기능을 즉시 활용할 수 있다. 실제 서비스 적용 단계에서 발생하는 기술적 허들이 크게 낮아진다.

작업 복잡도에 따라 추론 깊이를 결정하는 reasoning_effort 설정값과 컨텍스트 확장을 돕는 YaRN 설정을 config.json 파일에 반영해 비용과 성능을 최적화해야 한다.