공개 API에 Qwen 3.8 27B 모델을 추가하여 초당 약
초당 약 1,500토큰이라는 생성 속도는 270억 매개변수 규모의 모델을 실시간으로 활용하려는 사용자에게 새로운 기준을 제시한다. Cerebras가 공개 API에 Qwen 3.8 27B 모델을 추가하며 이 정도의 출력 속도를 구현했다. 270억 매개변수 모델의 출력을 매우 빠르게 생성할 수 있는 환경을 구축한 결과다.
Alibaba가 개발한 Qwen 3.8 27B는 270억 매개변수 규모의 Dense 멀티모달 모델이다. 텍스트뿐 아니라 이미지 입력이 가능하며 에이전트 코딩, 도구 사용, 리서치 및 장시간 워크플로 수행을 위해 설계되었다. 추론 강도 조절과 최대 32K 출력을 지원하며, Cerebras의 공유형 공개 엔드포인트에서 모델 ID `qwen-3.8-27b`로 호출한다.
다만 실제 처리량은 모든 환경에서 동일하게 나타나지 않는다. 요금제별 토큰 한도와 도구 실행 시간에 따라 실제 속도는 달라진다. 초당 1,500토큰이라는 수치가 전체 작업 시간의 절대적인 단축을 보장하지는 않는다.
공개 엔드포인트에 프루닝하지 않은 원본 모델을 사용하며 선택적
저장 공간 효율을 위해 가중치를 16비트, 8비트 또는 4비트로 나누어 저장하는 선택적 가중치 양자화(데이터 정밀도를 낮춰 용량을 줄이는 기술)를 적용한다. 공개 엔드포인트에는 프루닝(불필요한 파라미터를 제거하는 최적화)을 거치지 않은 원본 모델을 그대로 올린다. 실행 단계에서는 저장된 가중치를 다시 역양자화하여 높은 정밀도로 연산한다. 특히 활성값과 어텐션 계산, KV 캐시(이전 토큰의 계산 값을 저장해 재사용하는 메모리)는 양자화하지 않고 완전 정밀도로 유지한다. 모델의 원본 성능을 보존하면서 저장 효율만 확보하는 구조다.
프롬프트를 128토큰 블록 단위로 나누어 앞부분이 일치하는 계산 결과물을 재사용하는 자동 캐싱 기능을 제공한다. 시스템 프롬프트나 도구 정의, 대화 기록처럼 반복되는 공통 앞부분을 자동으로 캐싱하여 처리 지연을 줄이고 실질적 수용량을 개선한다. 캐시 유지 시간은 최소 5분에서 시스템 부하 상태에 따라 최대 1시간까지 보장한다. 반복되는 입력값에 대한 중복 계산을 제거해 처리 효율을 높인다.
확인해야 할 핵심 지점
초당 1,500토큰의 생성 속도는 모델이 응답을 내뱉는 구간에만 해당하며 전체 작업 시간의 단축을 보장하지 않는다. 입력 처리 단계나 셸 명령, 코드 실행, 브라우저 제어 같은 외부 도구의 대기 시간은 이 수치에 포함되지 않기 때문이다. 특히 긴 코딩 작업처럼 외부 도구 호출이 빈번하고 복잡한 경우, 출력 속도가 아무리 빨라도 도구 실행 단계에서 병목이 발생해 전체 작업 완료 시간은 크게 줄지 않는다. 실제 처리량은 요금제별 토큰 한도와 도구 실행 시간에 따라 결정된다.
무료 체험 계정은 5달러 크레딧과 64K 컨텍스트를 제공하며, Developer 등급은 128K 컨텍스트와 더 높은 우선순위를 지원한다. 컨텍스트 한도는 한 번에 처리 가능한 정보의 양을 결정하며, 이용 등급에 따라 지원 범위가 달라진다. 프로덕션 SLA(서비스 수준 협약)나 커스텀 가중치가 필요한 환경에서는 전용 엔드포인트(Dedicated Endpoints)를 사용한다. 전용 엔드포인트는 예약 용량과 더 높은 처리량, 추가 모델 접근 권한을 제공하여 기업의 실제 서비스 운영 단계에서 필요한 안정성과 성능을 확보한다.
생성 속도가 빨라도 외부 도구 실행 시간과 토큰 한도가 전체 작업 시간을 결정하므로, 짧은 응답을 병렬로 실행하는 구조에 우선 도입한다.




