facts

이번 업데이트의 핵심은 모델의 기초 구조를 바꾸지 않고 학습 단계의 후반부를 확장해 성능을 끌어올린 점이다. Z.ai가 공개한 GLM-5.3은 GLM-5.2와 동일한 7430억 개 파라미터 규모의 베이스 모델을 사용한다. 새로운 사전 학습(Pre-training) 주기 없이, 더 많은 환경과 다양한 작업에 걸쳐 포스트 트레이닝(Post-training) 규모를 키우고 강화 학습(RL) 연산량을 추가하는 방식으로 성능을 개선했다.

현재 GLM-5.3은 회사의 'GLM Coding Plan'과 'ZCode' 코딩 환경을 통해서만 이용 가능하다. API 접근 권한과 모델 가중치(Weights)는 안전성 평가 및 하드닝(Hardening) 작업이 완료된 후 공개될 예정이며, Z.ai 측은 출시 후 약 2주 뒤에 가중치를 배포할 계획이라고 밝혔다.

모델의 주된 지향점은 '에이전트 기반 엔지니어링(Agentic Engineering)'과 롱호라이즌(Long-horizon) 작업 수행이다. 특히 사이버 보안 능력이 예상보다 빠르게 향상되어, 최근 SpaceX가 인수한 AI 코딩 스타트업 Cursor에서 잠재적으로 심각한 취약점을 발견한 사례가 보고됐다.

how-it-works

학습 방식의 변화는 단순한 프로그래밍 연습을 넘어 실제 엔지니어링 업무와 유사한 환경을 구축한 데 있다. 에이전트가 코드베이스, 문서, 컴퓨팅 클러스터, 스토리지 시스템 및 실험 결과에 접근하여 문제를 진단하고 시스템을 수정하며, 정확성을 유지한 채 측정 가능한 개선을 입증하는 시나리오를 학습했다. 일부 작업은 숙련된 엔지니어가 며칠간 수행해야 하는 분량으로 설계됐다.

벤치마크 결과에서는 특정 영역의 상승과 한계가 동시에 나타난다. Terminal-Bench 3.0에서 GLM-5.3은 28.3점을 기록하며 GLM-5.2(4.6점) 대비 크게 상승했으나, GPT-5.6 Sol(34.6점)과 Claude Fable 5(33.7점)보다는 낮다. DeepSWE v1.1에서도 66.9점을 기록해 이전 버전(46.2점)보다 개선됐지만, GPT-5.6 Sol(72.7점)과 Fable 5(69.7점)에 밀리는 모습을 보였다. 반면 AutomationBench에서는 26.2점에서 48.2점으로 수치가 상승했다.

사이버 보안 영역의 성과는 취약점 발견과 실제 공격 체인 구축 단계에서 차이를 보인다. 소스 코드의 취약점 발견 및 검증을 테스트하는 CyberGym에서는 84.5%를 기록해 GPT-5.6 Sol(83.6%)과 Mythos 5(83.8%)를 소폭 앞섰다. 하지만 실제 익스플로잇(Exploit) 구축 능력을 측정하는 ExploitBench에서는 54.4%에 그쳐, GPT-5.6 Sol(76.5%)과 Mythos 5(78%)에 비해 낮은 성능을 보였다. ExploitGym의 작업 완료 수 또한 2~6시간 예산 기준 105~130개로, GPT-5.6 Sol의 216~293개보다 적다.

토큰 효율성 측면에서는 Z.ai 자체 평가인 Code Bench에서 유의미한 수치가 확인됐다. GLM-5.3은 'Max reasoning' 설정에서 작업당 약 75,000개의 출력 토큰을 소비하며 34.5%의 성공률을 기록했다. 이는 GLM-5.2가 약 96,000개의 토큰을 쓰고 23.4%의 성공률을 보인 것과 대비된다. 또한 'High effort' 설정에서는 약 50,000개의 토큰으로 31.4%의 성공률을 달성해, 120,000개의 토큰을 사용한 Claude Opus 4.8의 29.5%보다 적은 자원으로 더 높은 성능을 냈다.

implementation-impact

기존 GLM 애플리케이션을 운영 중인 개발자는 API 동작 방식의 변경 사항을 반드시 반영해야 한다. GLM-5.3은 추론 노력 수준을 `low`, `high`, `max` 세 단계로 지원하며, 코딩 작업에는 기본값인 `max` 설정을 권장한다. 이전 버전과 달리 '사고 과정(Thinking)' 기능을 비활성화할 수 없게 변경된 것이 핵심이다.

기존에 `thinking.type: "disabled"` 필드를 전송하던 애플리케이션은 해당 값을 `enabled`로 변경하고 구체적인 추론 노력 수준(reasoning effort)을 지정해야 한다. 이 설정을 수정하지 않고 모델 식별자만 GLM-5.3으로 교체할 경우 API 요청은 실패한다. 따라서 단순한 모델 이름 교체가 아닌, 요청 페이로드의 필드 값 수정이 동반되는 마이그레이션 작업이 필요하다.