TL;DR Z.ai는 GLM-5.2와 동일한 ~743–753B-파라미터 Mixture-of-Experts 베이스 모델 위에서 2026년 8월 14일 GLM-5.3을 출시했다. 모든 향상은 장기 지평 환경에서의 스케일된 사후 학습에서 나왔다. 그 결과 Z.ai 내부 Code Bench에서 약 50%의 상대적 향상, Terminal-Bench 3.0(4.6 → 28.3)과 Agents’ Last Exam에서 오픈소스 SOTA, 에이전트 성능의 대폭 개선, 그리고 사이버보안에서의 신규 최첨단 성능(CyberGym 84.5%)을 달성했다. 토큰 효율성도 개선되었다.
가중치는 안전 강화 이후 출시 약 2주 뒤 제공될 예정이다. 개발자는 CometAPI와 같은 통합 플랫폼을 통해 관련 GLM 모델에 이미 접근하고 워크플로를 효율적으로 테스트할 수 있다.
핵심 요약
- GLM-5.2와 동일한 베이스 모델; 모든 향상은 사후 학습에서 기인(IndexShare, SAO, slime 프레임워크 + 더 많은 환경과 컴퓨트).
- 코딩: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; Z.ai 내부 Code Bench에서 출력 토큰을 줄이면서 약 50% 향상.
- 에이전트: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
- 사이버: CyberGym 77.2 → 84.5(SOTA, Mythos 5 및 GPT-5.6 Sol 대비 우위); ExploitBench 두 배 이상(24.4 → 54.4). 실제 발견: 269개 프로젝트에서 2,436개 취약점.
- 코어 아키텍처의 사양 변경 없음: 컨텍스트 1M, 최대 128K 출력 토큰, low/high/max 노력의 항상-온 thinking.
- 접근: GLM Coding Plan과 ZCode를 통해 라이브; 일반 API와 오픈 가중치(예상 MIT 스타일)는 안전 검토 이후 제공. CometAPI는 병행 테스트와 프로덕션 라우팅을 위해 GLM 패밀리에 대한 OpenAI 호환 액세스를 편리하게 제공.
한눈에 보는 GLM-5.3 vs GLM-5.2
| Dimension | GLM-5.3 | GLM-5.2 | Winner / Notes |
|---|---|---|---|
| Base model | 동일 ~743–753B MoE | 동일 | 동일 |
| Post-training | 대폭 확장된 환경 | 이전 스택 | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3(대폭) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Internal Code Bench (Max) | 34.5% @ ~75K tokens | 23.4% @ ~96K tokens | 5.3(성능 + 효율) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5 (SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| Context / Max output | 1M / 128K | 1M / 유사 | 동일 |
| Thinking | 항상-온(low/high/max) | 이전이 더 유연 | 5.3(항상-온) |
| Open weights | 출시 후 약 2주(예정) | 사용 가능(MIT) | 현재는 5.2 |
| Primary access now | Coding Plan / ZCode | API + 가중치 + Coding Plan | 5.2가 더 성숙 |
소개: 사후 학습이 세대적 도약을 이끌다
2026년 8월 중순, 오픈 웨이트 경쟁에서 또 하나의 급속한 반복이 있었다. Z.ai(전 Zhipu AI / ChatGLM 팀의 국제 브랜드)가 GLM-5.2 이후 59일 만에 GLM-5.3을 출시했다. 발표는 이례적으로 명확했다. 기본 베이스 모델은 동일하게 유지되었다. “GLM-5.3을 위해 한 일은 사후 학습 규모 확장뿐이다,”라고 회사는 밝혔다.
이 주장은 중요하다. 수년간 지배적인 내러티브는 “더 큰 모델이 이긴다”였다. GLM-5.3은 강화학습 환경의 적극적 스케일링, 장기 지평 작업 다양성, 시스템 인프라만으로도 새로운 사전학습 없이도 어려운 코딩·에이전트·사이버보안 워크로드에서 과도한 성과 향상을 낼 수 있음을 보여준다. 특히 난도가 높은 여러 벤치마크에서 수치가 충분히 커서, 독립 관찰자들은 이 도약을 점진적 개선이 아닌 질적 변화로 묘사하고 있다. GLM-5.3의 기능, 벤치마크, 접근 방식 개요.
GLM-5.3 vs GLM-5.2: 실제로 무엇이 달라졌나?
가장 큰 오해는 GLM-5.3이 단순히 “더 큰 GLM-5.2”라는 생각일 것이다.
그렇지 않다.
Z.ai에 따르면 베이스 모델은 본질적으로 동일하다. 주요 혁신은 바로 사후 학습의 스케일링이다. Z.ai는 세 가지 축을 강조한다:
- slime 내부의 시스템 개선 — 더 나은 학습
- 환경 스케일링 — 실제 전문 워크플로에서 실행 가능하고 검증 가능한 장기 지평 환경을 합성하는 파이프라인. 리서치 에이전트가 작업 패턴을 추출하고, 판정 에이전트가 해결 가능성을 검증하며, 보상 해킹을 줄이기 위해 참조 해답에 접근하지 못하는 검증기를 구축.
- SAO + 컴팩션의 지속적 사용 — 짧은 경로에서 붕괴하지 않고 긴 궤적에서 이득이 유지되도록 지원. — 롤아웃 일관성(로그 확률 차이를 ~1e-7 수준으로 제어), 계층형 캐싱, 멀티 티처 지원, 워크로드 인지 스케줄링, 장기 지평 코딩 RL 작업에서 엔드투엔드 처리량 >2.3배 향상 보고.
이 변화는 코딩·에이전트·사이버보안 전반에서 측정 가능한 개선을 가져왔다. 특히 가장 어렵고 기준치가 낮은 테스트에서 상대적 향상이 가장 크게 나타났는데, 이는 이전에 안정적으로 처리하지 못하던 영역으로 모델을 밀어넣었을 때 기대되는 전형적 패턴이다.
결과적으로 이번 업그레이드는 단순히 아키텍처가 아닌, 주로 행동과 능력의 변화에 관한 것이다.
GLM-5.3 vs GLM-5.2: 기능 비교
1. 새로운 베이스 모델 대신 스케일된 사후 학습
Z.ai는 스케일된 사후 학습이 GLM-5.3의 전부라고 설명한다. 리서치 에이전트가 실제 작업에서 패턴을 추출해 숨은 상태와 다단계 의존성을 지닌 실행 가능한 태스크로 바꾸고, 판정 에이전트가 각 태스크의 해결 가능성을 검증한다. 검증기는 참조 해답을 보지 못한 상태에서 생성되고, 오라클·no-op·미해결 상태에 대한 테스트를 거쳐 보상 지름길을 줄인다.
이 시스템은 여전히 인간 검토가 필요하며, Z.ai는 환경 생성과 검증의 더 높은 자율화는 향후 과제라고 명시한다. 이 단서는 주장을 더 신뢰하게 만든다. 이는 합성 환경이 완전히 자율화되었다는 주장이 아니라, 대규모 학습 파이프라인이라는 뜻이기 때문이다.
2. 더 강한 장기 지평 코딩
GLM-5.3은 리포지토리 작업, 터미널 태스크, 머신러닝 인프라, 성능 최적화, 다단계 소프트웨어 딜리버리에서 향상되었다. 현실적 사용자 시나리오를 반영하려는 Z.ai의 내부 평가인 Code Bench에서 GLM-5.2 대비 약 50% 더 나은 코딩 성능을 보고했다.
효율성 결과도 중요하다. 최대 노력(Max)에서 GLM-5.3은 태스크당 약 75K 출력 토큰으로 34.5%를 달성했으며, GLM-5.2는 약 96K로 23.4%였다. 이는 출력 토큰을 약 22% 줄이면서 품질을 11.1포인트 끌어올린 것이다. 높은 노력(High)에서 GLM-5.3은 약 50K 토큰으로 31.4%에 도달해 동일 차트에서 120K 토큰으로 29.5%였던 Claude Opus 4.8을 앞섰다. 반면 Claude Fable 5는 최대 노력에서 39.5%로 여전히 더 높았다.
3. 발현적 사이버보안 능력
Z.ai는 사후 학습 과정에서 취약점 발견 환경을 추가했다. 발표에 따르면, 개별 결함 발견을 넘어 익스플로잇 체인의 여러 단계를 가로지르는 추론으로 능력이 확대되었다.
공개 점수는 진전과 한계를 모두 보여준다. GLM-5.3은 CyberGym에서 84.5로 Z.ai 비교표의 선두이며, GLM-5.2는 77.2였다. ExploitBench에서는 24.4에서 54.4로 두 배 이상 상승했지만, Fable 5(78.0)와 GPT-5.6 Sol(76.5)에는 여전히 뒤진다. ExploitGym에서는 정상화된 2시간 예산에서 105개, 6시간에서 130개 태스크를 완료했으며, GLM-5.2는 각각 29와 39였다. GPT-5.6 Sol과 Fable 5는 상당히 앞서 있다.
이 능력은 듀얼 유스다. 조직은 모델 접근을 제한하고, 도구를 샌드박스하며, 행동을 로깅하고, 스캐닝은 승인 절차를 요구하며, 취약점 검증과 공개에는 항상 사람이 개입하도록 해야 한다.
4. 세 가지 노력 레벨의 항상-온 추론
GLM-5.3은 low, high, max 추론 노력을 지원한다. GLM-5.2와 달리 thinking 비활성화는 지원하지 않는다. 기존 통합에서 thinking.type: "disabled"를 보내던 경우 모델 ID를 전환하기 전에 값을 enabled로 변경해야 하며, 그렇지 않으면 요청이 실패한다고 Z.ai는 말한다.
상호작용 편집과 저위험 변환에는 low, 리포지토리 수준의 실질적 작업에는 high, 어려운 코딩이나 보안 분석에는 max를 사용하라. 높은 노력은 지연과 비용을 고려해 평가해야 하며, 더 강한 답이 항상 가장 경제적인 답은 아니다.
5. slime을 통한 학습 처리량 개선
GLM-5.3은 학습 측의 Megatron과 롤아웃 측의 SGLang을 사용하는 Z.ai의 오픈소스 프레임워크 slime을 계속 활용한다. Z.ai는 top-p 마스킹, top-k 및 전체 어휘 온폴리시 증류, 티처 전환, 캐싱, 학습과 롤아웃 간 더 타이트한 수치 정합 추가를 보고했다. 발표에 따르면 평균 로그 확률 차이는 1e-7 수준으로 제어되어 이전 설정 대비 99.99% 이상 낮아졌다.
워크로드 인지 스케줄링과 로드 밸런싱은 장기 지평 코딩 RL 작업에서 엔드투엔드 강화학습 처리량을 2.3배 이상 개선한 것으로 보고됐다. 이는 최종 사용자 추론 보장이 아니라 학습 인프라 개선이지만, Z.ai가 한 달 만에 더 길고 다양한 궤적을 스케일할 수 있었던 이유를 설명한다.
6. 안전 검토를 위한 오픈 가중치 지연
Z.ai는 GLM-5.3을 오픈 웨이트 모델이라고 부르지만, 출시일에는 가중치를 다운로드할 수 없었다. 회사는 안전 평가와 하드닝 이후 출시 2주 뒤 공개하겠다고 한다. MIT 라이선스로 이미 Hugging Face에 올라와 있는 GLM-5.2와의 실질적 차이다.
대부분의 팀에겐 호스팅 API 테스트가 여전히 실용적 첫 단계다. 모델은 크고, 오픈 웨이트가 추론 하드웨어, 양자화, 서빙, 모니터링, 보안 통제의 비용을 없애주지는 않는다.
GLM-5.3 vs GLM-5.2: 벤치마크 개선
아래 표는 Z.ai의 공식 출시 데이터를 사용한다. “Change”는 보고된 점수로부터의 단순 계산이다. GLM-5.2의 기준치가 낮을수록 상대 변화율이 과장되어 보일 수 있으므로 절대 변화도 함께 표시한다.
| Benchmark | GLM-5.2 | GLM-5.3 | Absolute change | Relative change |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +8.9% |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +515.2% |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +44.8% |
| NL2Repo | 48.9 | 58.0 | +9.1 | +18.6% |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +100.0% |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +15.7% |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +119.1% |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +25.6% |
| CyberGym | 77.2 | 84.5 | +7.3 | +9.5% |
| ExploitBench | 24.4 | 54.4 | +30.0 | +123.0% |
| ExploitGym, 2-hour tasks | 29 | 105 | +76 | +262.1% |
| ExploitGym, 6-hour tasks | 39 | 130 | +91 | +233.3% |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +21.9% |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +84.0% |
| Agents' Last Exam CLI | 23.8 | 28.5 | +4.7 | +19.7% |
| HLE with tools | 54.7 | 62.5 | +7.8 | +14.3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17.3% |
벤치마크 개선: GLM-5.3 vs GLM-5.2 및 경쟁 모델
아래 모든 수치는 Z.ai 공식 블로그에서 제공한 공급업체 보고치(하니스, 컨텍스트 길이, 샘플링 방법에 대한 주석 포함)다. 가중치와 더 넓은 접근이 가능해지면 독립 검증이 뒤따를 것이다.
코딩 벤치마크
| Benchmark | GLM-5.3 | GLM-5.2 | Notes / Competitors |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | 최상위 클로즈드 모델과 경쟁 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 오픈소스 SOTA; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 큰 폭의 상승 |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench (internal, Max effort) | ~34.5% completion @ ~75K tokens | ~23.4% @ ~96K tokens | 코딩 체감 ~50% 개선; 더 높은 효율성 |
높은 노력(High)에서 GLM-5.3은 ~50K 토큰으로 31.4% 완수를 기록해 내부 벤치에서 120K 토큰으로 29.5%였던 Claude Opus 4.8을 앞섰지만, Claude Fable 5(Max) 39.5%에는 미치지 못했다.
사이버보안 벤치마크
| Benchmark | GLM-5.3 | GLM-5.2 | Competitors (approx.) |
|---|---|---|---|
| CyberGym | 84.5% | 77.2% | Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA) |
| ExploitBench | 54.4% | 24.4% | 이전 대비 두 배 이상; 클로즈드 모델이 더 높음(Mythos 5 ~78%, GPT-5.6 Sol ~76.5%) |
| ExploitGym (2h/6h) | 105 / 130 | 29 / 39 | Mythos 5가 여전히 우위(181/247) |
향상폭은 익스플로잇 체인의 상위 단계일수록 더 크다. 중국 보안팀과의 실제 테스트에서(5.2 작업을 기반으로) 모델은 269개 프로젝트에서 2,436개 취약점을 식별했으며, 그중 1,097개는 중~고심각도였다. 일부 결함은 약 40년 전(최고 ~1981년)으로 거슬러 올라간다. 결과는 공개된 Z.ai Security Disclosure Ledger에 추적된다.
에이전트 및 기타 벤치마크
| Benchmark | GLM-5.3 | GLM-5.2 | Notes |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 큰 폭의 향상 |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | 오픈소스 경쟁력 |
| HLE w/ Tools | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | 44개 직군 포함 |
이 결과는 장기 지평, 다단계의 전문 작업에서 분명한 진전을 보여준다.
토큰 효율, thinking 모드, 그리고 실무적 행동
조용하지만 중요한 개선은 토큰 효율성이다. 내부 Code Bench에서 더 높은 완수율이 더 적은 출력 토큰과 함께 도달했다. 이는 프로덕션 에이전트 루프에서 비용과 지연에 큰 의미를 가진다.
GLM-5.3은 thinking이 항상 활성화되어 있다. 세 가지 노력 레벨을 지원한다: low, high, max(기본값이며 코딩에는 max 권장). thinking 비활성화는 더 이상 지원되지 않으므로, 과거에 thinking.type: "disabled"를 설정하던 애플리케이션은 마이그레이션해야 한다.
컨텍스트는 여전히 1M 토큰이며 최대 출력은 128K까지 가능하다. 아키텍처는 GLM-5.2와 변경되지 않았으므로, 향후 자체 호스팅을 위한 하드웨어 규모 추정은 기존 GLM-5.2 경험을 바탕으로 할 수 있다(총 파라미터 수를 고려할 때 양자화 후에도 메모리 풋프린트는 여전히 큼).
즉시 실험하고 싶거나 모델 간 유연성을 유지하려는 개발자에겐 통합 게이트웨이가 유용하다. CometAPI는 GLM 시리즈 모델(사용 가능해지는 대로 모델 ID glm-5.3으로 등록된 GLM-5.3)을 OpenAI 호환 엔드포인트, 경쟁력 있는 요금, 사용량 기반 과금으로 제공하며, 통합 코드를 다시 작성하지 않고도 GLM-5.2, GLM-5.3 및 다수의 프런티어/오픈 모델 사이를 전환할 수 있다. 이는 코딩 에이전트의 A/B 테스트, 실제 태스크당 성공 비용 측정, 워크로드 기반 라우팅에 특히 실용적이다.
누가 GLM-5.3으로 옮겨야 하며 어떻게 평가할까
코딩 에이전트, 장기 지평 자동화, 리포지토리 규모의 엔지니어링 워크플로, 방어적 보안 도구를 구축하는 팀은 우선 평가해야 한다. 복잡한 태스크에서 더 높은 완수율, 더 나은 토큰 효율, 더 강한 다단계 에이전시의 조합은 실질적이다.
권장 평가 경로:
- 동일한 내부 태스크(또는 고정 하니스)를 GLM-5.2와 GLM-5.3(또는 Coding Plan)을 대상으로 동일한 노력 레벨에서 실행한다.
- 통과율뿐 아니라 토큰, 실시간 소요, 인간 개입률을 함께 측정한다.
- CometAPI 같은 통합 API 레이어를 사용해 비교의 마찰을 줄이고, 롤백이나 선택적 라우팅 옵션을 유지한다.
- 보안 민감 워크로드의 경우, 안전 강화된 오픈 웨이트 전체 공개를 기다리고 공개 절차를 검토한다.
가중치가 공개되면, 이미 GLM-5.2 인프라를 운영 중인 조직에겐 자체 호스팅이 매력적으로 보일 것이다.
결론: 사후 학습은 새로운 스케일링 프런티어
GLM-5.3은 최근 사례 중 사후 학습의 스케일—더 현실적인 환경, 더 나은 RL 인프라, 장기 궤적에 대한 지속적 컴퓨트—이 기존에는 새로운 베이스 모델이 필요하다고 여겨졌던 능력 도약을 만들어낼 수 있음을 가장 명확히 보여준다. 코딩과 에이전트 성능의 향상은 크고; 사이버 분야의 결과는 대체로 발현적이면서도, 발견 지향 벤치마크에서 이미 경쟁력 있거나 선도적이다.
실무자에게 실질적 시사점은 분명하다. 모델을 실제 워크로드에 테스트하고, 단순 순위가 아니라 성공 결과당 비용을 측정하며, 통합을 유연하게 유지하라. CometAPI 같은 플랫폼은 단일 키, OpenAI 호환 인터페이스, GLM 시리즈와 경쟁 모델 간 손쉬운 전환을 제공해, 새 능력을 얼마나 공격적으로 도입할지 결정하는 동안 이 과정을 단순화한다.
