GLM-5.3의 기술 사양
| Specification | GLM-5.3 |
|---|---|
| Developer | Z.ai / Zhipu AI |
| Release | August 14, 2026 |
| Model type | 플래그십 파운데이션 모델 |
| Input | 텍스트 |
| Output | 텍스트 |
| Context window | 1,000,000 토큰 |
| Maximum output | 128,000 토큰 |
| Thinking | 다중 모드 |
| Streaming | 예 |
| Function calling | 예 |
| Structured output | 예 |
| Context caching | 예 |
| MCP | 예 |
| Primary applications | 코딩, 에이전트, 엔지니어링, 사이버보안 |
Z.ai의 공개 모델 저장소에는 여전히 다운로드 가능한 GLM-5.3 산출물 대신 GLM-5.2가 눈에 띄게 표시되어 있으므로, 아직 공개되지 않은 사양은 명시적으로 미확정으로 표시되어야 합니다.
GLM-5.3란 무엇인가?
GLM-5.3는 Z.ai의 GLM 패밀리 최신 세대로서, 복잡한 보안 및 엔지니어링 작업을 자율적으로 수행할 수 있는 AI 시스템으로의 전환을 보여줍니다.
이번 발표가 특히 주목되는 이유는 사이버보안이 단순히 또 하나의 벤치마크 범주로 제시되는 것이 아니기 때문입니다. Z.ai는 GLM-5.3를 통해 소프트웨어 취약점을 발견하고 공격 개발 워크플로에 참여할 수 있는 AI 시스템을 시연하고 있습니다.
Reuters에 따르면 Z.ai는 보안 평가를 완료한 후 모델을 공개할 계획이며, 더 진보된 기능은 초기에는 신뢰 기반 접근 메커니즘을 통해 제한적으로 제공될 예정입니다.
이는 GLM-5.2와의 강조점에서 의미 있는 변화입니다.
GLM-5.2는 주로 장기 지평 소프트웨어 엔지니어링과 에이전틱 코딩을 중심으로 포지셔닝되었습니다. Z.ai의 6월 연구 페이지는 GLM-5.2를 "Built for Long-Horizon Tasks"라고 설명합니다.
GLM-5.3는 그 에이전틱 철학을 훨씬 더 민감한 도메인으로 확장합니다:
소프트웨어 엔지니어링 → 취약점 발견 → 사이버 방어 → 통제된 공격적 보안
GLM-5.3의 주요 기능은?
사이버보안 중심의 추론
헤드라인 역량은 사이버보안입니다.
GLM-5.3는 다음을 달성했습니다:
CyberGym에서 84.5%
CyberGym은 AI 시스템이 소프트웨어 취약점을 식별하는 능력을 평가합니다. 이 결과는 Mythos 5가 보고한 **83.8%**를 소폭 상회합니다.
이는 중요합니다. 사이버보안은 단지 문법적으로 올바른 코드를 생성하는 것 이상의 능력을 요구하기 때문입니다.
유능한 보안 에이전트는 다음이 필요합니다:
- 낯선 코드를 이해한다.
- 공격 표면을 식별한다.
- 취약점에 대한 가설을 수립한다.
- 데이터 및 제어 흐름을 추적한다.
- 가설을 검증한다.
- 적절한 PoC를 개발한다.
- 해당 취약점이 실제로 악용 가능한지 판단한다.
GLM-5.3의 CyberGym 점수는 이 과정의 전반부에서 의미 있는 진전을 시사합니다.
강한 취약점 발견 능력
84.5% CyberGym 점수는 초기 결과 중 가장 인상적인 수치로 볼 수 있습니다.
이는 취약점 식별에서 GLM-5.3를 Mythos 5보다 약간 앞서게 합니다:
| Model | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
격차는 단지 0.7 퍼센트포인트에 불과하므로, GLM-5.3가 결정적으로 우수하다고 묘사하는 것은 오해를 낳을 수 있습니다.
더 흥미로운 점은 Z.ai의 공개 가중치(오픈 웨이트) 모델이 매우 제한적인 사이버보안 시스템과 동일한 성능 영역에 진입하고 있다는 사실입니다.
익스플로잇 개발은 아직 약점
GLM-5.3가 모든 사이버보안 작업에서 압도적인 것은 아닙니다.
ExploitBench에서는:
| Model | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
이는 23.6포인트 격차입니다.
이 점은 중요한 구분을 드러냅니다:
취약점을 찾는 것과 이를 안정적으로 악용하는 것은 동일하지 않습니다.
GLM-5.3는 약점을 식별하는 데 매우 능숙해 보이지만, 초기 결과는 이러한 발견을 신뢰할 수 있는 익스플로잇 개발로 전환하는 것이 여전히 상당히 어렵다는 점을 보여줍니다.
기업 보안 팀에게는 이는 단순한 공격 자동화 엔진이라기보다 방어적 취약점 분석 보조로서 모델을 흥미롭게 만드는 요소입니다.
GLM-5.3 vs GLM-5.2
GLM-5.2가 가장 유용한 확정된 기준선을 제공합니다.
| Feature | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Status | 출시됨 | 발표됨 |
| Primary positioning | 장기 지평 에이전트 | 사이버보안 + 에이전트 |
| Coding | 뛰어남 | 강세 유지 예상 |
| Cybersecurity | 강한 잠재력 | 명시적 플래그십 초점 |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| Context | 1M | 미확정 |
| Parameters | ~753B | 미확정 |
| License | MIT | 공개 가중치(오픈 웨이트) 발표 |
| API pricing | 공개됨 | 아직 공개되지 않음 |
| Public weights | 제공됨 | 계획됨 |
GLM-5.2의 확인된 아키텍처는 대략 753B 파라미터이며, 공개 모델 카탈로그에는 여전히 753B 모델과 FP8 버전이 나열되어 있습니다.
또한 GLM-5.2는 제3자 보도(Z.ai의 모델 평가 자료 기반)에 따르면 Terminal-Bench 2.1에서 81.0, SWE-bench Pro에서 62.1을 달성했습니다.
하지만 이 숫자들은 GLM-5.2의 벤치마크로 남아야 하며, GLM-5.3에 귀속되어서는 안 됩니다.
GLM-5.3 vs Mythos 5
현재 가장 의미 있는 벤치마크 비교입니다.
| Benchmark | GLM-5.3 | Mythos 5 | Difference |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
이 결과는 미묘한 결론을 도출합니다.
GLM-5.3는 취약점 식별에서 우세합니다.
하지만:
Mythos 5는 익스플로잇 개발에서 여전히 상당히 강합니다.
따라서 **"GLM-5.3가 Mythos 5를 이긴다"**라고 말하는 것은 제공된 데이터를 부정확하게 해석하는 것입니다.
더 나은 설명은 다음과 같습니다:
GLM-5.3는 취약점 발견에서 Mythos 5 수준의 성능에 도달했지만, 익스플로잇 개발에서는 아직 뒤처져 있다.