Spesifikasi Teknis GLM-5.3
| Spesifikasi | GLM-5.3 |
|---|---|
| Pengembang | Z.ai / Zhipu AI |
| Rilis | August 14, 2026 |
| Jenis model | Model fondasi andalan |
| Masukan | Teks |
| Keluaran | Teks |
| Jendela konteks | 1,000,000 tokens |
| Keluaran maksimum | 128,000 tokens |
| Penalaran | Beberapa mode |
| Streaming | Ya |
| Pemanggilan fungsi | Ya |
| Keluaran terstruktur | Ya |
| Caching konteks | Ya |
| MCP | Ya |
| Aplikasi utama | Pengodean, agen, rekayasa, keamanan siber |
Repositori model publik Z.ai masih menampilkan GLM-5.2 secara mencolok, bukan artefak GLM-5.3 yang dapat diunduh, sehingga spesifikasi yang belum dipublikasikan harus tetap ditandai secara eksplisit sebagai belum terkonfirmasi.
Apa itu GLM-5.3?
GLM-5.3 adalah generasi terbaru dari keluarga GLM milik Z.ai dan menandai pergeseran menuju sistem AI yang mampu melakukan tugas keamanan dan rekayasa yang kompleks secara otonom.
Pengumuman ini khususnya penting karena keamanan siber tidak sekadar disajikan sebagai kategori tolok ukur lain. Z.ai menggunakan GLM-5.3 untuk menunjukkan sistem AI yang mampu menemukan kerentanan perangkat lunak dan berpartisipasi dalam alur kerja pengembangan serangan.
Reuters melaporkan bahwa Z.ai berencana merilis model secara publik setelah menyelesaikan penilaian keamanan, sementara kemampuan yang lebih maju awalnya akan dibatasi melalui mekanisme akses tepercaya.
Ini merupakan perubahan penekanan yang signifikan dari GLM-5.2.
GLM-5.2 terutama diposisikan seputar rekayasa perangkat lunak jangka panjang dan pengodean berbasis agen. Halaman riset Z.ai bulan Juni menggambarkan GLM-5.2 sebagai "Built for Long-Horizon Tasks."
GLM-5.3 membawa filosofi agen tersebut ke domain yang jauh lebih sensitif:
rekayasa perangkat lunak → penemuan kerentanan → pertahanan siber → keamanan ofensif terkontrol
Apa fitur utama GLM-5.3?
Penalaran Berfokus pada Keamanan Siber
Kemampuan utama adalah keamanan siber.
GLM-5.3 meraih:
84.5% di CyberGym
CyberGym mengevaluasi kemampuan sistem AI untuk mengidentifikasi kerentanan perangkat lunak. Hasilnya sedikit melampaui laporan 83.8% milik Mythos 5.
Itu penting karena keamanan siber memerlukan lebih dari sekadar menghasilkan kode yang secara sintaktis benar.
Agen keamanan yang mumpuni perlu:
- Memahami kode yang tidak familiar.
- Mengidentifikasi permukaan serangan.
- Membentuk hipotesis tentang kerentanan.
- Menelusuri aliran data dan kontrol.
- Memvalidasi hipotesis.
- Mengembangkan bukti konsep yang sesuai.
- Menentukan apakah kerentanan tersebut benar-benar dapat dieksploitasi.
Skor CyberGym GLM-5.3 menunjukkan kemajuan bermakna pada bagian awal dari rantai ini.
Penemuan Kerentanan yang Kuat
Skor CyberGym 84.5% boleh jadi merupakan hasil awal yang paling mengesankan.
Ini menempatkan GLM-5.3 sedikit di depan Mythos 5 dalam identifikasi kerentanan:
| Model | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
Marginnya hanya 0.7 poin persentase, sehingga akan menyesatkan jika menggambarkan GLM-5.3 sebagai jelas-jelas lebih unggul.
Poin yang lebih menarik adalah model open-weight dari Z.ai memasuki kawasan performa yang sama dengan sistem keamanan siber yang sangat dibatasi.
Pengembangan Eksploitasi Masih Menjadi Kelemahan
GLM-5.3 tidak mendominasi setiap tugas keamanan siber.
Pada ExploitBench:
| Model | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
Itu adalah selisih 23.6 poin.
Ini mengungkap perbedaan penting:
Menemukan kerentanan tidak sama dengan secara andal mengeksploitasinya.
GLM-5.3 tampak sangat mampu dalam mengidentifikasi kelemahan, tetapi hasil awal menunjukkan bahwa mengonversi temuan tersebut menjadi pengembangan eksploit yang andal tetap jauh lebih sulit.
Bagi tim keamanan perusahaan, ini justru membuat model tersebut menarik sebagai asisten analisis kerentanan defensif, alih-alih sekadar mesin otomasi ofensif.
GLM-5.3 vs GLM-5.2
GLM-5.2 menyediakan baseline terkonfirmasi yang paling berguna.
| Fitur | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Status | Dirilis | Diumumkan |
| Posisi utama | Agen jangka panjang | Keamanan siber + agen |
| Pengodean | Sangat baik | Diperkirakan tetap kuat |
| Keamanan siber | Potensi kuat | Fokus andalan secara eksplisit |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| Konteks | 1M | Belum terkonfirmasi |
| Parameter | ~753B | Belum terkonfirmasi |
| Lisensi | MIT | Open-weight diumumkan |
| Harga API | Diterbitkan | Belum diterbitkan |
| Bobot publik | Tersedia | Direncanakan |
Arsitektur GLM-5.2 yang terkonfirmasi berjumlah sekitar 753B parameter, dan katalog model publiknya masih mencantumkan model 753B dan versi FP8.
GLM-5.2 juga meraih 81.0 pada Terminal-Bench 2.1 dan 62.1 pada SWE-bench Pro menurut pelaporan pihak ketiga berdasarkan materi evaluasi model Z.ai.
Namun angka-angka tersebut harus tetap menjadi tolok ukur GLM-5.2, bukan dikaitkan dengan GLM-5.3.
GLM-5.3 vs Mythos 5
Ini saat ini merupakan perbandingan tolok ukur yang paling bermakna.
| Tolok ukur | GLM-5.3 | Mythos 5 | Perbedaan |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
Hasil tersebut menghasilkan kesimpulan yang bernuansa.
GLM-5.3 unggul dalam identifikasi kerentanan.
Namun:
Mythos 5 tetap secara signifikan lebih kuat dalam pengembangan eksploit.
Oleh karena itu, mengatakan "GLM-5.3 mengalahkan Mythos 5" akan menjadi interpretasi yang tidak akurat atas data yang tersedia.
Deskripsi yang lebih baik adalah:
GLM-5.3 mencapai performa setingkat Mythos 5 dalam penemuan kerentanan, sekaligus tetap tertinggal dalam pengembangan eksploit.