Spesifikasi Teknikal GLM-5.3
| Spesifikasi | GLM-5.3 |
|---|---|
| Pembangun | Z.ai / Zhipu AI |
| Keluaran | 14 Ogos 2026 |
| Jenis model | Model asas perdana |
| Input | Teks |
| Output | Teks |
| Tetingkap konteks | 1,000,000 token |
| Output maksimum | 128,000 token |
| Pemikiran | Pelbagai mod |
| Penstriman | Ya |
| Pemanggilan fungsi | Ya |
| Output berstruktur | Ya |
| Caching konteks | Ya |
| MCP | Ya |
| Aplikasi utama | Pengaturcaraan, agen, kejuruteraan, keselamatan siber |
Repositori model awam Z.ai masih jelas memaparkan GLM-5.2, bukannya artifak GLM-5.3 yang boleh dimuat turun, jadi spesifikasi yang belum diterbitkan harus kekal ditanda dengan jelas sebagai belum disahkan.
Apakah GLM-5.3?
GLM-5.3 ialah generasi terkini keluarga GLM Z.ai dan menandakan peralihan ke arah sistem AI yang mampu melaksanakan tugas keselamatan dan kejuruteraan yang kompleks secara autonomi.
Pengumuman ini amat ketara kerana keselamatan siber bukan sekadar dikemukakan sebagai satu lagi kategori penanda aras. Z.ai menggunakan GLM-5.3 untuk menunjukkan sistem AI yang mampu menemui kelemahan perisian dan menyertai aliran kerja pembangunan serangan.
Reuters melaporkan bahawa Z.ai merancang untuk mengeluarkan model tersebut kepada umum selepas melengkapkan penilaian keselamatan, manakala keupayaan yang lebih maju pada mulanya akan dihadkan melalui mekanisme capaian dipercayai.
Ini merupakan perubahan penekanan yang ketara berbanding GLM-5.2.
GLM-5.2 terutama diposisikan sekitar kejuruteraan perisian jangka panjang dan pengkodan berasaskan agen. Halaman penyelidikan Z.ai pada Jun menerangkan GLM-5.2 sebagai "Dibina untuk Tugas Jangka Panjang."
GLM-5.3 membawa falsafah berasaskan agen itu ke domain yang jauh lebih sensitif:
kejuruteraan perisian → penemuan kelemahan → pertahanan siber → keselamatan ofensif terkawal
Apakah Ciri Utama GLM-5.3?
Penaakulan Berpusatkan Keselamatan Siber
Keupayaan utama ialah keselamatan siber.
GLM-5.3 mencapai:
84.5% pada CyberGym
CyberGym menilai keupayaan sistem AI untuk mengenal pasti kelemahan perisian. Keputusan ini sedikit melebihi 83.8% yang dilaporkan oleh Mythos 5.
Ini penting kerana keselamatan siber memerlukan lebih daripada sekadar menghasilkan kod yang betul secara sintaksis.
Seorang agen keselamatan yang berkebolehan perlu:
- Memahami kod yang tidak dikenali.
- Mengenal pasti permukaan serangan.
- Membentuk hipotesis tentang kelemahan.
- Menjejak aliran data dan kawalan.
- Mengesahkan hipotesis.
- Membangunkan bukti konsep yang sesuai.
- Menentukan sama ada kelemahan itu sebenarnya boleh dieksploitasi.
Skor CyberGym GLM-5.3 menunjukkan kemajuan bermakna melalui bahagian pertama rantaian ini.
Penemuan Kelemahan yang Kukuh
Skor CyberGym 84.5% mungkin merupakan keputusan awal yang paling mengagumkan.
Ia meletakkan GLM-5.3 sedikit di hadapan Mythos 5 dalam pengenalpastian kelemahan:
| Model | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
Margin hanya 0.7 mata peratusan, jadi adalah mengelirukan untuk menggambarkan GLM-5.3 sebagai jauh lebih unggul.
Perkara yang lebih menarik ialah model open-weight daripada Z.ai memasuki lingkungan prestasi yang sama seperti sistem keselamatan siber yang sangat terhad.
Pembangunan Eksploit Masih Kelemahan
GLM-5.3 tidak mendominasi setiap tugas keselamatan siber.
Pada ExploitBench:
| Model | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
Itu jurang 23.6 mata.
Ini mendedahkan perbezaan penting:
Menemui kelemahan tidak sama dengan mengeksploitasinya secara boleh dipercayai.
GLM-5.3 nampaknya sangat berkebolehan dalam mengenal pasti kelemahan, tetapi keputusan awal menunjukkan bahawa menukar penemuan tersebut kepada pembangunan eksploit yang boleh diharap kekal jauh lebih sukar.
Bagi pasukan keselamatan perusahaan, ini sebenarnya menjadikan model ini menarik sebagai pembantu analisis kelemahan defensif, dan bukan semata-mata enjin automasi ofensif.
GLM-5.3 vs GLM-5.2
GLM-5.2 menyediakan garis dasar yang disahkan paling berguna.
| Ciri | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Status | Dikeluarkan | Diumumkan |
| Pemposisian utama | Agen jangka panjang | Keselamatan siber + agen |
| Pengaturcaraan | Cemerlang | Dijangka kekal kukuh |
| Keselamatan siber | Potensi kuat | Fokus perdana yang jelas |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| Konteks | 1M | Tidak disahkan |
| Parameter | ~753B | Tidak disahkan |
| Lesen | MIT | Open-weight diumumkan |
| Harga API | Diterbitkan | Belum diterbitkan |
| Berat awam | Tersedia | Dirancang |
Seni bina GLM-5.2 yang disahkan adalah kira-kira 753B parameter, dan katalog model awamnya masih menyenaraikan model 753B dan versi FP8.
GLM-5.2 juga mencapai 81.0 pada Terminal-Bench 2.1 dan 62.1 pada SWE-bench Pro menurut pelaporan pihak ketiga berdasarkan bahan penilaian model Z.ai.
Tetapi angka tersebut harus kekal sebagai penanda aras GLM-5.2, bukan dikaitkan dengan GLM-5.3.
GLM-5.3 vs Mythos 5
Ini buat masa ini perbandingan penanda aras paling bermakna.
| Penanda aras | GLM-5.3 | Mythos 5 | Perbezaan |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
Keputusan menghasilkan kesimpulan yang bernuansa.
GLM-5.3 menang dalam pengenalpastian kelemahan.
Tetapi:
Mythos 5 kekal jauh lebih kuat dalam pembangunan eksploit.
Oleh itu, mengatakan "GLM-5.3 mengatasi Mythos 5" akan menjadi tafsiran yang tidak tepat terhadap data yang tersedia.
Huraian yang lebih baik ialah:
GLM-5.3 mencapai prestasi setaraf Mythos 5 dalam penemuan kelemahan sambil kekal ketinggalan dalam pembangunan eksploit.
Itu jauh lebih mudah dipertahankan dan lebih berguna untuk pembangun.