TLDR Z.ai melancarkan GLM-5.3 pada 14 Ogos 2026, di atas model asas Mixture-of-Experts ~743–753B parameter yang sama seperti GLM-5.2. Semua peningkatan datang daripada pasca-latihan berskala pada persekitaran jangka panjang. Hasilnya ialah ~50% peningkatan relatif pada Code Bench dalaman Z.ai, SOTA sumber terbuka pada Terminal-Bench 3.0 (4.6 → 28.3) dan Agents’ Last Exam, markah keagenan jauh lebih baik, serta prestasi keselamatan siber tercanggih yang muncul (CyberGym 84.5%). Kecekapan token juga bertambah baik.
Berat model dijangka kira-kira dua minggu selepas pelancaran selepas pengukuhan keselamatan. Pembangun sudah boleh mengakses model GLM berkaitan dan menguji aliran kerja dengan cekap melalui platform bersatu seperti CometAPI.
Perkara Utama
- Model asas yang sama seperti GLM-5.2; semua kemajuan daripada pasca-latihan (IndexShare, SAO, rangka kerja slime + lebih banyak persekitaran dan komputasi).
- Pengaturcaraan: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; Code Bench dalaman Z.ai ~50% lebih baik dengan token output yang lebih sedikit.
- Keagenan: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
- Siber: CyberGym 77.2 → 84.5 (SOTA, mendahului Mythos 5 dan GPT-5.6 Sol); ExploitBench lebih daripada berganda (24.4 → 54.4). Penemuan dunia nyata: 2,436 kelemahan merentasi 269 projek.
- Spesifikasi teras tidak berubah dalam seni bina: konteks 1M, sehingga 128K token output, pemikiran sentiasa aktif dengan usaha low/high/max.
- Akses: Langsung melalui GLM Coding Plan dan ZCode; API umum dan berat terbuka (dijangka gaya MIT) akan datang selepas semakan keselamatan. CometAPI menawarkan akses serasi OpenAI yang mudah kepada keluarga GLM untuk ujian seiring dan peralihan produks.
GLM-5.3 vs GLM-5.2 Sekilas Pandang
| Dimensi | GLM-5.3 | GLM-5.2 | Pemenang / Nota |
|---|---|---|---|
| Model asas | Sama ~743–753B MoE | Sama | Identikal |
| Pasca-latihan | Persekitaran berskala besar | Tumpukan terdahulu | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3 (besar) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Internal Code Bench (Max) | 34.5% @ ~75K token | 23.4% @ ~96K token | 5.3 (prestasi + kecekapan) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5 (SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| Konteks / Output maks | 1M / 128K | 1M / serupa | Sama |
| Pemikiran | Sentiasa diaktifkan (low/high/max) | Lebih fleksibel sebelumnya | 5.3 (sentiasa aktif) |
| Berat terbuka | ~2 minggu selepas pelancaran (dirancang) | Tersedia (MIT) | 5.2 buat masa ini |
| Akses utama kini | Coding Plan / ZCode | API + berat + Coding Plan | 5.2 lebih matang |
Pengenalan: Pasca-Latihan Memberikan Lonjakan Generasi
Pada pertengahan Ogos 2026, komuniti AI menyaksikan satu lagi iterasi pantas dalam perlumbaan berat terbuka. Z.ai (wajah antarabangsa bekas pasukan Zhipu AI / ChatGLM) melancarkan GLM-5.3 hanya 59 hari selepas GLM-5.2. Pengumuman itu luar biasa jelas: model asas kekal sama. “Skala pasca-latihan adalah semua yang kami lakukan untuk GLM-5.3,” kata syarikat.
Dakwaan itu penting. Selama bertahun-tahun naratif dominan ialah “model lebih besar menang.” GLM-5.3 menunjukkan bahawa penskalaan agresif persekitaran pembelajaran pengukuhan, kepelbagaian tugas jangka panjang, dan infrastruktur sistem boleh menghasilkan peningkatan besar pada beban kerja pengaturcaraan sukar, keagenan, malah keselamatan siber tanpa pra-latihan baharu. Nombor pada beberapa penanda aras sukar cukup besar sehingga pemerhati bebas menyifatkan lonjakan itu sebagai berbeza secara kualitatif dan bukannya tambahan kecil. Gambaran keseluruhan ciri, penanda aras, dan nota akses GLM-5.3.
GLM-5.3 vs GLM-5.2: Apa Sebenarnya Berubah?
Salah tanggapan terbesar ialah berfikir GLM-5.3 sekadar “GLM-5.2 tetapi lebih besar.”
Bukan.
Model asas kekal pada dasarnya sama, menurut Z.ai. Inovasi utama ialah penskalaan pasca-latihan. Z.ai menekankan tiga tonggak:
- Penambahbaikan sistem dalam slime — Latihan yang lebih baik
- Penskalalaan persekitaran — Saluran paip yang mensintesis persekitaran boleh laksana, boleh sahkan, jangka panjang daripada aliran kerja profesional sebenar. Agen penyelidik mengekstrak corak tugas; agen hakim mengesahkan kebolehselesaian; pengesah dibina tanpa akses kepada penyelesaian rujukan untuk mengurangkan penggodaman ganjaran.
- Terus menggunakan SAO + pemampatan — Membantu keuntungan kekal pada trajektori panjang dan bukannya runtuh pada yang pendek. –konsistensi rollout (perbezaan kebarangkalian log dikawal sekitar ~1e-7), caching hierarki, sokongan berbilang guru, penjadualan peka beban kerja, dan dilaporkan >2.3× peningkatan throughput hujung-ke-hujung pada tugas RL pengaturcaraan jangka panjang.
Perubahan ini menghasilkan penambahbaikan terukur merentasi suite pengaturcaraan, keagenan, dan keselamatan siber. Pentingnya, keuntungan relatif terbesar muncul pada ujian paling sukar dengan garis dasar paling rendah—tepat corak yang dijangka apabila model ditolak ke rejim yang sebelum ini tidak dapat ditanganinya dengan boleh harap.
Hasilnya ialah naik taraf model yang terutamanya tentang tingkah laku dan keupayaan, bukannya semata-mata seni bina.
GLM-5.3 vs GLM-5.2: Perbandingan Ciri
1. Pasca-Latihan Berskala, Bukannya Model Asas Baharu
Z.ai menerangkan pasca-latihan berskala sebagai keseluruhan resipi untuk GLM-5.3. Agen penyelidik menukar corak daripada kerja sebenar kepada tugas boleh lari dengan keadaan tersembunyi dan kebergantungan berbilang langkah. Seorang agen hakim mengesahkan setiap tugas boleh diselesaikan. Pengesah dicipta tanpa melihat penyelesaian rujukan, kemudian diuji terhadap oracle, no-op, dan keadaan tidak selesai untuk mengurangkan jalan pintas ganjaran.
Sistem masih memerlukan semakan manusia, dan Z.ai secara jelas menyatakan penjanaan persekitaran dan pengesahan yang lebih autonomi kekal sebagai kerja masa hadapan. Kek caveat ini meningkatkan kredibiliti dakwaan: ini ialah saluran latihan berskala besar, bukan dakwaan bahawa persekitaran sintetik telah menjadi autonomi sepenuhnya.
2. Pengaturcaraan Jangka Panjang yang Lebih Kuat
GLM-5.3 bertambah baik pada kerja repositori, tugas terminal, infrastruktur pembelajaran mesin, pengoptimuman prestasi, dan penyampaian perisian berbilang langkah. Pada Z.ai Code Bench, penilaian dalaman peribadi yang bertujuan mencerminkan senario pengguna realistik, Z.ai melaporkan kira-kira 50% prestasi pengaturcaraan lebih baik berbanding GLM-5.2.
Hasil kecekapan sama pentingnya dengan skor. Pada usaha Max, GLM-5.3 mencapai 34.5% pada sekitar 75K token output setiap tugas, berbanding 23.4% pada 96K untuk GLM-5.2. Itu ialah peningkatan kualiti 11.1 mata sambil menghasilkan kira-kira 22% lebih sedikit token output. Pada usaha High, GLM-5.3 mencapai 31.4% menggunakan sekitar 50K token, mendahului Claude Opus 4.8 pada 29.5% dengan 120K dalam carta pihak pertama yang sama. Claude Fable 5 kekal lebih tinggi pada 39.5% di bawah usaha Max.
3. Keupayaan Keselamatan Siber yang Muncul
Z.ai menambah persekitaran penemuan kelemahan semasa pasca-latihan. Menurut laporan pelancaran, keupayaan berkembang melangkaui mencari kecacatan terpencil: model mula menaakul merentasi pelbagai peringkat rantaian eksploitasi.
Skor awam menunjukkan kemajuan dan had. GLM-5.3 menerajui jadual perbandingan Z.ai pada CyberGym dengan 84.5, berbanding 77.2 untuk GLM-5.2. Pada ExploitBench ia lebih daripada menggandakan GLM-5.2, mencapai 54.4 berbanding 24.4, tetapi kekal jauh di belakang Fable 5 pada 78.0 dan GPT-5.6 Sol pada 76.5. Pada ExploitGym ia menyiapkan 105 tugas dalam bajet dua jam ternormalisasi dan 130 dalam enam jam, berbanding 29 dan 39 untuk GLM-5.2; GPT-5.6 Sol dan Fable 5 kekal jauh di hadapan.
Keupayaan ini bersifat dwi-guna. Organisasi harus mengehadkan akses model, meletakkan alat dalam sandbox, merekod tindakan, memerlukan kebenaran untuk pengimbasan, dan memastikan manusia dalam kitaran untuk pengesahan dan pendedahan kelemahan.
4. Pemikiran Sentiasa Aktif dengan Tiga Tahap Usaha
GLM-5.3 menyokong low, high, dan max bagi usaha penaakulan. Tidak seperti GLM-5.2, ia tidak menyokong pemikiran dilumpuhkan. Integrasi sedia ada yang menghantar thinking.type: "disabled" mesti menukar nilainya kepada enabled sebelum menukar ID model, jika tidak Z.ai menyatakan permintaan akan gagal.
Guna low untuk suntingan interaktif dan transformasi risiko rendah, high untuk tugas repositori yang besar, dan max untuk pengaturcaraan sukar atau analisis keselamatan. Usaha lebih tinggi harus dinilai dari segi kelewatan dan kos kerana jawapan lebih kuat tidak semestinya jawapan paling ekonomik.
5. Throughput Latihan Lebih Baik melalui slime
GLM-5.3 terus menggunakan slime, rangka kerja sumber terbuka Z.ai dengan Megatron pada sisi latihan dan SGLang pada sisi rollout. Z.ai melaporkan penambahan untuk top-p masking, distilasi on-policy top-k dan seluruh perbendaharaan kata, pertukaran guru, caching, dan penjajaran berangka yang lebih ketat antara latihan dan rollout. Laporan pelancaran menyatakan perbezaan kebarangkalian log purata dikawal pada aras 1e-7, lebih 99.99% lebih rendah daripada set-up terdahulu.
Penjadualan peka beban kerja dan pengimbangan beban dilaporkan meningkatkan throughput pembelajaran pengukuhan hujung-ke-hujung lebih daripada 2.3 kali pada tugas RL pengaturcaraan jangka panjang. Ini ialah penambahbaikan infrastruktur latihan, bukan jaminan inferens pengguna akhir, tetapi ia menerangkan bagaimana Z.ai menskalakan trajektori yang lebih panjang dan pelbagai dalam sebulan.
6. Berat Terbuka Ditangguhkan untuk Semakan Keselamatan
Z.ai menyebut GLM-5.3 sebagai model berat terbuka, tetapi berat tidak boleh dimuat turun pada hari pelancaran. Syarikat menyatakan ia akan dikeluarkan dua minggu selepas pelancaran selepas penilaian dan pengukuhan keselamatan. Ini berbeza secara material daripada GLM-5.2, yang berat berlesen MIT telah pun berada di Hugging Face.
Bagi kebanyakan pasukan, ujian API dihoskan masih langkah praktikal pertama. Model ini besar, dan berat terbuka tidak menghapuskan kos perkakasan inferens, pengkuantuman, penyajian, pemantauan, atau kawalan keselamatan.
GLM-5.3 vs GLM-5.2: Peningkatan Penanda Aras
Jadual berikut menggunakan data pelancaran rasmi Z.ai. “Perubahan” ialah pengiraan mudah daripada skor yang dilaporkan. Peratusan relatif boleh kelihatan dramatik apabila garis dasar GLM-5.2 rendah, jadi perubahan mutlak turut ditunjukkan.
| Penanda aras | GLM-5.2 | GLM-5.3 | Perubahan mutlak | Perubahan relatif |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +8.9% |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +515.2% |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +44.8% |
| NL2Repo | 48.9 | 58.0 | +9.1 | +18.6% |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +100.0% |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +15.7% |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +119.1% |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +25.6% |
| CyberGym | 77.2 | 84.5 | +7.3 | +9.5% |
| ExploitBench | 24.4 | 54.4 | +30.0 | +123.0% |
| ExploitGym, tugas 2 jam | 29 | 105 | +76 | +262.1% |
| ExploitGym, tugas 6 jam | 39 | 130 | +91 | +233.3% |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +21.9% |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +84.0% |
| Agents' Last Exam CLI | 23.8 | 28.5 | +4.7 | +19.7% |
| HLE with tools | 54.7 | 62.5 | +7.8 | +14.3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17.3% |
Peningkatan Penanda Aras: GLM-5.3 vs GLM-5.2 dan Pesaing
Semua nombor di bawah dilaporkan vendor daripada blog rasmi Z.ai (dengan nota metodologi tentang harness, panjang konteks, dan pensampelan). Pengesahan bebas akan menyusul apabila berat dan akses lebih luas tersedia.
Penanda Aras Pengaturcaraan
| Penanda aras | GLM-5.3 | GLM-5.2 | Nota / Pesaing |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | Bersaing dengan model tertutup terbaik |
| Terminal Bench 3.0 | 28.3 | 4.6 | SOTA sumber terbuka; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | Lompatan kukuh |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench (dalaman, usaha Max) | ~34.5% penyiapan @ ~75K token | ~23.4% @ ~96K token | ~50% peningkatan keseluruhan dalam pengalaman pengaturcaraan; kecekapan lebih tinggi |
Pada usaha High, GLM-5.3 mencapai 31.4% penyiapan dengan ~50K token, mengatasi Claude Opus 4.8 (29.5% dengan 120K token) pada bench dalaman, sambil masih di belakang Claude Fable 5 (39.5% pada Max).
Penanda Aras Keselamatan Siber
| Penanda aras | GLM-5.3 | GLM-5.2 | Pesaing (anggaran) |
|---|---|---|---|
| CyberGym | 84.5% | 77.2% | Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA) |
| ExploitBench | 54.4% | 24.4% | Lebih daripada menggandakan sebelumnya; model tertutup lebih tinggi (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%) |
| ExploitGym (2j/6j) | 105 / 130 | 29 / 39 | Mythos 5 masih di hadapan (181/247) |
Keuntungan adalah terbesar lebih jauh ke atas rantaian eksploitasi. Dalam ujian dunia nyata bersama pasukan keselamatan China, model (membina atas kerja GLM-5.2) mengenal pasti 2,436 kelemahan merentas 269 projek, termasuk 1,097 isu sederhana hingga tinggi. Sesetengah kelemahan bertarikh sekitar 40 tahun lalu (tertua ~1981). Penemuan dijejaki dalam Z.ai Security Disclosure Ledger awam.
Penanda Aras Keagenan & Lain-lain
| Penanda aras | GLM-5.3 | GLM-5.2 | Nota |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | Keuntungan besar |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | Bersaing sumber terbuka |
| HLE w/ Tools | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | Meliputi 44 profesion |
Keputusan ini menunjukkan kemajuan jelas pada tugas profesional berbilang langkah jangka panjang.
Kecekapan Token, Mod Pemikiran, dan Tingkah Laku Praktikal
Satu penambahbaikan yang senyap tetapi penting ialah kecekapan token. Pada Code Bench dalaman, kadar penyiapan yang lebih tinggi dicapai dengan token output yang lebih sedikit. Ini penting untuk kos dan kelewatan dalam gelung agen produksi.
GLM-5.3 sentiasa mengaktifkan pemikiran. Tiga tahap usaha disokong: low, high, dan max (lalai dan disyorkan untuk pengaturcaraan ialah max). Melumpuhkan pemikiran tidak lagi disokong; aplikasi yang sebelum ini menetapkan thinking.type: "disabled" mesti berhijrah.
Konteks kekal kukuh pada 1M token dengan output maksimum sehingga 128K. Seni bina tidak berubah daripada GLM-5.2, jadi penyukatan perkakasan untuk hos kendiri masa hadapan boleh dianggarkan daripada pengalaman GLM-5.2 sedia ada (jejak terkuantum masih besar memandangkan jumlah kiraan parameter).
Bagi pembangun yang mahu bereksperimen serta-merta atau mengekalkan fleksibiliti merentasi model, gerbang bersatu adalah berguna. CometAPI menyenaraikan model siri GLM (termasuk GLM-5.3 di bawah ID model glm-5.3 apabila tersedia) dengan titik akhir serasi OpenAI, kadar kompetitif, pengebilan berasaskan penggunaan, dan keupayaan untuk bertukar antara GLM-5.2, GLM-5.3, dan berpuluh model lain tanpa menulis semula kod integrasi. Ini amat praktikal untuk A/B testing agen pengaturcaraan, mengukur kos per tugas berjaya yang sebenar, dan merutekan trafik berdasarkan beban kerja.
Siapa Patut Beralih ke GLM-5.3 dan Cara Menilai
Pasukan yang membina agen pengaturcaraan, automasi jangka panjang, aliran kerja kejuruteraan skala repositori, atau perkakas keselamatan defensif harus mengutamakan penilaian. Gabungan kadar penyiapan lebih tinggi, kecekapan token lebih baik pada tugas kompleks, dan agensi berbilang langkah yang lebih kukuh adalah material.
Laluan penilaian yang disyorkan:
- Jalankan tugas dalaman yang sama (atau harness tetap) pada GLM-5.2 dan GLM-5.3 (atau melalui Coding Plan) pada tahap usaha yang dipadankan.
- Ukur bukan sahaja kadar lulus tetapi juga token, masa dinding, dan kadar campur tangan manusia.
- Gunakan lapisan API bersatu seperti CometAPI untuk memastikan perbandingan bebas geseran dan mengekalkan pilihan untuk fallback atau perutean terpilih.
- Untuk beban kerja sensitif keselamatan, tunggu berat terbuka yang diperkukuh keselamatan sepenuhnya dan semak amalan pendedahan.
Hos kendiri akan menjadi menarik apabila berat dihantar, terutamanya bagi organisasi yang sudah menjalankan infrastruktur GLM-5.2.
Kesimpulan: Pasca-Latihan sebagai Sempadan Penskalaan Baharu
GLM-5.3 ialah salah satu demonstrasi paling jelas baru-baru ini bahawa skala pasca-latihan—persekitaran yang lebih realistik, infrastruktur RL yang lebih baik, dan komputasi berterusan pada trajektori panjang—boleh menghasilkan lonjakan keupayaan yang sebelum ini kelihatan memerlukan model asas baharu. Keuntungan dalam pengaturcaraan dan keagenan adalah besar; hasil siber sebahagian besarnya muncul dan sudah kompetitif atau mendahului pada penanda aras berorientasi penemuan.
Bagi pengamal, pengajaran praktikalnya mudah: uji model pada beban kerja sebenar anda, ukur kos per hasil berjaya dan bukannya kedudukan papan pendahulu semata-mata, dan kekalkan integrasi yang fleksibel. Platform seperti CometAPI memudahkan proses itu dengan menawarkan satu kunci, antara muka serasi OpenAI, dan pertukaran mudah merentasi siri GLM dan model pesaing sementara anda memutuskan sejauh mana agresif untuk menerima keupayaan baharu.
