TLDR Z.ai, 14 Ağustos 2026’da GLM-5.3’ü, GLM-5.2 ile tamamen aynı ~743–753B parametreli Mixture-of-Experts temel model üzerinde yayınladı. Tüm kazanımlar, uzun ufuklu ortamlarda ölçeklenmiş sonraki eğitimden geldi. Sonuç: Z.ai’nin dahili Code Bench’inde ~%50 göreli iyileşme, Terminal-Bench 3.0’da (4.6 → 28.3) ve Agents’ Last Exam’de açık kaynak SOTA, dramatik biçimde daha iyi ajanlık skorları ve ortaya çıkan üst düzey siber güvenlik performansı (CyberGym %84.5). Token verimliliği de iyileşti.
Ağırlıkların, güvenlik sağlamlaştırmasının ardından lansmandan yaklaşık iki hafta sonra yayımlanması bekleniyor. Geliştiriciler, CometAPI gibi birleşik platformlar üzerinden ilgili GLM modellerine şimdiden erişebilir ve iş akışlarını verimli biçimde test edebilir.
Öne Çıkanlar
- GLM-5.2 ile aynı temel model; tüm ilerleme sonraki eğitimden (IndexShare, SAO, slime framework + daha fazla ortam ve hesaplama).
- Kodlama: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; dahili Z.ai Code Bench’te daha az çıktı token’ıyla ~%50 daha iyi.
- Ajanlık: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
- Siber: CyberGym 77.2 → 84.5 (SOTA, Mythos 5 ve GPT-5.6 Sol’un önünde); ExploitBench iki kattan fazla arttı (24.4 → 54.4). Gerçek dünyada bulgular: 269 projede 2.436 zafiyet.
- Çekirdek mimaride özellikler değişmedi: 1M bağlam, 128K’ya kadar çıktı token’ı, düşük/ yüksek/ maksimum çabayla her zaman açık düşünme.
- Erişim: GLM Coding Plan ve ZCode ile canlı; genel API ve açık ağırlıklar (MIT tarzı bekleniyor) güvenlik incelemesi sonrası geliyor. CometAPI, GLM ailesine OpenAI uyumlu, yan yana test ve üretim yönlendirmesi için uygun erişim sunuyor.
GLM-5.3 vs GLM-5.2 Kısa Bakış
| Boyut | GLM-5.3 | GLM-5.2 | Kazanan / Notlar |
|---|---|---|---|
| Temel model | Aynı ~743–753B MoE | Aynı | Aynı |
| Sonraki eğitim | Yoğun ölçeklenen ortamlar | Önceki yığın | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3 (büyük) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Dahili Code Bench (Max) | %34.5 @ ~75K token | %23.4 @ ~96K token | 5.3 (performans + verim) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5 (SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| Bağlam / Maks çıktı | 1M / 128K | 1M / benzer | Aynı |
| Düşünme | Her zaman açık (low/high/max) | Önceden daha esnekti | 5.3 (her zaman açık) |
| Açık ağırlıklar | Lansman sonrası ~2 hafta (plan) | Mevcut (MIT) | Şu an 5.2 |
| Şu anki birincil erişim | Coding Plan / ZCode | API + ağırlıklar + Coding Plan | 5.2 daha olgun |
Giriş: Sonraki Eğitim Nesil Sıçraması Sağlıyor
2026 Ağustos ortasında, açık ağırlık yarışında bir başka hızlı yineleme yaşandı. Z.ai (eski Zhipu AI / ChatGLM ekibinin uluslararası yüzü), GLM-5.2’den sadece 59 gün sonra GLM-5.3’ü yayınladı. Duyuru, alışılmadık derecede netti: alttaki temel model aynı kaldı. “GLM-5.3 için yaptığımız tek şey sonraki eğitimi ölçeklemekti,” şirket belirtti.
Bu iddia önemli. Yıllardır baskın anlatı “daha büyük modeller kazanır” şeklindeydi. GLM-5.3, güçlendirme öğrenmesi ortamlarının agresifce ölçeklenmesinin, uzun ufuklu görev çeşitliliğinin ve sistem altyapısının, yeni bir ön eğitim koşusu olmadan zor kodlama, ajanlık ve hatta siber güvenlik iş yüklerinde beklenenden büyük kazanımlar üretebileceğini gösteriyor. Bazı zorlayıcı kıyaslamalardaki rakamlar o kadar yüksek ki, bağımsız gözlemciler bu sıçramayı artımsal değil niteliksel olarak farklı tanımlıyor. GLM-5.3 özellikleri, kıyaslamalar ve erişim notlarının özeti.
GLM-5.3 vs GLM-5.2: Gerçekte Ne Değişti?
En büyük yanlış kanı, GLM-5.3’ün basitçe “GLM-5.2’nin büyüğü” olduğunu düşünmek olurdu.
Değil.
Z.ai’ye göre temel model esasen aynı kaldı. Ana yenilik, sonraki eğitimin ölçeklenmesi. Z.ai üç sütunu vurguluyor:
- slime içinde sistem iyileştirmeleri — Daha iyi eğitim
- Ortam ölçekleme — Gerçek profesyonel iş akışlarından yürütülebilir, doğrulanabilir, uzun ufuklu ortamlar sentezleyen hatlar. Araştırma ajanları görev kalıplarını çıkarır; yargıç ajanlar çözülebilirliği doğrular; doğrulayıcılar, ödül suistimalini azaltmak için referans çözüme erişmeden inşa edilir.
- SAO + sıkıştırmanın sürekli kullanımı — Kazanımların kısa yerine uzun yörüngelerde kalıcı olmasına yardımcı olur. – yürütüm tutarlılığı (log-olasılık farkları ~1e-7 düzeyinde kontrol edildi), hiyerarşik önbellekleme, çoklu öğretmen desteği, iş yükü farkındalıklı zamanlama ve uzun ufuklu kodlama RL görevlerinde bildirilen >2.3× uçtan uca verim artışları.
Bu değişiklikler, kodlama, ajanlık ve siber güvenlik setlerinde ölçülebilir iyileştirmeler üretti. Önemlisi, en büyük göreli kazanımlar en zor, tabanı en düşük testlerde görünüyor—bu da modelin daha önce güvenilirce baş edemediği rejimlere itildiğinde beklenen bir desen.
Sonuç, sadece mimariden ziyade öncelikle davranış ve yetenek odaklı bir model yükseltmesi.
GLM-5.3 vs GLM-5.2: Özellik Karşılaştırması
1. Yeni Bir Temel Model Yerine Ölçeklenmiş Sonraki Eğitim
Z.ai, ölçeklenmiş sonraki eğitimi GLM-5.3’ün tüm tarifi olarak tanımlıyor. Araştırma ajanları, gerçek işten kalıpları gizli durumlu ve çok adımlı bağımlılıklara sahip çalıştırılabilir görevlere dönüştürüyor. Bir yargıç ajan her görevin çözülebilirliğini doğruluyor. Doğrulayıcılar referans çözümü görmeden oluşturuluyor, ardından ödül kestirmelerini azaltmak için oracle, no-op ve çözülmemiş durumlara karşı test ediliyor.
Sistem hâlâ insan incelemesi gerektiriyor ve Z.ai, daha otonom ortam üretimi ve doğrulamanın gelecekteki çalışmalar olduğunu açıkça belirtiyor. Bu çekince iddianın inandırıcılığını artırıyor: bu, sentetik ortamların tamamen kendi kendini yönettiği iddiası değil, büyük bir eğitim hattı.
2. Daha Güçlü Uzun Ufuklu Kodlama
GLM-5.3, depo çalışmaları, terminal görevleri, makine öğrenimi altyapısı, performans optimizasyonu ve çok adımlı yazılım tesliminde iyileşiyor. Gerçekçi kullanıcı senaryolarını yansıtmayı amaçlayan özel dahili değerlendirme Z.ai Code Bench’te, Z.ai GLM-5.2’ye kıyasla yaklaşık %50 daha iyi kodlama performansı bildiriyor.
Verimlilik sonucu skor kadar önemli. Max çabada GLM-5.3, görev başına yaklaşık 75K çıktı token’ında %34.5’e ulaşırken, GLM-5.2 aynı koşullarda 96K token’da %23.4’te kaldı. Bu, yaklaşık %22 daha az çıktı token’ı üretirken 11.1 puan kalite artışı demek. High çabada GLM-5.3, yaklaşık 50K token’la %31.4’e ulaştı ve aynı birinci taraf grafikte 120K token’la %29.5 yapan Claude Opus 4.8’i geçti. Claude Fable 5, Max çabada %39.5 ile daha yüksek kaldı.
3. Ortaya Çıkan Siber Güvenlik Yeteneği
Z.ai, sonraki eğitim sırasında zafiyet keşfi ortamları ekledi. Lansman raporuna göre yetenek, izole hataları bulmanın ötesine geçti: model, bir istismar zincirinin birden çok aşamasında akıl yürütmeye başladı.
Kamuya açık skorlar hem ilerlemeyi hem sınırları gösteriyor. GLM-5.3, CyberGym’de 84.5 ile Z.ai’nin karşılaştırma tablosuna liderlik ediyor (GLM-5.2: 77.2). ExploitBench’te GLM-5.2’yi iki kattan fazla artırarak 54.4’e ulaşıyor (GLM-5.2: 24.4), ancak Fable 5’in 78.0’ına ve GPT-5.6 Sol’un 76.5’ine göre geride kalıyor. ExploitGym’de normalize edilmiş iki saatlik bütçede 105, altı saatte 130 görevi tamamlıyor; GLM-5.2’de bu değerler sırasıyla 29 ve 39; GPT-5.6 Sol ve Fable 5 halen belirgin biçimde önde.
Bu yetenekler çift kullanımlıdır. Kuruluşlar, model erişimini sınırlamalı, araçları sandbox içinde çalıştırmalı, eylemleri kaydetmeli, tarama için yetki gerektirmeli ve zafiyet doğrulaması ile ifşasında insan denetimi bulundurmalıdır.
4. Üç Çaba Düzeyiyle Her Zaman Açık Akıl Yürütme
GLM-5.3, low, high ve max akıl yürütme çabalarını destekler. GLM-5.2’den farklı olarak, düşünmeyi devre dışı bırakmayı desteklemez. Entegrasyonlarında thinking.type: "disabled" gönderen uygulamalar, model kimliğini değiştirmeden önce değeri enabled olarak değiştirmelidir; aksi halde isteğin başarısız olacağı Z.ai tarafından belirtiliyor.
Etkileşimli düzenlemeler ve düşük riskli dönüşümler için low, kapsamlı depo görevleri için high, zor kodlama veya güvenlik analizi için max kullanın. Daha yüksek çabayı gecikme ve maliyet açısından değerlendirmek gerekir; daha güçlü bir yanıt otomatik olarak en ekonomik yanıt değildir.
5. slime ile Daha İyi Eğitim Verimi
GLM-5.3, eğitim tarafında Megatron ve yürütüm tarafında SGLang ile Z.ai’nin açık kaynak çerçevesi slimeı kullanmaya devam ediyor. Z.ai; top-p maskeleme, top-k ve tam sözlük içi on-policy distilasyon, öğretmen değiştirme, önbellekleme ve eğitim ile yürütüm arasında daha sıkı sayısal hizalama eklemeleri raporluyor. Lansman raporu, ortalama log-olasılık farklarının 1e-7 düzeyinde kontrol edildiğini, önceki kurulumlara göre %99.99’dan fazla daha düşük olduğunu söylüyor.
İş yükü farkındalıklı zamanlama ve yük dengeleme, uzun ufuklu kodlama güçlendirme öğrenmesi görevlerinde uçtan uca verimi >2.3 kat artırdı. Bunlar son kullanıcı çıkarım garantileri değil, eğitim altyapısı iyileştirmeleri; ancak Z.ai’nin bir ayda daha uzun ve çeşitli yörüngeleri nasıl ölçeklediğini açıklıyor.
6. Güvenlik İncelemesi İçin Gecikmeli Açık Ağırlıklar
Z.ai, GLM-5.3’ü açık ağırlıklı bir model olarak adlandırıyor, ancak ağırlıklar lansman gününde indirilebilir değildi. Şirket, güvenlik değerlendirmesi ve sağlamlaştırmasının ardından lansmandan iki hafta sonra yayımlanacağını söylüyor. Bu, MIT lisanslı ağırlıkları halihazırda Hugging Face’te bulunan GLM-5.2’den belirgin bir fark.
Çoğu ekip için barındırılan API testi yine de pratik ilk adımdır. Model büyük; açık ağırlıklar, çıkarım donanımı, kuantizasyon, sunum, izleme veya güvenlik kontrollerinin maliyetini ortadan kaldırmaz.
GLM-5.3 vs GLM-5.2: Kıyaslama İyileştirmeleri
Aşağıdaki tablo Z.ai’nin resmi lansman verilerini kullanır. “Değişim” bildirilen skorların basit hesaplamasıdır. GLM-5.2 tabanı düşükken göreli yüzdeler dramatik görünebilir, bu nedenle mutlak değişim de gösterilmiştir.
| Kıyaslama | GLM-5.2 | GLM-5.3 | Mutlak değişim | Göreli değişim |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +%8.9 |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +%515.2 |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +%44.8 |
| NL2Repo | 48.9 | 58.0 | +9.1 | +%18.6 |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +%100.0 |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +%15.7 |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +%119.1 |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +%25.6 |
| CyberGym | 77.2 | 84.5 | +7.3 | +%9.5 |
| ExploitBench | 24.4 | 54.4 | +30.0 | +%123.0 |
| ExploitGym, 2 saatlik görevler | 29 | 105 | +76 | +%262.1 |
| ExploitGym, 6 saatlik görevler | 39 | 130 | +91 | +%233.3 |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +%21.9 |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +%84.0 |
| Agents' Last Exam CLI | 23.8 | 28.5 | +4.7 | +%19.7 |
| HLE with tools | 54.7 | 62.5 | +7.8 | +%14.3 |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +%17.3 |
Kıyaslama İyileştirmeleri: GLM-5.3 vs GLM-5.2 ve Rakipler
Aşağıdaki tüm sayılar, resmi Z.ai blogundan tedarikçi tarafından rapor edilmiştir (kanca, bağlam uzunlukları ve örnekleme metodolojisi notlarıyla). Ağırlıklar ve daha geniş erişim sağlandığında bağımsız doğrulama takip edecektir.
Kodlama Kıyaslamaları
| Kıyaslama | GLM-5.3 | GLM-5.2 | Notlar / Rakipler |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | En iyi kapalı modellere yakın |
| Terminal Bench 3.0 | 28.3 | 4.6 | Açık kaynak SOTA; Fable 5 ~33.7, GPT-5.6 Sol ~34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | Güçlü sıçrama |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench (dahili, Max çaba) | ~%34.5 tamamlama @ ~75K token | ~%23.4 @ ~96K token | Kodlama deneyiminde ~%50 genel iyileşme; daha yüksek verim |
High çabada GLM-5.3, ~50K token’la %31.4 tamamlama oranına ulaştı; dahili kıyaslamada 120K token’la %29.5 yapan Claude Opus 4.8’i geçti, fakat Max altında Claude Fable 5 (%39.5) halen önde.
Siber Güvenlik Kıyaslamaları
| Kıyaslama | GLM-5.3 | GLM-5.2 | Rakipler (yaklaşık) |
|---|---|---|---|
| CyberGym | %84.5 | %77.2 | Mythos 5: %83.8, GPT-5.6 Sol: %83.6 (SOTA) |
| ExploitBench | %54.4 | %24.4 | Öncekini iki kattan fazla; kapalı modeller daha yüksek (Mythos 5 ~%78, GPT-5.6 Sol ~%76.5) |
| ExploitGym (2s/6s) | 105 / 130 | 29 / 39 | Mythos 5 hâlâ önde (181/247) |
Kazanımlar, istismar zincirinin üst aşamalarında daha büyüktür. Çinli güvenlik ekipleriyle gerçek dünyadaki testlerde, model (GLM-5.2 çalışmaları üzerine inşa edilerek) 269 projede 2.436 zafiyet belirledi; bunların 1.097’si orta-yüksek şiddette. Bazı kusurlar ~40 yıl öncesine (en eski ~1981) dayanıyordu. Bulgular, halka açık Z.ai Security Disclosure Ledger içinde izleniyor .
Ajanlık ve Diğer Kıyaslamalar
| Kıyaslama | GLM-5.3 | GLM-5.2 | Notlar |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | Büyük kazanım |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | Açık kaynak rekabetçi |
| HLE w/ Tools | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | 44 mesleği kapsar |
Bu sonuçlar, uzun ufuklu, çok adımlı profesyonel görevlerde net ilerleme göstermektedir.
Token Verimliliği, Düşünme Modları ve Pratik Davranış
Sessiz ama önemli bir iyileştirme, token verimliliğidir. Dahili Code Bench’te, daha yüksek tamamlama oranları daha az çıktı token’ıyla geliyor. Bu, üretim ajan döngülerinde maliyet ve gecikme açısından önemlidir.
GLM-5.3, düşünmeyi her zaman etkin kılar. Üç çaba düzeyi desteklenir: low, high ve max (kodlama için varsayılan ve önerilen max). Düşünmeyi devre dışı bırakma artık desteklenmiyor; daha önce thinking.type: "disabled" ayarlayan uygulamalar geçiş yapmalıdır.
Bağlam 1M token olarak güçlü kalıyor ve maksimum çıktı 128K’ya kadar. Mimari GLM-5.2 ile değişmediğinden, gelecekte öz barındırma için donanım boyutlandırması mevcut GLM-5.2 deneyiminden tahmin edilebilir (toplam parametre sayısı göz önüne alındığında kuantize ayak izi hâlâ büyük).
Hemen denemek isteyen veya modeller arasında esneklik korumak isteyen geliştiriciler için birleşik ağ geçitleri faydalıdır. CometAPI, GLM serisi modelleri (kullanıma sunuldukça glm-5.3 model kimliği altında GLM-5.3 dahil) OpenAI uyumlu uç noktalar, rekabetçi ücretler, kullanıma dayalı fatura ve GLM-5.2, GLM-5.3 ve onlarca sınır/açık model arasında entegrasyon kodunu yeniden yazmadan geçiş yapma imkânıyla listeler. Bu, özellikle kodlama ajanlarında A/B testleri, başarılı görev başına gerçek maliyeti ölçme ve iş yüke göre trafik yönlendirme için pratiktir.
Kimler GLM-5.3’e Geçmeli ve Nasıl Değerlendirmeli
Kodlama ajanları, uzun ufuklu otomasyon, depo ölçeğinde mühendislik iş akışları veya savunmacı güvenlik araçları geliştiren ekipler değerlendirmeye öncelik vermelidir. Daha yüksek tamamlama oranları, karmaşık görevlerde daha iyi token verimliliği ve daha güçlü çok adımlı ajanlık kombinasyonu kayda değerdir.
Önerilen değerlendirme yolu:
- Aynı dahili görevleri (veya sabit bir kanca) GLM-5.2 ve GLM-5.3 (veya Coding Plan aracılığıyla) üzerinde eşleşen çaba düzeylerinde çalıştırın.
- Yalnızca geçiş oranını değil, token’ları, duvar saati süresini ve insan müdahale oranını ölçün.
- Karşılaştırmayı sürtünmesiz tutmak ve geri dönüş veya seçici yönlendirme seçeneğini korumak için CometAPI gibi birleşik bir API katmanı kullanın.
- Güvenlik hassas iş yükleri için, tam güvenlik sağlamalı açık ağırlıkları bekleyin ve ifşa uygulamalarını gözden geçirin.
Ağırlıklar yayınlandığında, özellikle halihazırda GLM-5.2 altyapısı çalıştıran kuruluşlar için öz barındırma cazip hale gelecektir.
Sonuç: Ölçeklemede Yeni Sınır Olarak Sonraki Eğitim
GLM-5.3, sonraki eğitim ölçeğinin—daha gerçekçi ortamlar, daha iyi RL altyapısı ve uzun yörüngelerde sürdürülen hesaplama—yeni temel modellere ihtiyaç duyduğu düşünülen yetenek sıçramalarını üretebileceğine dair en net yakın dönem gösterimlerinden biridir. Kodlama ve ajanlık kazanımları büyük; siber sonuçlar büyük ölçüde ortaya çıkışsal ve keşif odaklı kıyaslamalarda şimdiden rekabetçi veya lider.
Uygulayıcılar için pratik çıkarım basittir: modeli gerçek iş yüklerinizde test edin, ham liderlik tablosu pozisyonu yerine başarılı sonuç başına maliyeti ölçün ve entegrasyonu esnek tutun. CometAPI gibi platformlar, tek anahtar, OpenAI uyumlu arayüz ve GLM serisi ile rakip modeller arasında kolay geçiş imkânı sunarak, yeni yetenekleri ne kadar agresif benimseyeceğinize karar verirken süreci basitleştirir.
