TL;DR Z.ai udostępniło GLM-5.3 14 sierpnia 2026 r., na dokładnie tym samym bazowym modelu Mixture-of-Experts z ~743–753B parametrów co GLM-5.2. Wszystkie ulepszenia pochodzą ze skalowanego post-treningu w środowiskach o długim horyzoncie. Efekt to ~50% względnej poprawy na wewnętrznym Code Bench Z.ai, open-source SOTA na Terminal-Bench 3.0 (4.6 → 28.3) i Agents’ Last Exam, dramatycznie lepsze wyniki agentowe oraz emergentowe, najwyższej klasy osiągi w cyberbezpieczeństwie (CyberGym 84,5%). Poprawiła się też efektywność tokenów.
Wagi mają zostać wydane mniej więcej dwa tygodnie po premierze, po wzmocnieniu bezpieczeństwa. Deweloperzy już teraz mogą korzystać z pokrewnych modeli GLM i sprawnie testować workflowy poprzez zunifikowane platformy, takie jak CometAPI.
Najważniejsze wnioski
- Ten sam bazowy model co GLM-5.2; wszystkie postępy z post-treningu (IndexShare, SAO, framework slime + więcej środowisk i mocy obliczeniowej).
- Kodowanie: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; wewnętrzny Z.ai Code Bench ~50% lepiej przy mniejszej liczbie tokenów wyjściowych.
- Agentowość: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
- Cyber: CyberGym 77.2 → 84.5 (SOTA, przed Mythos 5 i GPT-5.6 Sol); ExploitBench ponad dwukrotnie (24.4 → 54.4). Realne odkrycia: 2 436 podatności w 269 projektach.
- Specyfikacja rdzenia bez zmian: kontekst 1M, do 128K tokenów wyjściowych, always-on thinking z wysiłkiem low/high/max.
- Dostęp: Na żywo poprzez GLM Coding Plan i ZCode; ogólne API i otwarte wagi (planowany styl MIT) po przeglądzie bezpieczeństwa. CometAPI oferuje wygodny, zgodny z OpenAI dostęp do rodziny GLM do efektywnego testowania side-by-side i routingu produkcyjnego.
GLM-5.3 vs GLM-5.2 w skrócie
| Wymiar | GLM-5.3 | GLM-5.2 | Zwycięzca / Uwagi |
|---|---|---|---|
| Bazowy model | Ten sam ~743–753B MoE | Ten sam | Identyczne |
| Post-trening | Silnie skalowane środowiska | Wcześniejszy stos | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3 (duża) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Internal Code Bench (Max) | 34.5% @ ~75K tokenów | 23.4% @ ~96K tokenów | 5.3 (wydajność + efektywność) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5 (SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| Kontekst / Maks. wyjście | 1M / 128K | 1M / podobne | To samo |
| Myślenie | Zawsze włączone (low/high/max) | Wcześniej bardziej elastyczne | 5.3 (always-on) |
| Otwarte wagi | ~2 tygodnie po premierze (plan) | Dostępne (MIT) | 5.2 obecnie |
| Główny dostęp teraz | Coding Plan / ZCode | API + wagi + Coding Plan | 5.2 bardziej dojrzały |
Wprowadzenie: Post-trening przynosi skok generacyjny
W połowie sierpnia 2026 społeczność AI obserwowała kolejną szybką iterację w wyścigu otwartych wag. Z.ai (międzynarodowa twarz dawnego zespołu Zhipu AI / ChatGLM) wypuściło GLM-5.3 zaledwie 59 dni po GLM-5.2. Ogłoszenie było nietypowo klarowne: bazowy model pozostał identyczny. „Skalowanie post-treningu to jedyne, co zrobiliśmy dla GLM-5.3,” stwierdziła firma.
To twierdzenie ma znaczenie. Przez lata dominowała narracja „większe modele wygrywają”. GLM-5.3 pokazuje, że agresywne skalowanie środowisk RL, różnorodność zadań o długim horyzoncie oraz infrastruktura systemowa mogą przynieść ponadprzeciętne zyski w trudnym kodowaniu, agentowości, a nawet cyberbezpieczeństwie bez nowego pre-treningu. Liczby są na tyle duże na kilku wymagających benchmarkach, że niezależni obserwatorzy opisują skok jako jakościowo inny, a nie stopniowy. Przegląd funkcji, benchmarków i notatek o dostępie GLM-5.3.
GLM-5.3 vs GLM-5.2: Co faktycznie się zmieniło?
Największym nieporozumieniem byłoby myśleć, że GLM-5.3 to po prostu „GLM-5.2, tylko większy”.
Nie jest.
Bazowy model pozostaje zasadniczo taki sam, według Z.ai. Główna innowacja to skalowanie post-treningu. Z.ai podkreśla trzy filary:
- Ulepszenia systemowe wewnątrz slime — Lepszy trening
- Skalowanie środowisk — Potoki, które syntetyzują wykonywalne, weryfikowalne, długohoryzontalne środowiska z realnych profesjonalnych workflowów. Agenci badawczy ekstrahują wzorce zadań; agenci-sędziowie weryfikują rozwiązywalność; weryfikatory budowane bez dostępu do rozwiązań referencyjnych, aby zredukować nagradzanie skrótów.
- Kontynuacja użycia SAO + kompakcji — Pomaga utrzymać zyski na długich trajektoriach zamiast zanikać na krótkich. –spójność rolloutów (różnice log-prob kontrolowane do ~1e-7), buforowanie hierarchiczne, wsparcie wielu nauczycieli, planowanie świadome obciążenia oraz zgłaszane >2,3× zyski end-to-end w przepustowości na zadaniach RL o długim horyzoncie kodowania.
Te zmiany przyniosły mierzalne ulepszenia w zestawach kodowania, agentowości i cyberbezpieczeństwa. Co ważne, największe względne zyski pojawiają się na najtrudniejszych, najniżej bazowych testach — dokładnie ten wzorzec, którego oczekuje się, gdy model jest wypychany w rejony, których wcześniej nie potrafił wiarygodnie obsłużyć.
Wynikiem jest aktualizacja modelu, która dotyczy przede wszystkim zachowania i zdolności, a nie wyłącznie architektury.
GLM-5.3 vs GLM-5.2: Porównanie funkcji
1. Skalowany post-trening zamiast nowego bazowego modelu
Z.ai opisuje skalowany post-trening jako cały przepis na GLM-5.3. Agenci badawczy zamieniają wzorce z realnej pracy w uruchamialne zadania z ukrytym stanem i zależnościami wieloetapowymi. Agent-sędzia weryfikuje, że każde zadanie jest rozwiązywalne. Weryfikatory powstają bez wglądu w rozwiązanie referencyjne, a następnie są testowane względem orakla, no-op i stanów nierozwiązanych, aby ograniczyć skróty w nagradzaniu.
System nadal wymaga przeglądu przez człowieka, a Z.ai wyraźnie mówi, że bardziej autonomiczne generowanie i weryfikacja środowisk pozostają pracą na przyszłość. Ten zastrzeżenie zwiększa wiarygodność twierdzenia: to duży potok treningowy, a nie stwierdzenie, że syntetyczne środowiska stały się w pełni samorządne.
2. Silniejsze kodowanie o długim horyzoncie
GLM-5.3 poprawił się w pracy na repozytoriach, zadaniach terminalowych, infrastrukturze ML, optymalizacji wydajności oraz wieloetapowej dostawie oprogramowania. Na Z.ai Code Bench, prywnym wewnętrznym teście mającym odzwierciedlać realistyczne scenariusze użytkowe, Z.ai raportuje około 50% lepszą wydajność kodowania niż GLM-5.2.
Wynik efektywności jest równie ważny jak punktacja. Przy wysiłku Max, GLM-5.3 osiągnął 34,5% przy około 75K tokenów wyjściowych na zadanie, w porównaniu z 23,4% i 96K w GLM-5.2. To 11,1 punktu jakości przy ~22% mniejszej liczbie tokenów wyjściowych. Przy wysiłku High, GLM-5.3 uzyskał 31,4% używając około 50K tokenów, wyprzedzając Claude Opus 4.8 na 29,5% przy 120K w tym samym zestawieniu pierwszej strony. Claude Fable 5 pozostał wyżej na 39,5% przy wysiłku Max.
3. Emergentowa zdolność cyberbezpieczeństwa
Z.ai dodało środowiska odkrywania podatności podczas post-treningu. Według raportu premierowego, zdolność wyrosła poza znajdowanie odizolowanych błędów: model zaczął rozumować przez wiele etapów łańcucha eksploatacji.
Publiczne wyniki pokazują zarówno postępy, jak i ograniczenia. GLM-5.3 prowadzi tabelę porównawczą Z.ai na CyberGym z 84,5, wobec 77,2 dla GLM-5.2. Na ExploitBench ponad dwukrotnie przebija GLM-5.2, osiągając 54,4 wobec 24,4, ale pozostaje wyraźnie za Fable 5 na 78,0 i GPT-5.6 Sol na 76,5. Na ExploitGym kończy 105 zadań w znormalizowanym dwugodzinnym budżecie i 130 w sześciu godzinach, w porównaniu z 29 i 39 dla GLM-5.2; GPT-5.6 Sol i Fable 5 pozostają znacznie przed nim.
Te zdolności są dual-use. Organizacje powinny ograniczać dostęp do modelu, odseparowywać narzędzia w sandboxie, logować działania, wymagać autoryzacji dla skanowania oraz utrzymywać człowieka w pętli dla walidacji podatności i ujawniania.
4. Zawsze włączone rozumowanie z trzema poziomami wysiłku
GLM-5.3 obsługuje low, high i max poziomy wysiłku rozumowania. W przeciwieństwie do GLM-5.2, nie wspiera wyłączonego myślenia. Istniejące integracje, które wysyłają thinking.type: "disabled", muszą zmienić wartość na enabled przed przełączeniem identyfikatora modelu, inaczej — jak mówi Z.ai — zapytanie się nie powiedzie.
Używaj low do interaktywnych edycji i niskiego ryzyka transformacji, high do istotnych zadań w repozytorium oraz max do trudnego kodowania lub analizy bezpieczeństwa. Wyższy wysiłek należy oceniać pod kątem opóźnienia i kosztu, bo silniejsza odpowiedź nie jest automatycznie najbardziej ekonomiczna.
5. Lepsza przepustowość treningu dzięki slime
GLM-5.3 nadal używa slime, otwartoźródłowego frameworka Z.ai z Megatron po stronie treningu i SGLang po stronie rolloutów. Z.ai raportuje dodatki dla maskowania top-p, destylacji on-policy top-k i pełnego słownika, przełączania nauczycieli, cache’owania oraz ściślejszego zbieżności numerycznej między treningiem a rolloutem. Raport premierowy mówi, że średnie różnice log-prob były kontrolowane na poziomie 1e-7, o ponad 99,99% niższe niż we wcześniejszych konfiguracjach.
Planowanie świadome obciążenia i równoważenie obciążenia podobno zwiększyły end-to-end przepustowość w RL o ponad 2,3× na długohoryzontalnych zadaniach kodowania. To ulepszenia infrastruktury treningowej, a nie gwarancje inferencji dla użytkownika końcowego, ale wyjaśniają, jak Z.ai skalowało dłuższe i bardziej zróżnicowane trajektorie w ciągu miesiąca.
6. Opóźnione udostępnienie wag ze względu na przegląd bezpieczeństwa
Z.ai nazywa GLM-5.3 modelem z otwartymi wagami, ale wagi nie były dostępne do pobrania w dniu premiery. Firma mówi, że zostaną wydane dwa tygodnie po premierze po ocenie i wzmocnieniu bezpieczeństwa. To istotna różnica względem GLM-5.2, którego wagi na licencji MIT są już na Hugging Face.
Dla większości zespołów hostowane testy API pozostają praktycznym pierwszym krokiem. Model jest duży, a otwarte wagi nie usuwają kosztów sprzętu inferencyjnego, kwantyzacji, serwowania, monitoringu czy kontroli bezpieczeństwa.
GLM-5.3 vs GLM-5.2: Ulepszenia benchmarków
Poniższa tabela korzysta z oficjalnych danych premierowych Z.ai. „Zmiana” to proste obliczenie z raportowanych wyników. Względne procenty mogą wyglądać dramatycznie, gdy baza GLM-5.2 jest niska, dlatego pokazano też zmianę absolutną.
| Benchmark | GLM-5.2 | GLM-5.3 | Zmiana absolutna | Zmiana względna |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +8,9% |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +515,2% |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +44,8% |
| NL2Repo | 48.9 | 58.0 | +9.1 | +18,6% |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +100,0% |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +15,7% |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +119,1% |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +25,6% |
| CyberGym | 77.2 | 84.5 | +7.3 | +9,5% |
| ExploitBench | 24.4 | 54.4 | +30.0 | +123,0% |
| ExploitGym, zadania 2 h | 29 | 105 | +76 | +262,1% |
| ExploitGym, zadania 6 h | 39 | 130 | +91 | +233,3% |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +21,9% |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +84,0% |
| Agents’ Last Exam CLI | 23.8 | 28.5 | +4.7 | +19,7% |
| HLE with tools | 54.7 | 62.5 | +7.8 | +14,3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17,3% |
Ulepszenia benchmarków: GLM-5.3 vs GLM-5.2 i konkurenci
Wszystkie poniższe liczby są raportowane przez dostawcę z oficjalnego bloga Z.ai (z uwagami dotyczącymi metodyki, długości kontekstu i próbkowania). Niezależna weryfikacja nastąpi po udostępnieniu wag i szerszym dostępie.
Benchmarki kodowania
| Benchmark | GLM-5.3 | GLM-5.2 | Uwagi / Konkurenci |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | Konkurencyjny z czołowymi modelami zamkniętymi |
| Terminal Bench 3.0 | 28.3 | 4.6 | Open-source SOTA; w porównaniu z Fable 5 ~33.7, GPT-5.6 Sol ~34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | Silny skok |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench (wewn., Max effort) | ~34,5% ukończenia @ ~75K tokenów | ~23,4% @ ~96K tokenów | ~50% ogólnej poprawy „odczucia kodowania”; wyższa efektywność |
Przy wysiłku High, GLM-5.3 osiągnął 31,4% ukończenia przy ~50K tokenów, wyprzedzając Claude Opus 4.8 (29,5% przy 120K tokenów) w wewnętrznym teście, choć nadal za Claude Fable 5 (39,5% przy Max).
Benchmarki cyberbezpieczeństwa
| Benchmark | GLM-5.3 | GLM-5.2 | Konkurenci (przybliżone) |
|---|---|---|---|
| CyberGym | 84,5% | 77,2% | Mythos 5: 83,8%, GPT-5.6 Sol: 83,6% (SOTA) |
| ExploitBench | 54,4% | 24,4% | Ponad dwukrotnie lepiej niż wcześniej; modele zamknięte wyżej (Mythos 5 ~78%, GPT-5.6 Sol ~76,5%) |
| ExploitGym (2h/6h) | 105 / 130 | 29 / 39 | Mythos 5 nadal przed (181/247) |
Zyski są największe dalej w łańcuchu eksploatacji. W testach realnych z chińskimi zespołami bezpieczeństwa, model (na bazie pracy GLM-5.2) zidentyfikował 2 436 podatności w 269 projektach, w tym 1 097 średnich i wysokich. Niektóre błędy sięgały ~40 lat wstecz (najstarsze ~1981). Znaleziska są śledzone w publicznym Z.ai Security Disclosure Ledger.
Benchmarki agentowe i inne
| Benchmark | GLM-5.3 | GLM-5.2 | Uwagi |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | Duży wzrost |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | Konkurencyjne open-source |
| HLE w narzędziach | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | Obejmuje 44 profesje |
Te wyniki pokazują wyraźny postęp na długohoryzontalnych, wieloetapowych zadaniach profesjonalnych.
Efektywność tokenów, tryby myślenia i praktyczne zachowanie
Cicha, ale ważna poprawa to efektywność tokenów. Na wewnętrznym Code Bench wyższe wskaźniki ukończenia pojawiają się przy mniejszej liczbie tokenów wyjściowych. Ma to znaczenie dla kosztu i opóźnienia w produkcyjnych pętlach agentowych.
GLM-5.3 zawsze włącza myślenie. Wspierane są trzy poziomy wysiłku: low, high i max (domyślny i rekomendowany do kodowania to max). Wyłączanie myślenia nie jest już wspierane; aplikacje, które wcześniej ustawiały thinking.type: "disabled", muszą dokonać migracji.
Kontekst pozostaje solidne 1M tokenów z maksymalnym wyjściem do 128K. Architektura nie zmieniła się względem GLM-5.2, więc rozmiarowanie sprzętu dla przyszłego self-hostingu można oszacować z dotychczasowych doświadczeń GLM-5.2 (odciski po kwantyzacji nadal są duże przy całkowitej liczbie parametrów).
Dla deweloperów, którzy chcą eksperymentować od razu lub zachować elastyczność między modelami, zunifikowane bramy są użyteczne. CometAPI wymienia modele serii GLM (w tym GLM-5.3 pod identyfikatorem glm-5.3, gdy stanie się dostępny) ze zgodnymi z OpenAI endpointami, konkurencyjnymi stawkami, rozliczaniem według użycia oraz możliwością przełączania między GLM-5.2, GLM-5.3 i dziesiątkami innych modeli bez przepisywania integracji. Jest to szczególnie praktyczne dla A/B testów agentów kodujących, pomiaru realnego kosztu na udane zadanie oraz routingu ruchu w zależności od obciążenia.
Kto powinien przejść na GLM-5.3 i jak oceniać
Zespoły budujące agentów do kodowania, automatyzacji o długim horyzoncie, workflowów inżynieryjnych w skali repozytoriów lub narzędzi do defensywnego bezpieczeństwa powinny priorytetyzować ewaluację. Połączenie wyższych wskaźników ukończenia, lepszej efektywności tokenów na złożonych zadaniach oraz silniejszej wieloetapowej agentowości ma znaczenie.
Zalecana ścieżka ewaluacji:
- Uruchom te same wewnętrzne zadania (lub stały harness) na GLM-5.2 i GLM-5.3 (lub przez Coding Plan) przy dopasowanych poziomach wysiłku.
- Mierz nie tylko wskaźnik zaliczenia, ale też tokeny, czas ścienny i odsetek interwencji człowieka.
- Użyj zunifikowanej warstwy API, takiej jak CometAPI, aby utrzymać porównanie bez tarcia i zachować opcję wycofania lub selektywnego routingu.
- Dla obciążeń wrażliwych na bezpieczeństwo poczekaj na w pełni wzmocnione otwarte wagi i przejrzyj praktyki ujawniania.
Self-hosting stanie się atrakcyjny po publikacji wag, zwłaszcza dla organizacji, które już prowadzą infrastrukturę GLM-5.2.
Wniosek: Post-trening jako nowa granica skalowania
GLM-5.3 to jeden z najczytelniejszych ostatnio przykładów, że skala post-treningu — bardziej realistyczne środowiska, lepsza infrastruktura RL oraz utrzymany compute na długich trajektoriach — może przynieść skoki zdolności, które wcześniej wydawały się wymagać nowych modeli bazowych. Zyski w kodowaniu i agentowości są duże; wyniki cyber były w dużej mierze emergentowe i już konkurencyjne lub wiodące na benchmarkach zorientowanych na odkrywanie.
Dla praktyków wniosek jest prosty: testuj model na swoich rzeczywistych obciążeniach, mierz koszt na udany wynik zamiast surowej pozycji na tabeli, i utrzymuj elastyczność integracji. Platformy takie jak CometAPI upraszczają ten proces, oferując pojedynczy klucz, zgodny z OpenAI interfejs oraz łatwe przełączanie między serią GLM i konkurencyjnymi modelami, kiedy decydujesz, jak agresywnie przyjąć nowe możliwości.
