DeepSeek Vision and Grok Imagine models are now live on CometAPI →
ai-comparisons/CometAPI зерттеуі

GLM-5.3 vs GLM-5.2: Бенчмарк және тестілеу бізге не өзгергенін айтады

GLM-5.3 vs GLM-5.2: Базалық модель бірдей, тек пост-оқыту ~50% код жазуда серпіліс береді (Terminal-Bench 3.0 4.6→28.3) және эмердженттік CyberGym 84.5% SOTA.

CometAPI
AnnaAI model және API зерттеу тобы
Жаңартылды Aug 24, 2026 12 мин оқу
GLM-5.3 vs GLM-5.2: Бенчмарк және тестілеу бізге не өзгергенін айтады
Осы үлгіні пайдалану

Бірінші API шақыруын жасаңыз.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Қысқаша Z.ai 2026 жылғы 14 тамызда GLM-5.3-ті GLM-5.2-мен бірдей ~743–753B параметрлі Mixture-of-Experts базалық моделі үстіне шығарды. Барлық өсім ұзақ көкжиекті орталары бар кейінгі оқытуды ауқымдау есебінен келді. Нәтиже: Z.ai-дың ішкі Code Bench-інде шамамен 50% салыстырмалы жақсару, Terminal-Bench 3.0 (4.6 → 28.3) мен Agents’ Last Exam бойынша ашық бастапқы SOTA, агенттік метрикалардағы айқын ілгерілеу және киберқауіпсіздік бойынша жаңа деңгейдегі нәтижелер (CyberGym 84.5%). Токен тиімділігі де артты.

Салмақтар қауіпсіздік күшейтілгеннен кейін, шығарылымнан шамамен екі апта өткен соң күтіледі. Әзірлеушілер біріздендірілген платформалар арқылы, мысалы CometAPI, қатысты GLM үлгілеріне қазірдің өзінде қол жеткізіп, жұмыс ағындарын тиімді сынай алады.

Негізгі тұжырымдар

  • GLM-5.2-мен бірдей базалық модель; барлық жетістіктер кейінгі оқытудан (IndexShare, SAO, slime қаңқасы + көбірек орталар және есептеу).
  • Кодтау: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; ішкі Z.ai Code Bench шамамен 50% жақсырақ, шығатын токендер аз.
  • Агенттік: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
  • Кибер: CyberGym 77.2 → 84.5 (SOTA, Mythos 5 және GPT-5.6 Sol-дан озады); ExploitBench екі еседен көп (24.4 → 54.4). Нақты әлемдегі табылымдар: 269 жоба бойынша 2 436 осалдық.
  • Негізгі архитектура спецификациялары өзгермеген: 1M контекст, 128K-қа дейінгі шығатын токендер, low/high/max күш деңгейлері бар әрқашан қосулы ойлау.
  • Қол жеткізу: GLM Coding Plan және ZCode арқылы live; жалпы API мен ашық салмақтар (MIT-стиліндегі деп күтіледі) қауіпсіздік қарауынан кейін келеді. CometAPI OpenAI-мен үйлесімді интерфейстері арқылы GLM отбасына ыңғайлы қолжетімділік ұсынады.

GLM-5.3 мен GLM-5.2: қысқаша

ӨлшемGLM-5.3GLM-5.2Жеңімпаз / Ескертпе
Базалық модельБірдей ~743–753B MoEБірдейБірдей
Кейінгі оқытуҚатты ауқымдалған орталарыЕртеректегі стэк5.3
Terminal-Bench 3.028.34.65.3 (үлкен)
DeepSWE v1.166.946.25.3
Ішкі Code Bench (Max)34.5% @ ~75K токен23.4% @ ~96K токен5.3 (өнімділік + тиімділік)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5 (SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
Контекст / Макс шығу1M / 128K1M / ұқсасБірдей
ОйлауӘрқашан қосулы (low/high/max)Бұрын икемдірек5.3 (always-on)
Ашық салмақтарШығарылымнан ~2 аптадан соңҚолжетімді (MIT)Қазір 5.2
Негізгі қол жеткізуCoding Plan / ZCodeAPI + салмақтар + Coding Plan5.2 толығырақ

Кіріспе: Кейінгі оқыту буындық серпіліс әкелді

2026 жылғы тамыздың ортасында ашық салмақтар бәсекесінде тағы бір жедел итерация болды. Z.ai (бұрынғы Zhipu AI / ChatGLM тобының халықаралық бренді) GLM-5.3-ті GLM-5.2-ден небәрі 59 күн кейін шығарды. Хабарландыру айрықша айқын болды: негіздегі базалық модель өзгеріссіз қалды. “GLM-5.3 үшін жасағанымыздың бәрі — кейінгі оқытуды ауқымдау,” компанияның айтуынша.

Бұл мәлімдеме маңызды. Жылдар бойы “үлкенірек модельдер жеңеді” деген нарратив басым болып келді. GLM-5.3 жаңа алдын ала оқытуға бармай-ақ, күшейтілген орта, ұзақ көкжиекті тапсырма алуандылығы және жүйелік инфрақұрылым арқылы кодтау, агенттік және тіпті киберқауіпсіздік жүктемелерінде айрықша өсімге қол жеткізуге болатынын көрсетті. Бірқатар күрделі бенчмарктердегі сандар соншалықты үлкен, тәуелсіз бақылаушылар бұл секірісті инкременталдыдан гөрі сапалық өзгеріс деп сипаттады. GLM-5.3 мүмкіндіктері, бенчмарктері және қолжетімділігіне шолу.

GLM-5.3 vs GLM-5.2: Нақты не өзгерді?

Ең үлкен қате түсінік — GLM-5.3-ті жай ғана “үлкейтілген GLM-5.2” деп ойлау.

Бұл олай емес.

Z.ai айтуынша, базалық модель іс жүзінде сол күйінде. Негізгі инновация — кейінгі оқытуды ауқымдау. Z.ai үш тіректі ерекше атайды:

  1. slime ішіндегі жүйелік жақсартулар — Жақсырақ оқыту
  2. Орта ауқымдауы — Шынайы кәсіби жұмыс ағымдарынан орындалатын, тексерілетін, ұзақ көкжиекті орталары бар пайплайндар. Зерттеу агенттері тапсырма паттерндерін шығарады; төреші агенттер шешімінің болуы мен шешілетінін тексереді; сыйақыны айналып өтуді азайту үшін тексерушілер эталон шешімдерге қол жеткізбестен құрылады.
  3. SAO + компакцияны жалғастыру — Ұзын траекторияларда өсімнің сақталуына көмектеседі, қысқа траекторияларда құлдырауды болдырмайды. – шығарылым бірізділігі (log-prob айырмашылықтары ~1e-7 деңгейінде бақыланды), иерархиялық кэштеу, мульти-ұстаз қолдауы, жүктемеге бейімделген жоспарлау, және ұзақ көкжиекті кодтау RL тапсырмаларында >2.3× сквозной өткізгіштік өсімі хабарланған.

Бұл өзгерістер кодтау, агенттік және киберқауіпсіздік жиынтықтарында өлшенетін жақсартулар берді. Маңыздысы, салыстырмалы ең үлкен өсімдер ең қиын, бастапқы деңгейі төмен тесттерде көрінді — бұл модель бұрын сенімді орындай алмаған режимдерге итерілгенде күтілетін сипат.

Нәтижесінде бұл жаңарту жай архитектура емес, ең алдымен мінез-құлық пен қабілет туралы.

GLM-5.3 vs GLM-5.2: Ерекшеліктерді салыстыру

1. Жаңа базалық модельдің орнына ауқымдалған кейінгі оқыту

Z.ai GLM-5.3-тің бүкіл рецепті ретінде кейінгі оқытуды ауқымдауды сипаттайды. Зерттеу агенттері нақты жұмыстан паттерндерді жасырын күйі мен көпқадамды тәуелділіктері бар орындалатын тапсырмаларға айналдырады. Әр тапсырманың шешілетінін төреші агент тексереді. Тексерушілер эталон шешімін көрмей құрылады, кейін “оракул”, “no-op” және шешілмеген күйлерге қарсы тексеріледі, сыйақыны читтау ықтималдығын азайту үшін.

Жүйе әлі де адамдық шолуды қажет етеді, әрі Z.ai орта генерациясы мен верификациясының толық автономиясы болашақ жұмыс екенін ашық айтады. Бұл ескерту мәлімдемені сенімді етеді: бұл — үлкен жаттықтыру пайплайны, синтетикалық ортамен толық өзін-өзі басқару туралы талап емес.

2. Ұзақ көкжиекті кодтаудағы күшейту

GLM-5.3 репозиторийлік жұмыс, терминалдық тапсырмалар, машиналық оқыту инфрақұрылымы, өнімділік оңтайландыру және көпқадамды софтвер жеткізу бойынша жақсарды. Z.ai Code Bench-те, шынайы пайдаланушы сценарийлерін көрсетуге бағытталған ішкі бағалауда, GLM-5.2-мен салыстырғанда шамамен 50% жақсы нәтиже көрсетілді.

Тиімділік нәтижесі де маңызды. Max режимінде GLM-5.3 ~75K шығатын токенмен 34.5% көрсетті, GLM-5.2 — ~96K токенмен 23.4%. Бұл — сапада +11.1 п. өсім, шамамен 22% аз токен шығара отырып. High режимінде GLM-5.3 ~50K токенмен 31.4%-ға жетті, сол бірінші тарап диаграммасында 120K токенмен 29.5% көрсеткен Claude Opus 4.8-ден озып. Claude Fable 5 Max режимінде 39.5%-пен жоғары болып қалды.

3. Киберқауіпсіздіктегі пайда болған қабілет

Z.ai кейінгі оқыту кезінде осалдықтарды анықтау орталары қосты. Хабарландыруға сәйкес, қабілет жеке ақауларды табудан асып, эксплуатация тізбегінің бірнеше кезеңі бойынша пайымдауға дейін өсті.

Публикалық көрсеткіштер ілгерілеуді де, шектеулерді де көрсетеді. GLM-5.3 CyberGym-да 84.5-ке жетіп, Z.ai салыстыру кестесінде GLM-5.2-ні (77.2) басып озды. ExploitBench-те GLM-5.2-ні екі еседен аса арттырып, 54.4-ке жетті (GLM-5.2 — 24.4), бірақ Fable 5 (78.0) және GPT-5.6 Sol (76.5) деңгейінен төмен. ExploitGym-да 2 сағаттық бюджетте 105 тапсырманы, 6 сағатта 130-ды аяқтады, GLM-5.2 үшін сәйкесінше 29 және 39; GPT-5.6 Sol мен Fable 5 әлі айтарлықтай алда.

Бұл қабілеттер екіұшты қолданылымға ие. Ұйымдар модель қолжетімділігін шектеуі, құралдарды sandbox-та іске қосуы, әрекеттерді журналдауы, сканерлеуге рұқсат сұрауын талап етуі және осалдықтарды валидациялау мен жариялау үшін адам қатысуын сақтауы керек.

4. Үш күш деңгейімен әрқашан қосулы ойлау

GLM-5.3 low, high және max ойлау күшін қолдайды. GLM-5.2-ден айырмашылығы, ойлауды сөндіру қолдау таппайды. Интеграцияларында thinking.type: "disabled" жіберетіндер модель идентификаторын ауыстырмас бұрын мәнді enabled қылуға тиіс, әйтпесе сұрау сәтсіз болады дейді Z.ai.

low — интерактивті түзетулер мен төмен қауіпті трансформациялар үшін, high — елеулі репозиторийлік тапсырмаларға, max — күрделі кодтау немесе қауіпсіздік талдауы үшін. Жоғары күш деңгейлері кідіріс пен құнға әсер етуі мүмкін, сондықтан “күштірек жауап” әрқашан “ең үнемді жауап” бола бермейді.

5. slime арқылы оқыту өткізгіштігі жақсарды

GLM-5.3 Z.ai-дың ашық slime қаңқасын қолдануды жалғастырады: оқытуда Megatron, шығарылымда SGLang. Z.ai top-p маскілеу, top-k және толық вокабулярлық on-policy дистилляция, ұстаз ауыстыру, кэштеу және оқыту мен шығарылым арасындағы цифрлық үйлесімдікті қатайту бойынша толықтыруларды хабарлайды. Орташа log-prob айырмашылықтары 1e-7 деңгейінде бақыланғаны айтылған — бұрынғы баптаулардан 99.99% төмен.

Жүктемеге бейімделген жоспарлау және балансировка ұзақ көкжиекті кодтау RL тапсырмаларында сквозной өткізгіштікті 2.3 есе артық көтерді делінген. Бұлар — жаттықтыру инфрақұрылымындағы өзгерістер, соңғы пайдаланушыға инференс кепілдігі емес, бірақ Z.ai-дың бір айда ұзындау әрі алуан траекторияларды қалай ауқымдағанын түсіндіреді.

6. Қауіпсіздік қарауынан кейін салмақтарды кешіктіре ашу

Z.ai GLM-5.3-ті ашық салмақты модель деп атайды, бірақ жариялау күні салмақтар жүктеп алуға қолжетімді болмады. Компания оларды қауіпсіздік бағалауынан және қатаңдатудан кейін, шығарылымнан екі апта өткенде шығарамыз дейді. Бұл MIT лицензиясымен Hugging Face-те тұрған GLM-5.2-ден елеулі айырмашылық.

Көпшілік команда үшін hosted API арқылы тестілеу әлі де практикалық алғашқы қадам болып қала береді. Модель үлкен, әрі ашық салмақтар инференс аппараттық жабдығы, квантизация, сервис, мониторинг және қауіпсіздік бақылауларын қажет етуді жоймайды.

GLM-5.3 vs GLM-5.2: Бенчмарк жақсартулары

Төмендегі кестеде Z.ai-дың ресми шығарылым деректері қолданылды. “Өзгеріс” — деректерден тікелей есептеу. GLM-5.2 базалық көрсеткіші төмен болғанда салыстырмалы пайыздар драмалық көрінуі мүмкін, сондықтан абсолюттік өзгеріс те көрсетілді.

БенчмаркGLM-5.2GLM-5.3Абсолюттік өзгерісСалыстырмалы өзгеріс
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym, 2 сағат29105+76+262.1%
ExploitGym, 6 сағат39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE құралдармен54.762.5+7.8+14.3%
GDPval-AA v2, Elo15081769+261+17.3%

Бенчмарк жақсартулары: GLM-5.3 vs GLM-5.2 және бәсекелестер

Төмендегі барлық сандар ресми Z.ai блогынан алынған вендор мәліметтері (harness, контекст ұзындықтары және сэмплинг бойынша әдістемелік ескертпелермен). Салмақтар мен кеңірек қолжетімділік шыққан соң тәуелсіз тексерім болады.

Кодтау бенчмарктері

БенчмаркGLM-5.3GLM-5.2Ескертпелер / Бәсекелестер
Terminal Bench 2.188.281.0Жабық үздік модельдермен бәсекелі
Terminal Bench 3.028.34.6Ашық SOTA; Fable 5 ~33.7, GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2Күшті секіріс
NL2Repo58.048.9
ProgramBench Almost Solved19.09.5
FrontierSWE78.167.5
SWE-Marathon v1.142.519.4
Z.ai Code Bench (ішкі, Max режим)~34.5% аяқтау @ ~75K токен~23.4% @ ~96K токенКодтауда ~50% жалпы жақсару; жоғары тиімділік

High режимінде GLM-5.3 ~50K токенмен 31.4% аяқтауға жетіп, Claude Opus 4.8-ді (120K токенмен 29.5%) ішкі бенчте басып озды, бірақ Max режиміндегі Claude Fable 5 (39.5%) әлі жоғары.

Киберқауіпсіздік бенчмарктері

БенчмаркGLM-5.3GLM-5.2Бәсекелестер (шамамен)
CyberGym84.5%77.2%Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA)
ExploitBench54.4%24.4%Бұрынғысынан екі еседен көп; жабық модельдер жоғары (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%)
ExploitGym (2/6 сағ)105 / 13029 / 39Mythos 5 әлі алда (181/247)

Өсімдер эксплуатация тізбегінің жоғарырақ сатыларында ең үлкен. Қытай қауіпсіздік топтарымен нақты әлемдік тестте (GLM-5.2 жұмысы негізінде) модель 269 жоба бойынша 2 436 осалдықты анықтады, соның ішінде 1097 орта және жоғары ауырлықтағы ақаулар. Кейбір қателерге ~40 жыл болды (ең ескісі ~1981). Табылымдар Z.ai Security Disclosure Ledger-де жария түрде қадағаланады.

Агенттік және өзге бенчмарктер

БенчмаркGLM-5.3GLM-5.2Ескертпе
Toolathlon Verified73.059.9
AutomationBench v1.0.648.226.2Үлкен өсім
Agents’ Last Exam (ALE-CLI)28.523.8Ашықтарда бәсекелі
HLE құралдармен62.554.7
GDPval-AA v21769150844 мамандықты қамтиды

Бұл нәтижелер ұзақ көкжиекті, көпқадамды кәсіби тапсырмаларда айқын ілгерілеуді көрсетеді.

Токен тиімділігі, ойлау режимдері және практикалық мінез-құлық

Маңызды, бірақ тыныш жақсарту — токен тиімділігі. Ішкі Code Bench-те жоғары аяқтау үлесі аз шығатын токендермен бірге келеді. Бұл өндірістік агенттік циклдердегі құн мен кідіріс үшін мәнді.

GLM-5.3 ойлауды әрқашан қосады. Үш күш деңгейі бар: low, high және max (әдепкі және кодтау үшін ұсынылатын — max). Ойлауды сөндіру енді қолдау таппайды; бұрын thinking.type: "disabled" орнатқан қолданбалар көшу алдында оны enabled қылуы тиіс.

Контекст 1M токен болып қалады, максимум шығу 128K-қа дейін. Архитектура GLM-5.2-ден өзгермегендіктен, болашақта өзін-өзі хосттауға қажетті аппараттық бағалауды GLM-5.2 тәжірибесі арқылы шамалауға болады (жалпы параметр санына қарай квантизацияланған ізі әлі де үлкен).

Дереу тәжірибе жасау не модельдер арасында икемділікті сақтау үшін бірыңғай шлюздер пайдалы. CometAPI GLM сериясын (қол жетімді болғанда модель идентификаторы glm-5.3 ретінде GLM-5.3-ті қоса) OpenAI-үйлесімді endpoint-тармен, бәсекелі тарифтермен, тұтынуға негізделген биллингпен тізімдейді және GLM-5.2, GLM-5.3 пен өзге де ондаған шекті және ашық модельдер арасында интеграция кодын өзгертпей ауысуға мүмкіндік береді. Бұл әсіресе кодтау агенттерін A/B-тестілеу, бір сәтті тапсырмаға нақты құнды өлшеу және жүктемеге қарай маршруттау үшін практикалық.

Кімге GLM-5.3-ке көшу керек және қалай бағалау керек

Кодтау агенттерін, ұзақ көкжиекті автоматтандыруды, репозиторий ауқымындағы инженерлік жұмыс ағымдарын немесе қорғаныстық қауіпсіздік құралдарын құратын командаларға бағалауды басым ету керек. Күрделі тапсырмаларда жоғары аяқтау үлесі, токендер бойынша жақсы тиімділік және күштірек көпқадамды агенттік — материалдық артықшылық.

Ұсынылатын бағалау жолы:

  1. Бірдей ішкі тапсырмаларды (немесе тұрақты harness) GLM-5.2 және GLM-5.3-те (не Coding Plan арқылы) сәйкестендірілген күш деңгейлерінде іске қосыңыз.
  2. Тек pass rate емес, токендерді, wall-clock уақытын және адам араласу деңгейін өлшеңіз.
  3. Салыстыруды жеңілдету және кері қайту не селективті маршруттау опциясын сақтау үшін CometAPI сияқты бірыңғай API қабатын қолданыңыз.
  4. Қауіпсіздік-маңызды жүктемелер үшін толық қауіпсіздікпен қатаңдатылған ашық салмақтарды күтіп, жариялау тәжірибелерін шолудан өткізіңіз.

Салмақтар шыққанда, GLM-5.2 инфрақұрылымын қазірдің өзінде жүргізетін ұйымдар үшін өзін-өзі хосттау тартымды бола түседі.

Қорытынды: Жаңа масштабтау майданы ретінде кейінгі оқыту

GLM-5.3 — кейінгі оқытуды ауқымдау (шынайырақ орталар, жақсырақ RL инфрақұрылымы, ұзын траекторияларда тұрақты есептеу) жаңа базалық модельдерсіз-ақ қабілет серпілістерін бере алатынын соңғы кезеңдегі ең айқын демонстрациялардың бірі. Кодтау мен агенттіктегі өсімдер үлкен; кибер нәтиже — көбіне пайда болған қабілет және әзірдің өзінде ашу-бағытталған бенчмарктерде бәсекелі не жетекші.

Практиктер үшін түйін қарапайым: модельді нақты жүктемелеріңізде сынаңыз, рейтинг емес, сәтті нәтиже бірлігіне кететін құнды өлшеңіз және интеграцияны икемді ұстаңыз. CometAPI сияқты платформалар GLM сериясы мен бәсекелес модельдер арасында бір кілт, OpenAI-үйлесімді интерфейс және оңай ауысу ұсыну арқылы осы процесті жеңілдетеді, сіз жаңа қабілеттерді қаншалықты агрессивті енгізетініңізді шешкенше.

Оқуды жалғастыру

Осы мақаланы келесі шешіммен байланыстырыңыз.

Барлық тақырыптарды көру
Жарияланды Aug 15, 2026
Соңғы жаңарту Aug 24, 2026
190 көрілім
Түсініктілік, дереккөзге сілтеме және ағымдағы API терминологиясы бойынша тексерілді.

AI әзірлеу шығындарын 20%-ға қысқартуға дайынсыз ба?

Минуттар ішінде тегін бастаңыз. Тегін сынақ кредиттері қосылған. Банк картасы талап етілмейді.

Толығырақ оқу