TLDR Z.ai выпустила GLM-5.3 14 августа 2026 года на точно той же базе ~743–753B-параметровой MoE-модели, что и GLM-5.2. Все улучшения получены за счёт масштабированного пост-тренинга в средах с длинным горизонтом. Результат — ~50% относительное улучшение на внутреннем Code Bench Z.ai, открытое SOTA на Terminal-Bench 3.0 (4.6 → 28.3) и Agents’ Last Exam, резкий рост агентных показателей и новая возникающая SOTA-производительность в кибербезопасности (CyberGym 84.5%). Также улучшилась эффективность по токенам.
Веса ожидаются примерно через две недели после запуска после доработки по безопасности. Разработчики уже могут получить доступ к связанным моделям GLM и эффективно тестировать рабочие процессы через единые платформы, такие как CometAPI.
Ключевые выводы
- Та же базовая модель, что у GLM-5.2; все достижения — из пост-тренинга (IndexShare, SAO, фреймворк slime + больше сред и вычислений).
- Кодирование: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; внутренний Z.ai Code Bench ~50% лучше при меньшем числе выходных токенов.
- Агентность: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
- Кибер: CyberGym 77.2 → 84.5 (SOTA, впереди Mythos 5 и GPT-5.6 Sol); ExploitBench более чем удвоен (24.4 → 54.4). Реальные находки: 2 436 уязвимостей в 269 проектах.
- Характеристики ядра без изменений: контекст 1M, до 128K выходных токенов, мышление всегда включено с уровнями low/high/max.
- Доступ: Live через GLM Coding Plan и ZCode; общий API и открытые веса (ожидаются в стиле MIT) после обзора безопасности. CometAPI предлагает удобный доступ к семейству GLM, совместимый с OpenAI, для параллельных тестов и продакшен-маршрутизации.
GLM-5.3 vs GLM-5.2 кратко
| Dimension | GLM-5.3 | GLM-5.2 | Winner / Notes |
|---|---|---|---|
| Base model | Same ~743–753B MoE | Same | Identical |
| Post-training | Heavily scaled environments | Earlier stack | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3 (large) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Internal Code Bench (Max) | 34.5% @ ~75K tokens | 23.4% @ ~96K tokens | 5.3 (perf + efficiency) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5 (SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| Context / Max output | 1M / 128K | 1M / similar | Same |
| Thinking | Always on (low/high/max) | More flexible previously | 5.3 (всегда включено) |
| Open weights | ~2 weeks post-launch (planned) | Available (MIT) | 5.2 currently |
| Primary access now | Coding Plan / ZCode | API + weights + Coding Plan | 5.2 более зрелая |
Введение: пост-тренинг обеспечивает скачок поколения
В середине августа 2026 года сообщество ИИ наблюдало очередную стремительную итерацию в гонке открытых весов. Z.ai (международный бренд бывшей команды Zhipu AI / ChatGLM) запустила GLM-5.3 всего через 59 дней после GLM-5.2. Объявление было необычно ясным: базовая модель осталась идентичной. «Масштабирование пост-тренинга — всё, что мы сделали для GLM-5.3», заявила компания.
Это утверждение важно. Годы доминировал нарратив «более крупные модели выигрывают». GLM-5.3 показывает, что агрессивное масштабирование сред для обучения с подкреплением, разнообразие длинных задач и системная инфраструктура могут дать непропорциональные выигрыши на сложных задачах кодирования, агентности и даже кибербезопасности без нового претрейна. Числа настолько велики по нескольким трудным бенчмаркам, что независимые наблюдатели называют скачок качественным, а не инкрементальным. Обзор функций GLM-5.3, бенчмарков и заметок по доступу.
GLM-5.3 vs GLM-5.2: что действительно изменилось?
Главное заблуждение — думать, что GLM-5.3 это просто «GLM-5.2, но больше».
Это не так.
Базовая модель, по словам Z.ai, по сути та же. Основное новшество — масштабирование пост-тренинга. Z.ai выделяет три столпа:
- Системные улучшения внутри slime — лучшее обучение
- Масштабирование сред — конвейеры синтезируют исполняемые, проверяемые среды с длинным горизонтом из реальных профессиональных рабочих процессов. Исследовательские агенты извлекают паттерны задач; судьи проверяют разрешимость; проверяющие создаются без доступа к эталонным решениям, чтобы снизить взлом вознаграждения.
- Продолжение использования SAO + компактизации — помогает сохранять прирост на длинных траекториях, не схлопываясь на коротких. — согласованность развёртывания (различия лог-вероятностей контролируются до ~1e-7), иерархическое кэширование, поддержка нескольких учителей, планирование с учётом нагрузки и заявленные >2.3× приросты сквозной производительности на задачах RL для кодирования с длинным горизонтом.
Эти изменения дали измеримые улучшения в наборах для кодирования, агентности и кибербезопасности. Важно, что самые большие относительные выигрыши появляются на самых сложных, низкобазовых тестах — именно тот паттерн, который ожидается, когда модель толкают в режимы, где она ранее была ненадёжна.
Итог — апгрейд модели прежде всего о поведении и способности, а не просто об архитектуре.
GLM-5.3 vs GLM-5.2: сравнение функций
1. Масштабированный пост-тренинг вместо новой базовой модели
Z.ai описывает масштабированный пост-тренинг как весь рецепт GLM-5.3. Исследовательские агенты превращают паттерны реальной работы в исполняемые задачи с скрытым состоянием и многошаговыми зависимостями. Судья-агент проверяет, что каждая задача разрешима. Проверяющие создаются, не видя эталонного решения, затем тестируются против оракулов, no-op и неразрешённых состояний, чтобы снизить обходы награды.
Система всё ещё требует человеческого ревью, и Z.ai прямо говорит, что более автономное генерирование и проверка сред — задача будущего. Эта оговорка добавляет достоверности заявлению: это крупный тренировочный пайплайн, а не утверждение, что синтетические среды стали полностью самоуправляемыми.
2. Более сильное кодирование с длинным горизонтом
GLM-5.3 улучшилась в работе с репозиториями, задачах терминала, инфраструктуре ML, оптимизации производительности и многошаговой поставке ПО. На Z.ai Code Bench, внутренней оценке, предназначенной отражать реалистичные сценарии, Z.ai сообщает примерно на 50% лучшее качество кодирования, чем GLM-5.2.
Важен результат по эффективности. На уровне Max GLM-5.3 достигла 34.5% при около 75K выходных токенов на задачу против 23.4% при 96K у GLM-5.2. Это прирост качества на 11.1 пунктов при примерно 22% меньшем числе токенов. На уровне High GLM-5.3 достигла 31.4% с примерно 50K токенов, опередив Claude Opus 4.8 с 29.5% при 120K в той же «первой» таблице вендора. Claude Fable 5 остаётся выше — 39.5% на Max.
3. Возникающая способность в кибербезопасности
Z.ai добавила среды поиска уязвимостей на этапе пост-тренинга. По отчёту запуска способности выросли сверх поиска изолированных дефектов: модель начала рассуждать через несколько стадий цепочки эксплуатации.
Публичные оценки показывают и прогресс, и пределы. GLM-5.3 лидирует в таблице Z.ai на CyberGym с 84.5 против 77.2 у GLM-5.2. На ExploitBench она более чем вдвое превосходит GLM-5.2, достигая 54.4 против 24.4, но остаётся заметно позади Fable 5 с 78.0 и GPT-5.6 Sol с 76.5. На ExploitGym выполняет 105 задач в нормированном двухчасовом бюджете и 130 в шести часах, против 29 и 39 у GLM-5.2; GPT-5.6 Sol и Fable 5 остаются существенно впереди.
Эти возможности — двойного назначения. Организациям следует ограничивать доступ к модели, изолировать инструменты (песочницы), логировать действия, требовать авторизации на сканирование и держать человека в контуре для валидации уязвимостей и раскрытия.
4. Мышление всегда включено с тремя уровнями усилий
GLM-5.3 поддерживает уровни low, high и max. В отличие от GLM-5.2, отключённое мышление не поддерживается. Существующие интеграции, которые отправляют thinking.type: "disabled", должны изменить значение на enabled перед переключением ID модели, иначе, по словам Z.ai, запрос будет отклонён.
Используйте low для интерактивных правок и низкорисковых преобразований, high — для значимых задач по репозиторию, и max — для сложного кодирования или анализа безопасности. Более высокий уровень следует оценивать на предмет латентности и стоимости, так как более сильный ответ не всегда самый экономичный.
5. Лучший тренировочный сквозной вывод через slime
GLM-5.3 продолжает использовать slime, открытый фреймворк Z.ai с Megatron на стороне обучения и SGLang на стороне развёртывания. Z.ai сообщает о добавлениях для top-p-маскирования, top-k и полной словарной он-полиси дистилляции, переключения учителей, кэширования и более тесного численного согласования между обучением и развёртыванием. В отчёте запуска говорится, что средние различия лог-вероятностей контролировались на уровне 1e-7, более чем на 99.99% ниже прежних настроек.
Планирование с учётом нагрузки и балансировка загрузки, по сообщениям, повысили сквозную производительность RL более чем в 2.3 раза на задачах кодирования с длинным горизонтом. Это улучшения инфраструктуры обучения, а не гарантии инференса для конечного пользователя, но они объясняют, как Z.ai масштабировала более длинные и разнообразные траектории за месяц.
6. Открытые веса с задержкой на проверку безопасности
Z.ai называет GLM-5.3 моделью с открытыми весами, но в день запуска веса нельзя было скачать. Компания говорит, что они будут опубликованы через две недели после проверки и укрепления безопасности. Это существенное отличие от GLM-5.2, чьи веса под MIT уже на Hugging Face.
Для большинства команд hosted-API-тестирование остаётся практичным первым шагом. Модель крупная, и открытые веса не убирают стоимость аппаратуры инференса, квантования, сервинга, мониторинга или средств безопасности.
GLM-5.3 vs GLM-5.2: улучшения бенчмарков
Ниже приводятся данные официального запуска Z.ai. «Change» — простая разница из указанных оценок. Относительные проценты могут выглядеть драматично при низкой базе GLM-5.2, поэтому также показана абсолютная разница.
| Benchmark | GLM-5.2 | GLM-5.3 | Absolute change | Relative change |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +8.9% |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +515.2% |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +44.8% |
| NL2Repo | 48.9 | 58.0 | +9.1 | +18.6% |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +100.0% |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +15.7% |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +119.1% |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +25.6% |
| CyberGym | 77.2 | 84.5 | +7.3 | +9.5% |
| ExploitBench | 24.4 | 54.4 | +30.0 | +123.0% |
| ExploitGym, 2-hour tasks | 29 | 105 | +76 | +262.1% |
| ExploitGym, 6-hour tasks | 39 | 130 | +91 | +233.3% |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +21.9% |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +84.0% |
| Agents' Last Exam CLI | 23.8 | 28.5 | +4.7 | +19.7% |
| HLE with tools | 54.7 | 62.5 | +7.8 | +14.3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17.3% |
Улучшения бенчмарков: GLM-5.3 vs GLM-5.2 и конкуренты
Все цифры ниже — данные вендора из официального блога Z.ai (с примечаниями по методикам, длинам контекста и сэмплингу). Независимая верификация последует после публикации весов и расширения доступа.
Бенчмарки по кодированию
| Benchmark | GLM-5.3 | GLM-5.2 | Notes / Competitors |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | Конкурентна топовым закрытым моделям |
| Terminal Bench 3.0 | 28.3 | 4.6 | Open-source SOTA; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | Сильный скачок |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench (internal, Max effort) | ~34.5% completion @ ~75K tokens | ~23.4% @ ~96K tokens | ~50% общий прирост в кодинге; выше эффективность |
На уровне High GLM-5.3 достигла 31.4% завершения при ~50K токенов, обогнав Claude Opus 4.8 (29.5% при 120K токенов) на внутреннем стенде, оставаясь позади Claude Fable 5 (39.5% на Max).
Бенчмарки по кибербезопасности
| Benchmark | GLM-5.3 | GLM-5.2 | Competitors (approx.) |
|---|---|---|---|
| CyberGym | 84.5% | 77.2% | Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA) |
| ExploitBench | 54.4% | 24.4% | Более чем удвоение; закрытые модели выше (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%) |
| ExploitGym (2h/6h) | 105 / 130 | 29 / 39 | Mythos 5 всё ещё впереди (181/247) |
Выигрыши максимальны выше по цепочке эксплуатации. В реальном тестировании с китайскими командами безопасности модель (на базе работы GLM-5.2) выявила 2 436 уязвимостей в 269 проектах, включая 1 097 средней и высокой критичности. Некоторые дефекты датируются ~40 годами назад (самый старый ~1981). Находки отслеживаются в публичном Z.ai Security Disclosure Ledger.
Агентные и другие бенчмарки
| Benchmark | GLM-5.3 | GLM-5.2 | Notes |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | Большой прирост |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | Конкурентна open-source |
| HLE w/ Tools | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | Охватывает 44 профессии |
Эти результаты демонстрируют явный прогресс на многошаговых профессиональных задачах с длинным горизонтом.
Эффективность токенов, режимы мышления и практическое поведение
Тихое, но важное улучшение — эффективность по токенам. На внутреннем Code Bench более высокие показатели завершения достигаются при меньшем числе выходных токенов. Это влияет на стоимость и латентность в производственных циклах агента.
GLM-5.3 всегда включает мышление. Поддерживаются три уровня: low, high и max (по умолчанию и рекомендовано для кодирования — max). Отключение мышления больше не поддерживается; приложения, ранее выставлявшие thinking.type: "disabled", должны мигрировать.
Контекст остаётся 1M токенов с максимумом вывода до 128K. Архитектура не изменилась относительно GLM-5.2, поэтому размеры аппаратуры для будущего self-hosting можно оценивать по опыту GLM-5.2 (квантованные footprints всё ещё большие, учитывая общий счёт параметров).
Для разработчиков, желающих экспериментировать немедленно или сохранить гибкость по моделям, полезны унифицированные шлюзы. CometAPI перечисляет модели серии GLM (включая GLM-5.3 под ID модели glm-5.3 по мере доступности) с OpenAI-совместимыми эндпоинтами, конкурентными тарифами, биллингом по использованию и возможностью переключаться между GLM-5.2, GLM-5.3 и десятками других фронтирных и открытых моделей без переписывания интеграционного кода. Это особенно практично для A/B-тестирования кодовых агентов, измерения реальной стоимости на успешную задачу и маршрутизации трафика по типу нагрузки.
Кому стоит переходить на GLM-5.3 и как оценивать
Команды, строящие кодовые агенты, длинно-горизонтную автоматизацию, рабочие процессы на уровне репозиториев или инструменты оборонной безопасности, должны приоритизировать оценку. Сочетание более высоких показателей завершения, лучшей эффективности токенов на сложных задачах и более сильной многошаговой агентности — существенно.
Рекомендуемая программа оценки:
- Прогоните те же внутренние задачи (или фиксированный харднесс) на GLM-5.2 и GLM-5.3 (или через Coding Plan) при matched уровнях усилий.
- Измеряйте не только pass rate, но и токены, wall-clock время и долю человеческих вмешательств.
- Используйте унифицированный API-слой вроде CometAPI, чтобы сравнение было без трения и оставалась опция отката или селективной маршрутизации.
- Для нагрузок, чувствительных к безопасности, дождитесь полноценных открытых весов после харденинга и проверьте практики раскрытия.
Самостоятельный хостинг станет привлекательным, как только выйдут веса, особенно для организаций, уже эксплуатирующих инфраструктуру GLM-5.2.
Заключение: пост-тренинг как новый фронтир масштабирования
GLM-5.3 — один из самых ясных недавних примеров того, что масштаб пост-тренинга — более реалистичные среды, лучшая инфраструктура RL и устойчивые вычисления на длинных траекториях — может обеспечить скачки способностей, которые ранее казались требующими нового претрейна. Выигрыши в кодировании и агентности велики; результаты по кибербезопасности в значительной мере возникшие и уже конкурентны или лидируют на бенчмарках, ориентированных на обнаружение.
Практический вывод для специалистов прост: тестируйте модель на ваших реальных нагрузках, измеряйте стоимость за успешный исход, а не только позицию в рейтингах, и держите интеграцию гибкой. Платформы вроде CometAPI упрощают этот процесс, предлагая единый ключ, интерфейс, совместимый с OpenAI, и лёгкое переключение по серии GLM и конкурирующим моделям, пока вы решаете, насколько агрессивно принимать новые возможности.
