FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-comparisons/Исследования CometAPI

GLM-5.3 против GLM-5.2: бенчмарки и тестирование показывают, что изменилось

GLM-5.3 против GLM-5.2: та же базовая модель, одно лишь пост-обучение дает скачок в программировании на ~50% (Terminal-Bench 3.0 4,6→28,3) и эмерджентный результат на CyberGym — 84,5% SOTA.

CometAPI
AnnaКоманда исследователей AI-моделей и API
Обновлено Aug 16, 2026 12 мин. чтения
GLM-5.3 против GLM-5.2: бенчмарки и тестирование показывают, что изменилось
Использовать этот подход

Сделайте первый вызов API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Z.ai выпустила GLM-5.3 14 августа 2026 года на точно той же базе ~743–753B-параметровой MoE-модели, что и GLM-5.2. Все улучшения получены за счёт масштабированного пост-тренинга в средах с длинным горизонтом. Результат — ~50% относительное улучшение на внутреннем Code Bench Z.ai, открытое SOTA на Terminal-Bench 3.0 (4.6 → 28.3) и Agents’ Last Exam, резкий рост агентных показателей и новая возникающая SOTA-производительность в кибербезопасности (CyberGym 84.5%). Также улучшилась эффективность по токенам.

Веса ожидаются примерно через две недели после запуска после доработки по безопасности. Разработчики уже могут получить доступ к связанным моделям GLM и эффективно тестировать рабочие процессы через единые платформы, такие как CometAPI.

Ключевые выводы

  • Та же базовая модель, что у GLM-5.2; все достижения — из пост-тренинга (IndexShare, SAO, фреймворк slime + больше сред и вычислений).
  • Кодирование: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; внутренний Z.ai Code Bench ~50% лучше при меньшем числе выходных токенов.
  • Агентность: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
  • Кибер: CyberGym 77.2 → 84.5 (SOTA, впереди Mythos 5 и GPT-5.6 Sol); ExploitBench более чем удвоен (24.4 → 54.4). Реальные находки: 2 436 уязвимостей в 269 проектах.
  • Характеристики ядра без изменений: контекст 1M, до 128K выходных токенов, мышление всегда включено с уровнями low/high/max.
  • Доступ: Live через GLM Coding Plan и ZCode; общий API и открытые веса (ожидаются в стиле MIT) после обзора безопасности. CometAPI предлагает удобный доступ к семейству GLM, совместимый с OpenAI, для параллельных тестов и продакшен-маршрутизации.

GLM-5.3 vs GLM-5.2 кратко

DimensionGLM-5.3GLM-5.2Winner / Notes
Base modelSame ~743–753B MoESameIdentical
Post-trainingHeavily scaled environmentsEarlier stack5.3
Terminal-Bench 3.028.34.65.3 (large)
DeepSWE v1.166.946.25.3
Internal Code Bench (Max)34.5% @ ~75K tokens23.4% @ ~96K tokens5.3 (perf + efficiency)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5 (SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
Context / Max output1M / 128K1M / similarSame
ThinkingAlways on (low/high/max)More flexible previously5.3 (всегда включено)
Open weights~2 weeks post-launch (planned)Available (MIT)5.2 currently
Primary access nowCoding Plan / ZCodeAPI + weights + Coding Plan5.2 более зрелая

Введение: пост-тренинг обеспечивает скачок поколения

В середине августа 2026 года сообщество ИИ наблюдало очередную стремительную итерацию в гонке открытых весов. Z.ai (международный бренд бывшей команды Zhipu AI / ChatGLM) запустила GLM-5.3 всего через 59 дней после GLM-5.2. Объявление было необычно ясным: базовая модель осталась идентичной. «Масштабирование пост-тренинга — всё, что мы сделали для GLM-5.3», заявила компания.

Это утверждение важно. Годы доминировал нарратив «более крупные модели выигрывают». GLM-5.3 показывает, что агрессивное масштабирование сред для обучения с подкреплением, разнообразие длинных задач и системная инфраструктура могут дать непропорциональные выигрыши на сложных задачах кодирования, агентности и даже кибербезопасности без нового претрейна. Числа настолько велики по нескольким трудным бенчмаркам, что независимые наблюдатели называют скачок качественным, а не инкрементальным. Обзор функций GLM-5.3, бенчмарков и заметок по доступу.

GLM-5.3 vs GLM-5.2: что действительно изменилось?

Главное заблуждение — думать, что GLM-5.3 это просто «GLM-5.2, но больше».

Это не так.

Базовая модель, по словам Z.ai, по сути та же. Основное новшество — масштабирование пост-тренинга. Z.ai выделяет три столпа:

  1. Системные улучшения внутри slime — лучшее обучение
  2. Масштабирование сред — конвейеры синтезируют исполняемые, проверяемые среды с длинным горизонтом из реальных профессиональных рабочих процессов. Исследовательские агенты извлекают паттерны задач; судьи проверяют разрешимость; проверяющие создаются без доступа к эталонным решениям, чтобы снизить взлом вознаграждения.
  3. Продолжение использования SAO + компактизации — помогает сохранять прирост на длинных траекториях, не схлопываясь на коротких. — согласованность развёртывания (различия лог-вероятностей контролируются до ~1e-7), иерархическое кэширование, поддержка нескольких учителей, планирование с учётом нагрузки и заявленные >2.3× приросты сквозной производительности на задачах RL для кодирования с длинным горизонтом.

Эти изменения дали измеримые улучшения в наборах для кодирования, агентности и кибербезопасности. Важно, что самые большие относительные выигрыши появляются на самых сложных, низкобазовых тестах — именно тот паттерн, который ожидается, когда модель толкают в режимы, где она ранее была ненадёжна.

Итог — апгрейд модели прежде всего о поведении и способности, а не просто об архитектуре.

GLM-5.3 vs GLM-5.2: сравнение функций

1. Масштабированный пост-тренинг вместо новой базовой модели

Z.ai описывает масштабированный пост-тренинг как весь рецепт GLM-5.3. Исследовательские агенты превращают паттерны реальной работы в исполняемые задачи с скрытым состоянием и многошаговыми зависимостями. Судья-агент проверяет, что каждая задача разрешима. Проверяющие создаются, не видя эталонного решения, затем тестируются против оракулов, no-op и неразрешённых состояний, чтобы снизить обходы награды.

Система всё ещё требует человеческого ревью, и Z.ai прямо говорит, что более автономное генерирование и проверка сред — задача будущего. Эта оговорка добавляет достоверности заявлению: это крупный тренировочный пайплайн, а не утверждение, что синтетические среды стали полностью самоуправляемыми.

2. Более сильное кодирование с длинным горизонтом

GLM-5.3 улучшилась в работе с репозиториями, задачах терминала, инфраструктуре ML, оптимизации производительности и многошаговой поставке ПО. На Z.ai Code Bench, внутренней оценке, предназначенной отражать реалистичные сценарии, Z.ai сообщает примерно на 50% лучшее качество кодирования, чем GLM-5.2.

Важен результат по эффективности. На уровне Max GLM-5.3 достигла 34.5% при около 75K выходных токенов на задачу против 23.4% при 96K у GLM-5.2. Это прирост качества на 11.1 пунктов при примерно 22% меньшем числе токенов. На уровне High GLM-5.3 достигла 31.4% с примерно 50K токенов, опередив Claude Opus 4.8 с 29.5% при 120K в той же «первой» таблице вендора. Claude Fable 5 остаётся выше — 39.5% на Max.

3. Возникающая способность в кибербезопасности

Z.ai добавила среды поиска уязвимостей на этапе пост-тренинга. По отчёту запуска способности выросли сверх поиска изолированных дефектов: модель начала рассуждать через несколько стадий цепочки эксплуатации.

Публичные оценки показывают и прогресс, и пределы. GLM-5.3 лидирует в таблице Z.ai на CyberGym с 84.5 против 77.2 у GLM-5.2. На ExploitBench она более чем вдвое превосходит GLM-5.2, достигая 54.4 против 24.4, но остаётся заметно позади Fable 5 с 78.0 и GPT-5.6 Sol с 76.5. На ExploitGym выполняет 105 задач в нормированном двухчасовом бюджете и 130 в шести часах, против 29 и 39 у GLM-5.2; GPT-5.6 Sol и Fable 5 остаются существенно впереди.

Эти возможности — двойного назначения. Организациям следует ограничивать доступ к модели, изолировать инструменты (песочницы), логировать действия, требовать авторизации на сканирование и держать человека в контуре для валидации уязвимостей и раскрытия.

4. Мышление всегда включено с тремя уровнями усилий

GLM-5.3 поддерживает уровни low, high и max. В отличие от GLM-5.2, отключённое мышление не поддерживается. Существующие интеграции, которые отправляют thinking.type: "disabled", должны изменить значение на enabled перед переключением ID модели, иначе, по словам Z.ai, запрос будет отклонён.

Используйте low для интерактивных правок и низкорисковых преобразований, high — для значимых задач по репозиторию, и max — для сложного кодирования или анализа безопасности. Более высокий уровень следует оценивать на предмет латентности и стоимости, так как более сильный ответ не всегда самый экономичный.

5. Лучший тренировочный сквозной вывод через slime

GLM-5.3 продолжает использовать slime, открытый фреймворк Z.ai с Megatron на стороне обучения и SGLang на стороне развёртывания. Z.ai сообщает о добавлениях для top-p-маскирования, top-k и полной словарной он-полиси дистилляции, переключения учителей, кэширования и более тесного численного согласования между обучением и развёртыванием. В отчёте запуска говорится, что средние различия лог-вероятностей контролировались на уровне 1e-7, более чем на 99.99% ниже прежних настроек.

Планирование с учётом нагрузки и балансировка загрузки, по сообщениям, повысили сквозную производительность RL более чем в 2.3 раза на задачах кодирования с длинным горизонтом. Это улучшения инфраструктуры обучения, а не гарантии инференса для конечного пользователя, но они объясняют, как Z.ai масштабировала более длинные и разнообразные траектории за месяц.

6. Открытые веса с задержкой на проверку безопасности

Z.ai называет GLM-5.3 моделью с открытыми весами, но в день запуска веса нельзя было скачать. Компания говорит, что они будут опубликованы через две недели после проверки и укрепления безопасности. Это существенное отличие от GLM-5.2, чьи веса под MIT уже на Hugging Face.

Для большинства команд hosted-API-тестирование остаётся практичным первым шагом. Модель крупная, и открытые веса не убирают стоимость аппаратуры инференса, квантования, сервинга, мониторинга или средств безопасности.

GLM-5.3 vs GLM-5.2: улучшения бенчмарков

Ниже приводятся данные официального запуска Z.ai. «Change» — простая разница из указанных оценок. Относительные проценты могут выглядеть драматично при низкой базе GLM-5.2, поэтому также показана абсолютная разница.

BenchmarkGLM-5.2GLM-5.3Absolute changeRelative change
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym, 2-hour tasks29105+76+262.1%
ExploitGym, 6-hour tasks39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE with tools54.762.5+7.8+14.3%
GDPval-AA v2, Elo15081769+261+17.3%

Улучшения бенчмарков: GLM-5.3 vs GLM-5.2 и конкуренты

Все цифры ниже — данные вендора из официального блога Z.ai (с примечаниями по методикам, длинам контекста и сэмплингу). Независимая верификация последует после публикации весов и расширения доступа.

Бенчмарки по кодированию

BenchmarkGLM-5.3GLM-5.2Notes / Competitors
Terminal Bench 2.188.281.0Конкурентна топовым закрытым моделям
Terminal Bench 3.028.34.6Open-source SOTA; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2Сильный скачок
NL2Repo58.048.9
ProgramBench Almost Solved19.09.5
FrontierSWE78.167.5
SWE-Marathon v1.142.519.4
Z.ai Code Bench (internal, Max effort)~34.5% completion @ ~75K tokens~23.4% @ ~96K tokens~50% общий прирост в кодинге; выше эффективность

На уровне High GLM-5.3 достигла 31.4% завершения при ~50K токенов, обогнав Claude Opus 4.8 (29.5% при 120K токенов) на внутреннем стенде, оставаясь позади Claude Fable 5 (39.5% на Max).

Бенчмарки по кибербезопасности

BenchmarkGLM-5.3GLM-5.2Competitors (approx.)
CyberGym84.5%77.2%Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA)
ExploitBench54.4%24.4%Более чем удвоение; закрытые модели выше (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%)
ExploitGym (2h/6h)105 / 13029 / 39Mythos 5 всё ещё впереди (181/247)

Выигрыши максимальны выше по цепочке эксплуатации. В реальном тестировании с китайскими командами безопасности модель (на базе работы GLM-5.2) выявила 2 436 уязвимостей в 269 проектах, включая 1 097 средней и высокой критичности. Некоторые дефекты датируются ~40 годами назад (самый старый ~1981). Находки отслеживаются в публичном Z.ai Security Disclosure Ledger.

Агентные и другие бенчмарки

BenchmarkGLM-5.3GLM-5.2Notes
Toolathlon Verified73.059.9
AutomationBench v1.0.648.226.2Большой прирост
Agents’ Last Exam (ALE-CLI)28.523.8Конкурентна open-source
HLE w/ Tools62.554.7
GDPval-AA v217691508Охватывает 44 профессии

Эти результаты демонстрируют явный прогресс на многошаговых профессиональных задачах с длинным горизонтом.

Эффективность токенов, режимы мышления и практическое поведение

Тихое, но важное улучшение — эффективность по токенам. На внутреннем Code Bench более высокие показатели завершения достигаются при меньшем числе выходных токенов. Это влияет на стоимость и латентность в производственных циклах агента.

GLM-5.3 всегда включает мышление. Поддерживаются три уровня: low, high и max (по умолчанию и рекомендовано для кодирования — max). Отключение мышления больше не поддерживается; приложения, ранее выставлявшие thinking.type: "disabled", должны мигрировать.

Контекст остаётся 1M токенов с максимумом вывода до 128K. Архитектура не изменилась относительно GLM-5.2, поэтому размеры аппаратуры для будущего self-hosting можно оценивать по опыту GLM-5.2 (квантованные footprints всё ещё большие, учитывая общий счёт параметров).

Для разработчиков, желающих экспериментировать немедленно или сохранить гибкость по моделям, полезны унифицированные шлюзы. CometAPI перечисляет модели серии GLM (включая GLM-5.3 под ID модели glm-5.3 по мере доступности) с OpenAI-совместимыми эндпоинтами, конкурентными тарифами, биллингом по использованию и возможностью переключаться между GLM-5.2, GLM-5.3 и десятками других фронтирных и открытых моделей без переписывания интеграционного кода. Это особенно практично для A/B-тестирования кодовых агентов, измерения реальной стоимости на успешную задачу и маршрутизации трафика по типу нагрузки.

Кому стоит переходить на GLM-5.3 и как оценивать

Команды, строящие кодовые агенты, длинно-горизонтную автоматизацию, рабочие процессы на уровне репозиториев или инструменты оборонной безопасности, должны приоритизировать оценку. Сочетание более высоких показателей завершения, лучшей эффективности токенов на сложных задачах и более сильной многошаговой агентности — существенно.

Рекомендуемая программа оценки:

  1. Прогоните те же внутренние задачи (или фиксированный харднесс) на GLM-5.2 и GLM-5.3 (или через Coding Plan) при matched уровнях усилий.
  2. Измеряйте не только pass rate, но и токены, wall-clock время и долю человеческих вмешательств.
  3. Используйте унифицированный API-слой вроде CometAPI, чтобы сравнение было без трения и оставалась опция отката или селективной маршрутизации.
  4. Для нагрузок, чувствительных к безопасности, дождитесь полноценных открытых весов после харденинга и проверьте практики раскрытия.

Самостоятельный хостинг станет привлекательным, как только выйдут веса, особенно для организаций, уже эксплуатирующих инфраструктуру GLM-5.2.

Заключение: пост-тренинг как новый фронтир масштабирования

GLM-5.3 — один из самых ясных недавних примеров того, что масштаб пост-тренинга — более реалистичные среды, лучшая инфраструктура RL и устойчивые вычисления на длинных траекториях — может обеспечить скачки способностей, которые ранее казались требующими нового претрейна. Выигрыши в кодировании и агентности велики; результаты по кибербезопасности в значительной мере возникшие и уже конкурентны или лидируют на бенчмарках, ориентированных на обнаружение.

Практический вывод для специалистов прост: тестируйте модель на ваших реальных нагрузках, измеряйте стоимость за успешный исход, а не только позицию в рейтингах, и держите интеграцию гибкой. Платформы вроде CometAPI упрощают этот процесс, предлагая единый ключ, интерфейс, совместимый с OpenAI, и лёгкое переключение по серии GLM и конкурирующим моделям, пока вы решаете, насколько агрессивно принимать новые возможности.

Продолжить обучение

Свяжите эту статью со следующим решением.

Посмотреть все темы
Опубликовано Aug 15, 2026
Последнее обновление Aug 16, 2026
0 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Готовы сократить затраты на AI-разработку на 20%?

Начните бесплатно за несколько минут. Пробные кредиты включены. Карта не нужна.

Читать далее