GPT-6.1 Sol are now live on CometAPI →
ai-comparisons/Исследования CometAPI

GLM-5.3 против GLM-5.2: бенчмарки и тестирование показывают, что изменилось

GLM-5.3 против GLM-5.2: та же базовая модель, одно лишь пост-обучение дает скачок в программировании на ~50% (Terminal-Bench 3.0 4,6→28,3) и эмерджентный результат на CyberGym — 84,5% SOTA.

CometAPI
AnnaКоманда исследователей AI-моделей и API
Обновлено Sep 3, 2026 12 мин. чтения
GLM-5.3 против GLM-5.2: бенчмарки и тестирование показывают, что изменилось
Использовать этот подход

Сделайте первый вызов API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Z.ai выпустила GLM-5.3 14 августа 2026 года на точно той же базе ~743–753B-параметровой MoE-модели, что и GLM-5.2. Все улучшения получены за счёт масштабированного пост-тренинга в средах с длинным горизонтом. Результат — ~50% относительное улучшение на внутреннем Code Bench Z.ai, открытое SOTA на Terminal-Bench 3.0 (4.6 → 28.3) и Agents’ Last Exam, резкий рост агентных показателей и новая возникающая SOTA-производительность в кибербезопасности (CyberGym 84.5%). Также улучшилась эффективность по токенам.

Веса ожидаются примерно через две недели после запуска после доработки по безопасности. Разработчики уже могут получить доступ к связанным моделям GLM и эффективно тестировать рабочие процессы через единые платформы, такие как CometAPI.

Ключевые выводы

  • Та же базовая модель, что у GLM-5.2; все достижения — из пост-тренинга (IndexShare, SAO, фреймворк slime + больше сред и вычислений).
  • Кодирование: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; внутренний Z.ai Code Bench ~50% лучше при меньшем числе выходных токенов.
  • Агентность: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
  • Кибер: CyberGym 77.2 → 84.5 (SOTA, впереди Mythos 5 и GPT-5.6 Sol); ExploitBench более чем удвоен (24.4 → 54.4). Реальные находки: 2 436 уязвимостей в 269 проектах.
  • Характеристики ядра без изменений: контекст 1M, до 128K выходных токенов, мышление всегда включено с уровнями low/high/max.
  • Доступ: Live через GLM Coding Plan и ZCode; общий API и открытые веса (ожидаются в стиле MIT) после обзора безопасности. CometAPI предлагает удобный доступ к семейству GLM, совместимый с OpenAI, для параллельных тестов и продакшен-маршрутизации.

GLM-5.3 vs GLM-5.2 кратко

DimensionGLM-5.3GLM-5.2Winner / Notes
Base modelSame ~743–753B MoESameIdentical
Post-trainingHeavily scaled environmentsEarlier stack5.3
Terminal-Bench 3.028.34.65.3 (large)
DeepSWE v1.166.946.25.3
Internal Code Bench (Max)34.5% @ ~75K tokens23.4% @ ~96K tokens5.3 (perf + efficiency)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5 (SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
Context / Max output1M / 128K1M / similarSame
ThinkingAlways on (low/high/max)More flexible previously5.3 (всегда включено)
Open weights~2 weeks post-launch (planned)Available (MIT)5.2 currently
Primary access nowCoding Plan / ZCodeAPI + weights + Coding Plan5.2 более зрелая

Введение: пост-тренинг обеспечивает скачок поколения

В середине августа 2026 года сообщество ИИ наблюдало очередную стремительную итерацию в гонке открытых весов. Z.ai (международный бренд бывшей команды Zhipu AI / ChatGLM) запустила GLM-5.3 всего через 59 дней после GLM-5.2. Объявление было необычно ясным: базовая модель осталась идентичной. «Масштабирование пост-тренинга — всё, что мы сделали для GLM-5.3», заявила компания.

Это утверждение важно. Годы доминировал нарратив «более крупные модели выигрывают». GLM-5.3 показывает, что агрессивное масштабирование сред для обучения с подкреплением, разнообразие длинных задач и системная инфраструктура могут дать непропорциональные выигрыши на сложных задачах кодирования, агентности и даже кибербезопасности без нового претрейна. Числа настолько велики по нескольким трудным бенчмаркам, что независимые наблюдатели называют скачок качественным, а не инкрементальным. Обзор функций GLM-5.3, бенчмарков и заметок по доступу.

GLM-5.3 vs GLM-5.2: что действительно изменилось?

Главное заблуждение — думать, что GLM-5.3 это просто «GLM-5.2, но больше».

Это не так.

Базовая модель, по словам Z.ai, по сути та же. Основное новшество — масштабирование пост-тренинга. Z.ai выделяет три столпа:

  1. Системные улучшения внутри slime — лучшее обучение
  2. Масштабирование сред — конвейеры синтезируют исполняемые, проверяемые среды с длинным горизонтом из реальных профессиональных рабочих процессов. Исследовательские агенты извлекают паттерны задач; судьи проверяют разрешимость; проверяющие создаются без доступа к эталонным решениям, чтобы снизить взлом вознаграждения.
  3. Продолжение использования SAO + компактизации — помогает сохранять прирост на длинных траекториях, не схлопываясь на коротких. — согласованность развёртывания (различия лог-вероятностей контролируются до ~1e-7), иерархическое кэширование, поддержка нескольких учителей, планирование с учётом нагрузки и заявленные >2.3× приросты сквозной производительности на задачах RL для кодирования с длинным горизонтом.

Эти изменения дали измеримые улучшения в наборах для кодирования, агентности и кибербезопасности. Важно, что самые большие относительные выигрыши появляются на самых сложных, низкобазовых тестах — именно тот паттерн, который ожидается, когда модель толкают в режимы, где она ранее была ненадёжна.

Итог — апгрейд модели прежде всего о поведении и способности, а не просто об архитектуре.

GLM-5.3 vs GLM-5.2: сравнение функций

1. Масштабированный пост-тренинг вместо новой базовой модели

Z.ai описывает масштабированный пост-тренинг как весь рецепт GLM-5.3. Исследовательские агенты превращают паттерны реальной работы в исполняемые задачи с скрытым состоянием и многошаговыми зависимостями. Судья-агент проверяет, что каждая задача разрешима. Проверяющие создаются, не видя эталонного решения, затем тестируются против оракулов, no-op и неразрешённых состояний, чтобы снизить обходы награды.

Система всё ещё требует человеческого ревью, и Z.ai прямо говорит, что более автономное генерирование и проверка сред — задача будущего. Эта оговорка добавляет достоверности заявлению: это крупный тренировочный пайплайн, а не утверждение, что синтетические среды стали полностью самоуправляемыми.

2. Более сильное кодирование с длинным горизонтом

GLM-5.3 улучшилась в работе с репозиториями, задачах терминала, инфраструктуре ML, оптимизации производительности и многошаговой поставке ПО. На Z.ai Code Bench, внутренней оценке, предназначенной отражать реалистичные сценарии, Z.ai сообщает примерно на 50% лучшее качество кодирования, чем GLM-5.2.

Важен результат по эффективности. На уровне Max GLM-5.3 достигла 34.5% при около 75K выходных токенов на задачу против 23.4% при 96K у GLM-5.2. Это прирост качества на 11.1 пунктов при примерно 22% меньшем числе токенов. На уровне High GLM-5.3 достигла 31.4% с примерно 50K токенов, опередив Claude Opus 4.8 с 29.5% при 120K в той же «первой» таблице вендора. Claude Fable 5 остаётся выше — 39.5% на Max.

3. Возникающая способность в кибербезопасности

Z.ai добавила среды поиска уязвимостей на этапе пост-тренинга. По отчёту запуска способности выросли сверх поиска изолированных дефектов: модель начала рассуждать через несколько стадий цепочки эксплуатации.

Публичные оценки показывают и прогресс, и пределы. GLM-5.3 лидирует в таблице Z.ai на CyberGym с 84.5 против 77.2 у GLM-5.2. На ExploitBench она более чем вдвое превосходит GLM-5.2, достигая 54.4 против 24.4, но остаётся заметно позади Fable 5 с 78.0 и GPT-5.6 Sol с 76.5. На ExploitGym выполняет 105 задач в нормированном двухчасовом бюджете и 130 в шести часах, против 29 и 39 у GLM-5.2; GPT-5.6 Sol и Fable 5 остаются существенно впереди.

Эти возможности — двойного назначения. Организациям следует ограничивать доступ к модели, изолировать инструменты (песочницы), логировать действия, требовать авторизации на сканирование и держать человека в контуре для валидации уязвимостей и раскрытия.

4. Мышление всегда включено с тремя уровнями усилий

GLM-5.3 поддерживает уровни low, high и max. В отличие от GLM-5.2, отключённое мышление не поддерживается. Существующие интеграции, которые отправляют thinking.type: "disabled", должны изменить значение на enabled перед переключением ID модели, иначе, по словам Z.ai, запрос будет отклонён.

Используйте low для интерактивных правок и низкорисковых преобразований, high — для значимых задач по репозиторию, и max — для сложного кодирования или анализа безопасности. Более высокий уровень следует оценивать на предмет латентности и стоимости, так как более сильный ответ не всегда самый экономичный.

5. Лучший тренировочный сквозной вывод через slime

GLM-5.3 продолжает использовать slime, открытый фреймворк Z.ai с Megatron на стороне обучения и SGLang на стороне развёртывания. Z.ai сообщает о добавлениях для top-p-маскирования, top-k и полной словарной он-полиси дистилляции, переключения учителей, кэширования и более тесного численного согласования между обучением и развёртыванием. В отчёте запуска говорится, что средние различия лог-вероятностей контролировались на уровне 1e-7, более чем на 99.99% ниже прежних настроек.

Планирование с учётом нагрузки и балансировка загрузки, по сообщениям, повысили сквозную производительность RL более чем в 2.3 раза на задачах кодирования с длинным горизонтом. Это улучшения инфраструктуры обучения, а не гарантии инференса для конечного пользователя, но они объясняют, как Z.ai масштабировала более длинные и разнообразные траектории за месяц.

6. Открытые веса с задержкой на проверку безопасности

Z.ai называет GLM-5.3 моделью с открытыми весами, но в день запуска веса нельзя было скачать. Компания говорит, что они будут опубликованы через две недели после проверки и укрепления безопасности. Это существенное отличие от GLM-5.2, чьи веса под MIT уже на Hugging Face.

Для большинства команд hosted-API-тестирование остаётся практичным первым шагом. Модель крупная, и открытые веса не убирают стоимость аппаратуры инференса, квантования, сервинга, мониторинга или средств безопасности.

GLM-5.3 vs GLM-5.2: улучшения бенчмарков

Ниже приводятся данные официального запуска Z.ai. «Change» — простая разница из указанных оценок. Относительные проценты могут выглядеть драматично при низкой базе GLM-5.2, поэтому также показана абсолютная разница.

BenchmarkGLM-5.2GLM-5.3Absolute changeRelative change
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym, 2-hour tasks29105+76+262.1%
ExploitGym, 6-hour tasks39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE with tools54.762.5+7.8+14.3%
GDPval-AA v2, Elo15081769+261+17.3%

Улучшения бенчмарков: GLM-5.3 vs GLM-5.2 и конкуренты

Все цифры ниже — данные вендора из официального блога Z.ai (с примечаниями по методикам, длинам контекста и сэмплингу). Независимая верификация последует после публикации весов и расширения доступа.

Бенчмарки по кодированию

BenchmarkGLM-5.3GLM-5.2Notes / Competitors
Terminal Bench 2.188.281.0Конкурентна топовым закрытым моделям
Terminal Bench 3.028.34.6Open-source SOTA; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2Сильный скачок
NL2Repo58.048.9—
ProgramBench Almost Solved19.09.5—
FrontierSWE78.167.5—
SWE-Marathon v1.142.519.4—
Z.ai Code Bench (internal, Max effort)~34.5% completion @ ~75K tokens~23.4% @ ~96K tokens~50% общий прирост в кодинге; выше эффективность

На уровне High GLM-5.3 достигла 31.4% завершения при ~50K токенов, обогнав Claude Opus 4.8 (29.5% при 120K токенов) на внутреннем стенде, оставаясь позади Claude Fable 5 (39.5% на Max).

Бенчмарки по кибербезопасности

BenchmarkGLM-5.3GLM-5.2Competitors (approx.)
CyberGym84.5%77.2%Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA)
ExploitBench54.4%24.4%Более чем удвоение; закрытые модели выше (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%)
ExploitGym (2h/6h)105 / 13029 / 39Mythos 5 всё ещё впереди (181/247)

Выигрыши максимальны выше по цепочке эксплуатации. В реальном тестировании с китайскими командами безопасности модель (на базе работы GLM-5.2) выявила 2 436 уязвимостей в 269 проектах, включая 1 097 средней и высокой критичности. Некоторые дефекты датируются ~40 годами назад (самый старый ~1981). Находки отслеживаются в публичном Z.ai Security Disclosure Ledger.

Агентные и другие бенчмарки

BenchmarkGLM-5.3GLM-5.2Notes
Toolathlon Verified73.059.9—
AutomationBench v1.0.648.226.2Большой прирост
Agents’ Last Exam (ALE-CLI)28.523.8Конкурентна open-source
HLE w/ Tools62.554.7—
GDPval-AA v217691508Охватывает 44 профессии

Эти результаты демонстрируют явный прогресс на многошаговых профессиональных задачах с длинным горизонтом.

Эффективность токенов, режимы мышления и практическое поведение

Тихое, но важное улучшение — эффективность по токенам. На внутреннем Code Bench более высокие показатели завершения достигаются при меньшем числе выходных токенов. Это влияет на стоимость и латентность в производственных циклах агента.

GLM-5.3 всегда включает мышление. Поддерживаются три уровня: low, high и max (по умолчанию и рекомендовано для кодирования — max). Отключение мышления больше не поддерживается; приложения, ранее выставлявшие thinking.type: "disabled", должны мигрировать.

Контекст остаётся 1M токенов с максимумом вывода до 128K. Архитектура не изменилась относительно GLM-5.2, поэтому размеры аппаратуры для будущего self-hosting можно оценивать по опыту GLM-5.2 (квантованные footprints всё ещё большие, учитывая общий счёт параметров).

Для разработчиков, желающих экспериментировать немедленно или сохранить гибкость по моделям, полезны унифицированные шлюзы. CometAPI перечисляет модели серии GLM (включая GLM-5.3 под ID модели glm-5.3 по мере доступности) с OpenAI-совместимыми эндпоинтами, конкурентными тарифами, биллингом по использованию и возможностью переключаться между GLM-5.2, GLM-5.3 и десятками других фронтирных и открытых моделей без переписывания интеграционного кода. Это особенно практично для A/B-тестирования кодовых агентов, измерения реальной стоимости на успешную задачу и маршрутизации трафика по типу нагрузки.

Кому стоит переходить на GLM-5.3 и как оценивать

Команды, строящие кодовые агенты, длинно-горизонтную автоматизацию, рабочие процессы на уровне репозиториев или инструменты оборонной безопасности, должны приоритизировать оценку. Сочетание более высоких показателей завершения, лучшей эффективности токенов на сложных задачах и более сильной многошаговой агентности — существенно.

Рекомендуемая программа оценки:

  1. Прогоните те же внутренние задачи (или фиксированный харднесс) на GLM-5.2 и GLM-5.3 (или через Coding Plan) при matched уровнях усилий.
  2. Измеряйте не только pass rate, но и токены, wall-clock время и долю человеческих вмешательств.
  3. Используйте унифицированный API-слой вроде CometAPI, чтобы сравнение было без трения и оставалась опция отката или селективной маршрутизации.
  4. Для нагрузок, чувствительных к безопасности, дождитесь полноценных открытых весов после харденинга и проверьте практики раскрытия.

Самостоятельный хостинг станет привлекательным, как только выйдут веса, особенно для организаций, уже эксплуатирующих инфраструктуру GLM-5.2.

Заключение: пост-тренинг как новый фронтир масштабирования

GLM-5.3 — один из самых ясных недавних примеров того, что масштаб пост-тренинга — более реалистичные среды, лучшая инфраструктура RL и устойчивые вычисления на длинных траекториях — может обеспечить скачки способностей, которые ранее казались требующими нового претрейна. Выигрыши в кодировании и агентности велики; результаты по кибербезопасности в значительной мере возникшие и уже конкурентны или лидируют на бенчмарках, ориентированных на обнаружение.

Практический вывод для специалистов прост: тестируйте модель на ваших реальных нагрузках, измеряйте стоимость за успешный исход, а не только позицию в рейтингах, и держите интеграцию гибкой. Платформы вроде CometAPI упрощают этот процесс, предлагая единый ключ, интерфейс, совместимый с OpenAI, и лёгкое переключение по серии GLM и конкурирующим моделям, пока вы решаете, насколько агрессивно принимать новые возможности.

Продолжить обучение

Свяжите эту статью со следующим решением.

Посмотреть все темы
Опубликовано Aug 15, 2026
Последнее обновление Sep 3, 2026
349 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Читать далее