TL;DR: Выбирайте DeepSeek-V4-Flash для быстрой, низколатентной текстовой автоматизации; выбирайте GLM-5.3-Flash для мультимодальных возможностей, превосходных результатов в бенчмарках агента и высокоэффективного хостинга с длинным контекстом на частных серверах. Обе модели предоставляют открытые веса под MIT License**** и выпущены по разрешительной MIT License.
DeepSeek-V4-Flash**** — лучший вариант, если вам нужен сверхбыстрый, высокопроизводительный текстовый API для традиционных циклов кодирования и массовой пакетной обработки. Он набирает 50 на Artificial Analysis Intelligence Index, генерирует до 122+ токенов/с благодаря встроенному механизму спекулятивного декодирования DSpark и предлагает внепиковые тарифы API от $0.22/$0.66 за миллион входных/выходных токенов.
GLM-5.3-Flash — более универсальный выбор, когда требуются нативная мультимодальность, программирование с визуальной обратной связью и высокоэффективное масштабирование на частных серверах. Он набирает 57 на Artificial Analysis Intelligence Index, использует гибридный линейно-разреженный механизм внимания (KDA + NoPE Sparse MLA) для снижения памяти KV Cache в 4.44× на контексте 1M, а также обладает нативным визуальным рассуждением. Его API имеет очень конкурентную цену $0.15/$0.50 за миллион входных/выходных токенов (промотарифы до $0.075/$0.25).
Ключевые выводы
- DeepSeek-V4-Flash перешёл от первоначального превью в новостях DeepSeek API к официальному релизу на Hugging Face, включив Token-wise Compression, DeepSeek Sparse Attention (DSA) и спекулятивное декодирование DSpark для ускорения генерации.
- GLM-5.3-Flash был выпущен 26 августа 2026 года, после широкой популярности в анонимной тестовой фазе на OpenRouter под кодовым названием «Ox Alpha».
- GLM-5.3-Flash лидирует в общем Artificial Analysis Intelligence Index с 57 баллами против 50 у DeepSeek-V4-Flash-0731, что отражает более высокую общую способность к сложным рассуждениям и задачам агентов.
- Обе архитектуры — модели Mixture-of-Experts (MoE) с крайне небольшими вычислительными затратами на инференсе: DeepSeek активирует 13B из 284B параметров на токен, а GLM — 18B из 320B.
- Обе модели имеют полностью открытые веса и распространяются под MIT License, предоставляя максимальную свободу для корпоративной коммерциализации, кастомного дообучения и локального развёртывания on-prem.
DeepSeek-V4-Flash vs GLM-5.3-Flash: Быстрое сравнение
| Specification | DeepSeek-V4-Flash-0731 | GLM-5.3-Flash |
|---|---|---|
| Developer | DeepSeek-ai | Z.ai (Zhipu AI) |
| Release date | July 31, 2026 | August 26, 2026 |
| Model ID | deepseek-v4-flash | glm-5.3-flash |
| Hugging Face Repository | deepseek-ai/DeepSeek-V4-Flash | zai-org/GLM-5.3-Flash |
| Architecture | MoE; DSA + Token-wise Compression | MoE; KDA + NoPE Sparse MLA + mHC |
| Total parameters | 284B (304B with DSpark module) | 320B |
| Active parameters | 13B per token | 18B per token |
| Context window | 1,000,000 tokens | 1,048,576 / about 1M tokens |
| Input / output | Text → Text | Text + Image + Video + File → Text |
| Reasoning | Configurable (Thinking / Non-Thinking) | Three-level (Low / High / Max) |
| Function / tool use | JSON Schema / Tool Calls | ToolCalls, constraints, dynamic tool loading |
| Open weights | Yes (MIT License) | Yes (MIT License) |
| AA Intelligence Index | 50 | 57 |
| Official Price (1M Tokens) | Peak: $0.44 / $1.32 Off-peak: $0.22 / $0.66 | List: $0.15 / $0.50 Promo: $0.075 / $0.25 |
| Best fit | High-throughput agents, fast text generation | Visual programming, custom on-prem deployments |
Что такое DeepSeek-V4-Flash?
DeepSeek-V4-Flash — лёгкая, сверхбыстрая модель MoE, созданная для автономных агентів-разработчиков и масштабных текстовых конвейеров. Изначально представленный в новостях DeepSeek API, модель получила серьёзное пост-обучение в официальном релизе DeepSeek-V4-Flash-0731 на Hugging Face.
Модель оптимизирована под чистую текстовую пропускную способность, структурные API-вызовы и быстрое выполнение программного кода. Она минимизирует как задержку, так и стоимость инференса на токен, ориентируясь на многотуровые циклы разработки ПО, где критичны скорость и стоимость.
Что изменилось по сравнению с превью?
Официальная версия 0731 включает необязательную совместно обученную модель спекулятивного чернового наброска, увеличивающую локальное число параметров до 304B. При хостинге эта система спекулятивного декодирования (DSpark) работает параллельно активному контуру 13B, ускоряя генерацию до 122.7 токенов в секунду.
Кроме того, процесс выравнивания был существенно переобучен с применением RL в изолированных средах исполнения, что дало значительно более высокую надёжность в многошаговой терминальной работе, shell-скриптинге и структурированном использовании инструментов.
Характеристики DeepSeek-V4-Flash
| Property | DeepSeek-V4-Flash-0731 |
|---|---|
| Context | 1,000,000 tokens |
| Modalities | Text input; text output (standard model) |
| Reasoning | Supports Non-thinking and Thinking modes |
| Native API capabilities | JSON Output, Tool Calls, Responses API |
| Knowledge cutoff | Undisclosed |
| Standard Pricing (per MTok) | Peak: $0.44 Input / $0.014 Cached / $1.32 Output Off-peak: $0.22 Input / $0.007 Cached / $0.66 Output |
Что такое GLM-5.3-Flash?
GLM-5.3-Flash — флагманская мультимодальная модель MoE с открытыми весами от Z.ai. Официально представлена в блоге Z.ai 26 августа 2026 года, модель предназначена для выполнения очень сложных агентных операций, автоматической навигации по вебу и визуального анализа документов при стандартных ценах уровня «Flash». Веса публично доступны на Hugging Face.
Модель предобучена на огромном мультимодальном датасете в 30 трлн токенов, делая визуальные входы нативной модальностью, а не вторичной. Она ориентирована на разработку ПО, роботизацию процессов и мультимодальные запросы к базам данных.
Гибридное внимание, mHC и масштабирование разреженного MoE
GLM-5.3-Flash выделяется тремя архитектурными столпами:
- Hybrid Attention: Как описано в блоге Z.ai, модель сочетает Kimi Delta Attention (KDA) с NoPE Sparse MLA (Multi-head Latent Attention без позиционного кодирования). Этот гибридный слой внимания сжимает размеры проекций ключей и значений, сокращая хранение KV Cache в 4.44× и уменьшая вычисления внимания в 3.01× при оценках с контекстом 1M.
- Stable LatentMoE: Используя 896 экспертов с активацией ровно 16 на токен, модель избегает коллапса маршрутизации экспертов и остаётся стабильной при длинных многошаговых траекториях инференса.
- Manifold-Constrained Hyper-Connections (mHC): Эта техника стабилизирует глубокие градиенты в 45-слойной структуре, оптимизируя производительность железа при работе на распределённых GPU-кластерах или локальных AI-чипах.

GLM-5.3-Flash: Architecture for Extreme Efficacy Sourcing: z.ai
Характеристики GLM-5.3-Flash
| Property | GLM-5.3-Flash |
|---|---|
| Total / active parameters | 320B / 18B |
| Architecture | MoE with Hybrid Sparse & Linear Attention |
| Experts | 896 total; 16 activated per token |
| Context | 1,048,576 tokens (~1M) |
| Vision | Native Multimodal (Text, Image, Video, Doc File) |
| Reasoning | Supports Low, High, Max thinking modes |
| Tools | ToolCalls, constraints, dynamic tool loading |
| Open weights | Available on Hugging Face (MIT License) |
| Official Pricing (per MTok) | List: $0.15 Input / $0.03 Cached / $0.50 Output Promo (ends Sept 9): $0.075 Input / $0.015 Cached / $0.25 Output |
DeepSeek-V4-Flash vs GLM-5.3-Flash: Сравнение возможностей
Архитектура и эффективность по параметрам
DeepSeek-V4-Flash использует архитектуру с общим числом параметров 284B (13B активных) и совместно обученную спекулятивную модель черновиков (увеличивающую локальный размер развёртывания до 304B). GLM-5.3-Flash применяет 320B общих параметров (18B активных) в высокоразреженной 45-слойной конфигурации. Обе модели активируют очень мало параметров на токен, позволяя работать на скоростях, характерных для гораздо меньших моделей, сохраняя богатое представление знаний крупной модели.
Механизм внимания и оптимизация памяти
DeepSeek-V4-Flash применяет DeepSeek Sparse Attention (DSA) и Token-wise Compression. Она динамически анализирует структуру последовательности и сжимает избыточные токены (например, шаблонный код или повторяющиеся системные заголовки) при обработке длинных подсказок.
GLM-5.3-Flash сочетает линейную KDA с латентной проекцией (NoPE Sparse MLA). Это убирает явные позиционные кодировки из блока сжатия ключей/значений, уменьшая объём физического KV Cache до 22.5% от традиционных схем. Это позволяет кластерам с ограниченной памятью поддерживать существенно более высокую конкурентность при задачах с длинным контекстом.
Модальности и глубина мультимодальности
DeepSeek-V4-Flash-0731 — текстовая модель. Она отлично обрабатывает технические файлы, схемы JSON и структурированный Markdown. Для визуальных задач разработчикам нужно использовать отдельную экспериментальную мультимодальную модель (deepseek-v4-flash-vision-exp).
GLM-5.3-Flash — нативно мультимодальная. Она принимает высококачественные изображения, видео и сложные офисные документы (PDF, PPTX, таблицы) напрямую. Такая нативная мультимодальность поддерживает «visual-in-the-loop» разработку, когда модель может инспектировать отрендеренный UI, выявлять проблемы выравнивания и итеративно исправлять собственный код без текстового описания от человека.
Лицензирование и открытость
Обе модели выпущены под максимально разрешительной MIT License. Это даёт корпоративным разработчикам полную свободу модификации, распространения, сублицензирования и коммерческого локального развёртывания весов — в частном VPC или в изолированных on-prem инфраструктурах.
DeepSeek-V4-Flash vs GLM-5.3-Flash: Бенчмарки
При оценке на одних и тех же датасетах в идентичных условиях обе модели показывают конкурентные результаты в задачах инженерии ПО и автоматизации агентов.
Производительность в кодинге и агентных сценариях
| Benchmark | GLM-5.3-Flash (Z.ai) | DeepSeek-V4-Flash-0731 |
|---|---|---|
| Artificial Analysis Index v4.1.1 | 57 | 50 |
| Terminal Bench 2.1 (Acc) | 84.3 | 82.7 |
| DeepSWE v1.1 (GitHub Issues) | 63.4 | 54.4 |
| Toolathlon (Verified / Pass@1) | 78.4 | 70.3 |
| NL2Repo (Acc) | 56.3 | 54.2 |
| Automation Bench (Acc) | 48.8 | 25.1 |
| GDPval-AA v2 (Agent Elo) | 1773 | 1554 |
GLM-5.3-Flash сохраняет преимущество на большинстве агентных и инженерных бенчмарков, набирая 63.4% на DeepSWE v1.1 и 84.3 на Terminal Bench 2.1. Его активный маршрут 18B параметров и многотуровое пост-обучение выравнивания помогают справляться со сложным трекингом репозиториев и взаимодействиями с ОС.

GLM-5.3-Flash Benchmark: scoring 84.3 on Terminal Bench 2.1 Sourcing: z.ai
DeepSeek-V4-Flash-0731 тоже очень компетентен, набирая 82.7 на Terminal Bench 2.1 и 70.3 на Toolathlon. Он обеспечивает надёжную работу в детерминированных структурах API и строгом вызове функций.

DeepSeek-V4-Flash Benchmark 0731: scoring 82.7 on Terminal Bench 2.1 Sourcing: Hugging Face
Мультимодальность и визуальные рассуждения
Нативная мультимодальная подготовка GLM-5.3-Flash даёт ей явное преимущество в визуальных задачах рассуждения:
- OfficeQA Pro: 62.4 (GLM-5.3-Flash) против 57.9 (DeepSeek-V4-Vision experimental branch). GLM демонстрирует превосходный нативный разбор встроенных изображений, структурированных PDF-таблиц и презентаций.
- Chartography with Tools: 78.0 (GLM-5.3-Flash). Модель отлично воспринимает системные блок-схемы, вайрфреймы и сканы биллингов, переводя их напрямую в исполнимую логику системы.
Скорость и задержки
- Скорость генерации: DeepSeek-V4-Flash-0731 быстрее, достигая средней скорости вывода 122.7 токенов/с на стандартных корпоративных облачных эндпоинтах за счёт спекулятивного декодирования.
- Time to First Token (TTFT): GLM-5.3-Flash демонстрирует меньший TTFT — 1.21 секунды, против более 3.0 секунд у DeepSeek-V4-Flash, что делает его более отзывчивым в интерактивных чат-приложениях.
DeepSeek-V4-Flash vs GLM-5.3-Flash: Цены API
Обе модели предлагают крайне экономичные ценовые модели, делая их высококонкурентными по сравнению с традиционными плотными архитектурами.
Официальные тарифы API (за 1 миллион токенов)
| Price Layer | DeepSeek-V4-Flash-0731 (Peak) | DeepSeek-V4-Flash-0731 (Off-Peak) | GLM-5.3-Flash (Standard) | GLM-5.3-Flash (Promo - to Sep 9) |
|---|---|---|---|---|
| Input Price (Cache Miss) | $0.44 | $0.22 | $0.15 | $0.075 |
| Input Price (Cache Hit) | $0.014 | $0.007 | $0.03 | $0.015 |
| Output Price | $1.32 | $0.66 | $0.50 | $0.25 |
Вне пиковых часов DeepSeek-V4-Flash-0731 очень экономичен: вход стоит $0.22/MTok, выход — $0.66/MTok, при этом кэшированные входы обходятся в $0.007/MTok.
GLM-5.3-Flash предлагает конкурентные стандартные фиксированные тарифы ($0.15 за вход / $0.50 за выход) без надбавок в часы пик. Его промотариф (доступен до 9 сентября 2026 года) снижает стоимость до $0.075 и $0.25 соответственно, что делает его отличным вариантом для масштабных миграций и пакетной обработки.
Сильные и слабые стороны
DeepSeek-V4-Flash-0731
- Сильные стороны:
- Исключительная скорость генерации: До 122.7 токенов/с благодаря совместно обученной спекулятивной модели (DSpark).
- Экономия вне пиковых часов: Очень низкая стартовая ставка вне пика — $0.22 за вход и $0.66 за выход за миллион токенов.
- Сильная поддержка квантизации на CPU: Зрелая интеграция GGUF, высоко оптимизирована для локальных CPU-рантаймов и ограничений системной памяти.
- Компромиссы:
- Волатильность тарифов в часы пик: Цены API удваиваются в пиковые периоды (0.44/1.32 за MTok).
- Только текст в базовых весах: Стандартные веса не поддерживают нативное визуальное рассуждение, изображения или видео.
- Задержка первого токена: Более длительный TTFT по сравнению с GLM.
GLM-5.3-Flash
- Сильные стороны:
- Высокий уровень интеллекта: 57 баллов на Artificial Analysis Index.
- Нативная «vision-in-the-loop»: Интегрированная обработка изображений и видео в пост-обучении выравнивания, позволяющая визуально оценивать фронтенд-код.
- Исключительное сокращение кэша: Гибридные KDA и NoPE MLA уменьшают использование памяти в 4.44×, открывая более высокую локальную конкурентность.
- Плоские тарифы на длинный контекст: Стандартные цены остаются неизменными до 1M токенов с низкой ставкой при попадании в кэш ($0.03 стандарт, $0.015 промо).
- Компромиссы:
- Более медленный вывод токенов: Сырая скорость генерации ниже, чем у специализированного спекулятивного движка DeepSeek.
- Требования к оборудованию: Полноценный локальный хостинг MoE с 320B параметрами требует многосерверной GPU-среды несмотря на высокую разреженность.
| Model | Strengths | Trade-offs |
|---|---|---|
| DeepSeek-V4-Flash | Fast generation (122.7 tok/s in Artificial Analysis”); very cheap off-peak pricing; mature text quantization ecosystem; highly optimized for CPU-based local GGUF. | Peak hour rate variance; text-only base model (no native vision); slower TTFT. |
| GLM-5.3-Flash | 57 points on AA Intelligence; native multimodal parsing; 4.44× KV cache compression; flat pricing; fast TTFT (1.21s); MIT license. | Slightly slower raw token generation speed than DeepSeek; local multi-node deployments are hardware-intensive. |
DeepSeek-V4-Flash vs GLM-5.3-Flash: Что выбрать?
| Use case | Recommended | Why |
|---|---|---|
| Default frontier API | GLM-5.3-Flash | Scores higher on the intelligence index (57) and dominates multi-step agent benchmarks. |
| Long-running text agent | DeepSeek-V4-Flash | Blazing generation speed (122+ tok/s) makes it highly efficient for massive text/code generation. |
| Visual coding / UI workflows | GLM-5.3-Flash | Native multimodal design supports visual-in-the-loop debugging and UI rendering analysis. |
| Private/self-managed VPC | GLM-5.3-Flash | MIT licensed with KDA + NoPE MLA compression, which cuts hardware VRAM requirements by 4.44×. |
| Local CPU-only run | DeepSeek-V4-Flash | Stronger local GGUF quant support (92GB Unified Memory for extreme 1-bit or 3-bit runs). |
| Lower peak output cost | GLM-5.3-Flash | Standard output price of $0.50/MTok remains flat and is cheaper than DeepSeek's $1.32 peak output rate. |
| Heavy Prompt Caching | DeepSeek-V4-Flash | Off-peak cache hits cost an exceptionally low $0.007 per million tokens. |
Почему использовать Cometapi для доступа к DeepSeek-V4-Flash и GLM-5.3-Flash
Обе модели полностью интегрированы в CometAPI. Developers can accessDeepSeek-V4-Flash, and support for Chat Completions / Responses-style access and GLM-5.3-Flash model page exposes GLM-5.3-Flash through the unified CometAPI endpoint. That makes A/B testing easier because you can switch model IDs while keeping authentication and most application plumbing constant.
Заключение
Появление DeepSeek-V4-Flash-0731 и GLM-5.3-Flash изменило экономику развёртывания разреженных MoE с длинным контекстом. Обе архитектуры обеспечивают высокий интеллект при крайне низкой цене.
DeepSeek-V4-Flash-0731 — высоко оптимизированный текстово-кодовый движок, превосходящий по «сырой» скорости генерации, спекулятивному декодированию и локальной квантизации на CPU. GLM-5.3-Flash — серьёзный шаг вперёд для мультимодальных и агентных рабочих процессов, сочетая низкую задержку визуальных рассуждений с гибридным механизмом внимания, делающим on-prem хостинг высокоэффективным.
FAQs
Как назывался GLM-5.3-Flash в анонимном тесте?
До официального запуска GLM-5.3-Flash тестировалась анонимно на OpenRouter и OpenCode под кодовым названием «Ox Alpha», где быстро стала популярной среди разработчиков.
Могу ли я запускать эти модели локально на стандартном персональном компьютере?
Да, обе модели имеют открытые веса и доступны на Hugging Face. Однако из-за размеров параметров локальный хостинг требует значительного объёма унифицированной памяти:
- DeepSeek-V4-Flash-0731: Экстремальная 1-битная квантизация требует ~92GB RAM; настоятельно рекомендуется 3-битный запуск, который требует 110–135GB RAM.
- GLM-5.3-Flash: Экстремальная 1-битная квантизация требует ~100GB RAM, а 3-битные запуски лучше работают при 128GB–150GB унифицированной системной памяти.
Поддерживает ли DeepSeek-V4-Flash обработку изображений или видео?
Нет, стандартная DeepSeek-V4-Flash-0731 — это только текстовая модель. Для визуальных задач необходимо использовать их отдельную экспериментальную мультимодальную модель (deepseek-v4-flash-vision-exp).
Как работает «visual-in-the-loop» программирование в GLM-5.3-Flash?
Поскольку модель имеет нативное понимание изображений, она может писать фронтенд-код, анализировать визуально отрендеренный результат, обнаруживать ошибки в макете или стилях и переписывать код для исправления без необходимости, чтобы человек описывал проблемы верстки текстом.
Как Prompt Caching экономит деньги в этих моделях?
Если вы отправляете один и тот же большой контекст (например, кодовую базу или коллекцию документов) в нескольких API-вызовах, обе модели могут кэшировать этот промпт. В последующих вызовах они тарифицируют только по «cache-hit» ставке, которая составляет $0.007/MTok для DeepSeek-V4-Flash (вне пика) и $0.015/MTok для GLM-5.3-Flash (промо), что значительно снижает затраты на API.
