GPT-5.6 Luna price down 80%, Terra down 20% →

DeepSeek V4 Flash 0731 & DeepSeek Harness: Руководство по прорыву в агентном программировании (2026)

CometAPI
AnnaAug 9, 2026
DeepSeek V4 Flash 0731 & DeepSeek Harness: Руководство по прорыву в агентном программировании (2026)

TLDR DeepSeek-V4-Flash-0731 (released July 31, 2026) — это официальный, готовый к продакшену релиз эффективной модели Mixture-of-Experts DeepSeek (всего 284B / активных 13B параметров, контекст 1M токенов). Благодаря таргетированному посттренингу она обеспечивает резкий рост в агентном программировании, использовании инструментов и многошаговой разработке ПО. Имеет нативную поддержку Responses API и OpenAI Codex. DeepSeek Harness — сопутствующий агентный фреймворк (минимальный режим уже использовался в официальных оценках; полный релиз ожидается), призванный превратить модель в надежного автономного агента.

Вместе они предлагают одно из самых сильных соотношений цена/производительность среди открыто-весовых и доступных через API агентных ИИ по состоянию на август 2026 года.

Ключевые тезисы

  • Значительный агентный скачок исключительно за счет посттренинга: та же архитектура 284B/13B, что и в апрельском превью, но значительно более высокие баллы (например, Terminal Bench 2.1: 82.7 против 61.8; DeepSWE: 54.4 против 7.3).
  • Превосходит DeepSeek-V4-Pro (Preview) на множестве агентных бенчмарков, несмотря на существенно меньшее число активируемых параметров.
  • Конкурирует с ведущими проприетарными моделями (близко к Claude Opus 4.8 на ряде агентных задач) при гораздо более низкой стоимости.
  • Нативный контекст 1M, speculative decoding (DSpark), три уровня усилия рассуждения (low/high/max), лицензия MIT, открытые веса.
  • Официальная поддержка Responses API и Codex (CLI, desktop, расширение для VS Code).
  • DeepSeek Harness (минимальный режим уже использовался в оценках) — официальный агентный фреймворк в закрытой бете; публичный релиз ожидается скоро. DeepSeek Harness предоставляет слой рантайма агента; модель + harness = продакшен-агент.
  • Идеально для высокообъемных кодовых агентов, автоматизации терминала, использования инструментов и задач с длинным контекстом.
  • Доступ к моделям DeepSeek по доступной цене и с унифицированным туллингом через CometAPI (совместимая с OpenAI конечная точка, конкурентные цены, маршрутизация по нескольким моделям).

Что нового в DeepSeek V4 Flash 0731?

Изменение статуса официального релиза

Самое важное изменение продукта — DeepSeek V4 Flash 0731 теперь является официальным релизом DeepSeek V4 Flash в API, в публичной бете. Согласно журналу изменений DeepSeek от 31 июля, разработчики могут продолжать вызывать ту же модель, deepseek-v4-flash, чтобы получить доступ к последней версии. Это важно для миграции, поскольку исключает новый слаг модели и позволяет командам тестировать обновление в рамках существующей маршрутизации.

DeepSeek также заявляет, что обновление касается только API V4 Flash. API V4 Pro и модели в приложении/на вебе не изменялись релизом от 31 июля, и DeepSeek сообщил, что официальный релиз V4 Pro последует скоро. Иными словами, это не полный рефреш семейства DeepSeek V4. Это точечное обновление Flash.

Архитектура осталась прежней, изменился посттренинг

Базовая архитектура не изменилась: модель Mixture-of-Experts (MoE) с общим числом параметров 284 миллиарда и лишь 13 миллиардов активируемых на токен, гибридным вниманием, оптимизированным для длинного контекста, и нативным окном контекста в 1 миллион токенов. Для ускорения генерации подключен модуль speculative decoding (DSpark). Модель работает только с текстом, поддерживает настраиваемый уровень усилия рассуждения (low / high / max), вызов инструментов, структурированный вывод и распространяется под разрешительной лицензией MIT.

Это различие важно. Многие обновления моделей улучшаются благодаря увеличению размера модели. Это обновление примечательно тем, что DeepSeek заявляет о крупном агентном скачке без увеличения параметрического следа. V4 Flash остается моделью MoE с 284B общими и 13B активными параметрами, что на инференсе значительно меньше, чем дизайн V4 Pro с 1.6T общими и 49B активными параметрами.

Резкий рост показателей в агентном программировании

Официальная таблица DeepSeek демонстрирует значительные улучшения в задачах терминала, построения репозиториев, кибербезопасности, инженерии ПО, использования инструментов, автоматизации и full-stack разработки. Наибольший абсолютный скачок относительно предыдущей версии Flash — на DeepSWE: 54.4 против 7.3, рост на 47.1 пункта. Cybergym улучшился на 38.0 пункта, DSBench-Hard — на 33.8 пункта, а DSBench-FullStack — на 31.7 пункта.

Поэтому V4 Flash 0731 обсуждают не как обычную «быструю модель», а как кандидата в модель по умолчанию для кодовых агентов. Ценность — не только дешевый чат. Это недорогий, длинноконтекстный, дружелюбный к инструментам агентный инференс.

Появилась поддержка Responses API и Codex

Согласно июльскому журналу изменений, официальный V4 Flash нативно поддерживает формат Responses API и специально адаптирован под Codex. Руководство по Responses API от DeepSeek говорит, что формат добавлен в ответ на спрос со стороны Codex, использует базовый URL https://api.deepseek.com и в настоящее время поддерживает deepseek-v4-flash.

Это важно, поскольку рабочие процессы в стиле Codex — это не простые чат-сессии. Им нужны структурированные элементы ввода и вывода, элементы рассуждения, вызовы инструментов, операции изменения файлов, потоковые события, учет использования и интеграция с клиентами кодовых агентов. Поддержка DeepSeek — не идеальный клон всех возможностей OpenAI Responses API, но достаточна, чтобы сделать V4 Flash гораздо более практичным кандидатом для экспериментов с кодовыми агентами.

Результаты производительности для официальной версии V4-Flash

Важные оговорки по бенчмаркам, которые разработчикам не стоит игнорировать

Официальные результаты оценок (сообщенные DeepSeek на карточке модели) показывают крупные скачки относительно превью и, что примечательно, относительно гораздо большей V4-Pro Preview на агентно-центричных задачах. Для бенчмарков кодовых агентов использовался минимальный режим DeepSeek Harness (будет выпущен) при максимальном усилии рассуждения, temperature = 1.0, top_p = 0.95.

Отсюда два вывода. Во-первых, результат модели — частично результат модели и harness. Если ваш агентный рантайм имеет иные инструменты, разрешения shell, управление контекстом, повторные попытки, правила патчей или обработку ошибок, вы можете не получить те же баллы. Во-вторых, независимое воспроизведение ограничено, пока DeepSeek не предоставит достаточно harness и окружения оценок для внешних команд.

Официальная таблица бенчмарков DeepSeek

БенчмаркV4-Flash-0731V4-Flash PreviewV4-Pro PreviewGLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents’ Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7

По девяти бенчмаркам V4 Flash 0731 в среднем набирает 55.2. Старая версия V4 Flash preview — 29.6, а V4-Pro Preview — 34.9. Это означает, что V4 Flash 0731 примерно на 25.6 пункта выше Flash preview и на 20.3 пункта выше V4-Pro Preview в этой таблице.

Сигналы от третьих сторон

ARC Prize сообщает для V4 Flash 0731 при максимальном усилии 89.0% на ARC-AGI-1 Semi-Private и 61.4% на ARC-AGI-2 Semi-Private при указанных затратах $0.02 и $0.04 за задачу. Это не бенчмарки кодовых агентов, но они поддерживают широкую точку зрения, что модель конкурентоспособна на задачах рассуждения при более высоком усилии.

Особенно разительны приросты на DeepSWE (агентный цикл по инженерии ПО) и Cybergym. Независимые измерения (например, Artificial Analysis) сообщают немного ниже, но все же сильные показатели Terminal-Bench около 79%, подтверждая направление улучшения и напоминая, что цифры вендорского harness обычно оптимистичны.

Дополнительный контекст из более ранних оценок V4 и агрегаторов третьих сторон показывает сильные знания и производительность в коде в режиме максимального рассуждения (GPQA Diamond ~88–91%, LiveCodeBench — высокие 80–90-е, в зависимости от источника). Посттренинг 0731 специально разблокировал надежность агента, которой не хватало превью.

DeepSeek-V4-Flash теперь поддерживает Responses API и Codex

Стратегически важное дополнение — нативная поддержка OpenAI’s Responses API. Официальная документация DeepSeek подтверждает, что Responses API в настоящее время поддерживает deepseek-v4-flash (поддержка Pro ожидается в начале августа 2026). Базовый URL — https://api.deepseek.com.

Это значимое улучшение разработческого опыта. До поддержки Responses API и Codex DeepSeek V4 Flash уже можно было вызывать как текстовую модель, но кодовому агенту приходилось самостоятельно закрывать больше интеграционных деталей. Теперь модель можно использовать в рабочих процессах, ожидающих семантику Responses-стиля.

Что включает поддержка Responses API

Responses API DeepSeek создает ответ модели в формате OpenAI Responses API по адресу /responses. Responses API поддерживает model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, инструменты, выбор инструмента, усилие рассуждения, формат текста и отчетность об использовании. API является бестейтным, поэтому клиентам нужно отправлять полную историю диалога для многотуровых взаимодействий.

Самые важные детали совместимости — практические:

  • deepseek-v4-flash — единственная поддерживаемая модель для Responses API на данный момент.
  • Сообщения developer трактуются как system.
  • Поддерживаются function tools, стриминг, настраиваемое усилие рассуждения и серверный веб-поиск.
  • Пользовательский тип инструмента поддерживается только для apply_patch, что важно для совместимости с Codex.
  • Ввод изображений и файлов не поддерживается; части ввода изображений заменяются на текст-заглушку.
  • previous_response_id, conversation, store, фоновые режимы, метаданные и некоторые функции управления контекстом не поддерживаются.
  • Неподдерживаемые параметры могут быть тихо проигнорированы, поэтому в продакшене следует явно тестировать ожидаемое поведение.

Для разработчиков ключевой момент в том, что поддержка Responses API — это не просто синтаксис. Она позволяет DeepSeek V4 Flash занять протокольную «полосу», используемую современными кодовыми агентами, особенно там, где нужно единообразно представлять вызовы функций, потоковые события, элементы рассуждения и применение патчей.

Бестейтный дизайн (клиент управляет историей диалога). Пример (Python):

from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="Вы — полезный помощник по программированию.",
    input="Рефакторируйте эту функцию Python для лучшей читаемости...",
    reasoning={"effort": "max"}
)
print(response.output_text)

Полные детали и руководство по интеграции с Codex: DeepSeek API Docs – Responses API и Integrate with Codex.

Что означает поддержка Codex

Руководство по интеграции Codex от DeepSeek говорит, что Codex общается с моделями через Responses API, который DeepSeek теперь поддерживает нативно. Это позволяет прямую интеграцию с Codex (экосистема кодовых агентов OpenAI — CLI, настольное приложение ChatGPT и расширение Codex для VS Code).

Разработчики могут настроить кастомного провайдера один раз через скрипт установки или отредактировав ~/.codex/config.toml и файл каталога моделей. После настройки клиенты Codex распознают DeepSeek-V4-Flash и могут использовать его возможности вызова инструментов, apply_patch, веб-поиска и рассуждения.

DeepSeek V4 Flash против DeepSeek V4 Pro

АспектV4-Flash-0731V4-Pro (обычно / Preview)
Параметры (всего/активные)284B / 13B~1.6T / 49B
Окно контекста1M токенов1M токенов
Сильные стороныАгентное программирование, терминал, стоимость, скоростьМаксимально глубокие рассуждения, знания, самые сложные задачи
Преимущество на агентных бенчмаркахПобеждает на опубликованном наборе 0731Сильнее на чистых знаниях и сложных мультифайловых задачах в более ранних оценках
Типичное ценообразование API~$0.14 за вход / $0.28 за выход (при кэше — гораздо ниже)Существенно выше (исторически в 3–12 раз)
Рекомендуется дляВысоковолюмные агенты, продакшен-циклы кода, чувствительные к стоимости приложенияПередовые исследования, максимальные возможности одиночных задач
Открытые весаДа (MIT)Да (MIT)

С чего разработчикам начать?

По конкретным агентным бенчмаркам, опубликованным с 0731, более компактный Flash превосходит Pro preview по всем пунктам. Для чистого извлечения знаний или предельно сложных задач рассуждения Pro по-прежнему лидирует во многих независимых и более ранних оценках. На практике многие команды теперь по умолчанию используют Flash для большинства агентных нагрузок и маршрутизируют только самые требовательные задачи в Pro (или другие фронтирные модели).

Такая стратегия маршрутизации — область, где помогает CometAPI. Вместо жесткого закрепления одной модели под все задачи используйте CometAPI для централизации выбора модели, логирования, учета затрат и политик фолбэка. Например:

  • Используйте V4 Flash для суммаризации репозиториев, планирования рефакторинга, черновиков код-ревью, генерируемых тестов, структурированной экстракции, QA с длинным контекстом и повторяющихся агентных циклов.
  • Эскалируйте в V4 Pro или другую премиальную модель, когда задача несет высокий бизнес-риск, требования неясны, код в продакшене хрупок или повторяются неудачные попытки.
  • Отслеживайте конечную метрику, которая важна: принятые исправления на доллар, успешные задачи в час или сэкономленные минуты человеческого ревью.

Что такое DeepSeek Harness?

DeepSeek Harness — официальный агентный фреймворк/рантайм-слой, который DeepSeek создает, чтобы превращать свои модели в надежных автономных агентов. Компания формулирует уравнение просто: Model + Harness = Agent.

Официальные оценки V4-Flash-0731 уже использовали «минимальный режим» DeepSeek Harness. Полный продукт еще раскатывается (набор команды и раннее тестирование были активны в конце июля — начале августа 2026). Команду возглавляет Cui Tianyi (бэкграунд в системах количественного трейдинга), а описания вакансий подчеркивают глубокую интеграцию с возможностями DeepSeek-V4, такими как префикс-кэширование, управление длинным контекстом, оптимизация KV-кэша, цепочки использования инструментов, восстановление после ошибок и автоматические ретраи.

Harness — не универсальная обертка в стиле LangChain. Он разрабатывается вместе с моделью так, чтобы управление контекстом, оркестрация инструментов, сбор доказательств и циклы исправлений использовали специфические для V4 эффективности (разреженное внимание, кэширование, режимы рассуждения). Существуют и проекты сообщества, и сторонние harness, но официальный Harness нацелен на максимально тесную связку модель–рантайм.

Ожидается, что в полном релизе он предоставит:

  • Структурированные агентные циклы для программирования и автоматизации.
  • Ворота безопасности и процессы утверждения.
  • Эффективную работу с контекстом для задач с длинным горизонтом.
  • Наблюдаемость и производство артефактов.

До полного релиза разработчики уже могут получать сильные результаты, сочетая V4-Flash-0731 с существующими агентными фреймворками или используя связку Responses API + Codex.

Цены, доступность и практическое внедрение

  • Официальные цены API (приблизительно): $0.14 / 1M входных токенов (cache miss), ~$0.0028–0.03 при попадании в кэш, $0.28 / 1M выходных токенов. Высокие лимиты параллельности.
  • Открытые веса под MIT на Hugging Face; квантованные версии GGUF широко доступны для локального/самостоятельного хостинга (требуется значительный VRAM — полноточная версия велика).
  • Speculative decoding (DSpark) и гибридное внимание удерживают инференс с длинным контекстом относительно эффективным.
  • Поддерживаемые движки инференса: vLLM, SGLang и другие с документированными рецептами.

Для многих команд самый простой путь в продакшен — OpenAI-совместимый шлюз. CometAPI предлагает унифицированный доступ к моделям DeepSeek (включая серию V4) вместе со сотнями других моделей через единый endpoint (https://api.cometapi.com/v1). Преимущества включают упрощенную маршрутизацию по нескольким моделям, конкурентные или сниженные цены по сравнению с прямыми провайдерами, аналитику использования и возможность переключаться между Flash, Pro и другими моделями без изменения кода приложения. Это особенно полезно для агентных систем, которые могут резервироваться или маршрутизироваться по сложности/стоимости.

На момент этой статьи CometAPI для DeepSeek V4 Flash указывал стартовую входную цену $0.12 за 1M токенов, выходную — $0.24 за 1M токенов в сравнительной таблице, 100.0% аптайм за 24 часа и наблюдаемую задержку 2941 мс. DeepSeek также предупреждает, что общие цены API могут повыситься в ближайшем будущем. Поскольку цены провайдеров могут меняться, корректная формулировка: проверяйте актуальный каталог CometAPI и официальные цены DeepSeek перед планированием продакшен-бюджетов.

Практические рекомендации для разработчиков и команд

  1. Начинайте с Flash-0731 для агентного программирования — соотношение цена/производительность сейчас выдающееся для терминала, репозиториев и многократных инструментальных рабочих процессов. Для самых сложных задач используйте max reasoning effort + циклы в стиле Harness.
  2. Для локального инференса скачайте веса с Hugging Face и следуйте официальным рецептам vLLM/SGLang, включающим DSpark.
  3. Интегрируйтесь через Responses API, если уже используете Codex или хотите современные семантики вызова инструментов.
  4. Самостоятельно хостите или используйте квантованные веса для максимального контроля стоимости и приватности данных.
  5. Маршрутизируйте разумно — Flash для объема, Pro (или другие большие модели) для «длинного хвоста» ультрасложных задач.
  6. Рассмотрите CometAPI для упрощенного доступа к нескольким моделям, особенно если ваш стек уже смешивает DeepSeek с другими провайдерами.

Заключение

DeepSeek-V4-Flash-0731 — переломный момент в эффективном агентном ИИ. Доставляя фронтирно-конкурентную агентную производительность из относительно компактной MoE (13B активных) за счет сфокусированного посттренинга и сочетая ее с целевым Harness и современной совместимостью API (Responses + Codex), DeepSeek переопределил ожидания для экономичных кодовых и автоматизационных агентов.

Независимо от того, используете ли вы открытые веса локально, вызываете официальный API или маршрутизируете через единый шлюз вроде CometAPI, связка V4-Flash-0731 + развивающаяся экосистема Harness предлагает высокопроизводительную и экономичную основу для следующего поколения ИИ-агентов.

Частые вопросы

Что такое DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 — официальный публичный бета-релиз DeepSeek V4 Flash в DeepSeek API, объявленный в журнале изменений от 31 июля 2026. Он сменяет превью-версию, сохраняя то же имя модели deepseek-v4-flash.

Что нового в DeepSeek V4 Flash 0731?

Основные изменения: более сильные результаты на агентных бенчмарках, нативная поддержка Responses API, адаптация к Codex и повторно посттренированная официальная сборка V4 Flash. DeepSeek говорит, что архитектура и размер модели остались такими же, как у версии превью.

Поддерживает ли DeepSeek V4 Flash 0731 Codex?

Да. Руководство DeepSeek по Codex говорит, что только deepseek-v4-flash в настоящее время поддерживает интеграцию с Codex. Это работает через Responses API и может быть настроено для Codex CLI, настольного приложения ChatGPT и IDE-расширения Codex для VS Code.

Что такое DeepSeek Harness?

DeepSeek Harness — агентный фреймворк DeepSeek для превращения языковых моделей в автономных кодовых или рабочих агентов. Публичные описания определяют harness как слой, который управляет инструментами, контекстом, файлами, исполнением команд и многошаговыми рабочими процессами. DeepSeek использовал минимальный режим Harness в своем бенчмаркинге V4 Flash 0731.

Как получить доступ к DeepSeek V4 Flash через CometAPI?

Используйте совместимую с OpenAI конечную точку CometAPI с идентификатором модели deepseek-v4-flash. Страница модели CometAPI предоставляет примеры cURL, Python и JavaScript для /v1/chat/completions, а также спецификации модели, цены и информацию об аптайме.

Лучше ли DeepSeek V4 Flash, чем DeepSeek V4 Pro?

В таблице бенчмарков от 31 июля V4 Flash 0731 опережает V4-Pro Preview по указанным агентным бенчмаркам. Это не значит, что Flash всегда лучше Pro. V4 Pro больше по размеру и остается сильнее на многих задачах с большим объемом знаний и сложным рассуждением в карточке модели. Используйте Flash по умолчанию для чувствительных к стоимости агентных рабочих нагрузок и Pro как маршрут эскалации.

84 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Готовы сократить затраты на AI-разработку на 20%?

Начните бесплатно за несколько минут. Пробные кредиты включены. Карта не нужна.

Читать далее