GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Исследования CometAPI

Цены API Qwen 3.8 Max: $2 за ввод, $6 за вывод, 1M контекста

Qwen 3.8 Max стоит $2/M на вход и $6/M на выход. Сравните плату за кэш, стоимость инструментов, реальные примеры, ограничения и рекомендации по миграции с Qwen 3.7.

CometAPI
Mia MarenКоманда исследователей AI-моделей и API
Обновлено Sep 3, 2026 10 мин. чтения
Цены API Qwen 3.8 Max: $2 за ввод, $6 за вывод, 1M контекста
Использовать этот подход

Сделайте первый вызов API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max стоит $2 за 1 миллион входных токенов и $6 за 1 миллион выходных токенов на QwenCloud. Специфичные для модели ставки кэша: $0.25/M за неявно кэшированный ввод, $2.50/M за явное создание кэша и $0.17/M за явные чтения кэша.

Те же стандартные ставки применяются в поддерживаемом моделью окне контекста на 1M токенов. Большие промпты стоят дороже потому, что содержат больше токенов, а не из‑за перехода в более высокий ценовой уровень для длинного контекста.

По прайс‑листу Qwen 3.8 Max на 20% дешевле, чем Qwen 3.7 Max. Однако Qwen 3.7 Max дешевле, пока действует текущая 50% промо‑акция. Лучший выбор для продакшена зависит от стоимости на одну принятую задачу, включая рассуждения, попадания в кэш, инструменты, ретраи, задержку и ручную проверку.

Qwen 3.8 Max API: цены одним взглядом

ПозицияТекущее официальное значение
Идентификатор продакшенаqwen3.8-max
Официальная дата релизаAugust 3, 2026
Архитектура2.4T всего параметров; 95B активных параметров
Стандартная цена ввода$2 / 1M токенов
Стандартная цена вывода$6 / 1M токенов
Неявно кэшированный ввод$0.25 / 1M токенов
Явное создание кэша$2.50 / 1M токенов
Явное чтение кэша$0.17 / 1M токенов
Окно контекста1M токенов
Максимальный ввод991K без thinking; 983K с thinking
Максимальный вывод131K
Максимальные рассуждения262K
Модальности вводаТекст, изображение и видео
Модальность выводаТекст
Референс‑лимиты QwenCloud2M TPM и 15K RPM

Страница модели QwenCloud — самый прямой источник актуального идентификатора модели, цен, ставок кэша, лимитов контекста и модальностей. Квоты по аккаунту и региону могут отличаться, поэтому используйте лимиты, показанные в вашей консоли, при настройке продакшен‑конкурентности.

Продакшен‑релиз также заменяет preview‑идентификатор на qwen3.8-max и добавляет полный модельный прайс‑лист. В материалах запуска Qwen описывает настройки усилий на рассуждение low, medium и xhigh, но продакшен‑поведение следует проверять на используемой конечной точке и в соответствующей API‑документации.

Важное примечание по срокам: Qwen объявил, что открытые веса последуют за релизом API. По состоянию на August 4, 2026, не описывайте Qwen 3.8 Max как загружаемую или саморазвёртываемую до публикации официального чекпойнта и лицензии.

Как работает ценообразование Qwen 3.8 Max

QwenCloud сейчас указывает плоскую стандартную ставку $2 за 1M входных токенов и $6 за 1M выходных токенов по всему поддерживаемому окну контекста в 1M токенов у Qwen 3.8 Max. Ниже приведён официальный снимок цен на August 4, 2026; всегда проверяйте актуальную страницу модели перед принятием бюджетных решений для продакшена.

Цены API Qwen 3.8 Max: $2 за ввод, $6 за вывод, 1M контекста

Источник***:*** QwenCloud, “Qwen3.8-Max” official

Элемент биллингаЦена за 1M токеновКогда применяется
Стандартный ввод$2.00Новое содержимое промпта, определения инструментов и некэшированный контекст
Стандартный вывод$6.00Сгенерированный вывод и биллинг за рассуждения
Неявное попадание в кэш$0.25Автоматически переиспользуемые префиксы промпта; попадания не гарантированы
Явное создание кэша$2.50Создание помеченного переиспользуемого префикса промпта
Явное чтение кэша$0.17Переиспользование валидного блока явного кэша

Таким образом, запрос на 900K токенов стоит дороже, чем запрос на 100K токенов, потому что обрабатывает в девять раз больше входных токенов — а не из‑за перехода в более высокий ценовой уровень.

Рассуждения могут увеличить стоимость выходных данных

Короткий видимый ответ не всегда низкостоимостный. Вызовы с включёнными рассуждениями могут генерировать дополнительные токены рассуждений, поэтому в продакшене следует использовать поля использования, возвращаемые API, а не длину видимого ответа.

Если ваша конечная точка поддерживает управление рассуждениями для qwen3.8-max, сравните доступные настройки на одном и том же наборе оценивания. Не предполагайте, что значения по умолчанию в preview переходят в GA‑модель.

Экономия на кэше зависит от стабильности промпта

Страница модели Qwen 3.8 Max публикует специфичные для модели ставки кэша. Используйте эти ставки — а не общие коэффициенты — при оценке расходов.

Записи явного кэша действительны в течение пяти минут, а успешное попадание сбрасывает этот период. Неявное кэширование работает автоматически, но попадание не гарантируется. Кэширование особенно полезно, когда системные промпты, определения инструментов, контекст репозитория или крупные документы остаются стабильными при частых вызовах.

Встроенные инструменты создают отдельные списания

QwenCloud сейчас указывает следующие сборы за инструменты в дополнение к использованию токенов:

Встроенный инструментТекущий сбор
Web Search$10 / 1K вызовов
Image Search$8 / 1K вызовов
Web ExtractorБесплатно на ограниченное время
Code InterpreterБесплатно на ограниченное время

Вызов функций и MCP не имеют отдельных сборов, но описания инструментов всё равно считаются входными токенами. Акции бесплатных инструментов могут меняться, поэтому перед финализацией бюджета проверьте руководство по ценам QwenCloud.

Например, запрос с 20K входных токенов, 2K выходных токенов и двумя вызовами Web Search будет стоить примерно:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

В этом примере два вызова поиска составляют около 27.8% общей стоимости запроса.

Примеры реальной стоимости Qwen 3.8 Max

Эти примеры используют текущие модельные ставки QwenCloud. Они не включают налоги, ретраи, фолбэки и наценку провайдера.

Пример 1: Средний запрос агента

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Успешная первая попытка стоит около $0.13. Один полный ретрай увеличит модельную стоимость до примерно $0.26.

Пример 2: Анализ длинного документа

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Модель не применяет отдельную наценку за длинный контекст по текущему прайс‑листу, но большие промпты всё равно создают значимые абсолютные расходы.

Пример 3: Сеанс агента с кэшем

Предположим переиспользуемый префикс на 100K токенов, 10K новых входных токенов, 5K выходных токенов и 50 вызовов при действительном явном кэше:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Оценочная экономия = $8.917, или 71.3%

Оценочная экономия зависит от успешных попаданий в кэш и стабильности префикса. Долгие паузы или частые изменения системных промптов и схем инструментов снизят выгоду.

Qwen 3.8 Max vs Qwen 3.7 Max:Сравнение цен

Qwen 3.8 Max на 20% дешевле, чем Qwen 3.7 Max по прайс‑листу, но Qwen 3.7 Max дешевле на 37.5% пока активна его текущая 50% промо‑акция.

Модель и статус ценВвод / 1MВывод / 1MКонтекст
qwen3.8-max стандартная цена$2.00$6.001M
qwen3.7-max прайс‑лист$2.50$7.501M
qwen3.7-max текущая акция$1.25$3.751M

Держите страницу модели CometAPI Qwen3.7 Max как фолбэк при тестировании новой модели.

Цена за токен — лишь часть решения. Qwen 3.8 Max может быть экономичнее, если повышает долю успешных попыток, надёжнее использует инструменты, снижает число ретраев или требует меньше ручных правок.

Используйте этот продакшен‑метрик:

Стоимость на принятую задачу =

(токены модели + вызовы инструментов + ретраи + фолбэк‑расходы + стоимость ревью)

÷ принятые результаты

Указанные вендором приросты в бенчмарках — причина ретестировать сложные кодовые и профессиональные рабочие процессы, а не доказательство того, что каждый ворклоад Qwen 3.7 должен мигрировать.

Как мигрировать на Qwen 3.8 Max

Изменить строку модели необходимо, но этого недостаточно для полной продакшен‑миграции.

1. Протестируйте продакшен‑ID модели

Замените preview‑идентификатор на qwen3.8-max в тестовой среде. Не предполагайте, что алиасы, значения по умолчанию, задержка или поведение ответов из preview сохранятся.

Минимальный запрос, совместимый с OpenAI, может выглядеть так:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Начните с минимально задокументированного запроса. Добавляйте управление рассуждениями только если текущая API‑справка для вашей конечной точки явно их поддерживает.

2. Перебазируйте телеметрию стоимости и производительности

Запишите как минимум:

  • входные, выходные и токены рассуждений
  • попадания в кэш и токены на создание кэша
  • время до первого токена и общую задержку
  • вызовы инструментов, ретраи и фолбэки
  • принятые против отклонённых результатов
  • время ручной коррекции

3. Повторно протестируйте интерфейс, который использует ваше приложение

Проверьте события стриминга, мультимодальные данные, схемы инструментов, структурированный вывод, причины завершения, поля использования, обработку ошибок и поведение в многотуровых диалогах. На странице модели описан доступ через DashScope и совместимость с OpenAI; проверьте любой дополнительный слой совместимости прежде, чем полагаться на него.

4. Соблюдайте практические лимиты контекста

Окно контекста 1M — это не то же самое, что пользовательский промпт на 1M токенов. QwenCloud указывает максимальный ввод 991K без thinking и 983K с thinking. Добавьте запас, чтобы в запросе осталось место для вывода и рассуждений.

5. Запустите Qwen 3.7 и Qwen 3.8 параллельно

Используйте идентичные промпты, инструменты, валидаторы, правила ретраев и датасеты. Сравнивайте стоимость на принятую задачу и задержку, а не оценивайте отдельные ответы «на глаз».

Как оценивать и маршрутизировать Qwen 3.8 Max

Используйте реальные ворклоады, а не средние значения бенчмарков.

ВорклоадПредлагаемые задачиОсновной сигнал принятия
Кодинг в репозитории4Тесты проходят без ручных правок
Анализ длинных документов3Утверждения подкреплены предоставленными доказательствами
Мультимодальный анализ2Релевантные детали изображений/видео использованы корректно
Агенты с инструментами3Корректный выбор инструментов и валидные аргументы
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Используйте Qwen 3.8 Max для сложной работы с репозиториями, долгосрочных агентов, мультимодального анализа и сценариев, где Qwen 3.7 не проходит приемочные тесты. Оставляйте Qwen 3.7 Max, когда промо‑акция существенно снижает стоимость и текущая модель уже соответствует целевому качеству.

Проверьте страницу цен CometAPI и актуальную информацию по маршрутизации перед фиксацией порогов, поскольку доступность у провайдера и маршрутизируемые цены могут меняться независимо от прямого прайс‑листа QwenCloud. CometAPI Cookbook поможет построить воспроизводимые запросы и единый каркас оценивания.

Часто задаваемые вопросы

Сколько стоит API Qwen 3.8 Max?

QwenCloud сейчас указывает для Qwen 3.8 Max $2 за 1 миллион входных токенов и $6 за 1 миллион выходных токенов. Использование кэша и встроенных инструментов имеет отдельные ставки.

Дорожает ли Qwen 3.8 Max выше 128K токенов?

Отдельного уровня цены для длинного контекста нет в текущем модельном прайс‑листе. Длинные запросы стоят дороже потому, что содержат больше токенов, а не из‑за перехода в более высокий тариф.

Биллинг за токены рассуждений Qwen 3.8 Max взимается?

Рассуждения могут увеличивать сгенерированное использование и итоговую стоимость. Используйте поля токенов рассуждений и вывода, возвращаемые конечной точкой, а не оценку по длине видимого ответа.

Является ли Qwen 3.8 Max открытым исходным кодом?

Qwen объявил, что открытые веса последуют за релизом API. Не описывайте модель как загружаемую или саморазвёртываемую, пока не доступны официальный чекпойнт и лицензия.

Стоит ли пользователям Qwen 3.7 Max мигрировать немедленно?

Не автоматически. У Qwen 3.8 Max ниже стандартная цена по прайс‑листу, тогда как Qwen 3.7 Max дешевле при текущей акции. Мигрируйте, когда ваши собственные данные по качеству, задержке, поведению кэша и стоимости на принятую задачу подтверждают смену.

Протестируйте Qwen 3.8 Max с CometAPI

Используйте CometAPI Quickstart для настройки клиента, совместимого с OpenAI. Перед отправкой продакшен‑трафика подтвердите, что qwen3.8-max активна в вашем аккаунте, и проверьте отображаемую там маршрутизируемую цену.

Сравните её с вашей базовой линией Qwen 3.7, используя идентичные промпты, валидаторы, политики ретраев и телеметрию. Это удерживает оценивание сфокусированным на модели, а не на изменениях в тестовом каркасе.

Продолжить обучение

Свяжите эту статью со следующим решением.

Посмотреть все темы
Опубликовано Aug 4, 2026
Последнее обновление Sep 3, 2026
199 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Готовы сократить затраты на AI-разработку на 20%?

Начните бесплатно за несколько минут. Пробные кредиты включены. Карта не нужна.

Читать далее