GPT-5.6 Luna price down 80%, Terra down 20% →

Цены на API Qwen 3.8 Max: $2 ввод, $6 вывод, 1M контекст

CometAPI
Mia MarenAug 4, 2026
Цены на API Qwen 3.8 Max: $2 ввод, $6 вывод, 1M контекст

Цены API Qwen 3.8 Max: $2 за вход, $6 за выход, контекст 1M

Кратко

Qwen 3.8 Max стоит $2 за 1M входных токенов и $6 за 1M выходных токенов на QwenCloud. Ставки кэша, специфичные для модели: $0.25/M за неявно кэшированный вход, $2.50/M за явное создание кэша и $0.17/M за чтение явного кэша.

Те же стандартные ставки за токены действуют во всем поддерживаемом окне контекста в 1M токенов. Большие подсказки стоят дороже, потому что содержат больше токенов, а не из‑за перехода в более высокий тарифный уровень для длинного контекста.

По прайс‑листу Qwen 3.8 Max на 20% дешевле, чем Qwen 3.7 Max. Однако Qwen 3.7 Max дешевле, пока активна текущая 50% промо‑акция. Лучший выбор для продакшена зависит от стоимости на одну принятую задачу с учетом рассуждений, попаданий в кэш, инструментов, повторных попыток, задержки и ручной проверки.

Краткий обзор цен на API Qwen 3.8 Max

ПунктТекущее официальное значение
Идентификатор производственной моделиqwen3.8-max
Официальная дата релизаAugust 3, 2026
Архитектура2.4T общих параметров; 95B активных параметров
Стандартная цена за вход$2 / 1M токенов
Стандартная цена за выход$6 / 1M токенов
Неявно кэшированный вход$0.25 / 1M токенов
Явное создание кэша$2.50 / 1M токенов
Явное чтение кэша$0.17 / 1M токенов
Окно контекста1M токенов
Максимальный вход991K без рассуждений; 983K с рассуждениями
Максимальный выход131K
Максимум рассуждений262K
Входные модальностиText, image, and video
Выходная модальностьText
Референсные лимиты QwenCloud2M TPM и 15K RPM

Страница модели на QwenCloud (https://www.qwencloud.com/models/qwen3.8-max) — самый прямой источник актуального идентификатора модели, цен, ставок кэша, лимитов контекста и модальностей. Квоты для аккаунта и региона могут отличаться, поэтому при настройке продакшен‑конкурентности используйте лимиты, отображаемые в вашей консоли.

Продакшен‑релиз также заменяет превью‑идентификатор на qwen3.8-max и добавляет полный прайс‑кард, специфичный для модели. Материалы запуска Qwen описывают уровни усилий рассуждений low, medium и xhigh, но поведение в продакшене следует проверять по используемой конечной точке и API‑справочнику.

Важное примечание: Qwen объявила, что открытые веса последуют за релизом API. По состоянию на August 4, 2026 не следует описывать Qwen 3.8 Max как доступную для загрузки или самостоятельного хостинга, пока не опубликованы официальный чекпоинт и лицензия.

Как устроено ценообразование Qwen 3.8 Max

В QwenCloud сейчас указана плоская стандартная ставка $2 за 1M входных токенов и $6 за 1M выходных токенов по всему поддерживаемому окну контекста в 1M токенов у Qwen 3.8 Max. Ниже приведен официальный снимок цен по состоянию на August 4, 2026; всегда проверяйте живую страницу модели перед принятием бюджетных решений для продакшена.

Цены на API Qwen 3.8 Max: $2 ввод, $6 вывод, 1M контекст

Источник***:*** QwenCloud, «Qwen3.8-Max», официальный

Позиция биллингаЦена за 1M токеновКогда применяется
Стандартный вход$2.00Новое содержимое подсказки, описания инструментов и некэшированный контекст
Стандартный выход$6.00Сгенерированный выход и биллинговые токены рассуждений
Попадание в неявный кэш$0.25Автоматически переиспользуемые префиксы подсказок; попадания не гарантированы
Создание явного кэша$2.50Создание помеченного к переиспользованию префикса подсказки
Чтение явного кэша$0.17Повторное использование валидного блока явного кэша

Запрос на 900K токенов стоит больше, чем запрос на 100K токенов, потому что обрабатывается в девять раз больше входных токенов — а не из‑за перехода в более высокий ценовой уровень.

Рассуждения могут увеличить стоимость выхода

Короткий видимый ответ не всегда дешевый. Вызовы с включенным режимом рассуждений могут генерировать дополнительные токены рассуждений, поэтому в продакшене следует опираться на поля usage, возвращаемые API, а не на видимую длину ответа.

Если ваша конечная точка поддерживает управление рассуждениями для qwen3.8-max, сравнивайте доступные настройки на одном и том же наборе оценивания. Не предполагайте, что параметры по умолчанию из превью переносятся в модель GA.

Экономия от кэша зависит от стабильности подсказки

Страница модели Qwen 3.8 Max публикует ставки кэша, специфичные для модели. Используйте именно эти ставки — а не общие коэффициенты кэширования — при оценке расходов.

Записи явного кэша имеют срок действия пять минут; успешное попадание сбрасывает этот срок. Неявное кэширование происходит автоматически, но попадание не гарантировано. Кэширование наиболее полезно, когда системные подсказки, описания инструментов, контекст репозитория или большие документы остаются стабильными при частых вызовах.

Встроенные инструменты создают отдельные сборы

QwenCloud в настоящее время указывает следующие сборы за встроенные инструменты вдобавок к использованию токенов:

Встроенный инструментТекущая плата
Web Search$10 / 1K вызовов
Image Search$8 / 1K вызовов
Web ExtractorБесплатно в течение ограниченного времени
Code InterpreterБесплатно в течение ограниченного времени

Function calling и MCP не имеют отдельной платы за инструменты, но описания инструментов по‑прежнему учитываются как входные токены. Бесплатные промо‑акции для инструментов могут меняться, поэтому перед финализацией продакшен‑бюджета проверьте руководство по ценам QwenCloud (https://docs.qwencloud.com/developer-guides/getting-started/pricing).

Например, запрос с 20K входных токенов, 2K выходных токенов и двумя вызовами Web Search будет стоить примерно:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

В этом примере два вызова поиска составляют около 27.8% общей стоимости запроса.

Примеры реальной стоимости Qwen 3.8 Max

Эти примеры используют текущие ставки, специфичные для модели, на QwenCloud. Налоги, повторные попытки, фолбэки и наценка провайдера исключены.

Пример 1: Запрос среднего агента

Предположим 50K входных токенов и 5K выходных токенов:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Успешная первая попытка стоит около $0.13. Одна полная повторная попытка увеличит стоимость модели примерно до $0.26.

Пример 2: Анализ длинного документа

Предположим 800K входных токенов и 20K выходных токенов:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

В текущем прайс‑карде модель не применяет отдельную наценку за длинный контекст, но большие подсказки все равно создают существенную абсолютную стоимость.

Пример 3: Сессия агента с кэшированием

Предположим, есть переиспользуемый префикс в 100K токенов, 10K новых входных токенов, 5K выходных токенов и 50 вызовов, пока действителен явный кэш:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Оценочная экономия = $8.917, или 71.3%

Оценочная экономия зависит от успешных попаданий в кэш и стабильного префикса. Длинные паузы или частые изменения системных подсказок и схем инструментов уменьшают выгоду.

Qwen 3.8 Max vs Qwen 3.7 Max: сравнение цен

Qwen 3.8 Max на 20% дешевле Qwen 3.7 Max по прайс‑листу, но Qwen 3.7 Max на 37.5% дешевле, пока активна текущая 50% промо‑акция.

Модель и статус ценообразованияВход / 1MВыход / 1MКонтекст
qwen3.8-max стандартная цена$2.00$6.001M
qwen3.7-max цена по прайс-листу$2.50$7.501M
qwen3.7-max текущая промо‑акция$1.25$3.751M

Держите под рукой страницу модели CometAPI Qwen3.7 Max (https://www.cometapi.com/models/aliyun/qwen3-7-max/) как фолбэк при тестировании новой модели.

Цена за токен — лишь часть решения. Qwen 3.8 Max может оказаться экономичнее, если повышает успех с первой попытки, надежнее использует инструменты, снижает число повторов или требует меньше ручной корректировки.

Используйте эту метрику для продакшена:

Стоимость за принятую задачу =

(токены модели + вызовы инструментов + повторы + расходы на фолбэк + стоимость проверки)

÷ количество принятых ответов

Сообщаемые вендором улучшения в бенчмарках — повод заново протестировать сложные кодовые и профессиональные процессы, а не доказательство того, что каждую нагрузку Qwen 3.7 нужно мигрировать.

Как перейти на Qwen 3.8 Max

Изменить строку модели необходимо, но этого недостаточно для полноценной продакшен‑миграции.

1. Проверьте производственный идентификатор модели

Замените превью‑идентификатор на qwen3.8-max в тестовой среде. Не предполагайте, что алиасы превью, значения по умолчанию, задержки или поведение ответов останутся неизменными.

Минимальный совместимый с OpenAI запрос может выглядеть так:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Начните с минимально документированного запроса. Добавляйте управление рассуждениями только тогда, когда текущая справка по API для вашей конечной точки явно их поддерживает.

2. Переснимите базовые метрики затрат и производительности

Запишите как минимум:

  • входные, выходные и токены рассуждений
  • попадания в кэш и токены на создание кэша
  • время до первого токена и общую задержку
  • вызовы инструментов, повторы и фолбэки
  • принятые против отклоненных ответов
  • время ручной правки

3. Повторно протестируйте интерфейс, который использует ваше приложение

Проверьте событийный стриминг, мультимодальные полезные нагрузки, схемы инструментов, структурированный вывод, причины завершения, поля usage, обработку ошибок и поведение в многошаговых диалогах. На странице модели задокументирован доступ через DashScope и OpenAI‑совместимый интерфейс; проверьте любой дополнительный слой совместимости перед тем, как на него полагаться.

4. Соблюдайте практические ограничения контекста

Окно контекста 1M — это не то же самое, что пользовательская подсказка на 1M токенов. QwenCloud указывает максимум входа 991K без рассуждений и 983K с рассуждениями. Добавьте запас, чтобы в запросе осталось место для выхода и рассуждений.

5. Запускайте Qwen 3.7 и Qwen 3.8 параллельно

Используйте идентичные подсказки, инструменты, валидаторы, правила повторов и датасеты. Сравнивайте стоимость за принятую задачу и задержку, а не оценивайте отдельные ответы «на глаз».

Как оценивать и маршрутизировать Qwen 3.8 Max

Используйте реальные рабочие нагрузки, а не усредненные бенчмарки.

НагрузкаРекомендуемые заданияОсновной сигнал приемки
Работа с репозиторием кода4Тесты проходят без ручных правок
Анализ длинных документов3Утверждения подтверждены предоставленными доказательствами
Мультимодальный анализ2Соответствующие детали изображения или видео используются корректно
Агенты с инструментами3Корректный выбор инструмента и валидные аргументы
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Используйте Qwen 3.8 Max для сложной работы с репозиториями, долгоживущих агентов, мультимодального анализа и рабочих процессов, где Qwen 3.7 не проходит приемочные тесты. Оставляйте Qwen 3.7 Max, если промо‑акция значительно снижает стоимость и существующая модель уже достигает вашей цели по качеству.

Проверьте страницу цен CometAPI (https://www.cometapi.com/pricing/) и актуальную информацию о маршрутизации перед установкой порогов — доступность провайдеров и маршрутизируемые цены могут меняться независимо от прямого прайс‑листа QwenCloud. CometAPI Cookbook (https://github.com/cometapi-dev/cometapi-cookbook) поможет вам собрать воспроизводимые запросы и единый стенд для оценки.

FAQ

Сколько стоит API Qwen 3.8 Max?

QwenCloud сейчас указывает Qwen 3.8 Max по $2 за 1 миллион входных токенов и $6 за 1 миллион выходных токенов. Использование кэша и встроенных инструментов тарифицируется отдельно.

Дороже ли Qwen 3.8 Max выше 128K токенов?

Отдельного тарифного уровня для длинного контекста в текущем прайс‑карде не показано. Длинные запросы стоят дороже, потому что содержат больше токенов, а не из‑за перехода в более высокий тариф.

Токены рассуждений в Qwen 3.8 Max тарифицируются?

Рассуждения могут увеличить сгенерированное использование и итоговую стоимость. Используйте поля токенов рассуждений и выхода, возвращаемые конечной точкой, вместо оценки по видимому ответу.

Является ли Qwen 3.8 Max открытым исходным проектом?

Qwen объявила, что открытые веса последуют за релизом API. Не описывайте модель как доступную для загрузки или самостоятельного хостинга, пока не будут доступны официальный чекпоинт и лицензия.

Должны ли пользователи Qwen 3.7 Max переходить немедленно?

Не автоматически. У Qwen 3.8 Max ниже стандартная цена по прайс‑листу, тогда как Qwen 3.7 Max дешевле в период текущей акции. Переходите, когда ваши собственные данные по качеству, задержке, поведению кэша и стоимости за принятую задачу подтверждают необходимость.

Тестируйте Qwen 3.8 Max с CometAPI

Используйте CometAPI Quickstart (https://www.cometapi.com/quickstart/), чтобы настроить клиент, совместимый с OpenAI. Перед отправкой продакшен‑трафика убедитесь, что qwen3.8-max активна в вашем аккаунте, и проверьте цену маршрутизации, отображаемую там.

Сравните ее с вашей базовой линией для Qwen 3.7, используя идентичные подсказки, валидаторы, политики повторов и телеметрию. Это позволяет сосредоточить оценку на модели, а не на изменениях в тестовом стенде.

Готовы сократить затраты на AI-разработку на 20%?

Начните бесплатно за несколько минут. Пробные кредиты включены. Карта не нужна.

Читать далее