Цены API Qwen 3.8 Max: $2 за вход, $6 за выход, контекст 1M
Кратко
Qwen 3.8 Max стоит $2 за 1M входных токенов и $6 за 1M выходных токенов на QwenCloud. Ставки кэша, специфичные для модели: $0.25/M за неявно кэшированный вход, $2.50/M за явное создание кэша и $0.17/M за чтение явного кэша.
Те же стандартные ставки за токены действуют во всем поддерживаемом окне контекста в 1M токенов. Большие подсказки стоят дороже, потому что содержат больше токенов, а не из‑за перехода в более высокий тарифный уровень для длинного контекста.
По прайс‑листу Qwen 3.8 Max на 20% дешевле, чем Qwen 3.7 Max. Однако Qwen 3.7 Max дешевле, пока активна текущая 50% промо‑акция. Лучший выбор для продакшена зависит от стоимости на одну принятую задачу с учетом рассуждений, попаданий в кэш, инструментов, повторных попыток, задержки и ручной проверки.
Краткий обзор цен на API Qwen 3.8 Max
| Пункт | Текущее официальное значение |
|---|---|
| Идентификатор производственной модели | qwen3.8-max |
| Официальная дата релиза | August 3, 2026 |
| Архитектура | 2.4T общих параметров; 95B активных параметров |
| Стандартная цена за вход | $2 / 1M токенов |
| Стандартная цена за выход | $6 / 1M токенов |
| Неявно кэшированный вход | $0.25 / 1M токенов |
| Явное создание кэша | $2.50 / 1M токенов |
| Явное чтение кэша | $0.17 / 1M токенов |
| Окно контекста | 1M токенов |
| Максимальный вход | 991K без рассуждений; 983K с рассуждениями |
| Максимальный выход | 131K |
| Максимум рассуждений | 262K |
| Входные модальности | Text, image, and video |
| Выходная модальность | Text |
| Референсные лимиты QwenCloud | 2M TPM и 15K RPM |
Страница модели на QwenCloud (https://www.qwencloud.com/models/qwen3.8-max) — самый прямой источник актуального идентификатора модели, цен, ставок кэша, лимитов контекста и модальностей. Квоты для аккаунта и региона могут отличаться, поэтому при настройке продакшен‑конкурентности используйте лимиты, отображаемые в вашей консоли.
Продакшен‑релиз также заменяет превью‑идентификатор на qwen3.8-max и добавляет полный прайс‑кард, специфичный для модели. Материалы запуска Qwen описывают уровни усилий рассуждений low, medium и xhigh, но поведение в продакшене следует проверять по используемой конечной точке и API‑справочнику.
Важное примечание: Qwen объявила, что открытые веса последуют за релизом API. По состоянию на August 4, 2026 не следует описывать Qwen 3.8 Max как доступную для загрузки или самостоятельного хостинга, пока не опубликованы официальный чекпоинт и лицензия.
Как устроено ценообразование Qwen 3.8 Max
В QwenCloud сейчас указана плоская стандартная ставка $2 за 1M входных токенов и $6 за 1M выходных токенов по всему поддерживаемому окну контекста в 1M токенов у Qwen 3.8 Max. Ниже приведен официальный снимок цен по состоянию на August 4, 2026; всегда проверяйте живую страницу модели перед принятием бюджетных решений для продакшена.

Источник***:*** QwenCloud, «Qwen3.8-Max», официальный
| Позиция биллинга | Цена за 1M токенов | Когда применяется |
|---|---|---|
| Стандартный вход | $2.00 | Новое содержимое подсказки, описания инструментов и некэшированный контекст |
| Стандартный выход | $6.00 | Сгенерированный выход и биллинговые токены рассуждений |
| Попадание в неявный кэш | $0.25 | Автоматически переиспользуемые префиксы подсказок; попадания не гарантированы |
| Создание явного кэша | $2.50 | Создание помеченного к переиспользованию префикса подсказки |
| Чтение явного кэша | $0.17 | Повторное использование валидного блока явного кэша |
Запрос на 900K токенов стоит больше, чем запрос на 100K токенов, потому что обрабатывается в девять раз больше входных токенов — а не из‑за перехода в более высокий ценовой уровень.
Рассуждения могут увеличить стоимость выхода
Короткий видимый ответ не всегда дешевый. Вызовы с включенным режимом рассуждений могут генерировать дополнительные токены рассуждений, поэтому в продакшене следует опираться на поля usage, возвращаемые API, а не на видимую длину ответа.
Если ваша конечная точка поддерживает управление рассуждениями для qwen3.8-max, сравнивайте доступные настройки на одном и том же наборе оценивания. Не предполагайте, что параметры по умолчанию из превью переносятся в модель GA.
Экономия от кэша зависит от стабильности подсказки
Страница модели Qwen 3.8 Max публикует ставки кэша, специфичные для модели. Используйте именно эти ставки — а не общие коэффициенты кэширования — при оценке расходов.
Записи явного кэша имеют срок действия пять минут; успешное попадание сбрасывает этот срок. Неявное кэширование происходит автоматически, но попадание не гарантировано. Кэширование наиболее полезно, когда системные подсказки, описания инструментов, контекст репозитория или большие документы остаются стабильными при частых вызовах.
Встроенные инструменты создают отдельные сборы
QwenCloud в настоящее время указывает следующие сборы за встроенные инструменты вдобавок к использованию токенов:
| Встроенный инструмент | Текущая плата |
|---|---|
| Web Search | $10 / 1K вызовов |
| Image Search | $8 / 1K вызовов |
| Web Extractor | Бесплатно в течение ограниченного времени |
| Code Interpreter | Бесплатно в течение ограниченного времени |
Function calling и MCP не имеют отдельной платы за инструменты, но описания инструментов по‑прежнему учитываются как входные токены. Бесплатные промо‑акции для инструментов могут меняться, поэтому перед финализацией продакшен‑бюджета проверьте руководство по ценам QwenCloud (https://docs.qwencloud.com/developer-guides/getting-started/pricing).
Например, запрос с 20K входных токенов, 2K выходных токенов и двумя вызовами Web Search будет стоить примерно:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
В этом примере два вызова поиска составляют около 27.8% общей стоимости запроса.
Примеры реальной стоимости Qwen 3.8 Max
Эти примеры используют текущие ставки, специфичные для модели, на QwenCloud. Налоги, повторные попытки, фолбэки и наценка провайдера исключены.
Пример 1: Запрос среднего агента
Предположим 50K входных токенов и 5K выходных токенов:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Успешная первая попытка стоит около $0.13. Одна полная повторная попытка увеличит стоимость модели примерно до $0.26.
Пример 2: Анализ длинного документа
Предположим 800K входных токенов и 20K выходных токенов:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
В текущем прайс‑карде модель не применяет отдельную наценку за длинный контекст, но большие подсказки все равно создают существенную абсолютную стоимость.
Пример 3: Сессия агента с кэшированием
Предположим, есть переиспользуемый префикс в 100K токенов, 10K новых входных токенов, 5K выходных токенов и 50 вызовов, пока действителен явный кэш:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Оценочная экономия = $8.917, или 71.3%
Оценочная экономия зависит от успешных попаданий в кэш и стабильного префикса. Длинные паузы или частые изменения системных подсказок и схем инструментов уменьшают выгоду.
Qwen 3.8 Max vs Qwen 3.7 Max: сравнение цен
Qwen 3.8 Max на 20% дешевле Qwen 3.7 Max по прайс‑листу, но Qwen 3.7 Max на 37.5% дешевле, пока активна текущая 50% промо‑акция.
| Модель и статус ценообразования | Вход / 1M | Выход / 1M | Контекст |
|---|---|---|---|
| qwen3.8-max стандартная цена | $2.00 | $6.00 | 1M |
| qwen3.7-max цена по прайс-листу | $2.50 | $7.50 | 1M |
| qwen3.7-max текущая промо‑акция | $1.25 | $3.75 | 1M |
Держите под рукой страницу модели CometAPI Qwen3.7 Max (https://www.cometapi.com/models/aliyun/qwen3-7-max/) как фолбэк при тестировании новой модели.
Цена за токен — лишь часть решения. Qwen 3.8 Max может оказаться экономичнее, если повышает успех с первой попытки, надежнее использует инструменты, снижает число повторов или требует меньше ручной корректировки.
Используйте эту метрику для продакшена:
Стоимость за принятую задачу =
(токены модели + вызовы инструментов + повторы + расходы на фолбэк + стоимость проверки)
÷ количество принятых ответов
Сообщаемые вендором улучшения в бенчмарках — повод заново протестировать сложные кодовые и профессиональные процессы, а не доказательство того, что каждую нагрузку Qwen 3.7 нужно мигрировать.
Как перейти на Qwen 3.8 Max
Изменить строку модели необходимо, но этого недостаточно для полноценной продакшен‑миграции.
1. Проверьте производственный идентификатор модели
Замените превью‑идентификатор на qwen3.8-max в тестовой среде. Не предполагайте, что алиасы превью, значения по умолчанию, задержки или поведение ответов останутся неизменными.
Минимальный совместимый с OpenAI запрос может выглядеть так:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Начните с минимально документированного запроса. Добавляйте управление рассуждениями только тогда, когда текущая справка по API для вашей конечной точки явно их поддерживает.
2. Переснимите базовые метрики затрат и производительности
Запишите как минимум:
- входные, выходные и токены рассуждений
- попадания в кэш и токены на создание кэша
- время до первого токена и общую задержку
- вызовы инструментов, повторы и фолбэки
- принятые против отклоненных ответов
- время ручной правки
3. Повторно протестируйте интерфейс, который использует ваше приложение
Проверьте событийный стриминг, мультимодальные полезные нагрузки, схемы инструментов, структурированный вывод, причины завершения, поля usage, обработку ошибок и поведение в многошаговых диалогах. На странице модели задокументирован доступ через DashScope и OpenAI‑совместимый интерфейс; проверьте любой дополнительный слой совместимости перед тем, как на него полагаться.
4. Соблюдайте практические ограничения контекста
Окно контекста 1M — это не то же самое, что пользовательская подсказка на 1M токенов. QwenCloud указывает максимум входа 991K без рассуждений и 983K с рассуждениями. Добавьте запас, чтобы в запросе осталось место для выхода и рассуждений.
5. Запускайте Qwen 3.7 и Qwen 3.8 параллельно
Используйте идентичные подсказки, инструменты, валидаторы, правила повторов и датасеты. Сравнивайте стоимость за принятую задачу и задержку, а не оценивайте отдельные ответы «на глаз».
Как оценивать и маршрутизировать Qwen 3.8 Max
Используйте реальные рабочие нагрузки, а не усредненные бенчмарки.
| Нагрузка | Рекомендуемые задания | Основной сигнал приемки |
|---|---|---|
| Работа с репозиторием кода | 4 | Тесты проходят без ручных правок |
| Анализ длинных документов | 3 | Утверждения подтверждены предоставленными доказательствами |
| Мультимодальный анализ | 2 | Соответствующие детали изображения или видео используются корректно |
| Агенты с инструментами | 3 | Корректный выбор инструмента и валидные аргументы |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Используйте Qwen 3.8 Max для сложной работы с репозиториями, долгоживущих агентов, мультимодального анализа и рабочих процессов, где Qwen 3.7 не проходит приемочные тесты. Оставляйте Qwen 3.7 Max, если промо‑акция значительно снижает стоимость и существующая модель уже достигает вашей цели по качеству.
Проверьте страницу цен CometAPI (https://www.cometapi.com/pricing/) и актуальную информацию о маршрутизации перед установкой порогов — доступность провайдеров и маршрутизируемые цены могут меняться независимо от прямого прайс‑листа QwenCloud. CometAPI Cookbook (https://github.com/cometapi-dev/cometapi-cookbook) поможет вам собрать воспроизводимые запросы и единый стенд для оценки.
FAQ
Сколько стоит API Qwen 3.8 Max?
QwenCloud сейчас указывает Qwen 3.8 Max по $2 за 1 миллион входных токенов и $6 за 1 миллион выходных токенов. Использование кэша и встроенных инструментов тарифицируется отдельно.
Дороже ли Qwen 3.8 Max выше 128K токенов?
Отдельного тарифного уровня для длинного контекста в текущем прайс‑карде не показано. Длинные запросы стоят дороже, потому что содержат больше токенов, а не из‑за перехода в более высокий тариф.
Токены рассуждений в Qwen 3.8 Max тарифицируются?
Рассуждения могут увеличить сгенерированное использование и итоговую стоимость. Используйте поля токенов рассуждений и выхода, возвращаемые конечной точкой, вместо оценки по видимому ответу.
Является ли Qwen 3.8 Max открытым исходным проектом?
Qwen объявила, что открытые веса последуют за релизом API. Не описывайте модель как доступную для загрузки или самостоятельного хостинга, пока не будут доступны официальный чекпоинт и лицензия.
Должны ли пользователи Qwen 3.7 Max переходить немедленно?
Не автоматически. У Qwen 3.8 Max ниже стандартная цена по прайс‑листу, тогда как Qwen 3.7 Max дешевле в период текущей акции. Переходите, когда ваши собственные данные по качеству, задержке, поведению кэша и стоимости за принятую задачу подтверждают необходимость.
Тестируйте Qwen 3.8 Max с CometAPI
Используйте CometAPI Quickstart (https://www.cometapi.com/quickstart/), чтобы настроить клиент, совместимый с OpenAI. Перед отправкой продакшен‑трафика убедитесь, что qwen3.8-max активна в вашем аккаунте, и проверьте цену маршрутизации, отображаемую там.
Сравните ее с вашей базовой линией для Qwen 3.7, используя идентичные подсказки, валидаторы, политики повторов и телеметрию. Это позволяет сосредоточить оценку на модели, а не на изменениях в тестовом стенде.
