TL;DR Qwen 3.8 Max стоит $2 за 1 миллион входных токенов и $6 за 1 миллион выходных токенов на QwenCloud. Специфичные для модели ставки кэша: $0.25/M за неявно кэшированный ввод, $2.50/M за явное создание кэша и $0.17/M за явные чтения кэша.
Те же стандартные ставки применяются в поддерживаемом моделью окне контекста на 1M токенов. Большие промпты стоят дороже потому, что содержат больше токенов, а не из‑за перехода в более высокий ценовой уровень для длинного контекста.
По прайс‑листу Qwen 3.8 Max на 20% дешевле, чем Qwen 3.7 Max. Однако Qwen 3.7 Max дешевле, пока действует текущая 50% промо‑акция. Лучший выбор для продакшена зависит от стоимости на одну принятую задачу, включая рассуждения, попадания в кэш, инструменты, ретраи, задержку и ручную проверку.
Qwen 3.8 Max API: цены одним взглядом
| Позиция | Текущее официальное значение |
|---|---|
| Идентификатор продакшена | qwen3.8-max |
| Официальная дата релиза | August 3, 2026 |
| Архитектура | 2.4T всего параметров; 95B активных параметров |
| Стандартная цена ввода | $2 / 1M токенов |
| Стандартная цена вывода | $6 / 1M токенов |
| Неявно кэшированный ввод | $0.25 / 1M токенов |
| Явное создание кэша | $2.50 / 1M токенов |
| Явное чтение кэша | $0.17 / 1M токенов |
| Окно контекста | 1M токенов |
| Максимальный ввод | 991K без thinking; 983K с thinking |
| Максимальный вывод | 131K |
| Максимальные рассуждения | 262K |
| Модальности ввода | Текст, изображение и видео |
| Модальность вывода | Текст |
| Референс‑лимиты QwenCloud | 2M TPM и 15K RPM |
Страница модели QwenCloud — самый прямой источник актуального идентификатора модели, цен, ставок кэша, лимитов контекста и модальностей. Квоты по аккаунту и региону могут отличаться, поэтому используйте лимиты, показанные в вашей консоли, при настройке продакшен‑конкурентности.
Продакшен‑релиз также заменяет preview‑идентификатор на qwen3.8-max и добавляет полный модельный прайс‑лист. В материалах запуска Qwen описывает настройки усилий на рассуждение low, medium и xhigh, но продакшен‑поведение следует проверять на используемой конечной точке и в соответствующей API‑документации.
Важное примечание по срокам: Qwen объявил, что открытые веса последуют за релизом API. По состоянию на August 4, 2026, не описывайте Qwen 3.8 Max как загружаемую или саморазвёртываемую до публикации официального чекпойнта и лицензии.
Как работает ценообразование Qwen 3.8 Max
QwenCloud сейчас указывает плоскую стандартную ставку $2 за 1M входных токенов и $6 за 1M выходных токенов по всему поддерживаемому окну контекста в 1M токенов у Qwen 3.8 Max. Ниже приведён официальный снимок цен на August 4, 2026; всегда проверяйте актуальную страницу модели перед принятием бюджетных решений для продакшена.

Источник***:*** QwenCloud, “Qwen3.8-Max” official
| Элемент биллинга | Цена за 1M токенов | Когда применяется |
|---|---|---|
| Стандартный ввод | $2.00 | Новое содержимое промпта, определения инструментов и некэшированный контекст |
| Стандартный вывод | $6.00 | Сгенерированный вывод и биллинг за рассуждения |
| Неявное попадание в кэш | $0.25 | Автоматически переиспользуемые префиксы промпта; попадания не гарантированы |
| Явное создание кэша | $2.50 | Создание помеченного переиспользуемого префикса промпта |
| Явное чтение кэша | $0.17 | Переиспользование валидного блока явного кэша |
Таким образом, запрос на 900K токенов стоит дороже, чем запрос на 100K токенов, потому что обрабатывает в девять раз больше входных токенов — а не из‑за перехода в более высокий ценовой уровень.
Рассуждения могут увеличить стоимость выходных данных
Короткий видимый ответ не всегда низкостоимостный. Вызовы с включёнными рассуждениями могут генерировать дополнительные токены рассуждений, поэтому в продакшене следует использовать поля использования, возвращаемые API, а не длину видимого ответа.
Если ваша конечная точка поддерживает управление рассуждениями для qwen3.8-max, сравните доступные настройки на одном и том же наборе оценивания. Не предполагайте, что значения по умолчанию в preview переходят в GA‑модель.
Экономия на кэше зависит от стабильности промпта
Страница модели Qwen 3.8 Max публикует специфичные для модели ставки кэша. Используйте эти ставки — а не общие коэффициенты — при оценке расходов.
Записи явного кэша действительны в течение пяти минут, а успешное попадание сбрасывает этот период. Неявное кэширование работает автоматически, но попадание не гарантируется. Кэширование особенно полезно, когда системные промпты, определения инструментов, контекст репозитория или крупные документы остаются стабильными при частых вызовах.
Встроенные инструменты создают отдельные списания
QwenCloud сейчас указывает следующие сборы за инструменты в дополнение к использованию токенов:
| Встроенный инструмент | Текущий сбор |
|---|---|
| Web Search | $10 / 1K вызовов |
| Image Search | $8 / 1K вызовов |
| Web Extractor | Бесплатно на ограниченное время |
| Code Interpreter | Бесплатно на ограниченное время |
Вызов функций и MCP не имеют отдельных сборов, но описания инструментов всё равно считаются входными токенами. Акции бесплатных инструментов могут меняться, поэтому перед финализацией бюджета проверьте руководство по ценам QwenCloud.
Например, запрос с 20K входных токенов, 2K выходных токенов и двумя вызовами Web Search будет стоить примерно:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
В этом примере два вызова поиска составляют около 27.8% общей стоимости запроса.
Примеры реальной стоимости Qwen 3.8 Max
Эти примеры используют текущие модельные ставки QwenCloud. Они не включают налоги, ретраи, фолбэки и наценку провайдера.
Пример 1: Средний запрос агента
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Успешная первая попытка стоит около $0.13. Один полный ретрай увеличит модельную стоимость до примерно $0.26.
Пример 2: Анализ длинного документа
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Модель не применяет отдельную наценку за длинный контекст по текущему прайс‑листу, но большие промпты всё равно создают значимые абсолютные расходы.
Пример 3: Сеанс агента с кэшем
Предположим переиспользуемый префикс на 100K токенов, 10K новых входных токенов, 5K выходных токенов и 50 вызовов при действительном явном кэше:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Оценочная экономия = $8.917, или 71.3%
Оценочная экономия зависит от успешных попаданий в кэш и стабильности префикса. Долгие паузы или частые изменения системных промптов и схем инструментов снизят выгоду.
Qwen 3.8 Max vs Qwen 3.7 Max:Сравнение цен
Qwen 3.8 Max на 20% дешевле, чем Qwen 3.7 Max по прайс‑листу, но Qwen 3.7 Max дешевле на 37.5% пока активна его текущая 50% промо‑акция.
| Модель и статус цен | Ввод / 1M | Вывод / 1M | Контекст |
|---|---|---|---|
| qwen3.8-max стандартная цена | $2.00 | $6.00 | 1M |
| qwen3.7-max прайс‑лист | $2.50 | $7.50 | 1M |
| qwen3.7-max текущая акция | $1.25 | $3.75 | 1M |
Держите страницу модели CometAPI Qwen3.7 Max как фолбэк при тестировании новой модели.
Цена за токен — лишь часть решения. Qwen 3.8 Max может быть экономичнее, если повышает долю успешных попыток, надёжнее использует инструменты, снижает число ретраев или требует меньше ручных правок.
Используйте этот продакшен‑метрик:
Стоимость на принятую задачу =
(токены модели + вызовы инструментов + ретраи + фолбэк‑расходы + стоимость ревью)
÷ принятые результаты
Указанные вендором приросты в бенчмарках — причина ретестировать сложные кодовые и профессиональные рабочие процессы, а не доказательство того, что каждый ворклоад Qwen 3.7 должен мигрировать.
Как мигрировать на Qwen 3.8 Max
Изменить строку модели необходимо, но этого недостаточно для полной продакшен‑миграции.
1. Протестируйте продакшен‑ID модели
Замените preview‑идентификатор на qwen3.8-max в тестовой среде. Не предполагайте, что алиасы, значения по умолчанию, задержка или поведение ответов из preview сохранятся.
Минимальный запрос, совместимый с OpenAI, может выглядеть так:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Начните с минимально задокументированного запроса. Добавляйте управление рассуждениями только если текущая API‑справка для вашей конечной точки явно их поддерживает.
2. Перебазируйте телеметрию стоимости и производительности
Запишите как минимум:
- входные, выходные и токены рассуждений
- попадания в кэш и токены на создание кэша
- время до первого токена и общую задержку
- вызовы инструментов, ретраи и фолбэки
- принятые против отклонённых результатов
- время ручной коррекции
3. Повторно протестируйте интерфейс, который использует ваше приложение
Проверьте события стриминга, мультимодальные данные, схемы инструментов, структурированный вывод, причины завершения, поля использования, обработку ошибок и поведение в многотуровых диалогах. На странице модели описан доступ через DashScope и совместимость с OpenAI; проверьте любой дополнительный слой совместимости прежде, чем полагаться на него.
4. Соблюдайте практические лимиты контекста
Окно контекста 1M — это не то же самое, что пользовательский промпт на 1M токенов. QwenCloud указывает максимальный ввод 991K без thinking и 983K с thinking. Добавьте запас, чтобы в запросе осталось место для вывода и рассуждений.
5. Запустите Qwen 3.7 и Qwen 3.8 параллельно
Используйте идентичные промпты, инструменты, валидаторы, правила ретраев и датасеты. Сравнивайте стоимость на принятую задачу и задержку, а не оценивайте отдельные ответы «на глаз».
Как оценивать и маршрутизировать Qwen 3.8 Max
Используйте реальные ворклоады, а не средние значения бенчмарков.
| Ворклоад | Предлагаемые задачи | Основной сигнал принятия |
|---|---|---|
| Кодинг в репозитории | 4 | Тесты проходят без ручных правок |
| Анализ длинных документов | 3 | Утверждения подкреплены предоставленными доказательствами |
| Мультимодальный анализ | 2 | Релевантные детали изображений/видео использованы корректно |
| Агенты с инструментами | 3 | Корректный выбор инструментов и валидные аргументы |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Используйте Qwen 3.8 Max для сложной работы с репозиториями, долгосрочных агентов, мультимодального анализа и сценариев, где Qwen 3.7 не проходит приемочные тесты. Оставляйте Qwen 3.7 Max, когда промо‑акция существенно снижает стоимость и текущая модель уже соответствует целевому качеству.
Проверьте страницу цен CometAPI и актуальную информацию по маршрутизации перед фиксацией порогов, поскольку доступность у провайдера и маршрутизируемые цены могут меняться независимо от прямого прайс‑листа QwenCloud. CometAPI Cookbook поможет построить воспроизводимые запросы и единый каркас оценивания.
Часто задаваемые вопросы
Сколько стоит API Qwen 3.8 Max?
QwenCloud сейчас указывает для Qwen 3.8 Max $2 за 1 миллион входных токенов и $6 за 1 миллион выходных токенов. Использование кэша и встроенных инструментов имеет отдельные ставки.
Дорожает ли Qwen 3.8 Max выше 128K токенов?
Отдельного уровня цены для длинного контекста нет в текущем модельном прайс‑листе. Длинные запросы стоят дороже потому, что содержат больше токенов, а не из‑за перехода в более высокий тариф.
Биллинг за токены рассуждений Qwen 3.8 Max взимается?
Рассуждения могут увеличивать сгенерированное использование и итоговую стоимость. Используйте поля токенов рассуждений и вывода, возвращаемые конечной точкой, а не оценку по длине видимого ответа.
Является ли Qwen 3.8 Max открытым исходным кодом?
Qwen объявил, что открытые веса последуют за релизом API. Не описывайте модель как загружаемую или саморазвёртываемую, пока не доступны официальный чекпойнт и лицензия.
Стоит ли пользователям Qwen 3.7 Max мигрировать немедленно?
Не автоматически. У Qwen 3.8 Max ниже стандартная цена по прайс‑листу, тогда как Qwen 3.7 Max дешевле при текущей акции. Мигрируйте, когда ваши собственные данные по качеству, задержке, поведению кэша и стоимости на принятую задачу подтверждают смену.
Протестируйте Qwen 3.8 Max с CometAPI
Используйте CometAPI Quickstart для настройки клиента, совместимого с OpenAI. Перед отправкой продакшен‑трафика подтвердите, что qwen3.8-max активна в вашем аккаунте, и проверьте отображаемую там маршрутизируемую цену.
Сравните её с вашей базовой линией Qwen 3.7, используя идентичные промпты, валидаторы, политики ретраев и телеметрию. Это удерживает оценивание сфокусированным на модели, а не на изменениях в тестовом каркасе.
