Qwen3.8-Flash explained: 1M context, 6B active MoE design, coding and multimodal benchmarks, price-performance, comparisons, and CometAPI access.
TL;DR Qwen3.8-Flash от Alibaba — продукционная модель для высоконагруженного кодинга, агентных сценариев, задач с длинным контекстом и мультимодальности. Поддерживает хостинговый контекст на 1M токенов, сочетает высокие результаты на бенчмарках с низкой ценой API. Открытая версия с весами, Qwen3.8-Flash-Next, доступна для локальной оценки и развёртывания.
Ключевые тезисы
- Именование: продукционная vs. open-weight: Qwen3.8-Flash — это хостинговая продукционная модель; Qwen3.8-Flash-Next — релиз архитектуры с открытыми весами, на базе которого опубликованы детали модели и бенчмарки.
- Экстремально разреженная активация: 125B основных параметров + 51B N-граммных эмбеддингов, при этом только 6B активных параметров на токен.
- Длинный контекст: 262K нативного контекста в открытой модели, расширяемого до 1M с YaRN; в продукционном маршруте QwenCloud по умолчанию доступен контекст 1M.
- Сильный агентный кодинг: Qwen сообщает 62.5 на SWE-bench Pro, 73.9 на CoWorkBench, 73.5 на Toolathlon Verified и 91.9 на LiveCodeBench v6.
- Мультимодальные возможности: Qwen сообщает 84.5 на AndroidWorld, 88.5 на RealWorldQA и 90.6 на MathVision без интерпретатора кода.
- Эффективность: QSA достигает до 7.6x ускорения prefill и 4.9x decode ядра при 1M токенов, а также Qwen сообщает 8.6x более высокую пропускную способность предзаполнения на 1M токенов, чем Qwen3.7-Plus, в конфигурации сервинга с высоким уровнем попаданий в кэш префикса.
- Цены: Alibaba Cloud сейчас указывает US$0.15/M на вход и US$0.47/M на выход для международного развёртывания; CometAPI указывает US$0.12/M на вход и US$0.376/M на выход.
Официальное изображение запуска Qwen3.8-Flash — источник Alibaba/Qwen
Что такое Qwen3.8-Flash?
Qwen3.8-Flash — ориентированная на эффективность продукционная модель Alibaba Qwen для кодинга, агентных сценариев, длинноконтекстной работы с знанием и мультимодальных задач. Модель была анонсирована вместе с открытой версией с весами под названием Qwen3.8-Flash-Next. Alibaba описывает её как открытую по весам мультимодальную MoE-модель, оптимизированную по возможностям, задержкам и стоимости, и называет архитектуру ранним превью идей для Qwen4.
Маркировка “Flash” важна. Qwen3.8-Max — более крупный флагманский уровень для максимальных возможностей, тогда как Qwen3.8-Flash создана, чтобы дать значимую полезность в кодинге и агентных задачах при резко меньших активных вычислениях. Релиз активирует 6B параметров на токен, по сравнению с гораздо большими активными бюджетами у флагманских MoE-систем.
Продукционная модель сервится под ID qwen3.8-flash. QwenCloud поддерживает совместимые с OpenAI Chat Completions и Responses API, а также совместимый с Anthropic интерфейс, что делает модель легко интегрируемой в существующие агентные и кодинговые стеки.
Qwen3.8-Flash vs. Qwen3.8-Flash-Next: в чём разница?
Qwen3.8-Flash-Next — релиз модели с открытыми весами. Он раскрывает архитектуру, веса, рекомендации по развёртыванию и набор бенчмарков. Веса доступны на Hugging Face и ModelScope. Открытая модель поддерживает нативное контекстное окно 262,144 токена и может быть расширена до 1M с YaRN.
Qwen3.8-Flash — продукционная версия в API. В официальном релизе Alibaba говорит, что продукционная версия по умолчанию использует контекст 1M и включает встроенные инструменты. На практике разработчикам, оценивающим хостинговую модель, следует ориентироваться на поведение и цены API Qwen3.8-Flash, тогда как релиз Flash-Next — лучший публичный источник по архитектуре и бенчмаркам.
Спецификации Qwen3.8-Flash
| Спецификация | Qwen3.8-Flash / Flash-Next |
|---|---|
| Провайдер | Alibaba Qwen |
| ID продукционной модели | qwen3.8-flash |
| Модель с открытыми весами | Qwen3.8-Flash-Next |
| Архитектура | Мультимодальная Mixture-of-Experts; гибрид GDN + QSA |
| Основные параметры | 125B |
| Активируемые параметры | 6B на токен |
| Параметры N-грамм эмбедд. | 51B |
| Нативный контекст (open) | 262,144 токена |
| Расширённый/хостинговый | До 1,000,000 токенов |
| Модальности (продукция) | Текст + изображение (в офиц. примерах интеграций) |
| Модальности (open-weights) | Текст + зрение; мультимодальная |
| Контроль рассуждений | low / medium / xhigh в примерах QwenCloud |
| Параллельные tool-calls | Поддерживаются в офиц. конфиге Codex |
| Открытые веса | Да, для Qwen3.8-Flash-Next |
| Дата запуска | Окно релиза 26–27 августа 2026 |
Ключевая цифра эффективности — 6B активируемых параметров на токен. Дополнительные 51B параметров N-граммных эмбеддингов — это ёмкость на базе lookup; Qwen отмечает, что они не входят в бюджет матричных умножений на токен в том же виде, что и веса трансформера.
Что нового в архитектуре Qwen3.8-Flash?
Официальная схема архитектуры Qwen — Qwen3.8-Flash-Next
1. GDN + Qwen Sparse Attention (QSA)
Модель сочетает два механизма. Три из каждых четырёх слоёв используют Gated DeltaNet (GDN) для сжатия исторической информации в состояние фиксированного размера, а оставшийся слой применяет глобальное внимание для точного извлечения. Затем слой с глобальным вниманием использует Qwen Sparse Attention, чтобы сократить объём контекста, требующего прямой обработки.
Практическая цель проста: GDN управляет «дешёвой» памятью, тогда как QSA расходует полное внимание лишь там, где важно извлечение. Это особенно ценно для приложений с длинным контекстом, где обычное полное внимание становится дорогим как по вычислениям, так и по трафику KV-кэша.
2. Gated Residual с четырьмя путями информации
Gated Residual расширяет резидуальный поток до четырёх параллельных ветвей. Динамический покомпонентный шлюз контролирует, сколько информации читается из каждой ветви и записывается в неё. Это даёт ранней информации больше способов «выжить» в глубоких сетях, вместо того чтобы постоянно смешиваться в один поток. Qwen также сообщает, что резидуальное состояние может храниться в FP8 для уменьшения трафика памяти.
3. N-граммные эмбеддинги добавляют ёмкость без пропорциональных вычислений
Qwen добавляет 51B параметров N-граммных эмбеддингов, адресуемых с использованием локального контекста токена. В отличие от обычных весов трансформера, эти параметры извлекаются через операции lookup и могут быть выгружены в хостовую память с асинхронным предвыбором. Дизайн расширяет ёмкость модели при низкой арифметике на токен.
4. Оптимизатор Muon и кодизайн обучения
Qwen обучает модель с оптимизатором Muon для основных 2D линейных карт, сохраняя AdamW для эмбеддингов, роутеров и отдельных низкоранговых параметров. Команда также скорректировала закон масштабирования для новой архитектуры и сообщает, что разогрев размера батча не требовался, избежав 18.8% дополнительных шагов оптимизатора в экспериментах.
5. Ультра-разреженное MoE и многотокеновое предсказание
Модель сохраняет крупный пул экспертов, но маршрутизирует лишь небольшое число экспертов на токен. Также применяется многотокеновое предсказание, что помогает спекулятивному декодированию за счёт повышения доли принятых токенов и одновременно улучшает бэкбон при обучении. Вместе эти решения поддерживают одну и ту же цель: больше ёмкости и пропускной способности без «флагманских» вычислений на каждом токене.
Результаты Qwen3.8-Flash на бенчмарках
Кодинговые бенчмарки
Alibaba публикует набор бенчмарков под Qwen3.8-Flash-Next, открытой версией с весами продукционной Qwen3.8-Flash. Следующие таблицы используют релизные оценки Qwen и фокусируются на соперниках, доступных также через CometAPI.

Официальный график языковых бенчмарков Qwen
| Бенчмарк | Qwen3.8-Flash | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 54.4 | — |
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | — | 77.5 |
| NL2Repo-Bench | 48.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 45.1 | 68.2 |
| JobBench | 55.7 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 70.3 | — |
| IFBench | 81.3 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 90.8 | 91.3 |
| HLE | 35.9 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.6 | 88.8 |
Итог по кодингу: Qwen3.8-Flash лидирует над выбранными соперниками на SWE-bench Pro (62.5), SWE-bench Multilingual (81.0) и LiveCodeBench v6 (91.9). Существенное исключение — NL2Repo-Bench, где DeepSeek V4 Flash набирает 54.2 против 48.1.
Итог по агентам: Qwen3.8-Flash показывает 73.9 на CoWorkBench и 55.7 на JobBench, заметно выше выбранных соперников в таблице релиза Qwen. Также опережает DeepSeek V4 Flash на Toolathlon Verified: 73.5 против 70.3.
Итог по рассуждениям: Поле плотнее. Qwen3.8-Flash набирает 91.7 на GPQA Diamond, рядом с Claude Opus 4.6 (91.3) и DeepSeek V4 Flash (90.8). На HLE лидирует Claude Opus 4.6 с 40.0 против 35.9 у Qwen.
Мультимодальные бенчмарки

Официальный график бенчмарков «зрение-язык» Qwen
| Бенчмарк | Qwen3.8-Flash | Claude Opus 4.6 |
|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 52.5 / 54.7 |
| AndroidWorld | 84.5 | 62.0 |
| ERQA | 72.3 | 40.8 |
| LVBench | 76.6 | 63.0 |
| RealWorldQA | 88.5 | 73.9 |
| MathVision (no CI / with CI) | 90.6 / 95.7 | 65.5 / — |
| CharXiv RQ (no CI / with CI) | 84.6 / 90.6 | 66.0 / — |
Релизные мультимодальные результаты — один из сильнейших аргументов в пользу Qwen3.8-Flash. Qwen сообщает 84.5 на AndroidWorld, 88.5 на RealWorldQA и 90.6 на MathVision без интерпретатора кода. Эти оценки указывают, что модель предназначена для агентов, которым нужно читать экраны, понимать визуальное состояние и продолжать действовать, а не только отвечать на вопросы по изображениям.
Примечание по бенчмаркам: Это результаты, заявленные вендором, а не нейтральный head-to-head лабораторный тест. Несколько бенчмарков используют разные обвязки или конфигурации инструментов, некоторые — внутренние. Рассматривайте числа как направляющие данные и валидируйте модель на собственных промптах, инструментах, целевых задержках и критериях приёмки.
Почему Qwen3.8-Flash быстра и экономична

Официальный график эффективности на длинном контексте Qwen
На контексте 1M токенов Qwen сообщает до 7.6x быстрее предзаполнение и 4.9x быстрее декодирование для ядра внимания QSA. В эксперименте сервинга с 90% попаданий в кэш префикса Qwen3.8-Flash-Next достигла 8.6x пропускной способности предзаполнения относительно Qwen3.7-Plus.
Главная системная история — активные вычисления. Основная модель на 125B обычно выглядит крупной, но активируется лишь 6B параметров на токен. Этот активный след менее чем вдвое больше 13B активируемых параметров, заявленных для DeepSeek V4 Flash, и значительно ниже примерно 95B активных параметров, сообщаемых для Qwen3.8-Max. Количество параметров не линейно конвертируется в скорость, но дизайн задаёт Qwen3.8-Flash чёткую цель по эффективности.
Alibaba также сообщает, что обучение потребовало примерно одной девятой ресурсов относительно Qwen3.7-Plus, при этом улучшив показатели в кодинге и офисных задачах. Отдельно сообщается, что режим QwenWork Standard на базе этой модели сокращает потребление токенов на задачу на 75% и примерно вдвое ускоряет генерацию по сравнению с прежним режимом. Эти продуктовые цифры не следует считать универсальными гарантиями латентности API, но они показывают ожидаемые сценарии применения.
Цены Qwen3.8-Flash
В анонсе запуска Alibaba указывает цены QwenCloud $0.16 за миллион входных токенов и $0.47 за миллион выходных токенов. Цены могут варьироваться по регионам, поверхностям продукта, кэшированию и со временем; боевые команды всегда должны проверять актуальную страницу провайдера перед оценкой крупной нагрузки.
На момент подготовки этой статьи CometAPI указывает Qwen3.8-Flash по $0.12 за миллион входных токенов и примерно $0.376 за миллион выходных токенов. Страница модели на CometAPI помечает это как скидку 20% относительно указанной справочной цены.
| Маршрут | Вход / 1M токенов | Выход / 1M токенов | Пример: 10M вход + 2M выход |
|---|---|---|---|
| Тариф QwenCloud (запуск) | $0.16 | $0.47 | $2.54 |
| Тариф CometAPI | $0.12 | ~$0.376 | ~$1.95 |
Для нагрузки с 10 миллионов входных токенов и 2 миллионов выходных токенов арифметика стартовых тарифов ~ $2.54 на QwenCloud против ~ $1.95 по текущему тарифу CometAPI. Реальные счета агентов могут быть выше, поскольку вызовы инструментов, ретраи, длинные рассуждения, повторяющийся контент и внешние сервисы добавляют стоимость. Сравнивайте стоимость за принятый результат, а не только цену токена.
Qwen3.8-Flash vs. Qwen3.8-Max vs DeepSeek V4 Flash
| Измерение | Qwen3.8-Flash | Qwen3.8-Max | Gemini 3.7 Flash | DeepSeek V4 Flash |
|---|---|---|---|---|
| Позиционирование | Qwen с приоритетом эффективности | Флагманская модель Qwen | Рабочая «Flash»-модель Google | Текст-ориентированная MoE с приоритетом эффективности |
| Параметры (всего/активные) | 125B + 51B lookup / 6B | 2.4T / ~95B | Не раскрыто | 284B / 13B |
| Контекст | 1M (хостинг) | 1M | 1,048,576 | 1M |
| Мультимодальность | Документированы текст + зрение | Текст + изображение + видео | Текст + изображение + видео + аудио + PDF | Фокус на тексте |
| Контроли рассуждений | low / medium / xhigh | Продвинутые режимы рассуждений / быстрые | low / medium / high | Non-think / Think / Think Max |
| Цена входа (CometAPI) | US$0.12/M | US$1.60/M | US$0.60/M | US$0.176/M |
| Офиц. цена провайдера (вход/выход) | US$0.15 / US$0.47 (Alibaba Cloud intl.) | US$2 / US$6 (Alibaba Cloud intl.) | US$0.75 / US$3.75 до 31 дек. 2026 | Пик: US$0.44 / US$1.32; офф-пик: US$0.22 / US$0.66 |
| Лучшее применение | Массовый кодинг, агенты, совместная работа | Самые сложные задачи Qwen, длинный горизонт | Экосистема Google-инструментов, широкая мультимодальность | Высокая пропускная способность текста и кодинга |
Где Qwen3.8-Flash выигрывает
- Эффективность активных вычислений: 6B активируемых параметров — исключительно мало для модели с сильными агентно-кодинговыми и мультимодальными результатами.
- Ценность экосистемы Qwen: Qwen3.8-Flash значительно дешевле Qwen3.8-Max для задач, которым не нужен флагман.
- Баланс «агент + офис»: Релиз необычно силён на CoWorkBench, JobBench, Toolathlon, SWE-bench Pro и мультимодальных агентных задачах, а не только на академических QA.
- Путь с открытыми весами: Qwen3.8-Flash-Next предоставляет веса для команд, которым нужен локальный деплой, независимая оценка или тонкая настройка.
Где другая модель может быть лучше
- Используйте Qwen3.8-Max для пиковых возможностей Qwen. Уровень Max имеет значительно больший активный вычислительный бюджет и рассчитан на самые сложные задачи с длинным горизонтом.
- Используйте Gemini 3.7 Flash когда важна широкая поддержка модальностей. Модель Google критически покрывает аудио, видео, PDF и глубокие интеграции с инструментами Google.
- Используйте DeepSeek V4 Flash когда приоритет — эффективность в тексте. Он выигрывает NL2Repo-Bench в сравнении Qwen и остаётся сильной доступной альтернативой для кодинга.
- Используйте Claude Opus 4.6 когда цена оправдана премиальными рассуждениями и зрелой enterprise-практикой. В таблице релиза Qwen он лидирует на HLE и остаётся крайне конкурентоспособен на GPQA.
Лучшие сценарии использования Qwen3.8-Flash
Агентный кодинг и работа с репозиториями
Qwen3.8-Flash отлично подходит для устранения дефектов, рефакторинга, ревью кода, навигации по репозиторию, генерации тестов, отладки и инструментально-управляемых циклов кодинга. Высокие результаты на LiveCodeBench и SWE-bench Pro указывают, что это не просто низколатентная чат-модель; она спроектирована для многошаговой инженерной работы.
Длинноконтекстная работа знаний в предприятиях
Производственный контекст в 1M токенов способен вместить большие коллекции документов, кодовые базы, логи, расшифровки встреч или длительную историю агента. Результаты CoWorkBench и JobBench делают модель особенно интересной для синтеза документов, рабочих процессов в таблицах/слайдах, исследовательской поддержки, комплаенс-ревью и операционного анализа.
Мультимодальные агенты
Оценки на AndroidWorld, RealWorldQA, ERQA и MathVision ориентируют на агентов, которым требуется понимать скриншоты, визуальные документы, интерфейсы, диаграммы и реальные изображения в рамках рабочего процесса. Это делает модель релевантной для браузерных агентов, UI-тестирования, визуального QA, документ-агентов и экранно-осведомлённой автоматизации.
Высоконагруженная маршрутизация
Поскольку Qwen3.8-Flash заметно дешевле флагманских моделей, практичная архитектура — маршрутизировать большую часть трафика на Flash и эскалировать лишь неоднозначные, рискованные или исключительно сложные запросы на Qwen3.8-Max или другую премиальную модель. Унифицированные шлюзы вроде CometAPI упрощают этот шаблон маршрутизации, поскольку приложение может переключать провайдеров за одним API-контрактом.
Ограничения и оговорки
- Бенчмарки — самоотчёт. Некоторые используют обвязки, выбранные Qwen, внутренние задачи или настройки с инструментами. Независимая верификация всё ещё важна.
- Не каждый бенчмарк — победа. DeepSeek V4 Flash лидирует на NL2Repo-Bench в официальном сравнении, а Claude Opus 4.6 — на HLE.
- Компьютерное использование остаётся сложным в абсолюте. Релиз сообщает двоичный балл OSWorld 2.0 = 19.4, хотя частичный кредит заметно выше.
- Поведение хоста и open-weights может отличаться. Системные промпты, инструменты, управление контекстом, квантизация, стек сервинга и обновления провайдера могут уводить реальные результаты от настроек бенчмарков Flash-Next.
- Цены динамичны. Анонс и текущие агрегаторы могут слегка расходиться по справочным ценам. Для бюджетирования используйте живую цену на эндпоинте.
Как использовать Qwen3.8-Flash API через CometAPI
CometAPI предоставляет Qwen3.8-Flash через совместимый с OpenAI эндпоинт, поэтому существующие интеграции с SDK OpenAI обычно можно переключить, изменив ключ API, базовый URL и ID модели.
Зачем использовать CometAPI для Qwen3.8-Flash?
CometAPI даёт разработчикам унифицированный API для тестирования Qwen3.8-Flash вместе с другими моделями без поддержки отдельных интеграций провайдера. Это особенно полезно для сравнений бенчмарков, резервной маршрутизации и выбора модели по стоимости.
- Создайте ключ API CometAPI. Сгенерируйте ключ в дашборде CometAPI и храните его в переменной окружения, а не в исходниках.
- Используйте унифицированный base URL. Задайте базовый URL SDK как
https://api.cometapi.com/v1. - Выберите модель. Используйте qwen3.8-flash как ID модели.
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="qwen3.8-flash",
messages=[
{"role": "system", "content": "You are a precise coding assistant."},
{"role": "user", "content": "Review this API design and identify reliability risks."},
],
)
print(response.choices[0].message.content)
cURL
curl "https://api.cometapi.com/v1/chat/completions" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{"role": "user", "content": "Summarize the main risks in this migration plan."}
]
}'
For production, add timeout handling, retry policy, token limits, structured output validation, and model-routing telemetry. If your workflow is agentic, track tool-call failures and accepted-task rate in addition to raw model latency.
FAQs
Является ли Qwen3.8-Flash открытым исходником?
Продукционный маршрут Qwen3.8-Flash — это хостинговый API. Его open-weight аналог, Qwen3.8-Flash-Next, имеет опубликованные веса на Hugging Face и ModelScope. Точнее говорить «с открытыми весами», поскольку права использования зависят от лицензии модели.
Какое окно контекста у Qwen3.8-Flash?
Открытая модель поддерживает 262,144 токена нативно и может быть расширена до 1,000,000 токенов с YaRN. Alibaba говорит, что продукционная служба Qwen3.8-Flash по умолчанию использует контекст на 1M токенов.
Сколько параметров у Qwen3.8-Flash?
Релиз сообщает о 125B параметров в основной модели, 51B параметров N-граммных эмбеддингов и 6B активируемых параметров на токен. Низкое число активируемых параметров — ключ к её эффективности.
Поддерживает ли Qwen3.8-Flash изображения?
Да. Релиз — мультимодальный, стек развёртывания с открытыми весами поддерживает текст и зрение, а официальные примеры интеграции для хостинговой модели перечисляют текст и изображения. Поверхности конкретных провайдеров могут раскрывать разные комбинации модальностей; проверяйте текущую страницу возможностей API перед деплоем.
Qwen3.8-Flash лучше, чем Qwen3.8-Max?
Не всегда. Qwen3.8-Flash лучше, когда важны латентность, активные вычисления и цена. Qwen3.8-Max — флагман для самых сложных задач с длинным горизонтом и высокой ценностью. Система маршрутизации может использовать обе.
Сколько стоит Qwen3.8-Flash?
Alibaba объявила US$0.16/M на вход и US$0.47/M на выход токенов для QwenCloud на запуске. CometAPI сейчас указывает примерно US$0.12/M на вход и US$0.376/M на выход. Проверяйте актуальные цены, поскольку ставки провайдеров и агрегаторов меняются.
Заключение
Qwen3.8-Flash — один из нагляднейших примеров текущего сдвига от «больших моделей» к «лучшей экономике системы». Её основной бэкбон на 125B выглядит крупным на бумаге, но на токен активируется лишь 6B параметров, а ёмкость добавляется через lookup-стиля N-граммные эмбеддинги. QSA, Gated Residual, ультра-разрежённый маршрут MoE и ориентированный на длинный контекст сервинг тянут в одном направлении: дать агентный кодинг и мультимодальные возможности без флагманской стоимости инференса.
Релизные результаты особенно убедительны для разработки ПО, офисных агентов, инструментального использования и визуальных рабочих процессов. При этом модель не повсеместно лучше: DeepSeek V4 Flash выигрывает как минимум один бенчмарк генерации репозиториев по таблице Qwen, Claude Opus 4.6 сильнее на HLE, а Qwen3.8-Max остаётся более высококлассным уровнем в рамках Qwen.
Практический следующий шаг для разработчиков — оценить Qwen3.8-Flash на реальных задачах и сравнить стоимость принятого результата с Gemini 3.7 Flash, DeepSeek V4 Flash и премиальными моделями в вашей маршрутизации. CometAPI даёт один совместимый с OpenAI интерфейс для такого мультимодельного тестирования и деплоя.
