Qwen3.8-Flash-Next — это не просто меньшая или более быстрая версия семейства Qwen3.8. Qwen описывает её как мультимодальную MoE-модель с открытыми весами и ранний предварительный просмотр архитектуры, используемой в Qwen4. В её конструкции одновременно изменены механизм внимания, остаточные соединения, емкость эмбеддингов и оптимизация, с целью повысить возможности при резком снижении объёма вычислений на токен.
TL;DR
Qwen3.8-Flash-Next сочетает основной 125B-параметрический модуль с дополнительной 51B N-gram таблицей эмбеддингов, при этом активируется лишь 6B параметров на токен. Модель нативно обрабатывает 262 144 токена и может быть расширена до 1 000 000 токенов с помощью YaRN. Архитектура построена вокруг смеси 3:1 из Gated DeltaNet и Qwen Sparse Attention, четырёхветвевых Gated Residual соединений, N-gram Embedding, крупного ультраразреженного пула экспертов MoE, Multi-Token Prediction и обучения на основе Muon.
Главное — это эффективность, а не «сырое» число параметров. По данным Qwen, обучение модели требует примерно одной девятой стоимости Qwen3.7-Plus, при том что стартовая оценка ставит модель выше предыдущих базовых Qwen по многим задачам кодирования, офисных агентов и мультимодальности. Это результаты, сообщённые вендором, и их следует рассматривать как стартовые данные, а не как независимую валидацию.
Для разработчиков открытые веса доступны через каналы Qwen, а управляемая продакшен-версия называется Qwen3.8-Flash на QwenCloud. CometAPI указывает Qwen3.8-Flash-Next с идентификатором модели qwen3.8-flash-next, предоставляя разработчикам единый маршрут наряду с другими передовыми моделями.
Ключевые выводы
- 125B параметров основного модуля + 51B N-gram эмбеддингов, при 6B активных параметров на токен.
- Гибридный шаблон внимания 3 GDN : 1 QSA, сочетающий эффективную память с точным дальним извлечением.
- 262 144 токена нативного контекста и до 1M токенов через YaRN.
- Qwen сообщает о ускорении префилла до 7,6x и декодирования до 4,9x на 1M контексте для QSA.
- Резидуальный поток расширён до четырёх управляемых ветвей, что улучшает межслоевой обмен информацией и стабильность обучения.
- Официальная таблица запуска показывает сильные результаты на SWE-bench Pro, CoWorkBench, JobBench, Toolathlon, AndroidWorld и RealWorldQA, но это не «чистая победа» во всех бенчмарках.
- Qwen позиционирует релиз как превью архитектуры, так что его значимость связана не только с текущим рейтингом, но и с тем, что он сигнализирует о направлениях Qwen4.
Что такое Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next — это каузальная мультимодальная языковая модель с визуальным энкодером и ультраразрежной языковой «спинкой» Mixture-of-Experts. В официальной карте модели описана 48-слойная архитектура с 512 экспертами, 10 маршрутизируемыми экспертами и одним общим экспертом, а скрытая компоновка повторяет три слоя Gated DeltaNet, за которыми следует один слой Qwen Sparse Attention.
Релиз играет роль, аналогичную Qwen3-Next: он раскрывает архитектурные изменения до их масштабирования на следующее полное семейство. Qwen прямо называет модель экспериментальным предварительным просмотром архитектуры, которая ляжет в основу Qwen4. Это делает модель необычайно интересной для инженеров, которым важны эффективность сервинга, длинный контекст и направление исследований открытых архитектур.
4 ключевых компонента Qwen3.8-Flash-Next
Модель одновременно меняет четыре ключевых компонента: внимание, резидуальный поток, емкость эмбеддингов и оптимизацию. Такая совместная проработка важна, потому что эффективность в одном компоненте может быть нивелирована, если другой станет «узким местом» на длинном контексте или при большом масштабе.
Гибридное внимание: GDN + Qwen Sparse Attention
Большинство слоёв не выполняют глобального внимания. Вместо этого три из каждых четырёх слоёв используют Gated DeltaNet для сжатия исторической информации в состояние фиксированного размера. Четвёртый слой применяет глобальное внимание для точного извлечения, но это глобальное внимание переработано как Qwen Sparse Attention (QSA).
QSA избегает независимого поиска по каждому токену. Лёгкий индексатор сначала группирует последовательность в микроблоки, оценивает важность блоков, а затем уделяет внимание только выбранным регионам. По описанию Qwen, это снижает как вычисления внимания, так и накладные расходы на индексацию для поиска релевантного контекста. Дизайн особенно хорошо сочетается с гибридной сетью, поскольку разреженный индекс строится независимо в каждом слое внимания, а не опирается на сходство между соседними слоями внимания.
Показатели эффективности существенны. На контексте в 1M токенов Qwen сообщает об ускорении префилла до 7,6x и декодирования до 4,9x для ядра внимания QSA. В эксперименте сервинга с высоким повторным использованием кэша и 90% попаданий в префикс-кэш полная модель достигает 8,6x пропускной способности префилла по сравнению с Qwen3.7-Plus на 1M контексте.
Gated Residual: четыре пути вместо одного
Обычный Transformer многократно читает и пишет в один резидуальный поток. Qwen3.8-Flash-Next вместо этого использует Gated Residual, чтобы расширить поток в четыре параллельные ветви. Поэлементные «ворота чтения» решают, сколько информации взять из каждой ветви, а «ворота записи» на уровне ветви определяют, что будет записано обратно.
Цель — сохранять полезные признаки по глубине, не заставляя каждый признак проходить через один и тот же непрерывно смешиваемый канал. Qwen также сообщает, что ворота подавляют выбросы активаций, а резидуальное состояние может храниться в FP8, уменьшая трафик памяти. Ключевая идея — не просто большая резидуальная ёмкость, а управляемая маршрутизация информации по слоям.
N-gram Embedding: больше ёмкости без пропорциональных вычислений
Модель добавляет 51B параметров N-gram Embedding сверх 125B основного «каркаса». В отличие от обычных эмбеддингов, индексируемых по одному токену, N-gram Embedding используют локальные шаблоны токенов — биграммы, триграммы и т. п. Это дает модели крупную «память» в стиле таблицы поиска для повторяющихся локальных паттернов.
Необычно то, где сосредоточена эта ёмкость. Поскольку адрес для выборки известен до того, как эмбеддинг потребуется, таблица может храниться в оперативной памяти хоста и асинхронно подгружаться, пока вычисления на GPU продолжаются. Это означает, что дополнительные 51B параметров не ведут себя как 51B параметров для плотных матричных умножений. Архитектура эффективно масштабирует два разных ресурса: вычислительно «тяжёлые» параметры модели и «лёгкую» по вычислениям память таблицы поиска.
Muon и оптимизация обучения
Qwen обучает архитектуру с оптимизатором Muon для двумерных линейных отображений, таких как основные веса в внимании, GDN и экспертах MoE, тогда как эмбеддинги, маршрутизатор и низкоранговые параметры Gated Residual продолжают использовать AdamW. Сдвоенные матрицы, такие как проекции QKV и SwiGLU, разделяются на независимые линейные преобразования перед ортогонализацией.
Команда также заново подогнала закон масштабирования под новую архитектуру и сообщает, что обычная «раскачка размера батча» не потребовалась. Постепенное увеличение размера батча не улучшило конечный результат и вместо этого потребовало на 18,8% больше шагов оптимизатора. Итоговый рецепт сразу начинается с целевого размера батча.
Ультраразрежный MoE и Multi-Token Prediction
Официальная карта модели указывает 512 экспертов с 10 маршрутизируемыми экспертами и одним общим экспертом, активными на токен. Крупный пул экспертов увеличивает запасённую ёмкость без активации всей модели на каждый токен. Однослойный модуль Multi-Token Prediction (MTP) обучается с несколькими шагами, чтобы повысить принятие спекулятивного декодирования, одновременно поддерживая основной «каркас».
Производительность Qwen3.8-Flash-Next в бенчмарках
Qwen публикует широкие оценки по языковым, кодовым, агентным и визион-языковым задачам. Эти числа полезны, поскольку многие модели сравнения были перезапущены в окружении Qwen, но это всё же заявленные вендором стартовые оценки, а не независимые воспроизведения бенчмарков. Несколько строк также используют специфичные для бенчмарков окружения или «судей», поэтому безопаснее трактовать результаты как направленные: они показывают, где Qwen3.8-Flash-Next сильнее, а где конкуренты лидируют.
Код и агентные задачи
| Бенчмарк | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
История с кодом сильная, но нюансированная. Qwen3.8-Flash-Next лидирует в приведённой выборке по SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified и LiveCodeBench v6. Однако DeepSeek V4 Flash впереди на NL2Repo-Bench, а Claude Opus 4.6 лидирует в HLE. Поэтому эффективность — более надёжный заголовок, чем «универсальное доминирование» в бенчмарках.
Наиболее заметные приросты по сравнению с предыдущими базовыми Qwen видны в задачах с длинным горизонтом. CoWorkBench растёт с 65.1 у Qwen3.7-Plus до 73.9, а JobBench — с 27.6 до 55.7. Поскольку CoWorkBench — внутренний бенчмарк Qwen, этим приростам нужна независимая проверка, но они согласуются с заявленным фокусом архитектуры на экономичных по стоимости агентных и офисных рабочих процессах.
Мультимодальная производительность
| Бенчмарк | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| ClawEval-MM (Pass@3 / среднее) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | -- |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0 (бинарный / частичный) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | -- |
| Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision (без / с CI) | 90.6 / 95.7 | 90.0 / 94.6 | 90.3 / 88.7 | 65.5 / -- |
| CharXiv RQ (без / с CI) | 84.6 / 90.6 | 83.7 / 90.2 | 85.8 / 85.9 | 66.0 / -- |
Источник данных: официальный стартовый отчёт Qwen**.
Мультимодальные результаты подтверждают, что это не просто «Flash-модель для кода». Qwen3.8-Flash-Next набирает 84.5 в AndroidWorld, 64.0 в Vision2Web, 76.6 в LVBench и 88.5 в RealWorldQA в таблице Qwen. Карта модели также предоставляет примеры для изображений и видео, включая рекомендации по более высокой частоте выборки кадров для часовых видео-нагрузок. видео-нагрузок.
Qwen3.8-Flash-Next по сравнению с другими моделями
Полезное сравнение должно разделять три вопроса: сколько вычислений активируется на токен, насколько широки модальности и контекст модели, и насколько хорошо она работает на представительских рабочих задачах. Простое «общее число параметров» на эти вопросы не отвечает.
Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus
| Параметр | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|---|
| Параметры модели | 125B + 51B N-gram эмбеддинги | 27B | 397B |
| Активируемые параметры | 6B | 27B | 17B |
| Нативный контекст | 262K | 262K в сравнительной настройке Qwen | Модель предыдущего поколения с длинным контекстом |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 |
| CoWorkBench | 73.9 | 70.7 | 65.1 |
| JobBench | 55.7 | 33.4 | 27.6 |
| AndroidWorld | 84.5 | 81.9 | 81.0 |
Ключевой результат — способность на единицу активируемых параметров. Qwen3.8-Flash-Next активирует 6B параметров на токен против 27B у Qwen3.8-27B и 17B у Qwen3.7-Plus, но опережает по приведённым метрикам DeepSWE, CoWorkBench, JobBench и AndroidWorld. Компромисс — след памяти: разрежённость снижает активные вычисления, а не объём модельной ёмкости, которую в итоге нужно где-то хранить.
Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6
| Параметр | Qwen3.8-Flash-Next | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| Веса | Открытые веса | Открытые веса | Закрытые |
| Сообщаемый профиль параметров | 125B основной + 51B N-gram; 6B активных | 284B всего; 13B активных | Не раскрыт публично |
| Основной источник эффективности | QSA + GDN + 6B активного MoE + lookup-память | Высокопроизводительный разрежённый MoE | Управляемый фронтир для рассуждений и агентов |
| Нативная мультимодальность | Текст, изображение, видео -> текст | Семейство Flash, ориентированное на текст; маршрут vision доступен отдельно на CometAPI | Текст + vision/файлы через хостинговые API |
| SWE-bench Pro* | 62.5 | 56.0 | 53.4 |
| CoWorkBench* | 73.9 | 45.1 | 68.2 |
| NL2Repo-Bench* | 48.1 | 54.2 | 47.6 |
| HLE* | 35.9 | 33.8 | 40.0 |
DeepSeek V4 Flash остаётся сильнее на NL2Repo-Bench в сравнении Qwen, что важно для генерации кода на уровне репозиториев. Claude Opus 4.6 сильнее по HLE в той же таблице и представляет закрытую управляемую модель, а не открытый объект для развёртывания. Qwen3.8-Flash-Next выделяется сочетанием открытых весов, нативной мультимодальности, инженерии длинного контекста и очень малого бюджета активных параметров.
Qwen3.8-Flash-Next vs Qwen3.8-Max
| Параметр | Qwen3.8-Flash-Next | Qwen3.8-Max |
|---|---|---|
| Роль | Открытая превью-архитектура с приоритетом эффективности | Флагман Qwen3.8 |
| Основной/общий масштаб | 125B основной + 51B N-gram; 6B активных | 2.4T всего; около 95B активных на странице модели в CometAPI |
| Акцент архитектуры | QSA, GDN, Gated Residual, N-gram Embedding, Muon | Максимальная фронтирная способность при гораздо большем масштабе |
| Лучшее применение | Массовые агенты, ассистенты по коду, мультимодальная автоматизация, self-hosting | Самые сложные рассуждения, крупные корпоративные агенты, приоритет максимальной способности |
| Контекст | 262K нативно; до 1M с YaRN | Контекст класса 1M на текущих флагманских маршрутах Qwen3.8 |
Спецификации для Qwen3.8-Max основаны на текущем листинге модели в CometAPI.
Различие простое: Qwen3.8-Max — флагман «способностей», а Qwen3.8-Flash-Next — эксперимент в области архитектуры и эффективности. Разработчикам при выборе стоит ответить, является ли узким местом абсолютная способность модели или стоимость запуска множества длинноконтекстных, инструментально-насыщенных задач в масштабе.
Цены и доступность Qwen3.8-Flash-Next
Открытые веса Qwen3.8-Flash-Next опубликованы через Hugging Face и ModelScope. Для управляемого сервинга Qwen заявляет, что продакшен-версия называется Qwen3.8-Flash на QwenCloud, с 1M контекстом по умолчанию и официальными встроенными инструментами.
Qwen указывает цену управляемого продакшена $0.16 за миллион входных токенов и $0.47 за миллион выходных токенов. Эта цена относится к продакшен-модели Qwen3.8-Flash на QwenCloud, а не к самостоятельному хостингу открытых весов.
| Маршрут | Вход | Выход |
|---|---|---|
| Продакшен-модель QwenCloud (Qwen3.8-Flash) | $0.16 / 1M токенов | $0.47 / 1M токенов |
| Самостоятельный хостинг с открытыми весами | Зависит от инфраструктуры | Зависит от инфраструктуры |
| Маршрут CometAPI | Проверьте актуальную страницу модели | Проверьте актуальную страницу модели |
Цены QwenCloud взяты из официальной статьи о запуске Qwen; биллинг CometAPI следует проверять на актуальной странице модели.
Для пользователей CometAPI выделенная модель Qwen3.8-Flash-Next обозначается маршрутом qwen3.8-flash-next. Поскольку маршрутизация, доступность «апстрима» и биллинг могут меняться независимо от релиза открытых весов, продакшен-интеграциям следует сверяться с живым каталогом CometAPI, прежде чем жёстко фиксировать ценовые предположения.
Рекомендация CometAPI
Ожидается, что Qwen3.8-Flash-Next скоро станет доступной через CometAPI. CometAPI предоставляет единый OpenAI-совместимый endpoint (https://api.cometapi.com/v1), агрегирующий 500+ моделей от ведущих провайдеров, включая серию Qwen. Такой подход снижает зависимость от одного вендора, упрощает эксперименты с Qwen3.8-Flash (как только она станет доступна через платформу или связанные маршруты Qwen) и упорядочивает продакшен-развёртывания, которые могут смешивать модели под разные задачи (например, Qwen для экономичных кодовых агентов + другая модель для специализированных рассуждений). Документация и быстрые руководства доступны на apidoc.cometapi.com и основном сайте CometAPI.
Независимо от того, размещаете ли вы открытые веса у себя, используете QwenCloud или подключаетесь через единую платформу вроде CometAPI, Qwen3.8-Flash-Next снижает барьер для высокопроизводительных, длинноконтекстных мультимодальных агентов.
Что умеет Qwen3.8-Flash-Next?
1. Массовые кодовые агенты
Бюджет в 6B активных параметров в сочетании с 62.5 на SWE-bench Pro в оценке Qwen делает Qwen3.8-Flash-Next особенно интересной для кодовых систем, запускающих множество параллельных сессий. Примеры включают code review, триаж задач, навигацию по репозиторию, генерацию тестов и итеративные патчи, где важна пропускная способность почти так же, как и «интеллект» одиночного прогона.
2. Долгий горизонт офисной и знания‑ориентированной работы
CoWorkBench и JobBench центральны в позиционировании модели. Архитектура рассчитана на агентные циклы, которые многократно читают контекст, вызывают инструменты, обновляют состояние и продолжают работу, а не отвечают один раз. Это естественно ложится на документооборот, анализ таблиц, сбор отчётов, синтез исследований и автоматизацию бизнес‑процессов.
3. Мультимодальные компьютерные и мобильные агенты
Входы изображений и видео, результаты AndroidWorld, оценка OSWorld и Vision2Web делают модель релевантной для GUI‑агентов. Она может выступать слоем рассуждений в системах, которые интерпретируют скриншоты, управляют мобильными интерфейсами, воспроизводят макеты приложений или совмещают визуальное состояние с вызовами инструментов.
4. Длинное видео и визуальные рассуждения
Официальная карта модели включает явные примеры видео‑входов и рекомендации по предобработке видео часового масштаба. Это делает модель полезной для видео‑QA, поиска по длинным видео, извлечения визуальных событий и рабочих процессов, сочетающих понимание видео с downstream‑инструментами.
5. Миллион‑токеновые исследования и репозиторные процессы
Открытая модель нативно на 262 144 токена и расширяема до 1 000 000 с YaRN. Это важно: 1M — расширение, а не нативный контекст открытой модели. Для крупных репозиториев или корпусов исследований QSA призвана сделать стоимость извлечения в таких длинных контекстах более практичной, чем плотное глобальное внимание.
Как разработчикам запускать Qwen3.8-Flash-Next?
Разработчики могут скачать открытые веса с Hugging Face и запускать модель через Transformers, vLLM, SGLang или TokenSpeed. Qwen предоставляет примеры интерфейса Chat Completions, совместимого с OpenAI, для текста и мультимодального ввода.
Например, официальная карта модели демонстрирует сервинг Qwen/Qwen3.8-Flash-Next с vLLM и вызов через /v1/chat/completions. Входы изображений и видео также демонстрируются через совместимый с OpenAI интерфейс.
Qwen3.8-Flash-Next по умолчанию работает в thinking mode. Разработчики могут управлять поведением «мышления» через enable_thinking, preserve_thinking и reasoning_effort; задокументированные уровни reasoning_effort — xhigh, medium и low.
Каковы ограничения Qwen3.8-Flash-Next?
Наибольшее практическое ограничение — стоимость аппаратуры. Хотя активируются только 6B параметров языковой модели, чекпойнт содержит 125B языковых параметров плюс компонент 51B n-gram эмбеддингов и 4B параметров MTP. Текущий репозиторий составляет примерно 360 GB, поэтому локальное развёртывание остаётся инфраструктурно тяжёлой задачей.
Второе ограничение — 262K как нативная длина контекста, а не 1M. Модель может быть расширена до 1M токенов, но страница CometAPI или модели не должна просто указывать «1M нативного контекста». Корректная формулировка — 262K нативного контекста, расширяемого до 1M.
Наконец, производительность в бенчмарках неравномерна. Qwen3.8-Flash-Next очень конкурентоспособна в кодовых и агентных задачах, но не лидирует во всех бенчмарках. Например, Claude Opus 4.6 набирает 40.0 на HLE против 35.9 у Flash-Next, тогда как DeepSeek-V4-Flash-0731 лидирует в указанной выборке на NL2Repo-Bench.
Qwen3.8-Flash-Next: что это сигнализирует для Qwen4
Более широкая значимость релиза — его роль раннего превью архитектуры, которая, как ожидается, ляжет в основу Qwen4. Qwen3.8-Flash-Next объединяет Qwen Sparse Attention, Gated DeltaNet, четырёхветвевые Gated Residual соединения, N-gram Embedding, ультраразрежный пул экспертов MoE и Multi-Token Prediction. Эти решения показывают, как Qwen исследует путь к большей ёмкости, более длинному контексту и более сильной мультимодальной и агентной производительности без пропорционального роста активных вычислений на токен.
Итоговый вердикт
Qwen3.8-Flash-Next важна тем, что меняет постановку задачи эффективности. Вместо того чтобы считать все параметры эквивалентными, модель сочетает относительно малый активный MoE‑путь с очень большой памятью «поискового» типа и разрежённым механизмом извлечения, ориентированным на длинный контекст. Это даёт Qwen несколько независимых рычагов для увеличения ёмкости без равного роста матричных вычислений на токен.
Для разработчиков это делает модель привлекательным вариантом для массовых кодовых ассистентов, длинноконтекстных агентов, мультимодальной автоматизации и self‑hosted экспериментов. Для более широкой дорожной карты Qwen это ещё значимее: Qwen прямо использует этот релиз, чтобы показать направление архитектуры, которую планирует доработать к Qwen4.
