Технические характеристики Qwen3.8-Flash-Next
| Характеристика | Qwen3.8-Flash-Next |
|---|---|
| Разработчик | Qwen Team, Alibaba Group |
| Тип модели | Мультимодальная каузальная языковая модель с vision-энкодером; ультразреженная MoE |
| Параметры основной модели | 125B |
| Активируемые параметры | 6B на токен |
| Параметры встраивания n-грамм | 51B дополнительно |
| Параметры MTP | 4B |
| Слои | 48 |
| Гибридная схема внимания | 12 x [3 Gated DeltaNet слоя + 1 Qwen Sparse Attention слой] |
| Эксперты MoE | 512 всего; 10 маршрутизируемых + 1 общий на токен |
| Gated Residual | 4 ветви; ранг бутылочного горлышка 320 |
| Нативное окно контекста | 262,144 токенов |
| Расширенный контекст | До 1,000,000 токенов с YaRN |
| Модальности | Ввод текста, изображений и видео; вывод текста |
| Управление мышлением | Режимы с/без мышления и управление усилием рассуждения в поддерживаемых API |
| Развёртывание | Transformers, vLLM, SGLang, TokenSpeed и другие поддерживаемые фреймворки |
| Открытые веса | Да |
| Идентификатор модели в CometAPI | qwen3.8-flash-next |
Что такое Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next — это готовящаяся к выпуску модель с открытыми весами, мультимодальная MoE от команды Qwen компании Alibaba. Более важно то, что она позиционируется как ранний предварительный обзор архитектуры, предназначенной для будущего семейства моделей Qwen4, а не просто как очередной инкрементальный чекпойнт Qwen3.8.
Qwen использует этот релиз, чтобы представить направление архитектуры следующего поколения сообществу open-source до выхода более широкого семейства Qwen4. Это даёт разработчикам движков вывода, проектам по квантованию, фреймворкам для обслуживания моделей и разработчикам приложений возможность заранее подготовиться к архитектурным изменениям.
Раскрытая на данный момент архитектура вводит два важных компонента: гибридную архитектуру на основе GDN и Qwen Sparse Attention (QSA). GDN относится к линейному вниманию в стиле DeltaNet с механизмом gating, продолжающему направление гибридного внимания, ранее исследованное в Qwen3-Next. QSA представлена как новый механизм разреженного внимания, хотя его полный технический спецификатор пока публично не опубликован.
Основные особенности Qwen3.8-Flash-Next
- Предварительный обзор архитектуры Qwen4: Qwen3.8-Flash-Next явно позиционируется как ранняя реализация архитектурного направления, которое будет лежать в основе грядущего семейства Qwen4.
- Мультимодальный дизайн MoE: модель описывается как мультимодальная Mixture-of-Experts, расширяющая эффективную стратегию разреженных моделей Qwen к архитектуре нового поколения.
- Гибридная архитектура GDN: модель продолжает направление исследований гибридного внимания, представленное в Qwen3-Next, сочетая эффективные механизмы линейного внимания с обычным вниманием там, где важен точный поиск. Qwen3-Next показала, что такой подход может существенно улучшить эффективность вывода на длинных контекстах.
- Qwen Sparse Attention: QSA — одна из двух архитектурных новаций, публично выделенных для Flash-Next. Её подробная реализация и количественные преимущества ещё предстоит задокументировать Qwen.
- Ориентация на экосистему открытых весов: релиз призван предоставить open-source сообществу ранний доступ к архитектурным изменениям, чтобы рантаймы вывода и нижестоящие инструменты могли адаптироваться до выхода Qwen4.
- Coding and Agent Performance of Qwen3.8-Flash-Next
| Бенчмарк | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next vs Qwen3.8-Max vs Qwen3.8-27B
| Модель | Позиционирование | Архитектура / масштаб | Мультимодальность | Текущий статус |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Предварительный обзор архитектуры Qwen4 / модель, ориентированная на эффективность | Мультимодальная MoE; полные спецификации ожидаются | Да | Готовится к выпуску |
| Qwen3.8-Max | Флагманская хостинговая модель Qwen3.8 | Крупномасштабная MoE | Да | Доступна |
| Qwen3.8-27B | Модель Qwen3.8 с открытыми весами | 27B плотная модель | Специфические возможности модели | Доступна |
Qwen3.8-Max уже доступна через облачную экосистему Alibaba и позиционируется для задач продвинутого рассуждения, визуального понимания, кодирования и агентности. В текущей документации Qwen указано, что Qwen3.8-Max имеет окно контекста на 1M токенов, а CometAPI уже предоставляет qwen3.8-max.
Поэтому Flash-Next следует рассматривать иначе: на данном этапе его первостепенное значение является архитектурным, а не основанным на бенчмарках. Он демонстрирует техническое направление Qwen4 и предоставляет open-source экосистеме раннюю целевую платформу для оптимизации рантайма и развёртывания.