Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/Исследования CometAPI

Что такое Qwen3.8-Flash-Next?

Ознакомьтесь с Qwen3.8-Flash-Next: архитектура MoE 125B, 6B активных параметров, QSA, расширенный контекст на 1M токенов, мультимодальные бенчмарки, возможности, цены.

CometAPI
Mia MarenКоманда исследователей AI-моделей и API
Обновлено Aug 29, 2026 16 мин. чтения
Что такое Qwen3.8-Flash-Next?
Использовать этот подход

Сделайте первый вызов API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Qwen3.8-Flash-Next — это не просто меньшая или более быстрая версия семейства Qwen3.8. Qwen описывает её как мультимодальную MoE-модель с открытыми весами и ранний предварительный просмотр архитектуры, используемой в Qwen4. В её конструкции одновременно изменены механизм внимания, остаточные соединения, емкость эмбеддингов и оптимизация, с целью повысить возможности при резком снижении объёма вычислений на токен.

TL;DR

Qwen3.8-Flash-Next сочетает основной 125B-параметрический модуль с дополнительной 51B N-gram таблицей эмбеддингов, при этом активируется лишь 6B параметров на токен. Модель нативно обрабатывает 262 144 токена и может быть расширена до 1 000 000 токенов с помощью YaRN. Архитектура построена вокруг смеси 3:1 из Gated DeltaNet и Qwen Sparse Attention, четырёхветвевых Gated Residual соединений, N-gram Embedding, крупного ультраразреженного пула экспертов MoE, Multi-Token Prediction и обучения на основе Muon.

Главное — это эффективность, а не «сырое» число параметров. По данным Qwen, обучение модели требует примерно одной девятой стоимости Qwen3.7-Plus, при том что стартовая оценка ставит модель выше предыдущих базовых Qwen по многим задачам кодирования, офисных агентов и мультимодальности. Это результаты, сообщённые вендором, и их следует рассматривать как стартовые данные, а не как независимую валидацию.

Для разработчиков открытые веса доступны через каналы Qwen, а управляемая продакшен-версия называется Qwen3.8-Flash на QwenCloud. CometAPI указывает Qwen3.8-Flash-Next с идентификатором модели qwen3.8-flash-next, предоставляя разработчикам единый маршрут наряду с другими передовыми моделями.

Ключевые выводы

Что такое Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next — это каузальная мультимодальная языковая модель с визуальным энкодером и ультраразрежной языковой «спинкой» Mixture-of-Experts. В официальной карте модели описана 48-слойная архитектура с 512 экспертами, 10 маршрутизируемыми экспертами и одним общим экспертом, а скрытая компоновка повторяет три слоя Gated DeltaNet, за которыми следует один слой Qwen Sparse Attention.

Релиз играет роль, аналогичную Qwen3-Next: он раскрывает архитектурные изменения до их масштабирования на следующее полное семейство. Qwen прямо называет модель экспериментальным предварительным просмотром архитектуры, которая ляжет в основу Qwen4. Это делает модель необычайно интересной для инженеров, которым важны эффективность сервинга, длинный контекст и направление исследований открытых архитектур.

4 ключевых компонента Qwen3.8-Flash-Next

Модель одновременно меняет четыре ключевых компонента: внимание, резидуальный поток, емкость эмбеддингов и оптимизацию. Такая совместная проработка важна, потому что эффективность в одном компоненте может быть нивелирована, если другой станет «узким местом» на длинном контексте или при большом масштабе.

Гибридное внимание: GDN + Qwen Sparse Attention

Большинство слоёв не выполняют глобального внимания. Вместо этого три из каждых четырёх слоёв используют Gated DeltaNet для сжатия исторической информации в состояние фиксированного размера. Четвёртый слой применяет глобальное внимание для точного извлечения, но это глобальное внимание переработано как Qwen Sparse Attention (QSA).

QSA избегает независимого поиска по каждому токену. Лёгкий индексатор сначала группирует последовательность в микроблоки, оценивает важность блоков, а затем уделяет внимание только выбранным регионам. По описанию Qwen, это снижает как вычисления внимания, так и накладные расходы на индексацию для поиска релевантного контекста. Дизайн особенно хорошо сочетается с гибридной сетью, поскольку разреженный индекс строится независимо в каждом слое внимания, а не опирается на сходство между соседними слоями внимания.

Показатели эффективности существенны. На контексте в 1M токенов Qwen сообщает об ускорении префилла до 7,6x и декодирования до 4,9x для ядра внимания QSA. В эксперименте сервинга с высоким повторным использованием кэша и 90% попаданий в префикс-кэш полная модель достигает 8,6x пропускной способности префилла по сравнению с Qwen3.7-Plus на 1M контексте.

Gated Residual: четыре пути вместо одного

Обычный Transformer многократно читает и пишет в один резидуальный поток. Qwen3.8-Flash-Next вместо этого использует Gated Residual, чтобы расширить поток в четыре параллельные ветви. Поэлементные «ворота чтения» решают, сколько информации взять из каждой ветви, а «ворота записи» на уровне ветви определяют, что будет записано обратно.

Цель — сохранять полезные признаки по глубине, не заставляя каждый признак проходить через один и тот же непрерывно смешиваемый канал. Qwen также сообщает, что ворота подавляют выбросы активаций, а резидуальное состояние может храниться в FP8, уменьшая трафик памяти. Ключевая идея — не просто большая резидуальная ёмкость, а управляемая маршрутизация информации по слоям.

N-gram Embedding: больше ёмкости без пропорциональных вычислений

Модель добавляет 51B параметров N-gram Embedding сверх 125B основного «каркаса». В отличие от обычных эмбеддингов, индексируемых по одному токену, N-gram Embedding используют локальные шаблоны токенов — биграммы, триграммы и т. п. Это дает модели крупную «память» в стиле таблицы поиска для повторяющихся локальных паттернов.

Необычно то, где сосредоточена эта ёмкость. Поскольку адрес для выборки известен до того, как эмбеддинг потребуется, таблица может храниться в оперативной памяти хоста и асинхронно подгружаться, пока вычисления на GPU продолжаются. Это означает, что дополнительные 51B параметров не ведут себя как 51B параметров для плотных матричных умножений. Архитектура эффективно масштабирует два разных ресурса: вычислительно «тяжёлые» параметры модели и «лёгкую» по вычислениям память таблицы поиска.

Muon и оптимизация обучения

Qwen обучает архитектуру с оптимизатором Muon для двумерных линейных отображений, таких как основные веса в внимании, GDN и экспертах MoE, тогда как эмбеддинги, маршрутизатор и низкоранговые параметры Gated Residual продолжают использовать AdamW. Сдвоенные матрицы, такие как проекции QKV и SwiGLU, разделяются на независимые линейные преобразования перед ортогонализацией.

Команда также заново подогнала закон масштабирования под новую архитектуру и сообщает, что обычная «раскачка размера батча» не потребовалась. Постепенное увеличение размера батча не улучшило конечный результат и вместо этого потребовало на 18,8% больше шагов оптимизатора. Итоговый рецепт сразу начинается с целевого размера батча.

Ультраразрежный MoE и Multi-Token Prediction

Официальная карта модели указывает 512 экспертов с 10 маршрутизируемыми экспертами и одним общим экспертом, активными на токен. Крупный пул экспертов увеличивает запасённую ёмкость без активации всей модели на каждый токен. Однослойный модуль Multi-Token Prediction (MTP) обучается с несколькими шагами, чтобы повысить принятие спекулятивного декодирования, одновременно поддерживая основной «каркас».

Производительность Qwen3.8-Flash-Next в бенчмарках

Qwen публикует широкие оценки по языковым, кодовым, агентным и визион-языковым задачам. Эти числа полезны, поскольку многие модели сравнения были перезапущены в окружении Qwen, но это всё же заявленные вендором стартовые оценки, а не независимые воспроизведения бенчмарков. Несколько строк также используют специфичные для бенчмарков окружения или «судей», поэтому безопаснее трактовать результаты как направленные: они показывают, где Qwen3.8-Flash-Next сильнее, а где конкуренты лидируют.

Код и агентные задачи

БенчмаркQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek V4 FlashClaude Opus 4.6
DeepSWE 1.158.742.216.554.4--
SWE-bench Pro62.561.755.856.053.4
SWE-bench Multilingual81.073.875.8--77.5
NL2Repo-Bench48.142.341.154.247.6
CoWorkBench73.970.765.145.168.2
JobBench55.733.427.641.336.6
Toolathlon Verified73.567.150.670.3--
IFBench81.379.579.179.262.5
GPQA Diamond91.789.290.390.891.3
HLE35.930.834.733.840.0
LiveCodeBench v691.990.389.690.688.8

История с кодом сильная, но нюансированная. Qwen3.8-Flash-Next лидирует в приведённой выборке по SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified и LiveCodeBench v6. Однако DeepSeek V4 Flash впереди на NL2Repo-Bench, а Claude Opus 4.6 лидирует в HLE. Поэтому эффективность — более надёжный заголовок, чем «универсальное доминирование» в бенчмарках.

Наиболее заметные приросты по сравнению с предыдущими базовыми Qwen видны в задачах с длинным горизонтом. CoWorkBench растёт с 65.1 у Qwen3.7-Plus до 73.9, а JobBench — с 27.6 до 55.7. Поскольку CoWorkBench — внутренний бенчмарк Qwen, этим приростам нужна независимая проверка, но они согласуются с заявленным фокусом архитектуры на экономичных по стоимости агентных и офисных рабочих процессах.

Мультимодальная производительность

БенчмаркQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude Opus 4.6
ClawEval-MM (Pass@3 / среднее)64.4 / 60.457.4 / 56.957.4 / 60.152.5 / 54.7
RecreationBench49.947.130.2--
AndroidWorld84.581.981.062.0
OSWorld 2.0 (бинарный / частичный)19.4 / 52.319.4 / 48.02.8 / 21.5--
Vision2Web64.062.942.1--
ERQA72.365.569.840.8
LVBench76.672.476.263.0
RealWorldQA88.585.986.973.9
MathVision (без / с CI)90.6 / 95.790.0 / 94.690.3 / 88.765.5 / --
CharXiv RQ (без / с CI)84.6 / 90.683.7 / 90.285.8 / 85.966.0 / --

Источник данных: официальный стартовый отчёт Qwen**.

Мультимодальные результаты подтверждают, что это не просто «Flash-модель для кода». Qwen3.8-Flash-Next набирает 84.5 в AndroidWorld, 64.0 в Vision2Web, 76.6 в LVBench и 88.5 в RealWorldQA в таблице Qwen. Карта модели также предоставляет примеры для изображений и видео, включая рекомендации по более высокой частоте выборки кадров для часовых видео-нагрузок. видео-нагрузок.

Qwen3.8-Flash-Next по сравнению с другими моделями

Полезное сравнение должно разделять три вопроса: сколько вычислений активируется на токен, насколько широки модальности и контекст модели, и насколько хорошо она работает на представительских рабочих задачах. Простое «общее число параметров» на эти вопросы не отвечает.

Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus

ПараметрQwen3.8-Flash-NextQwen3.8-27BQwen3.7-Plus
Параметры модели125B + 51B N-gram эмбеддинги27B397B
Активируемые параметры6B27B17B
Нативный контекст262K262K в сравнительной настройке QwenМодель предыдущего поколения с длинным контекстом
DeepSWE 1.158.742.216.5
CoWorkBench73.970.765.1
JobBench55.733.427.6
AndroidWorld84.581.981.0

Ключевой результат — способность на единицу активируемых параметров. Qwen3.8-Flash-Next активирует 6B параметров на токен против 27B у Qwen3.8-27B и 17B у Qwen3.7-Plus, но опережает по приведённым метрикам DeepSWE, CoWorkBench, JobBench и AndroidWorld. Компромисс — след памяти: разрежённость снижает активные вычисления, а не объём модельной ёмкости, которую в итоге нужно где-то хранить.

Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6

ПараметрQwen3.8-Flash-NextDeepSeek V4 FlashClaude Opus 4.6
ВесаОткрытые весаОткрытые весаЗакрытые
Сообщаемый профиль параметров125B основной + 51B N-gram; 6B активных284B всего; 13B активныхНе раскрыт публично
Основной источник эффективностиQSA + GDN + 6B активного MoE + lookup-памятьВысокопроизводительный разрежённый MoEУправляемый фронтир для рассуждений и агентов
Нативная мультимодальностьТекст, изображение, видео -> текстСемейство Flash, ориентированное на текст; маршрут vision доступен отдельно на CometAPIТекст + vision/файлы через хостинговые API
SWE-bench Pro*62.556.053.4
CoWorkBench*73.945.168.2
NL2Repo-Bench*48.154.247.6
HLE*35.933.840.0

DeepSeek V4 Flash остаётся сильнее на NL2Repo-Bench в сравнении Qwen, что важно для генерации кода на уровне репозиториев. Claude Opus 4.6 сильнее по HLE в той же таблице и представляет закрытую управляемую модель, а не открытый объект для развёртывания. Qwen3.8-Flash-Next выделяется сочетанием открытых весов, нативной мультимодальности, инженерии длинного контекста и очень малого бюджета активных параметров.

Qwen3.8-Flash-Next vs Qwen3.8-Max

ПараметрQwen3.8-Flash-NextQwen3.8-Max
РольОткрытая превью-архитектура с приоритетом эффективностиФлагман Qwen3.8
Основной/общий масштаб125B основной + 51B N-gram; 6B активных2.4T всего; около 95B активных на странице модели в CometAPI
Акцент архитектурыQSA, GDN, Gated Residual, N-gram Embedding, MuonМаксимальная фронтирная способность при гораздо большем масштабе
Лучшее применениеМассовые агенты, ассистенты по коду, мультимодальная автоматизация, self-hostingСамые сложные рассуждения, крупные корпоративные агенты, приоритет максимальной способности
Контекст262K нативно; до 1M с YaRNКонтекст класса 1M на текущих флагманских маршрутах Qwen3.8

Спецификации для Qwen3.8-Max основаны на текущем листинге модели в CometAPI.

Различие простое: Qwen3.8-Max — флагман «способностей», а Qwen3.8-Flash-Next — эксперимент в области архитектуры и эффективности. Разработчикам при выборе стоит ответить, является ли узким местом абсолютная способность модели или стоимость запуска множества длинноконтекстных, инструментально-насыщенных задач в масштабе.

Цены и доступность Qwen3.8-Flash-Next

Открытые веса Qwen3.8-Flash-Next опубликованы через Hugging Face и ModelScope. Для управляемого сервинга Qwen заявляет, что продакшен-версия называется Qwen3.8-Flash на QwenCloud, с 1M контекстом по умолчанию и официальными встроенными инструментами.

Qwen указывает цену управляемого продакшена $0.16 за миллион входных токенов и $0.47 за миллион выходных токенов. Эта цена относится к продакшен-модели Qwen3.8-Flash на QwenCloud, а не к самостоятельному хостингу открытых весов.

МаршрутВходВыход
Продакшен-модель QwenCloud (Qwen3.8-Flash)$0.16 / 1M токенов$0.47 / 1M токенов
Самостоятельный хостинг с открытыми весамиЗависит от инфраструктурыЗависит от инфраструктуры
Маршрут CometAPIПроверьте актуальную страницу моделиПроверьте актуальную страницу модели

Цены QwenCloud взяты из официальной статьи о запуске Qwen; биллинг CometAPI следует проверять на актуальной странице модели.

Для пользователей CometAPI выделенная модель Qwen3.8-Flash-Next обозначается маршрутом qwen3.8-flash-next. Поскольку маршрутизация, доступность «апстрима» и биллинг могут меняться независимо от релиза открытых весов, продакшен-интеграциям следует сверяться с живым каталогом CometAPI, прежде чем жёстко фиксировать ценовые предположения.

Рекомендация CometAPI

Ожидается, что Qwen3.8-Flash-Next скоро станет доступной через CometAPI. CometAPI предоставляет единый OpenAI-совместимый endpoint (https://api.cometapi.com/v1), агрегирующий 500+ моделей от ведущих провайдеров, включая серию Qwen. Такой подход снижает зависимость от одного вендора, упрощает эксперименты с Qwen3.8-Flash (как только она станет доступна через платформу или связанные маршруты Qwen) и упорядочивает продакшен-развёртывания, которые могут смешивать модели под разные задачи (например, Qwen для экономичных кодовых агентов + другая модель для специализированных рассуждений). Документация и быстрые руководства доступны на apidoc.cometapi.com и основном сайте CometAPI.

Независимо от того, размещаете ли вы открытые веса у себя, используете QwenCloud или подключаетесь через единую платформу вроде CometAPI, Qwen3.8-Flash-Next снижает барьер для высокопроизводительных, длинноконтекстных мультимодальных агентов.

Что умеет Qwen3.8-Flash-Next?

1. Массовые кодовые агенты

Бюджет в 6B активных параметров в сочетании с 62.5 на SWE-bench Pro в оценке Qwen делает Qwen3.8-Flash-Next особенно интересной для кодовых систем, запускающих множество параллельных сессий. Примеры включают code review, триаж задач, навигацию по репозиторию, генерацию тестов и итеративные патчи, где важна пропускная способность почти так же, как и «интеллект» одиночного прогона.

2. Долгий горизонт офисной и знания‑ориентированной работы

CoWorkBench и JobBench центральны в позиционировании модели. Архитектура рассчитана на агентные циклы, которые многократно читают контекст, вызывают инструменты, обновляют состояние и продолжают работу, а не отвечают один раз. Это естественно ложится на документооборот, анализ таблиц, сбор отчётов, синтез исследований и автоматизацию бизнес‑процессов.

3. Мультимодальные компьютерные и мобильные агенты

Входы изображений и видео, результаты AndroidWorld, оценка OSWorld и Vision2Web делают модель релевантной для GUI‑агентов. Она может выступать слоем рассуждений в системах, которые интерпретируют скриншоты, управляют мобильными интерфейсами, воспроизводят макеты приложений или совмещают визуальное состояние с вызовами инструментов.

4. Длинное видео и визуальные рассуждения

Официальная карта модели включает явные примеры видео‑входов и рекомендации по предобработке видео часового масштаба. Это делает модель полезной для видео‑QA, поиска по длинным видео, извлечения визуальных событий и рабочих процессов, сочетающих понимание видео с downstream‑инструментами.

5. Миллион‑токеновые исследования и репозиторные процессы

Открытая модель нативно на 262 144 токена и расширяема до 1 000 000 с YaRN. Это важно: 1M — расширение, а не нативный контекст открытой модели. Для крупных репозиториев или корпусов исследований QSA призвана сделать стоимость извлечения в таких длинных контекстах более практичной, чем плотное глобальное внимание.

Как разработчикам запускать Qwen3.8-Flash-Next?

Разработчики могут скачать открытые веса с Hugging Face и запускать модель через Transformers, vLLM, SGLang или TokenSpeed. Qwen предоставляет примеры интерфейса Chat Completions, совместимого с OpenAI, для текста и мультимодального ввода.

Например, официальная карта модели демонстрирует сервинг Qwen/Qwen3.8-Flash-Next с vLLM и вызов через /v1/chat/completions. Входы изображений и видео также демонстрируются через совместимый с OpenAI интерфейс.

Qwen3.8-Flash-Next по умолчанию работает в thinking mode. Разработчики могут управлять поведением «мышления» через enable_thinking, preserve_thinking и reasoning_effort; задокументированные уровни reasoning_effort — xhigh, medium и low.

Каковы ограничения Qwen3.8-Flash-Next?

Наибольшее практическое ограничение — стоимость аппаратуры. Хотя активируются только 6B параметров языковой модели, чекпойнт содержит 125B языковых параметров плюс компонент 51B n-gram эмбеддингов и 4B параметров MTP. Текущий репозиторий составляет примерно 360 GB, поэтому локальное развёртывание остаётся инфраструктурно тяжёлой задачей.

Второе ограничение — 262K как нативная длина контекста, а не 1M. Модель может быть расширена до 1M токенов, но страница CometAPI или модели не должна просто указывать «1M нативного контекста». Корректная формулировка — 262K нативного контекста, расширяемого до 1M.

Наконец, производительность в бенчмарках неравномерна. Qwen3.8-Flash-Next очень конкурентоспособна в кодовых и агентных задачах, но не лидирует во всех бенчмарках. Например, Claude Opus 4.6 набирает 40.0 на HLE против 35.9 у Flash-Next, тогда как DeepSeek-V4-Flash-0731 лидирует в указанной выборке на NL2Repo-Bench.

Qwen3.8-Flash-Next: что это сигнализирует для Qwen4

Более широкая значимость релиза — его роль раннего превью архитектуры, которая, как ожидается, ляжет в основу Qwen4. Qwen3.8-Flash-Next объединяет Qwen Sparse Attention, Gated DeltaNet, четырёхветвевые Gated Residual соединения, N-gram Embedding, ультраразрежный пул экспертов MoE и Multi-Token Prediction. Эти решения показывают, как Qwen исследует путь к большей ёмкости, более длинному контексту и более сильной мультимодальной и агентной производительности без пропорционального роста активных вычислений на токен.

Итоговый вердикт

Qwen3.8-Flash-Next важна тем, что меняет постановку задачи эффективности. Вместо того чтобы считать все параметры эквивалентными, модель сочетает относительно малый активный MoE‑путь с очень большой памятью «поискового» типа и разрежённым механизмом извлечения, ориентированным на длинный контекст. Это даёт Qwen несколько независимых рычагов для увеличения ёмкости без равного роста матричных вычислений на токен.

Для разработчиков это делает модель привлекательным вариантом для массовых кодовых ассистентов, длинноконтекстных агентов, мультимодальной автоматизации и self‑hosted экспериментов. Для более широкой дорожной карты Qwen это ещё значимее: Qwen прямо использует этот релиз, чтобы показать направление архитектуры, которую планирует доработать к Qwen4.

Продолжить обучение

Свяжите эту статью со следующим решением.

Посмотреть все темы
Опубликовано Aug 28, 2026
Последнее обновление Aug 29, 2026
13 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Готовы сократить затраты на AI-разработку на 20%?

Начните бесплатно за несколько минут. Пробные кредиты включены. Карта не нужна.

Читать далее