Сначала ответ: Qwen4 больше не является лишь предположительным названием. Qwen теперь описывает Qwen3.8-Flash-Next как мультимодальную модель MoE и экспериментальный предварительный обзор архитектуры, которая ляжет в основу Qwen4. Это подтверждает ориентацию архитектуры на эффективность, но не является запуском продукта Qwen4. Итоговая линейка моделей, масштаб параметров, таблица бенчмарков, идентификатор API, лицензия, цены и график релиза остаются нераскрытыми.
Что такое Qwen4?
Qwen4 — это следующее крупное поколение архитектуры Qwen, о котором команда Qwen теперь заявляет открыто, хотя ни отдельная модель Qwen4, ни продуктовая линейка не были запущены. В официальных материалах по Qwen3.8-Flash-Next она названа экспериментальным предварительным обзором архитектуры для Qwen4. Финальный объём параметров, продуктовая линейка, таблица бенчмарков, цены, идентификатор API, лицензия и дата релиза не раскрываются. Точные значения, которые нельзя отследить до Qwen или Alibaba Cloud, следует считать непроверенными.
Наиболее полезно обсуждать Qwen4 по трём уровням доказательств. Подтверждённая информация сейчас включает текущие модели Qwen, опубликованную документацию и архитектурный превью Qwen3.8-Flash-Next. Ожидаемые направления — это выводы, основанные на этих сигналах. Неизвестные — это финальные продуктовые детали, которые нельзя ответственно заполнять оценками. Это различие важно, потому что превью подтверждает архитектурные намерения, не определяя при этом производственную линейку Qwen4.
| Уровень доказательств | Как следует использовать | Примеры в этой статье |
|---|---|---|
| Подтверждено | Излагать как факт с прямой официальной ссылкой | Архитектурный превью Qwen3.8-Flash-Next; масштаб и базовые бенчмарки Qwen3.8-Max |
| Ожидается | Использовать осторожные формулировки и выводы | Как превью-архитектура может масштабироваться в финальные модели Qwen4 |
| Неизвестно | Не придумывать значения или сроки релиза | Финальная линейка моделей, параметры, таблица, цена, лицензия и идентификатор API |
Почему Qwen4 — логичный следующий шаг
Поколение Qwen3 утвердило гибридный подход к рассуждению. В официальном анонсе описаны режимы с размышлением и без него, позволяющие разработчикам менять скорость отклика в обмен на более глубокое обдумывание. В этом же поколении расширили мультиязычную поддержку и усилили работу с инструментами, включая агентные процессы, ориентированные на MCP.
Дорожная карта Qwen затем указала на масштабирование данных, расширение контекста, углубление модальностей и RL с обратной связью от среды. Эта дорожная карта важнее прогнозов, основанных на слухах: она описывает переход следующего поколения от обучения моделей к обучению агентов, способных взаимодействовать со средой и завершать работу на длинном горизонте.
Линия Qwen3.8 теперь даёт две разные базы. Qwen3.8-Max остаётся текущей флагманской базой возможностей, с размещённой системой MoE на 2.4 трлн параметров для кодинга, офисной работы, визуального понимания, длинных документов, длинных видео и автономного планирования. Qwen3.8-Flash-Next играет другую роль: Qwen прямо позиционирует её как архитектурный превью для Qwen4. Будущий Qwen4 должен объединить широту флагмана с ориентированным на эффективность дизайном превью.
Что Qwen3.8-Flash-Next раскрывает о Qwen4
Qwen3.8-Flash-Next — это первое конкретное публичное свидетельство о фундаменте Qwen4. Qwen называет её первым релизом с открытыми весами на новой архитектуре и утверждает, что этот дизайн ляжет в основу Qwen4. Превью — это более весомый сигнал, чем выводы по дорожной карте, при этом масштаб и конфигурация производственной модели остаются открытыми.
Модель — это мультимодальная каузальная языковая модель с визуальным энкодером. Её языковая часть включает 125B параметров с активацией 6B, плюс 51B n-граммных эмбеддингов и 4B параметров MTP. В ней 48 слоёв, 512 экспертов с 10 маршрутизируемыми и одним общим активным экспертом на токен, нативный контекст на 262 144 токена и поддержка расширения до 1 000 000 токенов.
| Архитектурный сигнал | Подтверждено в Qwen3.8-Flash-Next | Что это предполагает для Qwen4 |
|---|---|---|
| Ультра-разреженная MoE | Основная модель 125B; 6B активных на токен; 512 экспертов | Возможности на единицу активных вычислений могут стать ключевой целью |
| Гибридное внимание | Три слоя Gated DeltaNet на каждый слой Qwen Sparse Attention | Для длинного контекста важнее задержка и эффективность KV-кэша, чем голый размер окна |
| Управляемые резидуалы | Четыре расширенные резидуальные ветви с зависящими от данных гейтами | Qwen тестирует более выразительное глубокое масштабирование с контролируемыми накладными |
| N-граммные эмбеддинги | 51B параметров биграммных и триграммных эмбеддингов | Выгружаемая в память ёмкость может дополнять вычислительно тяжёлое масштабирование MoE |
| Нативная мультимодальность | Каузальная ЯМ с визуальным энкодером | Текст и зрение — вероятно, архитектурные основы, а не приставные варианты |
| Длинный контекст | Нативно 262K; расширяемо до 1M | Qwen4, вероятно, подчеркнёт эффективных долгогоризонтных агентов |
Результаты бенчмарков, заявленные вендором, также показывают, почему архитектура важна. Несмотря на активацию лишь 6B параметров на токен, модель превосходит плотный базовый Qwen3.8-27B в выбранных оценках по кодингу, офисной работе, использованию инструментов и мультимодальным агентам ниже. Это не оценки Qwen4; это свидетельство того, что новая архитектура нацелена на рост возможностей на активный параметр.
| Бенчмарк | Qwen3.8-Flash-Next | Qwen3.8-27B |
|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 |
| SWE-bench Pro | 62.5 | 61.7 |
| CoWorkBench | 73.9 | 70.7 |
| Toolathlon Verified | 73.5 | 67.1 |
| ClawEval-MM (Pass@3) | 64.4 | 57.4 |
| AndroidWorld | 84.5 | 81.9 |
Интерпретация: Flash-Next превращает три ожидания для Qwen4 в более сильные сигналы: ультра-разрежённую активацию, гибридное внимание для длинного контекста и нативную мультимодальность. Она не раскрывает финальный объём параметров, точную конфигурацию контекста, продуктовые уровни или сроки релиза Qwen4.
Ожидаемые спецификации Qwen4
Поскольку финальных спецификаций Qwen4 нет, таблица ниже использует Qwen3.8-Max как подтверждённую производственную базу и Qwen3.8-Flash-Next как подтверждённый архитектурный сигнал. Превью повышает уверенность в нескольких направлениях, но каждое финальное поле Qwen4 остаётся ожидаемым или неизвестным, пока Qwen не опубликует модель.
| Спецификация | Подтверждённая база Qwen3.8-Max | Ожидание для Qwen4 | Уверенность |
|---|---|---|---|
| Статус | Выпущен | Предварительный обзор архитектуры подтверждён; модель не запущена | Подтверждено |
| Архитектура | Разрежённая MoE с гибридным вниманием | Ожидается на базе GDN + QSA из Flash-Next, с управляемыми резидуалами и n-граммами | Высокая |
| Всего параметров | 2.4T | Неизвестно; может и не превосходить 2.4T | Низкая |
| Активные параметры | Около 95B на шаг в модели с открытыми весами | Вероятна ультра-разрежённая маршрутизация; точные активные вычисления неизвестны | Средне-высокая |
| Окно контекста | 1,000,000 токенов | Оптимизация для длинного контекста; финальные нативные и дефолтные лимиты неизвестны | Высокая |
| Максимальный вывод | 131,072 токена | Вероятно сохранён или расширен | Средняя |
| Вход в хостинге | Текст, изображение и видео | Мультимодальность подтверждена; точная поддержка аудио неизвестна | Высокая |
| Выходная модальность | Текст | Вероятно текст; нативные медиа-выходы не подтверждены | Средняя |
| Рассуждение | Режимы размышления и быстрой инференции | Контролі рассуждений вероятны; финальное поведение API неизвестно | Средне-высокая |
| Поддержка инструментов | Function calling и структурированный вывод | Ожидаются более сильный выбор инструментов, сохранение состояния и восстановление | Высокая |
| Веса и лицензия | Есть флагманский чекпойнт с открытыми весами | Превью с открытыми весами; финальные лицензия и чекпойнты Qwen4 неизвестны | Средняя |
| ID модели API | qwen3.8-max | Недоступен | Подтверждено |
Интерпретация: Flash-Next повышает уверенность в ультра-разрежённой маршрутизации MoE, гибридном внимании для длинного контекста, управляемых резидуалах, n-граммных эмбеддингах и нативной мультимодальности. Это не доказывает, что финальная модель Qwen4 будет иметь 125B параметров, активировать 6B на токен или поставляться с теми же лимитами контекста.
На какой архитектуре ожидается Qwen4?
Ультра-разрежённая MoE — теперь самый сильный сигнал
Архитектурный вопрос теперь менее спекулятивен. Карточка модели Qwen3.8-Flash-Next документирует 125B основных параметров при активации лишь 6B на токен, плюс 51B n-граммных эмбеддингов. Этот ультра-разрежённый дизайн предполагает, что Qwen4 может приоритизировать общую способность к задачам на единицу активных вычислений, а не наращивать активные параметры пропорционально объёму хранения.
Важно не то, будут ли в Qwen4 больше экспертов, а то, останутся ли маршрутизация, доступ к памяти и специализация экспертов стабильными на длинных задачах. N-граммные эмбеддинги Flash-Next также показывают, что Qwen изучает ёмкости, более дешёвые по вычислениям и проще выгружаемые в память, чем классическое масштабирование MoE.
Гибридное внимание нацелено на эффективность длинного контекста
Flash-Next заменяет прежнюю связку Gated DeltaNet и полноразмерного внимания на Gated DeltaNet и Qwen Sparse Attention, работающие на уровне микро-блоков. Её 48 слоёв повторяют три блока Gated DeltaNet, за которыми следует один блок разрежённого внимания. Это самый ясный признак того, что Qwen4 может быть спроектирован для снижения задержки на длинном контексте и давления на KV-кэш, а не для упора на более широкое окно плотного внимания.
Длинный контекст должен стать памятью агента, а не просто большим промптом
Окно на миллион токенов полезно лишь тогда, когда модель умеет извлекать нужные факты, сохранять цели и избегать накопления противоречивого состояния. Поэтому Qwen4 следует оценивать по тому, как он использует длинный контекст через вызовы инструментов, изменения файлов, промежуточные результаты и восстановление после ошибок. Сырая длина контекста менее информативна, чем точность извлечения и завершение задач на длинной траектории.
Управление рассуждениями может стать более гранулярным
Гибридный дизайн Qwen3 уже позволял быстрое и вдумчивое поведение. Flash-Next укрепляет сигнал, поддерживая enable_thinking, preserve_thinking и reasoning_effort controls. Содержательное улучшение в Qwen4 могло бы распределять рассуждения динамически и сохранять лишь то состояние, которое повышает многошаговую согласованность, уменьшая общую стоимость рабочего процесса, а не просто генерируя более длинные видимые рассуждения.
Мультимодальность может приблизиться к использованию компьютера
Мультимодальность теперь ожидается сильнее, поскольку и сервис Qwen3.8-Max, и превью с открытыми весами Flash-Next поддерживают визуальный ввод. Qwen4 может объединить это восприятие с более надёжным действием: понять скриншот, выбрать UI-элемент, проверить результат и скорректировать план. Нативные аудио, генерация изображений, голосовой вывод и генерация видео остаются неподтверждёнными.
Ожидаемые возможности Qwen4
- Более надёжные долгогоризонтные агенты. Ниже доля неудачных вызовов инструментов, сильнее удержание целей, лучше восстановление и более стабильные результаты после сотен действий.
- Инжиниринг уровня репозиториев. Улучшенное планирование на больших кодовых базах, тестах, терминалах, трекерах задач и окружениях деплоя.
- Сквозная офисная работа. Более сильный путь от исследования и анализа документов к таблицам, презентациям, отчётам и готовым решениям.
- Мультимодальное использование инструментов. Визуальное понимание, которое информирует взаимодействие с UI, операции с документами и рассуждения, опирающиеся на окружение.
- Адаптивные бюджеты рассуждения. Автоматическое повышение от быстрых ответов к более глубоким, когда растут неопределённость или сложность задачи.
- Более высокая способность на активный параметр. Лучшая маршрутизация экспертов, n-граммная ёмкость, разрежённое внимание, кэширование и пост-тренировка вместо масштабирования ради масштабирования.
- Более широкая семейство моделей. Возможны варианты Max, Plus, Coder, small MoE, VL или Omni, хотя ни одно из этих названий не подтверждено.
Перспективы бенчмарков Qwen4: что показывает база Qwen3.8-Max
Оценок Qwen4 нет. Flash-Next и Max отвечают на разные вопросы: таблица Flash-Next тестирует возможности новой архитектуры, ориентированной на эффективность, а официальная таблица Qwen3.8-Max остаётся более сильной производственной базой возможностей по кодинговым агентам, воспроизводимости исследований, профессиональному cowork, визуальному рассуждению, мобильному и компьютерному использованию. Qwen4 нужно будет сочетать оба направления под согласованные оценки.
| Бенчмарк | Заявленный результат Qwen3.8-Max | Что должен будет доказать Qwen4 |
|---|---|---|
| SWE-Pro | 67.7 | Сократить разрыв в профессиональном решении задач по репозиториям |
| TerminalBench 2.1 | 86.6 | Повысить надёжность терминального агента в том же стенде |
| PaperBench | 93.0 | Сохранить силу в исследованиях с независимой репликацией |
| FrontierSWE | 73.5 | Превращать долгие рассуждения в больше завершённой инженерной работы |
| CoWorkBench | 74.8 | Давать более надёжные профессиональные результаты |
| OSWorld-Verified | 86.1 | Снизить ошибки визуальных действий в сценариях использования ПК |
Две базы указывают на двойное требование. Flash-Next показывает, что низкие активные вычисления всё ещё могут обеспечивать сильные агентные и мультимодальные результаты; Max демонстрирует более высокий потолок возможностей, который должен превзойти новый флагман. Поэтому Qwen4 следует оценивать и по успеху на согласованных задачах, и по общей стоимости рабочего процесса, а заявленные вендором результаты — отделять от независимой репликации.
Официальные результаты бенчмарков Qwen3.8-Max. Источник: официальный релиз Qwen3.8-Max**.
Qwen4 и текущие фронтирные модели: подтверждённые базы и неизвестные
Наиболее полезно сравнивать не просто Qwen4 против Qwen3.8-Max, а Qwen4 против уже видимых инженерных решений в Kimi K3, DeepSeek V4 Pro и GLM-5.3. Следующая таблица сравнивает подтверждённые атрибуты текущих моделей с всё ещё неизвестной колонкой Qwen4.
| Измерение | Qwen4 | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Pro | GLM-5.3 |
|---|---|---|---|---|---|
| Статус | Подтверждён архитектурный превью; модель не выпущена | Выпущен | Выпущен | Выпущен | Выпущен |
| Масштаб | Неизвестно | 2.4T / около 95B активных | 2.8T / 16 из 896 экспертов | 1.6T / 49B активных | Не раскрыт в этом релизе |
| Контекст | Ожидается 1M+ | 1M | 1M | 1M | 1M |
| Ввод | Направление на мультимодальность подтверждено; финальный интерфейс неизвестен | Текст, изображение, видео | Текст и нативное зрение | Ориентация на текст | Только текст |
| Рассуждение | Неизвестно | Режимы размышления и быстрый | Low / high / max effort | Thinking / non-thinking | Всегда включено; low / high / max |
| Открытая экосистема | Финальные веса и лицензия не подтверждены | Есть флагман с открытыми весами | Позиционирование как open-source | Открытые веса | Позиционирование как open-source |
| Фокус | Ожидается эффективный мультимодальный агент | Кодинг, cowork, визуальные агенты | Кодинг и интеллектуальная работа | Эффективные рассуждения и кодинг | Кодинг и кибербезопасность |
Масштаб модели и эффективность инференса
Документация Kimi описывает 2.8T параметров и 16 активных экспертов из 896. DeepSeek V4 Pro идёт другим путём с 1.6T общих и 49B активных параметров. Qwen4 не обязан быть самой крупной моделью, чтобы выиграть это сравнение; ему нужно превращать активные вычисления в более надёжно завершённую работу.
Контекст и мультимодальность
Один миллион токенов стал общим флагманским базовым уровнем, так что длина контекста сама по себе не выделит Qwen4. Более сильная возможность Qwen — использование мультимодального контекста: найти верные доказательства среди документов, кода, скриншотов и видео, а затем выполнить правильное действие. Kimi K3 также имеет нативное визуальное понимание, тогда как текущий интерфейс GLM-5.3 только текстовый с контекстом 1M и максимумом вывода 128K.
Кодинг, агенты и специализированные сильные стороны
Qwen3.8-Max приносит широкий профиль по кодингу, исследованиям, cowork и визуальным агентам. Qwen3.8-Flash-Next добавляет ориентированную на эффективность мультимодальную архитектуру с более высокой способностью на активный параметр. Kimi K3 делает акцент на долгогоризонтный кодинг и интеллектуальную работу, DeepSeek V4 Pro — на эффективные рассуждения и агентный кодинг, а GLM-5.3 добавляет заметный фокус на кибербезопасность. Достоверный запуск Qwen4 должен объединить широкую надёжность агентов со специалистским уровнем производительности в программной инженерии и компьютерном зрительном использовании.
Открытые веса — это не вся история развёртывания
Открытые веса могут улучшить контроль, кастомизацию и выбор провайдера, но практическое сравнение также включает условия лицензии, требования к железу, качество квантизации, поддержку дообучения и доступность оптимизированных стэков сервинга. Слово «открытый» не должно подменять проверку точной лицензии и условий развёртывания каждого релиза.
Результат сравнения: Сильнейшая потенциальная позиция Qwen4 — это широкий мультимодальный агент, сочетающий визуальные и cowork-сильные стороны Qwen3.8-Max с ориентированной на низкие активные вычисления архитектурой Flash-Next и более высокой надёжностью в программной инженерии. Объявлять его победителем нельзя, пока нет согласованных оценок и производственного поведения.
Потенциальные сценарии использования Qwen4
Автономная программная инженерия
Более сильный агент Qwen мог бы инспектировать репозиторий, воспроизводить проблему, редактировать несколько файлов, запускать тесты, анализировать сбои и готовить изменения, пригодные для pull request. Важная метрика — доля задач, завершённых без вмешательства человека, а не объём сгенерированного кода.
Корпоративная интеллектуальная работа
Длинный контекст и мультимодальное понимание могли бы поддерживать процессы, начинающиеся с контрактов, PDF, таблиц, диаграмм и протоколов встреч и заканчивающиеся запиской по решению, анализом или структурированным планом действий. Предприятиям всё равно потребуются средства контроля извлечения, журналы аудита и проверка источников вокруг модели.
Мультимодальные агенты использования компьютера
Qwen4 может быть полезен там, где агент должен интерпретировать скриншоты, перемещаться по приложениям, проверять состояние интерфейса и восстанавливаться, если клик или отправка формы привели к неожиданному результату. Это естественное продолжение сильной визуальной и OSWorld-базы Qwen3.8-Max, но нативная поддержка управления компьютером не анонсирована.
Научные и инженерные исследования
Рабочие процессы исследований объединяют обзор литературы, код, симуляции, анализ данных и написание отчётов. Будущая модель Qwen могла бы оркестрировать эти шаги и сохранять более длинную историю экспериментов. Производительность на PaperBench делает это направлением, достойным внимания, но воспроизводимость и независимая проверка останутся ключевыми.
Что мы пока не знаем
Хотя Qwen подтвердил архитектуру через Flash-Next, следующие производственные детали недоступны и должны оставаться явно неразрешёнными до официального анонса Qwen4:
- Точные названия продуктов и запустится ли Qwen4 как одна модель или семейство.
- Дата релиза или график превью.
- Сохранят ли финальные модели точное соотношение GDN/QSA, дизайн управляемых резидуалов, масштаб n-граммных эмбеддингов и маршрутизацию экспертов из Flash-Next.
- Общее число параметров, активные параметры, число экспертов и масштаб обучающих данных для каждой модели Qwen4.
- Нативная длина контекста, значения по умолчанию, максимальный вывод и поддерживаемые модальности для каждого маршрута.
- Нативные возможности аудио, генерации изображений, речи или видео.
- Официальные результаты бенчмарков и стенд оценки, использованный для каждой оценки.
- Доступность открытых весов, условия лицензии и коммерческого использования.
- Цены API, региональная доступность, лимиты и финальный ID модели.
Правило проверки: Любые точные спецификации Qwen4, графики бенчмарков, таблицы цен или идентификаторы API следует считать непроверенными, если они не восходят напрямую к Qwen, Alibaba Cloud или официальному репозиторию модели.
Когда выйдет Qwen4?
Обоснованной публичной даты релиза нет. Qwen3.8-Flash-Next подтверждает, что Qwen тестирует архитектуру, которая ляжет в основу Qwen4, но публичные материалы не дают графика появления производственной модели Qwen4. Завершение обучения, эффективность сервинга, оценка безопасности, лицензирование весов и продуктовая интеграция могут повлиять на сроки и форму релиза.
Самый безопасный подход в публикациях — избегать прогнозов на месяц или квартал. Следите за официальным сайтом Qwen, документацией Alibaba Cloud Model Studio, проверенными репозиториями моделей и каталогом моделей CometAPI. Страница модели Qwen4 должна появиться только после фактического листинга модели.
Как разработчикам подготовиться к Qwen4
- Установите две базы. Используйте Qwen3.8-Flash-Next для измерения эффективности архитектуры и Qwen3.8-Max для измерения текущего флагманского уровня возможностей.
- Отделите ID моделей от бизнес-логики. Держите маршрутизацию и конфигурации вне кода приложения, чтобы безопасно менять модели.
- Стройте оценки на уровне задач. Мерьте завершённые исправления, точные результаты исследований, успешные цепочки инструментов и пригодные результаты.
- Логируйте общую стоимость рабочего процесса. Отслеживайте задержки, входные и выходные токены, использование кэша, ретраи, неудачные действия и доработку человеком.
- Сохраняйте маршруты отката. Используйте маршрутизацию моделей и фоллбеки провайдеров вместо превращения одной неизданной модели в единую точку отказа.
- Не придумывайте ID модели. Ждите официального идентификатора, прежде чем добавлять qwen4 или qwen4-max в прод-конфигурацию.
Попробуйте Qwen3.8-Flash-Next и Qwen3.8-Max через CometAPI
Разработчики уже могут тестировать Qwen3.8-Flash-Next через CometAPI и держать Qwen3.8-Max как флагман для сравнения. Создайте API-ключ, сохраните его в переменной окружения и вызывайте существующую модель через совместимый с OpenAI клиент. В примере намеренно используется qwen3.8-flash-next; он не предполагает будущий идентификатор Qwen4.
Заключение
Qwen4 — это больше не слух: Qwen прямо указал на Qwen3.8-Flash-Next как на экспериментальный предварительный обзор архитектуры, которая ляжет в его основу. Превью подтверждает мультимодальное, ультра-разрежённое направление MoE, построенное вокруг Gated DeltaNet, Qwen Sparse Attention, управляемых резидуалов и n-граммных эмбеддингов. Qwen3.8-Max остаётся более сильной текущей производственной базой возможностей.
Настоящим испытанием для Qwen4 будет не то, насколько больше его объём параметров. Важно, сможет ли финальная модель совместить эффективность Flash-Next с уровнем возможностей Max, завершать более длинную работу с меньшим числом ошибок и надёжнее использовать мультимодальные доказательства. Направление архитектуры уже публично, но финальные спецификации, бенчмарки, лицензия, цена, ID API и дата релиза остаются неизвестными.
