Кратко
Qwen3.8-Omni-Flash — нативная омнимодальная модель Alibaba Qwen для понимания текста, изображений, аудио и видео с текстом в качестве выходной модальности. Анонсирована 18 сентября 2026 года; сочетает контекстное окно 1M токенов, нативное аудио‑видео рассуждение, настраиваемые рассуждения, вызов функций, веб‑поиск, понимание пространственного звука и использование инструментов.
Главное изменение — не просто лучшее понимание видео. Qwen описывает модель как свою первую омнимодальную модель, построенную вокруг агентных возможностей: она понимает, что видит и слышит, планирует дальнейшие действия, вызывает инструменты и решает более длинные задачи, такие как монтаж влогов, перевод видео, создание пересказов фильмов, анализ встреч и мультимедийные исследования.
На запуске Qwen сообщила о среднем приросте более чем на 25% по 29 оценкам по сравнению с Qwen3.5-Omni-Plus. Это результаты, заявленные поставщиком на момент запуска, а не независимые оценки.
Основные тезисы
- Нативный омнимодальный ввод: Qwen3.8-Omni-Flash принимает текст, изображения, аудио и видео, а возвращает текст.
- Агентные медиапроцессы: сочетает понимание медиа с планированием, вызовом функций и веб‑поиском.
- Длинный контекст и глубина по аудио: хостинговая модель предоставляет контекстное окно 1M токенов и поддерживает мультиязычное, стерео и амбисоническое аудио первого порядка.
- Приросты по бенчмаркам от вендора: наибольшие улучшения — в мультимодальных агентах, понимании длинного аудио, диаризации говорящих и аудиопривязке.
- Доступность как сервис: модель доступна через хостинговые API; Qwen-MM-Plugins отдельно доступен с открытым исходным кодом для мультимодальных агентных сценариев.
Разработчики могут получить доступ к API Qwen3.8-Omni-Flash в CometAPI через унифицированный рабочий процесс API.
Что такое Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash — это следующее поколение нативной омнимодальной модели Qwen. Вместо того чтобы рассматривать аудио или видео лишь как артефакты предобработки, она рассуждает в едином процессе над текстом, визуальными кадрами, речью, звуками окружения и временными связями. Поддерживаемые входы: текст, изображения, аудио и видео; текущий выход — текст.
Это различие по выходным данным важно. Официальная документация Alibaba Cloud позиционирует Qwen3.8-Omni-Flash для мультимодального понимания и агентного исполнения, в то время как сценарии с генерацией речи лучше соответствуют вариантам Omni, которые явно поддерживают аудиогенерацию.
Рамка запуска смещается от “воспринимать медиа” к “понимать, планировать, исполнять и доставлять результат”. Это делает модель релевантной для видеомонтажа, мультимедийных исследований, анализа встреч, обработки учебных видео и других сценариев, где нужно что‑то делать с медиа, а не просто их суммировать.
Спецификации Qwen3.8-Omni-Flash
Таблица ниже основана на официальных страницах Alibaba Cloud и QwenCloud; лимиты и цены могут отличаться по регионам и должны быть перепроверены перед публикацией или развёртыванием.
| Параметр | Qwen3.8-Omni-Flash — официальная страница модели |
|---|---|
| Разработчик | Alibaba Qwen |
| Выпуск | 18 сентября 2026 |
| Тип модели | Нативная омнимодальная модель |
| Ввод / вывод | Текст, изображение, аудио, видео / текст |
| Контекстное окно | 1,000,000 токенов |
| Максимальный ввод | 991,808 токенов обычный; 983,616 токенов в режиме рассуждений |
| Максимальный вывод | 131,072 токена |
| Макс. лимит рассуждений | До 262K токенов на QwenCloud |
| Рассуждения | Включено по умолчанию; настраиваемая интенсивность рассуждений |
| Инструменты и кэширование | Вызов функций, веб‑поиск, неявный кэш и сессионный кэш |
| Аудио | 113 языков и диалектов; стерео и четырёхканальный FOA |
| Стили API | Chat Completions и Responses |
| Цена QwenCloud | $0.15 за ввод, $0.47 за вывод и $0.016 за ввод через implicit‑cache на 1M токенов |
| Открытые веса | Не объявлены для этой модели на запуске |
Как работает Qwen3.8-Omni-Flash?
QwenCloud указывает, что Qwen3.8-Omni-Flash основана на архитектуре Qwen3.8-Flash-Next. Это даёт архитектурный контекст, однако опубликованные для Flash-Next числа параметров не следует автоматически представлять как точные параметры Omni‑модели, если Qwen не подтвердит соответствие.
Gated DeltaNet + Qwen Sparse Attention
База Flash-Next сочетает Gated DeltaNet с Qwen Sparse Attention. В упрощённом виде рекуррентный компонент сжимает историческую информацию в компактное состояние, а разрежённое внимание извлекает выбранный дальний контекст вместо плотного внимания ко всем парам токенов. Это особенно важно для длинных аудио‑ и видеопотоков, где длина последовательности доминирует в вычислительной стоимости.
Агентное восприятие вместо статического
Главное изменение — на уровне системы. Qwen утверждает, что модель может активно исследовать длинные видео и сосредотачиваться на релевантных моментах, а не тратить равные ресурсы на каждый сегмент. Концептуально агент выявляет, где вероятны свидетельства, глубже исследует эти моменты, рассуждает о них, а затем решает, какой инструмент или операция должны быть следующими.
Основные возможности Qwen3.8-Omni-Flash
Нативное аудио‑видео рассуждение
Qwen3.8-Omni-Flash рассуждает совместно по визуальному и аудиопотокам видео. Это важно, когда ответ зависит от обеих модальностей: определить, кто что сказал, решить, произошёл ли звук до или после действия, интерпретировать музыку или фоновый звук, связать проговорённые инструкции с тем, что на экране.
Понимание многоголосия и пространственного звука
API поддерживает многоканальное аудио, включая двухканальное стерео и амбисонику первого порядка (FOA). Сохранение направленной информации помогает в анализе встреч, воплощённых агентах, записи событий, многоголосых средах и аудиопривязке.
Настраиваемая интенсивность рассуждений
Режим рассуждений включён по умолчанию. Разработчики могут настраивать интенсивность рассуждений, балансируя задержку и расход токенов против глубины для сложных мультимедийных задач.
Вызов функций и веб‑поиск
Вызов функций и веб‑поиск — ключ к агентной позиции. Поняв видео, изображение или аудиофайл, модель может передать структурированные аргументы внешнему инструменту, получить дополнительную информацию или продолжить рабочий процесс вне модели.
Qwen-MM-Plugins
Qwen также выпустила Qwen-MM-Plugins — набор инструментов Apache-2.0 для нативных мультимодальных агентных каркасов. Среди сценариев — видеопроизводство, конвертация видео в заметки, обучение переносимым навыкам по демонстрационным видео и аудиовизуальная память.
Насколько хороша Qwen3.8-Omni-Flash на бенчмарках?
Остаётся ли Qwen3.8-Omni-Flash сильной в тексте и коде?
По результатам запуска модель Omni остаётся близка к родственной текстовой модели Flash на ряде оценок кода и рассуждений. Qwen сообщает 92.6 на LiveCodeBench v6, 63.3 на SWE-bench Pro и 91.0 на GPQA Diamond. Это результаты, заявленные поставщиком в условиях запуска, и их следует валидировать относительно задач кодирования и агентного каркаса, используемых в продакшене.
Qwen сообщает более 25% среднего улучшения по 29 оценкам по сравнению с Qwen3.5-Omni-Plus. Следующие таблицы суммируют официальные результаты запуска. Это первичные результаты и на момент публикации ещё не были независимо воспроизведены.
Условия оценки: статические строки измеряют один прогон модели в настройках запуска Qwen. Строки с пометкой “+ агент” включают окружающий агентный каркас, поиск или итеративный просмотр медиа. Официальные материалы запуска следует консультировать по шаблонам подсказок, настройкам сэмплирования, предобработке медиа и версиям каркасов; если детали не раскрыты, результат следует считать заявленным поставщиком, а не независимо воспроизводимым.
Главный сдвиг — от мультимодального понимания к мультимодальному исполнению. Ранее конвейеры часто транскрибировали аудио, семплировали кадры, отправляли артефакты в LLM, получали ответ, а затем опирались на отдельную логику приложения для выполнения задачи. Qwen3.8-Omni-Flash призвана сжать больше этого цикла в одну агентную систему.
Медиапроизводственный агент может изучить видео и аудио перед планированием монтажей. Агент для встреч может сочетать идентичность говорящих с содержанием речи и визуалами презентации. Исследовательский агент может найти релевантные моменты в часах аудиовизуального материала, а затем выполнить поиск внешнего контекста. В такой рамке аудио и видео становятся рабочим контекстом агента, а не пассивными вложениями.
Аудио‑видео агенты
| Бенчмарк — официальный источник запуска | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 |
| UniClawBench | 69.6 | 67.1 | 69.0 |
| AgenticVBench | 36.8 | 14.5 | 45.0 |
| OmniGAIA | 74.0 | — | 78.6 |
| StreamingBench | 80.8 | 57.1 | 79.9 |
Наибольший поколенческий скачок — WildClawBench-MM: по данным Qwen рост с 34.5 до 71.0. AgenticVBench также улучшился, при этом Gemini 3.8 Flash остаётся впереди на этом бенчмарке. Шаблон, таким образом, не сводится к универсальному “одна модель выигрывает всё”.
Аудио‑видео понимание и рассуждение
| Бенчмарк | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63.4 | 53.8 | 65.2 |
| OmniVideoBench + агент | 67.8 | — | 65.2 |
| Video-MME-v2 | 65.0 | — | 71.0 |
| Video-MME-v2 + агент | 71.3 | — | 71.0 |
| LVOmniBench | 63.3 | — | 70.7 |
| LVOmniBench + агент | 73.6 | — | 70.7 |
| JointAVBench | 75.9 | — | 70.4 |
Статические строки дают смешанную картину. Gemini лидирует в нескольких традиционных тестах по видеорассуждению, но результат Qwen часто повышается внутри агентного цикла. Это различие важно лишь при условии, что продакшн‑приложение использует сопоставимые поиск/инструменты/итеративный просмотр.
Аудио и многоголосое понимание
| Бенчмарк | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82.7 | 74.4 | 79.3 |
| AliMeeting DER ↓ | 3.4 | 88.1 | 72.6 |
| AliMeeting cpWER ↓ | 17.2 | 89.6 | 53.1 |
| FLEURS-ASR WER ↓ | 9.3 | 7.2 | 7.9 |
| VoiceBench | 91.6 | 92.9 | 92.3 |
Строки по встречам — явные лидеры, тогда как FLEURS-ASR и VoiceBench не улучшились относительно предшественника. Результаты запуска указывают, что выгоды больше в многоголосом, пространственном и длинноконтекстном аудио, а не в равномерном росте распознавания речи.
Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash
Таблица объединяет официальную продуктовую информацию Qwen и официальную спецификацию Gemini 3.8 Flash от Google. Сравнения бенчмарков — выполнены Qwen и не должны рассматриваться как нейтральные третьесторонние рейтинги.
| Параметр | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| Архитектура | Основа Qwen3.8-Flash-Next; точное соответствие параметров Omni не раскрыто | Предыдущее поколение Qwen Omni | Проприетарная архитектура Google Gemini |
| Контекстное окно | 1M токенов | Меньшие развернутые лимиты | 1,048,576 входных токенов |
| Рассуждения | Настраиваемая интенсивность; режим рассуждений включён по умолчанию | Нет эквивалентного режима по умолчанию в указанной конфигурации | Низкий, средний и высокий уровни рассуждений |
| Мультимодальный ввод | Текст, изображение, аудио, видео | Текст, изображение, аудио, видео | Текст, изображение, видео, аудио и PDF |
| Выход | Текст | Текст и поддерживаемые речевые сценарии | Текст |
| Кодирование | Высокие заявленные показатели по коду; не главный дифференциатор | Не основное позиционирование | Разработана для долгосрочного софтверного инжиниринга и агентов |
| Доступность API | Chat Completions и Responses; хостинговый API | Хостинговые API Qwen | Gemini API; общедоступен |
| Инструменты | Вызов функций и веб‑поиск | Вызов функций и веб‑поиск | Вызов функций, поиск с привязкой, исполнение кода и другие встроенные инструменты |
| Опубликованные цены API | QwenCloud: $0.15 за ввод / $0.47 за вывод на 1M токенов | Зависит от региона и точки доступа | Вступительная цена Google: $0.75 за ввод / $3.75 за вывод на 1M токенов до 31 декабря 2026 |
| Оптимальное применение | Медиа‑агенты и анализ | Omni‑диалоги и вывод речи | Широкие мультимодальные, кодовые и автономные агентные сценарии |
Qwen3.5-Omni-Plus остаётся актуальной, когда требуется генерируемая речь. Qwen3.8-Omni-Flash более явно оптимизирована под эффективное аудио‑видео понимание и инструментально ориентированное исполнение.
По сравнению с Gemini 3.8 Flash оценка Qwen смешанная: Qwen3.8-Omni-Flash конкурентоспособна в аудио, многоголосной обработке, привязке и ряде агентных рабочих процессов, тогда как Gemini лидирует в некоторых статических тестах по видеорассуждению. Разумное сравнение — по конкретной нагрузке.
Разработчики, оценивающие унифицированный доступ, могут сравнить API Gemini 3.8 Flash в CometAPI, API Qwen3.8-Flash в CometAPI и API Qwen3.8-Flash-Next в CometAPI вне таблицы, чтобы технические источники и ссылки на доступ к продукту оставались раздельными.
Ограничения Qwen3.8-Omni-Flash
- Только текстовый выход: понимает аудио и видео, но не генерирует речь в качестве выходной модальности.
- Хостинговое развёртывание: открытые веса не объявлены для Qwen3.8-Omni-Flash на запуске.
- Свежие бенчмарки: основные сравнения — преимущественно первичные результаты, требующие независимой проверки.
- Эффекты агентного каркаса: некоторые оценки включают поиск, инструментальную среду или итеративный просмотр и не должны путаться с результатами “только модель”.
- Стоимость, зависящая от процесса: длинные видео всё ещё могут быть дорогими, если приложение повторно перерабатывает большие сегменты вместо использования поиска, кэширования или целевого просмотра.
Кому стоит использовать Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash наиболее интересна, когда аудио или видео — часть самой задачи, а не вложение для краткого резюме. Подходящие сценарии включают интеллект встреч, поиск по длинным медиа, конвейеры перевода видео, рабочие процессы “урок‑в‑конспект”, медиапроизводственные агенты и аудиовизуальные архивы.
Для обычного текстового чата специализированная текстовая модель Flash может быть проще. Для приложений с речевым выходом лучше подойдёт Omni‑модель с явной аудиогенерацией. Для сценариев, сочетающих зрение, слух, рассуждение и действие, Qwen3.8-Omni-Flash — более выразительный вариант в линейке Qwen.
Заключение
Qwen3.8-Omni-Flash правильнее понимать как агентную аудио‑видео модель, а не просто очередной мультимодальный релиз Flash. Её контекст 1M, нативное аудио‑видео рассуждение, многоголосие и пространственный звук, настраиваемые рассуждения, вызов функций, поиск и экосистема Qwen-MM-Plugins нацелены на одно и то же: позволить ИИ‑системе перейти от понимания мультимедиа к работе с мультимедиа.
Данные запуска показывают существенный поколенческий скачок относительно Qwen3.5-Omni-Plus, особенно в агентных рабочих процессах и сложных аудиосценариях. По сравнению с Gemini 3.8 Flash собственные числа Qwen более сбалансированы. Важен не вопрос “какая модель выигрывает таблицу”, а то, какая комбинация модели и каркаса решает целевой рабочий процесс точно и экономично.
