TL;DR
Qwen3.8-Omni-Flash は、テキスト・画像・音声・動画の理解にネイティブ対応し、出力はテキストのオムニモーダルモデル。2026年9月18日に発表され、1M-token context window、ネイティブな音声・動画推論、調整可能な思考、関数呼び出し、ウェブ検索、空間オーディオ理解、ツール利用などを備える。
最重要の変化は、単なる動画理解の向上ではない。Qwen は本モデルをエージェント指向の能力を軸に設計した初のオムニモーダルモデルと位置づける。見聞きした内容を理解し、次に何をすべきかを計画し、ツールを呼び出し、Vlog編集、動画翻訳、映画の要約制作、会議分析、マルチメディア調査といった長尺タスクを遂行できる。
ローンチ時点で、Qwen は Qwen3.5-Omni-Plus に対し29の評価で平均25%以上の改善を報告。これらはベンダーによるローンチ時の結果であり、独立検証ではない。
Key Takeaways
- ネイティブなオムニモーダル入力対応: Qwen3.8-Omni-Flash はテキスト、画像、音声、動画を受け取り、現時点の出力はテキスト。
- エージェント的なメディアワークフロー: メディア理解を計画、関数呼び出し、ウェブ検索と組み合わせ可能。
- 長いコンテキストと音声の奥行き: ホステッド版は1Mトークンのコンテキストウィンドウを提供し、多言語・ステレオ・一次アンビソニック音声に対応。
- ベンダー報告のベンチマーク向上: マルチモーダルエージェント、長尺音声理解、話者分離、音声グラウンディングで大幅改善が目立つ。
- ホステッド提供: モデルはホステッドAPI経由で利用可能。マルチモーダル・エージェント用の Qwen-MM-Plugins は別途オープンソース。
開発者は、統一APIのワークフローで CometAPI の Qwen3.8-Omni-Flash API にアクセスできる。
What Is Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash は Qwen の次世代ネイティブ・オムニモーダルモデル。音声や動画を単なる前処理の生成物として扱うのではなく、テキスト、ビジュアルフレーム、音声、環境音、時間関係を1つのワークフロー内で推論する。対応入力はテキスト・画像・音声・動画、現時点の出力はテキスト。
この出力の違いは重要。 Alibaba Cloud の公式ドキュメンテーションでは、Qwen3.8-Omni-Flash をマルチモーダル理解とエージェント実行に位置づけており、音声出力のユースケースは明示的に音声生成をサポートする Omni 系列が引き続き適する。
ローンチの位置づけは「メディアを知覚する」から「理解・計画・実行・成果」へと移行。動画編集、マルチメディア調査、会議分析、インストラクション動画処理など、メディアを単に要約するのでなく「扱って作業する」必要があるワークフローに適合する。
Qwen3.8-Omni-Flash specifications
以下の仕様表は Alibaba Cloud および QwenCloud の公式モデルページに基づく。制限や価格は地域により異なる可能性があるため、公開や導入前に再確認が必要。
| Specification | Qwen3.8-Omni-Flash — official model page |
|---|---|
| Developer | Alibaba Qwen |
| Release | September 18, 2026 |
| Model type | Native omni-modal model |
| Input / output | Text, image, audio, video / text |
| Context window | 1,000,000 tokens |
| Maximum input | 991,808 tokens normal; 983,616 tokens in thinking mode |
| Maximum output | 131,072 tokens |
| Maximum reasoning allowance | Up to 262K tokens on QwenCloud |
| Thinking | Enabled by default; configurable reasoning effort |
| Tools and caching | Function calling, web search, implicit cache, and session cache |
| Audio | 113 languages and dialects; stereo and four-channel FOA |
| API styles | Chat Completions and Responses |
| QwenCloud price | $0.15 input, $0.47 output, and $0.016 implicit-cache input per 1M tokens |
| Open weights | Not announced for this model at launch |
How Does Qwen3.8-Omni-Flash Work?
QwenCloud によれば、Qwen3.8-Omni-Flash は Qwen3.8-Flash-Next architecture 上に構築されている。これはアーキテクチャの文脈を与えるが、Flash-Next で公開されたパラメータ規模を Qwen の確認なしに Omni モデルの正確なパラメータ仕様として提示すべきではない。
Gated DeltaNet + Qwen Sparse Attention
Flash-Next の基盤は Gated DeltaNet と Qwen Sparse Attention の組み合わせ。単純化すると、再帰コンポーネントが履歴情報をコンパクトな状態に圧縮し、スパースアテンションが全トークン対に密なフルアテンションを適用する代わりに、選択的に長距離コンテキストを取得する。系列長が計算コストを支配し得る長尺の音声・動画ストリームで特に有効。
静的な知覚からエージェント的知覚へ
より大きな変化はシステムレベル。Qwen は、モデルが長尺動画を能動的に探索し、全セグメントに等しく計算資源を使うのではなく、関連する瞬間に焦点を当てられるとする。概念的には、エージェントが証拠がありそうな箇所を特定し、そこを深く検査し、推論し、次にどのツールや操作を行うべきかを決める。
What Are the Main Qwen3.8-Omni-Flash Features?
ネイティブな音声・動画推論
Qwen3.8-Omni-Flash は動画のビジュアルと音声ストリームを統合的に推論する。誰が発言したかの特定、音が行動の前後どちらで起きたかの判断、音楽や環境音の解釈、発話された指示と画面表示の接続など、両モダリティに依存する課題で重要となる。
マルチスピーカーと空間オーディオ理解
API はマルチチャネル音声をサポートし、2チャネルのステレオと4チャネルの一次アンビソニックスに対応。方向性情報の保持は、会議分析、実世界エージェント、記録イベント、マルチスピーカー環境、音声グラウンディングに役立つ。
調整可能な推論労力
思考は既定で有効。開発者は推論労力を設定し、レイテンシとトークン消費を、複雑なマルチメディアタスク向けの深い推論とトレードオフできる。
関数呼び出しとウェブ検索
関数呼び出しとウェブ検索はエージェント的ポジショニングの中核。動画・画像・音声ファイルを理解した後、モデルは構造化引数を外部ツールに渡し、追加情報を取得し、モデル外でワークフローを継続できる。
Qwen-MM-Plugins
Qwen は Qwen-MM-Plugins も公開。マルチモーダルネイティブなエージェント・ハーネス向けの Apache-2.0 ツールキットで、動画制作、動画からノート化、デモ動画からの再利用可能スキル学習、視聴覚メモリなどのワークフローを含む。
How Good Is Qwen3.8-Omni-Flash on Benchmarks?
Is Qwen3.8-Omni-Flash Still Good at Text and Coding?
ローンチ結果によれば、Omni モデルは関連する Flash テキストモデルに対し、いくつかのコーディングおよび推論評価で近い水準を維持。Qwen は LiveCodeBench v6 で 92.6、SWE-bench Pro で 63.3、GPQA Diamond で 91.0 を報告。これらは Qwen のローンチ設定下でのベンダー報告であり、実運用のコーディングタスクやエージェント・ハーネスに対する検証が望ましい。
Qwen は Qwen3.5-Omni-Plus 比で 29 評価の平均25%以上の改善を報告。以下は公式ローンチのベンチマーク結果の要約。いずれも一次情報であり、公開時点では第三者による再現は未実施。
評価条件: Static 行は Qwen のローンチ設定下での単回推論を測定。“+ agent” 行は周辺のエージェント・ハーネス、リトリーバル、反復的メディア検査を含む。プロンプトテンプレート、サンプリング設定、メディア前処理、ハーネスのバージョンは公式資料を参照。未開示の場合、その結果はベンダー報告であり独立再現性は未確認として扱う。
より大きな意味は、マルチモーダル「理解」からマルチモーダル「実行」へのシフト。従来パイプラインは音声を文字起こし、動画フレームをサンプリングし、それらを LLM に渡して回答を生成し、実作業は別のアプリロジックに委ねることが多かった。Qwen3.8-Omni-Flash は、そのループのより多くを1つのエージェントシステムに圧縮する設計。
メディア制作エージェントは編集前に映像と音声を精査できる。会議エージェントは話者の同定、発話内容、資料の視覚情報を組み合わせられる。調査エージェントは数時間の視聴覚資料から関連箇所を特定し、外部コンテキストを検索できる。この枠組みでは、音声と動画は受動的な添付物ではなく、エージェントの作業コンテキストとなる。
Audio-video agents
| Benchmark — official launch source | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 |
| UniClawBench | 69.6 | 67.1 | 69.0 |
| AgenticVBench | 36.8 | 14.5 | 45.0 |
| OmniGAIA | 74.0 | — | 78.6 |
| StreamingBench | 80.8 | 57.1 | 79.9 |
世代間で最大の伸びは WildClawBench-MM で、34.5 から 71.0 に上昇。AgenticVBench も大きく改善する一方、そのベンチマークでは Gemini 3.8 Flash が先行。したがって「どのベンチでも一強」という結果ではない。
Audio-video understanding and reasoning
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63.4 | 53.8 | 65.2 |
| OmniVideoBench + Qwen Code agent | 67.8 | — | 65.2 |
| Video-MME-v2 | 65.0 | — | 71.0 |
| Video-MME-v2 + agent | 71.3 | — | 71.0 |
| LVOmniBench | 63.3 | — | 70.7 |
| LVOmniBench + agent | 73.6 | — | 70.7 |
| JointAVBench | 75.9 | — | 70.4 |
Static 行は混戦。従来型の動画推論テストでは Gemini が先行する項目があるが、エージェントループ内では Qwen の結果が上がることが多い。この区別は、本番アプリが同等のリトリーバルやツール、反復的検査を使う場合にのみ意味を持つ。
Audio and multi-speaker understanding
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82.7 | 74.4 | 79.3 |
| AliMeeting DER ↓ | 3.4 | 88.1 | 72.6 |
| AliMeeting cpWER ↓ | 17.2 | 89.6 | 53.1 |
| FLEURS-ASR WER ↓ | 9.3 | 7.2 | 7.9 |
| VoiceBench | 91.6 | 92.9 | 92.3 |
会議系の行が際立つ一方、FLEURS-ASR と VoiceBench は前世代比で改善していない。ローンチ結果は、音声認識の一律な勝利ではなく、より豊かなマルチスピーカー、空間、長尺文脈での音声理解の向上を示唆。
Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash
この表は Qwen の公式製品情報と、Google の公式 Gemini 3.8 Flash 仕様を併記。ベンチマーク比較は Qwen 実行であり、中立な第三者ランキングとは見なすべきでない。
| Dimension | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| Architecture | Qwen3.8-Flash-Next foundation; exact Omni parameter mapping not disclosed | Previous Qwen Omni generation | Google proprietary Gemini architecture |
| Context window | 1M tokens | Smaller deployment limits | 1,048,576 input tokens |
| Reasoning | Adjustable reasoning effort; thinking enabled by default | No equivalent default-on reasoning mode in the cited deployment | Low, medium and high thinking levels |
| Multimodal input | Text, image, audio, video | Text, image, audio, video | Text, image, video, audio and PDF |
| Output | Text | Text and supported speech workflows | Text |
| Coding | Strong vendor-reported coding scores; not its primary differentiator | Not the main positioning | Designed for long-horizon software engineering and agents |
| API availability | Chat Completions and Responses; hosted API | Hosted Qwen APIs | Gemini API; generally available |
| Tools | Function calling and web search | Function calling and web search | Function calling, search grounding, code execution and other built-in tools |
| Published API pricing | QwenCloud: $0.15 input / $0.47 output per 1M tokens | Region and endpoint dependent | Google introductory price: $0.75 input / $3.75 output per 1M tokens through December 31, 2026 |
| Best fit | Media agents and analysis | Omni conversation and speech output | Broad multimodal, coding and autonomous-agent workflows |
生成音声が必要な場合は Qwen3.5-Omni-Plus が引き続き有力。Qwen3.8-Omni-Flash は、効率的な音声・映像理解とツール指向の実行により明確に最適化されている。
Gemini 3.8 Flash に対しては評価が入り交じる。Qwen3.8-Omni-Flash は音声、マルチスピーカー処理、グラウンディング、いくつかのエージェントワークフローで競合力がある一方、静的な動画推論テストの一部では Gemini が先行。妥当な比較はワークロード別に行うべき。
統一アクセスの評価では、表の外で CometAPI の Gemini 3.8 Flash API、CometAPI の Qwen3.8-Flash API、CometAPI の Qwen3.8-Flash-Next APIを比較し、技術情報リンクと製品アクセスリンクを区別して参照できる。
Limitations of Qwen3.8-Omni-Flash
- テキストのみの出力: 音声と動画を理解するが、応答モダリティとしての音声生成は行わない。
- ホステッド配布: ローンチ時点で Qwen3.8-Omni-Flash のオープンウェイトは未発表。
- 新規ベンチマーク: 主要な比較は主に一次情報であり、独立した再現が必要。
- エージェント・ハーネスの影響: 一部のスコアはリトリーバル、ツール環境、反復的検査を含み、純粋な生モデルのスコアと混同すべきではない。
- ワークフロー依存のコスト: リトリーバル、キャッシュ、対象検査を使わずに長尺動画を繰り返し再処理すると高コストになり得る。
Who Should Use Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash は、音声や動画がタスクの本体であり、単なる添付要約に留まらない場合に最も有用。会議インテリジェンス、長編メディア検索、動画翻訳パイプライン、チュートリアルからのノート化、メディア制作エージェント、視聴覚アーカイブなどが適用例。
通常のテキストチャットには、専用の Flash テキストモデルのほうが簡潔な場合がある。音声出力が必要なアプリケーションには、明示的に音声生成をサポートする Omni モデルが適する。見て・聞いて・推論し・行動するワークフローには、Qwen ラインアップの中で Qwen3.8-Omni-Flash がより特徴的な選択肢。
Conclusion
Qwen3.8-Omni-Flash は、単なる別のマルチモーダル Flash リリースではなく、「エージェント的な音声・映像モデル」として理解するのが適切。1M コンテキスト、ネイティブな音声・動画推論、マルチスピーカーと空間オーディオ対応、調整可能な思考、関数呼び出し、検索、Qwen-MM-Plugins のエコシステムはいずれも、マルチメディアを「理解する」から「使って仕事をする」への移行に向けられている。
ローンチデータは、特にエージェントワークフローや複雑な音声シナリオで、Qwen3.5-Omni-Plus からの大幅な世代改良を示す。Gemini 3.8 Flash との比較では、Qwen 自身の数値はより拮抗。重要なのは、一つの表でどちらが勝つかではなく、対象ワークフローを正確かつ経済的に完遂する「モデル+ハーネス」の組み合わせである。
