GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/CometAPIリサーチ

Qwen3.8-Omni-Flashとは何ですか、どのようにアクセスしますか?

翻訳元のテキスト(Qwen3.8-Omni-Flash の概要、音声・映像エージェント、アーキテクチャ、ベンチマーク、価格、制限事項、API アクセスに関する内容)をご提供ください。原文の構造を保持したまま日本語に正確に翻訳します。

CometAPI
Mia MarenAIモデルとAPIの調査チーム
更新日 Sep 21, 2026 5 分読み
Qwen3.8-Omni-Flashとは何ですか、どのようにアクセスしますか?
このパターンを使う

最初のAPI呼び出しを行う。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Qwen3.8-Omni-Flash は、テキスト・画像・音声・動画の理解にネイティブ対応し、出力はテキストのオムニモーダルモデル。2026年9月18日に発表され、1M-token context window、ネイティブな音声・動画推論、調整可能な思考、関数呼び出し、ウェブ検索、空間オーディオ理解、ツール利用などを備える。

最重要の変化は、単なる動画理解の向上ではない。Qwen は本モデルをエージェント指向の能力を軸に設計した初のオムニモーダルモデルと位置づける。見聞きした内容を理解し、次に何をすべきかを計画し、ツールを呼び出し、Vlog編集、動画翻訳、映画の要約制作、会議分析、マルチメディア調査といった長尺タスクを遂行できる。

ローンチ時点で、Qwen は Qwen3.5-Omni-Plus に対し29の評価で平均25%以上の改善を報告。これらはベンダーによるローンチ時の結果であり、独立検証ではない。

Key Takeaways

  • ネイティブなオムニモーダル入力対応: Qwen3.8-Omni-Flash はテキスト、画像、音声、動画を受け取り、現時点の出力はテキスト。
  • エージェント的なメディアワークフロー: メディア理解を計画、関数呼び出し、ウェブ検索と組み合わせ可能。
  • 長いコンテキストと音声の奥行き: ホステッド版は1Mトークンのコンテキストウィンドウを提供し、多言語・ステレオ・一次アンビソニック音声に対応。
  • ベンダー報告のベンチマーク向上: マルチモーダルエージェント、長尺音声理解、話者分離、音声グラウンディングで大幅改善が目立つ。
  • ホステッド提供: モデルはホステッドAPI経由で利用可能。マルチモーダル・エージェント用の Qwen-MM-Plugins は別途オープンソース。

開発者は、統一APIのワークフローで CometAPI の Qwen3.8-Omni-Flash API にアクセスできる。

What Is Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash は Qwen の次世代ネイティブ・オムニモーダルモデル。音声や動画を単なる前処理の生成物として扱うのではなく、テキスト、ビジュアルフレーム、音声、環境音、時間関係を1つのワークフロー内で推論する。対応入力はテキスト・画像・音声・動画、現時点の出力はテキスト。

この出力の違いは重要。 Alibaba Cloud の公式ドキュメンテーションでは、Qwen3.8-Omni-Flash をマルチモーダル理解とエージェント実行に位置づけており、音声出力のユースケースは明示的に音声生成をサポートする Omni 系列が引き続き適する。

ローンチの位置づけは「メディアを知覚する」から「理解・計画・実行・成果」へと移行。動画編集、マルチメディア調査、会議分析、インストラクション動画処理など、メディアを単に要約するのでなく「扱って作業する」必要があるワークフローに適合する。

Qwen3.8-Omni-Flash specifications

以下の仕様表は Alibaba Cloud および QwenCloud の公式モデルページに基づく。制限や価格は地域により異なる可能性があるため、公開や導入前に再確認が必要。

SpecificationQwen3.8-Omni-Flash — official model page
DeveloperAlibaba Qwen
ReleaseSeptember 18, 2026
Model typeNative omni-modal model
Input / outputText, image, audio, video / text
Context window1,000,000 tokens
Maximum input991,808 tokens normal; 983,616 tokens in thinking mode
Maximum output131,072 tokens
Maximum reasoning allowanceUp to 262K tokens on QwenCloud
ThinkingEnabled by default; configurable reasoning effort
Tools and cachingFunction calling, web search, implicit cache, and session cache
Audio113 languages and dialects; stereo and four-channel FOA
API stylesChat Completions and Responses
QwenCloud price$0.15 input, $0.47 output, and $0.016 implicit-cache input per 1M tokens
Open weightsNot announced for this model at launch

How Does Qwen3.8-Omni-Flash Work?

QwenCloud によれば、Qwen3.8-Omni-Flash は Qwen3.8-Flash-Next architecture 上に構築されている。これはアーキテクチャの文脈を与えるが、Flash-Next で公開されたパラメータ規模を Qwen の確認なしに Omni モデルの正確なパラメータ仕様として提示すべきではない。

Gated DeltaNet + Qwen Sparse Attention

Flash-Next の基盤は Gated DeltaNet と Qwen Sparse Attention の組み合わせ。単純化すると、再帰コンポーネントが履歴情報をコンパクトな状態に圧縮し、スパースアテンションが全トークン対に密なフルアテンションを適用する代わりに、選択的に長距離コンテキストを取得する。系列長が計算コストを支配し得る長尺の音声・動画ストリームで特に有効。

静的な知覚からエージェント的知覚へ

より大きな変化はシステムレベル。Qwen は、モデルが長尺動画を能動的に探索し、全セグメントに等しく計算資源を使うのではなく、関連する瞬間に焦点を当てられるとする。概念的には、エージェントが証拠がありそうな箇所を特定し、そこを深く検査し、推論し、次にどのツールや操作を行うべきかを決める。

What Are the Main Qwen3.8-Omni-Flash Features?

ネイティブな音声・動画推論

Qwen3.8-Omni-Flash は動画のビジュアルと音声ストリームを統合的に推論する。誰が発言したかの特定、音が行動の前後どちらで起きたかの判断、音楽や環境音の解釈、発話された指示と画面表示の接続など、両モダリティに依存する課題で重要となる。

マルチスピーカーと空間オーディオ理解

API はマルチチャネル音声をサポートし、2チャネルのステレオと4チャネルの一次アンビソニックスに対応。方向性情報の保持は、会議分析、実世界エージェント、記録イベント、マルチスピーカー環境、音声グラウンディングに役立つ。

調整可能な推論労力

思考は既定で有効。開発者は推論労力を設定し、レイテンシとトークン消費を、複雑なマルチメディアタスク向けの深い推論とトレードオフできる。

関数呼び出しとウェブ検索

関数呼び出しとウェブ検索はエージェント的ポジショニングの中核。動画・画像・音声ファイルを理解した後、モデルは構造化引数を外部ツールに渡し、追加情報を取得し、モデル外でワークフローを継続できる。

Qwen-MM-Plugins

Qwen は Qwen-MM-Plugins も公開。マルチモーダルネイティブなエージェント・ハーネス向けの Apache-2.0 ツールキットで、動画制作、動画からノート化、デモ動画からの再利用可能スキル学習、視聴覚メモリなどのワークフローを含む。

How Good Is Qwen3.8-Omni-Flash on Benchmarks?

Is Qwen3.8-Omni-Flash Still Good at Text and Coding?

ローンチ結果によれば、Omni モデルは関連する Flash テキストモデルに対し、いくつかのコーディングおよび推論評価で近い水準を維持。Qwen は LiveCodeBench v6 で 92.6、SWE-bench Pro で 63.3、GPQA Diamond で 91.0 を報告。これらは Qwen のローンチ設定下でのベンダー報告であり、実運用のコーディングタスクやエージェント・ハーネスに対する検証が望ましい。

Qwen は Qwen3.5-Omni-Plus 比で 29 評価の平均25%以上の改善を報告。以下は公式ローンチのベンチマーク結果の要約。いずれも一次情報であり、公開時点では第三者による再現は未実施。

評価条件: Static 行は Qwen のローンチ設定下での単回推論を測定。“+ agent” 行は周辺のエージェント・ハーネス、リトリーバル、反復的メディア検査を含む。プロンプトテンプレート、サンプリング設定、メディア前処理、ハーネスのバージョンは公式資料を参照。未開示の場合、その結果はベンダー報告であり独立再現性は未確認として扱う。

より大きな意味は、マルチモーダル「理解」からマルチモーダル「実行」へのシフト。従来パイプラインは音声を文字起こし、動画フレームをサンプリングし、それらを LLM に渡して回答を生成し、実作業は別のアプリロジックに委ねることが多かった。Qwen3.8-Omni-Flash は、そのループのより多くを1つのエージェントシステムに圧縮する設計。

メディア制作エージェントは編集前に映像と音声を精査できる。会議エージェントは話者の同定、発話内容、資料の視覚情報を組み合わせられる。調査エージェントは数時間の視聴覚資料から関連箇所を特定し、外部コンテキストを検索できる。この枠組みでは、音声と動画は受動的な添付物ではなく、エージェントの作業コンテキストとなる。

Audio-video agents

Benchmark — official launch sourceQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71.034.558.9
UniClawBench69.667.169.0
AgenticVBench36.814.545.0
OmniGAIA74.078.6
StreamingBench80.857.179.9

世代間で最大の伸びは WildClawBench-MM で、34.5 から 71.0 に上昇。AgenticVBench も大きく改善する一方、そのベンチマークでは Gemini 3.8 Flash が先行。したがって「どのベンチでも一強」という結果ではない。

Audio-video understanding and reasoning

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
OmniVideoBench63.453.865.2
OmniVideoBench + Qwen Code agent67.865.2
Video-MME-v265.071.0
Video-MME-v2 + agent71.371.0
LVOmniBench63.370.7
LVOmniBench + agent73.670.7
JointAVBench75.970.4

Static 行は混戦。従来型の動画推論テストでは Gemini が先行する項目があるが、エージェントループ内では Qwen の結果が上がることが多い。この区別は、本番アプリが同等のリトリーバルやツール、反復的検査を使う場合にのみ意味を持つ。

Audio and multi-speaker understanding

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
LongAudioSpan82.774.479.3
AliMeeting DER ↓3.488.172.6
AliMeeting cpWER ↓17.289.653.1
FLEURS-ASR WER ↓9.37.27.9
VoiceBench91.692.992.3

会議系の行が際立つ一方、FLEURS-ASR と VoiceBench は前世代比で改善していない。ローンチ結果は、音声認識の一律な勝利ではなく、より豊かなマルチスピーカー、空間、長尺文脈での音声理解の向上を示唆。

Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash

この表は Qwen の公式製品情報と、Google の公式 Gemini 3.8 Flash 仕様を併記。ベンチマーク比較は Qwen 実行であり、中立な第三者ランキングとは見なすべきでない。

DimensionQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
ArchitectureQwen3.8-Flash-Next foundation; exact Omni parameter mapping not disclosedPrevious Qwen Omni generationGoogle proprietary Gemini architecture
Context window1M tokensSmaller deployment limits1,048,576 input tokens
ReasoningAdjustable reasoning effort; thinking enabled by defaultNo equivalent default-on reasoning mode in the cited deploymentLow, medium and high thinking levels
Multimodal inputText, image, audio, videoText, image, audio, videoText, image, video, audio and PDF
OutputTextText and supported speech workflowsText
CodingStrong vendor-reported coding scores; not its primary differentiatorNot the main positioningDesigned for long-horizon software engineering and agents
API availabilityChat Completions and Responses; hosted APIHosted Qwen APIsGemini API; generally available
ToolsFunction calling and web searchFunction calling and web searchFunction calling, search grounding, code execution and other built-in tools
Published API pricingQwenCloud: $0.15 input / $0.47 output per 1M tokensRegion and endpoint dependentGoogle introductory price: $0.75 input / $3.75 output per 1M tokens through December 31, 2026
Best fitMedia agents and analysisOmni conversation and speech outputBroad multimodal, coding and autonomous-agent workflows

生成音声が必要な場合は Qwen3.5-Omni-Plus が引き続き有力。Qwen3.8-Omni-Flash は、効率的な音声・映像理解とツール指向の実行により明確に最適化されている。

Gemini 3.8 Flash に対しては評価が入り交じる。Qwen3.8-Omni-Flash は音声、マルチスピーカー処理、グラウンディング、いくつかのエージェントワークフローで競合力がある一方、静的な動画推論テストの一部では Gemini が先行。妥当な比較はワークロード別に行うべき。

統一アクセスの評価では、表の外で CometAPI の Gemini 3.8 Flash APICometAPI の Qwen3.8-Flash APICometAPI の Qwen3.8-Flash-Next APIを比較し、技術情報リンクと製品アクセスリンクを区別して参照できる。

Limitations of Qwen3.8-Omni-Flash

  • テキストのみの出力: 音声と動画を理解するが、応答モダリティとしての音声生成は行わない。
  • ホステッド配布: ローンチ時点で Qwen3.8-Omni-Flash のオープンウェイトは未発表。
  • 新規ベンチマーク: 主要な比較は主に一次情報であり、独立した再現が必要。
  • エージェント・ハーネスの影響: 一部のスコアはリトリーバル、ツール環境、反復的検査を含み、純粋な生モデルのスコアと混同すべきではない。
  • ワークフロー依存のコスト: リトリーバル、キャッシュ、対象検査を使わずに長尺動画を繰り返し再処理すると高コストになり得る。

Who Should Use Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash は、音声や動画がタスクの本体であり、単なる添付要約に留まらない場合に最も有用。会議インテリジェンス、長編メディア検索、動画翻訳パイプライン、チュートリアルからのノート化、メディア制作エージェント、視聴覚アーカイブなどが適用例。

通常のテキストチャットには、専用の Flash テキストモデルのほうが簡潔な場合がある。音声出力が必要なアプリケーションには、明示的に音声生成をサポートする Omni モデルが適する。見て・聞いて・推論し・行動するワークフローには、Qwen ラインアップの中で Qwen3.8-Omni-Flash がより特徴的な選択肢。

Conclusion

Qwen3.8-Omni-Flash は、単なる別のマルチモーダル Flash リリースではなく、「エージェント的な音声・映像モデル」として理解するのが適切。1M コンテキスト、ネイティブな音声・動画推論、マルチスピーカーと空間オーディオ対応、調整可能な思考、関数呼び出し、検索、Qwen-MM-Plugins のエコシステムはいずれも、マルチメディアを「理解する」から「使って仕事をする」への移行に向けられている。

ローンチデータは、特にエージェントワークフローや複雑な音声シナリオで、Qwen3.5-Omni-Plus からの大幅な世代改良を示す。Gemini 3.8 Flash との比較では、Qwen 自身の数値はより拮抗。重要なのは、一つの表でどちらが勝つかではなく、対象ワークフローを正確かつ経済的に完遂する「モデル+ハーネス」の組み合わせである。

学習を続ける

この記事を次の判断につなげる。

すべてのトピックを見る
公開日 Sep 21, 2026
最終更新 Sep 21, 2026
3 回視聴
明確性、出典の帰属、最新のAPI用語について確認済みです。

AI開発コストを20%削減する準備はできていますか?

数分で無料スタート。無料トライアルクレジット付き。クレジットカード不要。

もっと読む