TL;DR
Qwen3.8-Omni-Flash 是阿里巴巴 Qwen 的原生全模態模型,能理解文字、圖像、音訊與影片,輸出模態為文字。於 2026 年 9 月 18 日發布,結合了 100 萬 token 的上下文視窗、原生視聽推理、可調整思考、函式調用、網頁搜尋、空間音訊理解與工具使用。
最重要的改變不僅是更好的影片理解。Qwen 將此模型描述為其首個以 代理能力 為核心構建的全模態模型:它能理解所見所聞、規劃下一步、調用工具,並完成 vlog 編輯、影片翻譯、電影回顧製作、會議分析與多媒體研究等更長程的任務。
在發布時,Qwen 報告相較 Qwen3.5-Omni-Plus 在 29 項評估中平均提升超過 25%。這些為廠商於發布時提供的結果,並非獨立評估。
Key Takeaways
- 原生全模態輸入:Qwen3.8-Omni-Flash 接受文字、圖像、音訊與影片輸入,目前輸出為文字。
- 代理式媒體工作流程:可將媒體理解與規劃、函式調用與網頁搜尋結合。
- 長上下文與音訊深度:託管模型提供 100 萬 token 上下文視窗,支援多語、立體聲與一階 Ambisonics(FOA)音訊。
- 廠商報告的基準提升:最大改進出現在多模態代理、長音訊理解、說話者分離與音訊錨定。
- 託管供應:模型透過託管 API 提供;Qwen-MM-Plugins 另行開源以支援多模態代理工作流程。
開發者可透過統一的 API 工作流程在 CometAPI 取得 Qwen3.8-Omni-Flash API。
What Is Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash 是 Qwen 的次世代原生全模態模型。它不僅將音訊或影片視為前處理產物,而是於同一工作流程中對文字、視覺畫面、語音、環境聲與時間關係進行推理。其支援的輸入包括文字、圖像、音訊與影片;目前輸出為文字。
此輸出差異至關重要。阿里雲官方文件將 Qwen3.8-Omni-Flash 定位為用於多模態理解與代理執行,而語音輸出用例仍更適合明確支援生成音訊的 Qwen Omni 變體。
此次發布的定位從「感知媒體」轉向「理解、規劃、執行與交付」。這使模型適用於影片剪輯、多媒體研究、會議分析、教學影片處理以及其他需要模型對媒體採取具體行動的工作流程,而非僅僅摘要。
Qwen3.8-Omni-Flash 規格
下方規格表基於阿里雲與 QwenCloud 官方模型頁面;限制與價格可能因地區而異,應於發布或部署前再次確認。
| Specification | Qwen3.8-Omni-Flash — 官方模型頁面 |
|---|---|
| Developer | Alibaba Qwen |
| Release | September 18, 2026 |
| Model type | 原生全模態模型 |
| Input / output | 文字、圖像、音訊、影片 / 文字 |
| Context window | 1,000,000 tokens |
| Maximum input | 一般 991,808 tokens;思考模式 983,616 tokens |
| Maximum output | 131,072 tokens |
| Maximum reasoning allowance | 在 QwenCloud 上最高 262K tokens |
| Thinking | 預設啟用;可配置推理力度 |
| Tools and caching | 函式調用、網頁搜尋、隱式快取與工作階段快取 |
| Audio | 113 種語言與方言;立體聲與四通道 FOA |
| API styles | Chat Completions 與 Responses |
| QwenCloud price | 每 100 萬 tokens:輸入 $0.15、輸出 $0.47、隱式快取輸入 $0.016 |
| Open weights | 此模型於發布時未宣布開源權重 |
How Does Qwen3.8-Omni-Flash Work?
QwenCloud 指出 Qwen3.8-Omni-Flash 建構於 Qwen3.8-Flash-Next 架構 之上。這提供了架構背景,但 Flash-Next 已公布的參數數量不應在未獲 Qwen 確認對應的情況下,直接視為 Omni 模型的精確參數規格。
Gated DeltaNet + Qwen Sparse Attention
Flash-Next 基礎結合了 Gated DeltaNet 與 Qwen Sparse Attention。簡化而言,循環組件將歷史資訊壓縮為緊湊狀態,而稀疏注意力會擷取選定的長距上下文,而非對每個 token 配對施以密集的全注意力。這對長音訊與影片串流尤為重要,因為序列長度可能主導計算成本。
代理式感知而非靜態感知
更大的改變在於系統層面。Qwen 表示該模型能主動探索長影片並聚焦於相關片段,而非對每一段平均分配計算資源。概念上,代理會識別證據可能存在的位置,更深入檢視這些時刻、對其進行推理,然後決定下一步該調用哪個工具或執行何種操作。
What Are the Main Qwen3.8-Omni-Flash Features?
原生視聽推理
Qwen3.8-Omni-Flash 能在影片的視覺與音訊串流上進行聯合推理。當答案取決於兩種模態時尤為重要:辨識是誰說了什麼、判定聲響是否發生在動作前或後、解讀音樂或環境音、或將口述指令與畫面內容對應。
多說話者與空間音訊理解
API 支援多聲道音訊,包括雙聲道立體聲與四通道一階 Ambisonics。保留方向性資訊有助於會議分析、具身代理、活動錄影、多說話者環境與音訊錨定。
可調整推理力度
思考預設為啟用。開發者可配置推理力度,在延遲與 token 消耗與複雜多媒體任務所需的更深入推理之間進行取捨。
函式調用與網頁搜尋
函式調用與網頁搜尋是其代理式定位的核心。在理解影片、圖像或音訊檔後,模型可向外部工具傳遞結構化參數、擷取額外資訊,或在模型之外延續工作流程。
Qwen-MM-Plugins
Qwen 亦發布了 Qwen-MM-Plugins,一套 Apache-2.0 授權的多模態原生代理工具組。其工作流程涵蓋影片製作、影片轉筆記、從示範影片學習可重用技能,以及視聽記憶。
How Good Is Qwen3.8-Omni-Flash on Benchmarks?
Qwen3.8-Omni-Flash 在文字與程式領域仍然表現良好嗎?
Qwen 的發布結果顯示,Omni 模型在部分程式與推理評測上與同系的 Flash 文字模型相近。Qwen 報告在 LiveCodeBench v6 得分 92.6、SWE-bench Pro 63.3、GPQA Diamond 91.0。這些為 Qwen 的發布設定下的廠商報告結果,需依生產環境中的程式任務與代理框架加以驗證。
Qwen 報告相較 Qwen3.5-Omni-Plus 在 29 項評估中平均提升超過 25%。下表彙整了官方發布的基準測試結果。它們屬於第一方結果,於發布時尚未被獨立重現。
評估條件:標示為靜態的列以 Qwen 的發布設定進行單次模型運行。標示為「+ agent」的列包含外圍代理框架、檢索或迭代媒體檢視。官方發布資料應參考提示模板、採樣設定、媒體前處理與框架版本;若未公開相關細節,則此結果應視為廠商報告而非可獨立複現。
更具意義的是從多模態理解走向多模態執行的轉變。以往流程常先轉錄音訊、抽樣影片影格、將這些產物送入 LLM 產生答案,再由獨立的應用邏輯執行真實任務。Qwen3.8-Omni-Flash 旨在將更多此迴路壓縮至同一代理系統。
媒體製作代理可先檢視素材與音訊再規劃剪輯。會議代理可結合說話者身份、口述內容與展示視覺。研究代理可在數小時的視聽素材中定位相關時刻,並搜尋外部上下文。於此定位中,音訊與影片成為代理的工作上下文,而非被動附件。
Audio-video agents
| Benchmark — 官方發布來源 | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 |
| UniClawBench | 69.6 | 67.1 | 69.0 |
| AgenticVBench | 36.8 | 14.5 | 45.0 |
| OmniGAIA | 74.0 | — | 78.6 |
| StreamingBench | 80.8 | 57.1 | 79.9 |
最大世代躍升在 WildClawBench-MM,Qwen 報告從 34.5 提升至 71.0。AgenticVBench 也大幅提升,但 Gemini 3.8 Flash 在該基準仍領先。模式因此並非普遍「一個模型贏過所有」的結果。
視聽理解與推理
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63.4 | 53.8 | 65.2 |
| OmniVideoBench + Qwen Code agent | 67.8 | — | 65.2 |
| Video-MME-v2 | 65.0 | — | 71.0 |
| Video-MME-v2 + agent | 71.3 | — | 71.0 |
| LVOmniBench | 63.3 | — | 70.7 |
| LVOmniBench + agent | 73.6 | — | 70.7 |
| JointAVBench | 75.9 | — | 70.4 |
靜態列的表現有高有低。Gemini 於多項傳統影片推理測試領先,但 Qwen 的結果在代理迴圈中時常上升。此差異僅在生產應用採用可比的檢索、工具或迭代檢視時才具意義。
音訊與多說話者理解
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82.7 | 74.4 | 79.3 |
| AliMeeting DER ↓ | 3.4 | 88.1 | 72.6 |
| AliMeeting cpWER ↓ | 17.2 | 89.6 | 53.1 |
| FLEURS-ASR WER ↓ | 9.3 | 7.2 | 7.9 |
| VoiceBench | 91.6 | 92.9 | 92.3 |
會議相關列最為亮眼,而 FLEURS-ASR 與 VoiceBench 相較前代並未改善。因此發布結果指向更豐富的多說話者、空間與長上下文音訊理解,而非一致的語音辨識勝出。
Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash
此表結合 Qwen 的官方產品資訊與 Google 的官方 Gemini 3.8 Flash 規格。基準比較仍為 Qwen 執行,故不可視為中立第三方排名。
| Dimension | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| Architecture | Qwen3.8-Flash-Next 基礎;未披露 Omni 的精確參數對應 | 前一代 Qwen Omni | Google 專有 Gemini 架構 |
| Context window | 1M tokens | 部署限制較小 | 1,048,576 input tokens |
| Reasoning | 可調整推理力度;思考預設啟用 | 引用部署中無等效的預設開啟思考模式 | 低、中、高思考等級 |
| Multimodal input | 文字、圖像、音訊、影片 | 文字、圖像、音訊、影片 | 文字、圖像、影片、音訊與 PDF |
| Output | 文字 | 文字與支援語音輸出工作流程 | 文字 |
| Coding | 廠商報告的程式分數表現強勁;非主要差異化 | 非主要定位 | 為長期軟體工程與代理設計 |
| API availability | Chat Completions 與 Responses;託管 API | 託管 Qwen API | Gemini API;普遍可用 |
| Tools | 函式調用與網頁搜尋 | 函式調用與網頁搜尋 | 函式調用、搜尋對齊、程式碼執行等內建工具 |
| Published API pricing | QwenCloud:每 100 萬 tokens 輸入 $0.15/輸出 $0.47 | 依區域與端點而定 | Google 推出期間價格:每 100 萬 tokens 輸入 $0.75/輸出 $3.75(至 2026 年 12 月 31 日) |
| Best fit | 媒體代理與分析 | 全模態對話與語音輸出 | 廣泛的多模態、程式與自主代理工作流程 |
在需要生成語音時,Qwen3.5-Omni-Plus 仍具相關性。Qwen3.8-Omni-Flash 更明確地圍繞高效視聽理解與以工具為導向的執行進行最佳化。
與 Gemini 3.8 Flash 相比,Qwen 的評估結果呈現平衡:Qwen3.8-Omni-Flash 在音訊、多說話者處理、錨定與多項代理工作流程上具競爭力,而 Gemini 在部分靜態影片推理測試領先。合理的比較應以工作負載為依歸。
評估統一存取的開發者可比較 CometAPI 的 Gemini 3.8 Flash API、CometAPI 的 Qwen3.8-Flash API 與 CometAPI 的 Qwen3.8-Flash-Next API,並在表格之外保留技術來源與產品存取連結的區別。
Limitations of Qwen3.8-Omni-Flash
- 僅文字輸出:能理解音訊與影片,但不以語音作為回應模態。
- 託管部署:發布時未宣布 Qwen3.8-Omni-Flash 的開源權重。
- 新鮮基準:重點比較主要為第一方結果,需獨立重現。
- 代理框架影響:部分分數包含檢索、工具環境或迭代檢視,勿與僅原始模型結果混淆。
- 工作流程相關成本:長影片若反覆重處理大量片段,仍可能成本高昂;應使用檢索、快取或目標化檢視。
Who Should Use Qwen3.8-Omni-Flash?
當音訊或影片是任務本身的一部分,而非僅需摘要的附件時,Qwen3.8-Omni-Flash 最具吸引力。適用用例包括會議智能、長篇媒體搜尋、影片翻譯管線、教學影片轉筆記工作流程、媒體製作代理與視聽檔案管理。
對於傳統文字聊天,專用的 Flash 文字模型可能更簡單。對於語音輸出應用,支援明確音訊生成的 Omni 模型更匹配。對於結合「看」「聽」「推理」「行動」的工作流程,Qwen3.8-Omni-Flash 是 Qwen 產品線中更具特色的選擇。
Conclusion
Qwen3.8-Omni-Flash 應被理解為代理式視聽模型,而非僅是另一個多模態 Flash 版本。其 100 萬上下文、原生視聽推理、多說話者與空間音訊能力、可調整思考、函式調用、搜尋與 Qwen-MM-Plugins 生態系,皆指向同一轉變:讓 AI 從「理解多媒體」走向「用多媒體完成工作」。
發布資料顯示相較 Qwen3.5-Omni-Plus 有顯著世代提升,特別是在代理式工作流程與複雜音訊場景。對比 Gemini 3.8 Flash,Qwen 的數據更為均衡。因此,更重要的問題不在於哪個模型贏下一個表格,而是「哪種模型與框架組合能在目標工作流程中準確且經濟地完成任務」。
