GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/CometAPI 研究

什麼是 Qwen3.8-Omni-Flash,以及如何存取

瞭解 Qwen3.8-Omni-Flash 是什麼,包括其音訊與視訊代理、架構、基準測試、定價、限制,以及 API 存取。

CometAPI
Mia MarenAI 模型與 API 研究團隊
更新於 Sep 21, 2026 5 分鐘閱讀
什麼是 Qwen3.8-Omni-Flash,以及如何存取
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Qwen3.8-Omni-Flash 是阿里巴巴 Qwen 的原生全模態模型,能理解文字、圖像、音訊與影片,輸出模態為文字。於 2026 年 9 月 18 日發布,結合了 100 萬 token 的上下文視窗、原生視聽推理、可調整思考、函式調用、網頁搜尋、空間音訊理解與工具使用。

最重要的改變不僅是更好的影片理解。Qwen 將此模型描述為其首個以 代理能力 為核心構建的全模態模型:它能理解所見所聞、規劃下一步、調用工具,並完成 vlog 編輯、影片翻譯、電影回顧製作、會議分析與多媒體研究等更長程的任務。

在發布時,Qwen 報告相較 Qwen3.5-Omni-Plus 在 29 項評估中平均提升超過 25%。這些為廠商於發布時提供的結果,並非獨立評估。

Key Takeaways

  • 原生全模態輸入:Qwen3.8-Omni-Flash 接受文字、圖像、音訊與影片輸入,目前輸出為文字。
  • 代理式媒體工作流程:可將媒體理解與規劃、函式調用與網頁搜尋結合。
  • 長上下文與音訊深度:託管模型提供 100 萬 token 上下文視窗,支援多語、立體聲與一階 Ambisonics(FOA)音訊。
  • 廠商報告的基準提升:最大改進出現在多模態代理、長音訊理解、說話者分離與音訊錨定。
  • 託管供應:模型透過託管 API 提供;Qwen-MM-Plugins 另行開源以支援多模態代理工作流程。

開發者可透過統一的 API 工作流程在 CometAPI 取得 Qwen3.8-Omni-Flash API

What Is Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash 是 Qwen 的次世代原生全模態模型。它不僅將音訊或影片視為前處理產物,而是於同一工作流程中對文字、視覺畫面、語音、環境聲與時間關係進行推理。其支援的輸入包括文字、圖像、音訊與影片;目前輸出為文字。

此輸出差異至關重要。阿里雲官方文件將 Qwen3.8-Omni-Flash 定位為用於多模態理解與代理執行,而語音輸出用例仍更適合明確支援生成音訊的 Qwen Omni 變體。

此次發布的定位從「感知媒體」轉向「理解、規劃、執行與交付」。這使模型適用於影片剪輯、多媒體研究、會議分析、教學影片處理以及其他需要模型對媒體採取具體行動的工作流程,而非僅僅摘要。

Qwen3.8-Omni-Flash 規格

下方規格表基於阿里雲與 QwenCloud 官方模型頁面;限制與價格可能因地區而異,應於發布或部署前再次確認。

SpecificationQwen3.8-Omni-Flash — 官方模型頁面
DeveloperAlibaba Qwen
ReleaseSeptember 18, 2026
Model type原生全模態模型
Input / output文字、圖像、音訊、影片 / 文字
Context window1,000,000 tokens
Maximum input一般 991,808 tokens;思考模式 983,616 tokens
Maximum output131,072 tokens
Maximum reasoning allowance在 QwenCloud 上最高 262K tokens
Thinking預設啟用;可配置推理力度
Tools and caching函式調用、網頁搜尋、隱式快取與工作階段快取
Audio113 種語言與方言;立體聲與四通道 FOA
API stylesChat Completions 與 Responses
QwenCloud price每 100 萬 tokens:輸入 $0.15、輸出 $0.47、隱式快取輸入 $0.016
Open weights此模型於發布時未宣布開源權重

How Does Qwen3.8-Omni-Flash Work?

QwenCloud 指出 Qwen3.8-Omni-Flash 建構於 Qwen3.8-Flash-Next 架構 之上。這提供了架構背景,但 Flash-Next 已公布的參數數量不應在未獲 Qwen 確認對應的情況下,直接視為 Omni 模型的精確參數規格。

Gated DeltaNet + Qwen Sparse Attention

Flash-Next 基礎結合了 Gated DeltaNet 與 Qwen Sparse Attention。簡化而言,循環組件將歷史資訊壓縮為緊湊狀態,而稀疏注意力會擷取選定的長距上下文,而非對每個 token 配對施以密集的全注意力。這對長音訊與影片串流尤為重要,因為序列長度可能主導計算成本。

代理式感知而非靜態感知

更大的改變在於系統層面。Qwen 表示該模型能主動探索長影片並聚焦於相關片段,而非對每一段平均分配計算資源。概念上,代理會識別證據可能存在的位置,更深入檢視這些時刻、對其進行推理,然後決定下一步該調用哪個工具或執行何種操作。

What Are the Main Qwen3.8-Omni-Flash Features?

原生視聽推理

Qwen3.8-Omni-Flash 能在影片的視覺與音訊串流上進行聯合推理。當答案取決於兩種模態時尤為重要:辨識是誰說了什麼、判定聲響是否發生在動作前或後、解讀音樂或環境音、或將口述指令與畫面內容對應。

多說話者與空間音訊理解

API 支援多聲道音訊,包括雙聲道立體聲與四通道一階 Ambisonics。保留方向性資訊有助於會議分析、具身代理、活動錄影、多說話者環境與音訊錨定。

可調整推理力度

思考預設為啟用。開發者可配置推理力度,在延遲與 token 消耗與複雜多媒體任務所需的更深入推理之間進行取捨。

函式調用與網頁搜尋

函式調用與網頁搜尋是其代理式定位的核心。在理解影片、圖像或音訊檔後,模型可向外部工具傳遞結構化參數、擷取額外資訊,或在模型之外延續工作流程。

Qwen-MM-Plugins

Qwen 亦發布了 Qwen-MM-Plugins,一套 Apache-2.0 授權的多模態原生代理工具組。其工作流程涵蓋影片製作、影片轉筆記、從示範影片學習可重用技能,以及視聽記憶。

How Good Is Qwen3.8-Omni-Flash on Benchmarks?

Qwen3.8-Omni-Flash 在文字與程式領域仍然表現良好嗎?

Qwen 的發布結果顯示,Omni 模型在部分程式與推理評測上與同系的 Flash 文字模型相近。Qwen 報告在 LiveCodeBench v6 得分 92.6、SWE-bench Pro 63.3、GPQA Diamond 91.0。這些為 Qwen 的發布設定下的廠商報告結果,需依生產環境中的程式任務與代理框架加以驗證。

Qwen 報告相較 Qwen3.5-Omni-Plus 在 29 項評估中平均提升超過 25%。下表彙整了官方發布的基準測試結果。它們屬於第一方結果,於發布時尚未被獨立重現。

評估條件:標示為靜態的列以 Qwen 的發布設定進行單次模型運行。標示為「+ agent」的列包含外圍代理框架、檢索或迭代媒體檢視。官方發布資料應參考提示模板、採樣設定、媒體前處理與框架版本;若未公開相關細節,則此結果應視為廠商報告而非可獨立複現。

更具意義的是從多模態理解走向多模態執行的轉變。以往流程常先轉錄音訊、抽樣影片影格、將這些產物送入 LLM 產生答案,再由獨立的應用邏輯執行真實任務。Qwen3.8-Omni-Flash 旨在將更多此迴路壓縮至同一代理系統。

媒體製作代理可先檢視素材與音訊再規劃剪輯。會議代理可結合說話者身份、口述內容與展示視覺。研究代理可在數小時的視聽素材中定位相關時刻,並搜尋外部上下文。於此定位中,音訊與影片成為代理的工作上下文,而非被動附件。

Audio-video agents

Benchmark — 官方發布來源Qwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71.034.558.9
UniClawBench69.667.169.0
AgenticVBench36.814.545.0
OmniGAIA74.078.6
StreamingBench80.857.179.9

最大世代躍升在 WildClawBench-MM,Qwen 報告從 34.5 提升至 71.0。AgenticVBench 也大幅提升,但 Gemini 3.8 Flash 在該基準仍領先。模式因此並非普遍「一個模型贏過所有」的結果。

視聽理解與推理

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
OmniVideoBench63.453.865.2
OmniVideoBench + Qwen Code agent67.865.2
Video-MME-v265.071.0
Video-MME-v2 + agent71.371.0
LVOmniBench63.370.7
LVOmniBench + agent73.670.7
JointAVBench75.970.4

靜態列的表現有高有低。Gemini 於多項傳統影片推理測試領先,但 Qwen 的結果在代理迴圈中時常上升。此差異僅在生產應用採用可比的檢索、工具或迭代檢視時才具意義。

音訊與多說話者理解

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
LongAudioSpan82.774.479.3
AliMeeting DER ↓3.488.172.6
AliMeeting cpWER ↓17.289.653.1
FLEURS-ASR WER ↓9.37.27.9
VoiceBench91.692.992.3

會議相關列最為亮眼,而 FLEURS-ASR 與 VoiceBench 相較前代並未改善。因此發布結果指向更豐富的多說話者、空間與長上下文音訊理解,而非一致的語音辨識勝出。

Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash

此表結合 Qwen 的官方產品資訊與 Google 的官方 Gemini 3.8 Flash 規格。基準比較仍為 Qwen 執行,故不可視為中立第三方排名。

DimensionQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
ArchitectureQwen3.8-Flash-Next 基礎;未披露 Omni 的精確參數對應前一代 Qwen OmniGoogle 專有 Gemini 架構
Context window1M tokens部署限制較小1,048,576 input tokens
Reasoning可調整推理力度;思考預設啟用引用部署中無等效的預設開啟思考模式低、中、高思考等級
Multimodal input文字、圖像、音訊、影片文字、圖像、音訊、影片文字、圖像、影片、音訊與 PDF
Output文字文字與支援語音輸出工作流程文字
Coding廠商報告的程式分數表現強勁;非主要差異化非主要定位為長期軟體工程與代理設計
API availabilityChat Completions 與 Responses;託管 API託管 Qwen APIGemini API;普遍可用
Tools函式調用與網頁搜尋函式調用與網頁搜尋函式調用、搜尋對齊、程式碼執行等內建工具
Published API pricingQwenCloud:每 100 萬 tokens 輸入 $0.15/輸出 $0.47依區域與端點而定Google 推出期間價格:每 100 萬 tokens 輸入 $0.75/輸出 $3.75(至 2026 年 12 月 31 日)
Best fit媒體代理與分析全模態對話與語音輸出廣泛的多模態、程式與自主代理工作流程

在需要生成語音時,Qwen3.5-Omni-Plus 仍具相關性。Qwen3.8-Omni-Flash 更明確地圍繞高效視聽理解與以工具為導向的執行進行最佳化。

與 Gemini 3.8 Flash 相比,Qwen 的評估結果呈現平衡:Qwen3.8-Omni-Flash 在音訊、多說話者處理、錨定與多項代理工作流程上具競爭力,而 Gemini 在部分靜態影片推理測試領先。合理的比較應以工作負載為依歸。

評估統一存取的開發者可比較 CometAPI 的 Gemini 3.8 Flash APICometAPI 的 Qwen3.8-Flash APICometAPI 的 Qwen3.8-Flash-Next API,並在表格之外保留技術來源與產品存取連結的區別。

Limitations of Qwen3.8-Omni-Flash

  • 僅文字輸出:能理解音訊與影片,但不以語音作為回應模態。
  • 託管部署:發布時未宣布 Qwen3.8-Omni-Flash 的開源權重。
  • 新鮮基準:重點比較主要為第一方結果,需獨立重現。
  • 代理框架影響:部分分數包含檢索、工具環境或迭代檢視,勿與僅原始模型結果混淆。
  • 工作流程相關成本:長影片若反覆重處理大量片段,仍可能成本高昂;應使用檢索、快取或目標化檢視。

Who Should Use Qwen3.8-Omni-Flash?

當音訊或影片是任務本身的一部分,而非僅需摘要的附件時,Qwen3.8-Omni-Flash 最具吸引力。適用用例包括會議智能、長篇媒體搜尋、影片翻譯管線、教學影片轉筆記工作流程、媒體製作代理與視聽檔案管理。

對於傳統文字聊天,專用的 Flash 文字模型可能更簡單。對於語音輸出應用,支援明確音訊生成的 Omni 模型更匹配。對於結合「看」「聽」「推理」「行動」的工作流程,Qwen3.8-Omni-Flash 是 Qwen 產品線中更具特色的選擇。

Conclusion

Qwen3.8-Omni-Flash 應被理解為代理式視聽模型,而非僅是另一個多模態 Flash 版本。其 100 萬上下文、原生視聽推理、多說話者與空間音訊能力、可調整思考、函式調用、搜尋與 Qwen-MM-Plugins 生態系,皆指向同一轉變:讓 AI 從「理解多媒體」走向「用多媒體完成工作」。

發布資料顯示相較 Qwen3.5-Omni-Plus 有顯著世代提升,特別是在代理式工作流程與複雜音訊場景。對比 Gemini 3.8 Flash,Qwen 的數據更為均衡。因此,更重要的問題不在於哪個模型贏下一個表格,而是「哪種模型與框架組合能在目標工作流程中準確且經濟地完成任務」。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Sep 21, 2026
最後更新 Sep 21, 2026
2 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多