Qwen3.8-Flash 全面解析:100 萬上下文、每 Token 啟用 60 億參數的 MoE 設計、程式與多模態基準、性價比、對比,以及 CometAPI 存取。
TL;DR 阿里巴巴的 Qwen3.8-Flash 是面向高吞吐的生產級模型,適用於程式編寫、代理、長上下文工作與多模態任務。其託管版支援 100 萬 Token 上下文,兼具強勁基準表現與低 API 價格。另有開放權重對應版本 Qwen3.8-Flash-Next,可供本地評估與部署。
關鍵要點
- 生產版 vs. 開放權重命名: Qwen3.8-Flash 是託管生產模型;Qwen3.8-Flash-Next 是用於釋出架構細節與基準的開放權重版本。
- 極度稀疏激活: 主幹 125B 參數 + 51B N-gram 嵌入,每個 Token 僅啟用 6B 參數。
- 長上下文: 開放模型原生 262K 上下文,可透過 YaRN 擴展至 1M;生產版 QwenCloud 路由預設提供 1M 上下文。
- 強大的代理式編碼: Qwen 報告 SWE-bench Pro 62.5、CoWorkBench 73.9、Toolathlon Verified 73.5、LiveCodeBench v6 91.9。
- 多模態能力: Qwen 報告 AndroidWorld 84.5、RealWorldQA 88.5、MathVision(無程式解譯器)90.6。
- 效率: QSA 在 1M Token 時的 prefill 可達 7.6 倍、decode 可達 4.9 倍核心加速,且在高前綴快取命中率的服務設定下,Qwen 報告 1M Token prefill 吞吐量較 Qwen3.7-Plus 高 8.6 倍。
- 定價: 阿里雲目前國際部署列示 US$0.15/M 輸入與 US$0.47/M 輸出;CometAPI 列示 US$0.12/M 輸入與 US$0.376/M 輸出。
Official Qwen3.8-Flash launch image — Alibaba/Qwen source
什麼是 Qwen3.8-Flash?
Qwen3.8-Flash 是阿里巴巴 Qwen 面向效率的生產級模型,針對程式、代理、長上下文知識工作與多模態任務。該模型與開放權重對應版本 Qwen3.8-Flash-Next 同步發佈。阿里巴巴將其描述為一個開放權重的多模態 MoE 模型,優化能力、延遲與成本,並稱此架構是通往 Qwen4 的早期理念預覽。
“Flash” 這一標籤很關鍵。Qwen3.8-Max 是更大、更高能力的旗艦層,Qwen3.8-Flash 則旨在以顯著更低的活躍計算成本,提供大量實用的編碼與代理表現。此次釋出每個 Token 僅啟用 60 億參數,相比旗艦級 MoE 系統的活躍參數規模要小得多。
生產模型以 model ID qwen3.8-flash 提供服務。QwenCloud 支援 OpenAI-compatible Chat Completions and Responses APIs,以及 Anthropic-compatible 介面,便於融入既有的代理與程式開發堆疊。
Qwen3.8-Flash 與 Qwen3.8-Flash-Next 有何不同?
Qwen3.8-Flash-Next 是開放權重版本。其公開架構、模型權重、部署指南與基準套件。權重可在 Hugging Face 與 ModelScope 取得。開放模型原生支援 262,144 Token 上下文,可透過 YaRN 擴展至 1M。
Qwen3.8-Flash 是生產 API 版本。官方表示生產版預設使用 1M 上下文並內建官方工具。實務上,評估託管模型的開發者應以 Qwen3.8-Flash 的 API 行為與定價為準,而 Flash-Next 是公開的架構與基準細節來源。
Qwen3.8-Flash 規格
| 規格 | Qwen3.8-Flash / Flash-Next |
|---|---|
| 提供方 | Alibaba Qwen |
| 生產模型 ID | qwen3.8-flash |
| 開放權重模型 | Qwen3.8-Flash-Next |
| 架構 | 多模態專家混合(Mixture-of-Experts);GDN + QSA 混合注意力 |
| 主參數量 | 125B |
| 每 Token 啟用參數 | 6B per token |
| N-gram 嵌入參數量 | 51B |
| 開放模型原生上下文 | 262,144 tokens |
| 擴展/託管上下文 | Up to 1,000,000 tokens |
| 生產路由輸入模態 | 官方整合示例記載 Text + image |
| 開放權重模態 | Text + vision;以多模態形式釋出 |
| 推理控制 | QwenCloud 範例中的 low / medium / xhigh |
| 平行工具呼叫 | 官方 Codex 模型配置中標示支援 |
| 開放權重 | 是,適用於 Qwen3.8-Flash-Next |
| 發佈日期 | August 26–27, 2026 release window |
關鍵效率數字是每個 Token 僅啟用 60 億參數。另外的 510 億 N-gram 嵌入屬於查表式容量;Qwen 指出它們不像 Transformer 權重那樣進入每 Token 的矩陣運算預算。
Qwen3.8-Flash 架構有哪些新特性?
Official Qwen architecture diagram — Qwen3.8-Flash-Next
1. GDN + Qwen Sparse Attention(QSA)
模型混合兩種機制。每四層中的三層使用 Gated DeltaNet(GDN) 將歷史資訊壓縮為固定大小的狀態,其餘一層使用全域注意力以進行精確擷取。該全域注意力層再藉由 Qwen Sparse Attention 降低需直接處理的上下文規模。
實務目標很直接:GDN 處理低成本記憶,QSA 僅在檢索重要處花費完整注意力。這對長上下文應用尤其有價值,因為一般的全注意力在計算與 KV-cache 傳輸上都變得昂貴。
2. 具有四條資訊路徑的門控殘差
門控殘差將殘差流拓寬為四個並行分支。動態的元素層級門控控制從各分支讀寫資訊的量。這讓早期資訊在深層網路中有更多存活途徑,而非反覆混入同一條流。Qwen 亦表示殘差狀態可用 FP8 儲存以降低記憶體流量。
3. N-gram 嵌入在不成比例增加計算下擴展容量
Qwen 新增 510 億 N-gram 嵌入參數,透過本地 Token 上下文定址。不同於一般 Transformer 權重,這些參數以查表操作取回,並可透過非同步預取卸載至主機記憶體。此設計在保持每 Token 算術運算量低的同時,擴展了模型容量。
4. Muon 最佳化器與訓練共同設計
Qwen 對核心 2D 線性映射權重使用 Muon 最佳化器訓練,同時對嵌入、路由器與部分低秩參數保留 AdamW。團隊亦重新擬合了此新架構的縮放律,並報告無需批次大小暖啟,於實驗中避免了 18.8% 的額外最佳化步數。
5. 超稀疏 MoE 與多 Token 預測
模型保留大型專家池,但每個 Token 只路由少量專家。同時使用多 Token 預測,有助於推測式解碼提升接受率,並在訓練期間改進主幹表現。這些選擇共同強化同一設計目標:在不為每個 Token 支付旗艦級計算成本的前提下,獲得更高的容量與吞吐。
Qwen3.8-Flash 基準測試表現
程式碼基準測試
阿里巴巴以 Qwen3.8-Flash-Next(生產版 Qwen3.8-Flash 的開放權重對應)發佈了測試套件。下表採用 Qwen 公佈的釋出分數,並聚焦 CometAPI 上亦可用的同儕。

Official Qwen language benchmark chart
| 基準測試 | Qwen3.8-Flash | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 54.4 | — |
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | — | 77.5 |
| NL2Repo-Bench | 48.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 45.1 | 68.2 |
| JobBench | 55.7 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 70.3 | — |
| IFBench | 81.3 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 90.8 | 91.3 |
| HLE | 35.9 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.6 | 88.8 |
程式結果: Qwen3.8-Flash 在 SWE-bench Pro(62.5)、SWE-bench Multilingual(81.0)與 LiveCodeBench v6(91.9)領先所選同儕。主要例外是 NL2Repo-Bench,DeepSeek V4 Flash 為 54.2,相較 Qwen 的 48.1。
代理結果: Qwen3.8-Flash 在 CoWorkBench 取得 73.9、在 JobBench 取得 55.7,顯著高於 Qwen 釋出表中的所選同儕。在 Toolathlon Verified 上也以 73.5 些微勝過 DeepSeek V4 Flash 的 70.3。
推理結果: 差距較小。Qwen3.8-Flash 在 GPQA Diamond 為 91.7,接近 Claude Opus 4.6 的 91.3 與 DeepSeek V4 Flash 的 90.8。在 HLE 上,Claude Opus 4.6 以 40.0 領先 Qwen 的 35.9。
多模態基準測試

Official Qwen vision-language benchmark chart
| 基準測試 | Qwen3.8-Flash | Claude Opus 4.6 |
|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 52.5 / 54.7 |
| AndroidWorld | 84.5 | 62.0 |
| ERQA | 72.3 | 40.8 |
| LVBench | 76.6 | 63.0 |
| RealWorldQA | 88.5 | 73.9 |
| MathVision (no CI / with CI) | 90.6 / 95.7 | 65.5 / — |
| CharXiv RQ (no CI / with CI) | 84.6 / 90.6 | 66.0 / — |
這組多模態釋出結果是支持 Qwen3.8-Flash 的關鍵理由之一。Qwen 報告 AndroidWorld 84.5、RealWorldQA 88.5、MathVision(無程式解譯器)90.6。這些分數顯示該模型面向需要讀取螢幕、理解視覺狀態並持續行動的代理,而不僅是回答圖像問題。
基準測試說明: 以上為廠商公佈的釋出結果,並非中立的實驗室正面對比。若干基準使用不同的測評框架或工具設定,部分為內部測試。請將這些數字視為方向性證據,並在自身的提示、工具、延遲目標與驗收標準下驗證模型。
為何 Qwen3.8-Flash 既快又具成本效率

Official Qwen long-context efficiency chart
在 100 萬 Token 上下文下,Qwen 報告 QSA 注意力核心的 prefill 可達 7.6 倍、decode 可達 4.9 倍加速。在 90% 前綴快取命中率的服務實驗中,Qwen3.8-Flash-Next 達到相較 Qwen3.7-Plus 8.6 倍的 prefill 吞吐量。
更大的系統層面故事在於活躍計算。125B 的主模型看似龐大,但每個 Token 僅啟用 6B 參數。這個活躍規模不到 DeepSeek V4 Flash 報告的 13B 的一半,也遠低於 Qwen3.8-Max 約 95B 的活躍參數。參數數量不會線性對應速度,但此設計為 Qwen3.8-Flash 提供明確的效率目標。
阿里巴巴也報告,訓練所需資源約為 Qwen3.7-Plus 的九分之一,同時提升了程式與辦公任務表現。另據報導,基於該模型的 QwenWork Standard 模式可將每個任務的 Token 消耗降低 75%,並大致將生成速度提高一倍。這些產品層面的數字不應視為通用 API 延遲保證,但顯示了阿里巴巴對模型使用方式的預期。
Qwen3.8-Flash 價格
阿里巴巴的發佈公告列示 QwenCloud 價格為每百萬輸入 Token $0.16、每百萬輸出 Token $0.47。價格可能因區域、產品介面、快取或後續更新而變動,生產團隊在估算大量工作負載前應以供應商即時頁面為準。
本文撰寫時,CometAPI 列示 Qwen3.8-Flash 為每百萬輸入 Token $0.12、每百萬輸出 Token 約 $0.376。CometAPI 模型頁將此標示為相對其參考價的 20% 折扣。
| 路由 | 輸入 / 每 1M Token | 輸出 / 每 1M Token | 範例:10M 輸入 + 2M 輸出 |
|---|---|---|---|
| QwenCloud 發佈價 | $0.16 | $0.47 | $2.54 |
| CometAPI 列示價格 | $0.12 | ~$0.376 | ~$1.95 |
對於 1000 萬輸入 Token 與 200 萬輸出 Token 的工作負載,按發佈價計算 QwenCloud 約 $2.54,而按當前 CometAPI 列示價格約 $1.95。實際代理帳單可能更高,因為工具呼叫、重試、長推理、重複上下文與外部服務都會增加成本。請比較「每個被接受結果的成本」,而非僅看 Token 單價。
Qwen3.8-Flash vs. Qwen3.8-Max vs DeepSeek V4 Flash
| 維度 | Qwen3.8-Flash | Qwen3.8-Max | Gemini 3.7 Flash | DeepSeek V4 Flash |
|---|---|---|---|---|
| 定位 | 以效率為先的 Qwen 生產模型 | Qwen 旗艦模型 | Google 主力 Flash 模型 | 以效率為先的文字型 MoE |
| 總/活躍參數 | 125B + 51B 查表 / 6B | 2.4T / ~95B | 未披露 | 284B / 13B |
| 上下文 | 1M 託管 | 1M | 1,048,576 | 1M |
| 多模態 | 官方文件記載 Text + vision | Text + image + video | Text + image + video + audio + PDF | 以文字為主 |
| 推理控制 | low / medium / xhigh | 高級推理 / 快速模式 | low / medium / high | Non-think / Think / Think Max |
| CometAPI 輸入價格 | US$0.12/M | US$1.60/M | US$0.60/M | US$0.176/M |
| 官方供應商價格(輸入/輸出) | US$0.15 / US$0.47(阿里雲國際) | US$2 / US$6(阿里雲國際) | US$0.75 / US$3.75 至 2026 年 12 月 31 日 | 尖峰:US$0.44 / US$1.32;離峰:US$0.22 / US$0.66 |
| 最佳適用 | 高量程式任務、代理、協同工作 | 最艱難的 Qwen 任務、長期自主 | Google 工具生態、廣泛多模態代理 | 高吞吐的文字推理與程式任務 |
Qwen3.8-Flash 的優勢
- 活躍計算效率: 每 Token 啟用 6B 參數,在具備強勁代理式程式與多模態分數的模型中極為少見。
- Qwen 生態價值: 對於不需要旗艦層的工作負載,Qwen3.8-Flash 相較 Qwen3.8-Max 便宜許多。
- 代理 + 辦公平衡: 在 CoWorkBench、JobBench、Toolathlon、SWE-bench Pro 與多模態代理任務上表現尤佳,而非僅限學術型 QA。
- 開放權重路徑: Qwen3.8-Flash-Next 提供權重,方便需要在地部署、獨立評估或微調的團隊。
其他模型可能更合適的情況
- 當追求 Qwen 的峰值能力時使用 Qwen3.8-Max。 Max 層擁有更大的活躍計算預算,面向最困難的長期任務。
- 當廣泛輸入模態很重要時使用 Gemini 3.7 Flash。 Google 的 Flash 模型明確支援音訊、影片、PDF 與深度 Google 工具整合。
- 當以文字為先的效率是優先事項時使用 DeepSeek V4 Flash。 在 Qwen 的比較中,它贏下 NL2Repo-Bench,仍是強勁、成本導向的程式替代方案。
- 當高價高能正當其價值時使用 Claude Opus 4.6。 在 Qwen 的釋出表中,它仍領先 HLE,且在 GPQA 上極具競爭力。
Qwen3.8-Flash 的最佳使用案例
程式代理與版本庫工作
Qwen3.8-Flash 很適合處理 Issue 修復、重構、程式碼審查、倉庫導覽、測試生成、除錯與工具驅動的編碼循環。其 LiveCodeBench 與 SWE-bench Pro 的高分顯示,它不只是低延遲對話模型,而是為多步驟軟體工作設計。
長上下文的企業知識型工作
100 萬 Token 的生產上下文可容納大型文件集、程式碼庫、日誌、會議逐字稿或長期代理歷史。CoWorkBench 與 JobBench 的結果使其對文件綜整、試算表/簡報工作流程、研究支援、合規審查與營運分析尤為吸引。
多模態代理
AndroidWorld、RealWorldQA、ERQA 與 MathVision 的分數,指向需要理解截圖、視覺文件、介面、圖表與真實世界影像的工作流程代理。這使該模型適合瀏覽器代理、UI 測試、視覺 QA、文件代理與具螢幕感知的自動化。
高流量路由
由於 Qwen3.8-Flash 比旗艦模型便宜許多,一種務實架構是將大多數生產流量路由到 Flash,僅將模糊、高風險或極難請求升級到 Qwen3.8-Max 或其他高階模型。像 CometAPI 這樣的統一閘道讓此類路由模式更容易,因為應用可在單一 API 合約下切換供應商。
限制與注意事項
- 基準測試為自報數據。 部分使用 Qwen 自選框架、內部任務或啟用工具設定。獨立驗證仍很重要。
- 並非每項基準都獲勝。 在官方比較中,DeepSeek V4 Flash 領先 NL2Repo-Bench,而 Claude Opus 4.6 領先 HLE。
- 電腦操作仍然是難題。 釋出報告 OSWorld 2.0 的二元分數為 19.4,儘管部分得分表現高得多。
- 託管與開放權重行為可能不同。 系統提示、工具、上下文管理、量化、服務堆疊與供應商更新都可能使真實表現偏離發佈時的 Flash-Next 基準設定。
- 價格具動態性。 發佈公告與當前聚合頁可能給出略有不同的參考價。預算時請以即時端點價格為準。
如何透過 CometAPI 使用 Qwen3.8-Flash API
CometAPI 透過 OpenAI-compatible 端點提供 Qwen3.8-Flash,因此既有的 OpenAI SDK 整合通常只需更換 API Key、base URL 與 model ID 即可切換。
為何使用 CometAPI 來調用 Qwen3.8-Flash?
CometAPI 提供統一 API 端點,方便開發者在不維護多家供應商整合的情況下,同時測試 Qwen3.8-Flash 與其他模型。這對基準對比、故障切換路由與基於成本的模型選擇特別有用。
- 建立 CometAPI API Key。 在 CometAPI dashboard 生成金鑰,並以環境變數而非原始碼保存。
- 使用統一 base URL。 將 SDK base URL 設為
https://api.cometapi.com/v1. - 選擇模型。 使用 qwen3.8-flash 作為 model ID。
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="qwen3.8-flash",
messages=[
{"role": "system", "content": "你是一位精準的程式設計助理。"},
{"role": "user", "content": "審查此 API 設計並識別可靠性風險。"},
],
)
print(response.choices[0].message.content)
cURL
curl "https://api.cometapi.com/v1/chat/completions" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{"role": "user", "content": "總結此遷移計畫中的主要風險。"}
]
}'
For production, add timeout handling, retry policy, token limits, structured output validation, and model-routing telemetry. If your workflow is agentic, track tool-call failures and accepted-task rate in addition to raw model latency.
常見問題
Qwen3.8-Flash 是否開源?
生產路由 Qwen3.8-Flash 為託管 API。其開放權重對應版本 Qwen3.8-Flash-Next 在 Hugging Face 與 ModelScope 提供權重下載。“開放權重”更為精確,因為使用權限取決於模型授權。
Qwen3.8-Flash 的上下文長度是什麼?
開放模型原生支援 262,144 Token,並可透過 YaRN 擴展至 1,000,000 Token。阿里巴巴表示生產版 Qwen3.8-Flash 服務預設使用 1M 上下文。
Qwen3.8-Flash 有多少參數?
釋出資訊顯示主模型 125B 參數、N-gram 嵌入 51B、每 Token 啟用 6B。低活躍參數量是其效率設計的核心。
Qwen3.8-Flash 是否支援圖像?
是。該釋出為多模態,開放權重部署堆疊支援文本與視覺,生產版官方整合示例亦列出文本與圖像輸入。不同供應商介面可能暴露不同模態組合,部署前請檢查當前 API 能力頁。
Qwen3.8-Flash 是否優於 Qwen3.8-Max?
並非一概而論。當延遲、活躍計算與價格很重要時,Qwen3.8-Flash 更合適;Qwen3.8-Max 則是面向最艱難長期與高價值任務的旗艦選擇。可透過路由系統同時使用兩者。
Qwen3.8-Flash 的費用是多少?
阿里巴巴宣佈 QwenCloud 的價格為每百萬輸入 Token $0.16、每百萬輸出 Token $0.47。CometAPI 目前列示約每百萬輸入 Token $0.12、每百萬輸出 Token $0.376。價格會變動,請以即時價格為準。
結論
Qwen3.8-Flash 清晰體現了當前從「更大模型」轉向「更佳系統經濟性」的趨勢。其主幹 125B 參數看似龐大,但每 Token 僅啟用 6B,並透過查表式 N-gram 嵌入擴展容量。QSA、門控殘差、超稀疏 MoE 路由,以及面向長上下文的服務化設計皆指向同一方向:在不支付旗艦級推理成本的前提下,交付代理式編碼與多模態能力。
該釋出對軟體工程、辦公代理、工具使用與視覺工作流程尤為有說服力。同時,模型並非全方位勝出:在 Qwen 自身表中,DeepSeek V4 Flash 至少在一項倉庫生成基準上領先,Claude Opus 4.6 在 HLE 上更強,而 Qwen3.8-Max 仍是更高能力的 Qwen 層級。
對開發者而言,最務實的下一步是在真實任務上評估 Qwen3.8-Flash,並將「被接受結果的成本」與 Gemini 3.7 Flash、DeepSeek V4 Flash 以及路由堆疊中的高階模型比較。CometAPI 提供單一 OpenAI-compatible 介面,便於進行此類多模型測試與部署。
