GPT-6 Astra is now live on CometAPI →
technology/CometAPI 研究

什麼是 Qwen3.8-Flash?規格、基準測試、架構、定價與 API 指南

瞭解 Qwen3.8-Flash 是什麼,包括其 6B-active MoE 架構、1M 上下文、基準測試、定價、比較,以及 CometAPI 的使用方式。

CometAPI
Mia MarenAI 模型與 API 研究團隊
更新於 Sep 6, 2026 9 分鐘閱讀
什麼是 Qwen3.8-Flash?規格、基準測試、架構、定價與 API 指南
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Qwen3.8-Flash 全面解析:100 萬上下文、每 Token 啟用 60 億參數的 MoE 設計、程式與多模態基準、性價比、對比,以及 CometAPI 存取。

 TL;DR 阿里巴巴的 Qwen3.8-Flash 是面向高吞吐的生產級模型,適用於程式編寫、代理、長上下文工作與多模態任務。其託管版支援 100 萬 Token 上下文,兼具強勁基準表現與低 API 價格。另有開放權重對應版本 Qwen3.8-Flash-Next,可供本地評估與部署。

關鍵要點

什麼是 Qwen3.8-Flash?規格、基準測試、架構、定價與 API 指南

Official Qwen3.8-Flash launch image — Alibaba/Qwen source

什麼是 Qwen3.8-Flash?

Qwen3.8-Flash 是阿里巴巴 Qwen 面向效率的生產級模型,針對程式、代理、長上下文知識工作與多模態任務。該模型與開放權重對應版本 Qwen3.8-Flash-Next 同步發佈。阿里巴巴將其描述為一個開放權重的多模態 MoE 模型,優化能力、延遲與成本,並稱此架構是通往 Qwen4 的早期理念預覽。

“Flash” 這一標籤很關鍵。Qwen3.8-Max 是更大、更高能力的旗艦層,Qwen3.8-Flash 則旨在以顯著更低的活躍計算成本,提供大量實用的編碼與代理表現。此次釋出每個 Token 僅啟用 60 億參數,相比旗艦級 MoE 系統的活躍參數規模要小得多。

生產模型以 model ID qwen3.8-flash 提供服務。QwenCloud 支援 OpenAI-compatible Chat Completions and Responses APIs,以及 Anthropic-compatible 介面,便於融入既有的代理與程式開發堆疊。

Qwen3.8-Flash 與 Qwen3.8-Flash-Next 有何不同?

Qwen3.8-Flash-Next 是開放權重版本。其公開架構、模型權重、部署指南與基準套件。權重可在 Hugging Face 與 ModelScope 取得。開放模型原生支援 262,144 Token 上下文,可透過 YaRN 擴展至 1M。

Qwen3.8-Flash 是生產 API 版本。官方表示生產版預設使用 1M 上下文並內建官方工具。實務上,評估託管模型的開發者應以 Qwen3.8-Flash 的 API 行為與定價為準,而 Flash-Next 是公開的架構與基準細節來源。

Qwen3.8-Flash 規格

規格Qwen3.8-Flash / Flash-Next
提供方Alibaba Qwen
生產模型 IDqwen3.8-flash
開放權重模型Qwen3.8-Flash-Next
架構多模態專家混合(Mixture-of-Experts);GDN + QSA 混合注意力
主參數量125B
每 Token 啟用參數6B per token
N-gram 嵌入參數量51B
開放模型原生上下文262,144 tokens
擴展/託管上下文Up to 1,000,000 tokens
生產路由輸入模態官方整合示例記載 Text + image
開放權重模態Text + vision;以多模態形式釋出
推理控制QwenCloud 範例中的 low / medium / xhigh
平行工具呼叫官方 Codex 模型配置中標示支援
開放權重是,適用於 Qwen3.8-Flash-Next
發佈日期August 26–27, 2026 release window

關鍵效率數字是每個 Token 僅啟用 60 億參數。另外的 510 億 N-gram 嵌入屬於查表式容量;Qwen 指出它們不像 Transformer 權重那樣進入每 Token 的矩陣運算預算。

Qwen3.8-Flash 架構有哪些新特性?

什麼是 Qwen3.8-Flash?規格、基準測試、架構、定價與 API 指南

Official Qwen architecture diagram — Qwen3.8-Flash-Next

1. GDN + Qwen Sparse Attention(QSA)

模型混合兩種機制。每四層中的三層使用 Gated DeltaNet(GDN) 將歷史資訊壓縮為固定大小的狀態,其餘一層使用全域注意力以進行精確擷取。該全域注意力層再藉由 Qwen Sparse Attention 降低需直接處理的上下文規模。

實務目標很直接:GDN 處理低成本記憶,QSA 僅在檢索重要處花費完整注意力。這對長上下文應用尤其有價值,因為一般的全注意力在計算與 KV-cache 傳輸上都變得昂貴。

2. 具有四條資訊路徑的門控殘差

門控殘差將殘差流拓寬為四個並行分支。動態的元素層級門控控制從各分支讀寫資訊的量。這讓早期資訊在深層網路中有更多存活途徑,而非反覆混入同一條流。Qwen 亦表示殘差狀態可用 FP8 儲存以降低記憶體流量。

3. N-gram 嵌入在不成比例增加計算下擴展容量

Qwen 新增 510 億 N-gram 嵌入參數,透過本地 Token 上下文定址。不同於一般 Transformer 權重,這些參數以查表操作取回,並可透過非同步預取卸載至主機記憶體。此設計在保持每 Token 算術運算量低的同時,擴展了模型容量。

4. Muon 最佳化器與訓練共同設計

Qwen 對核心 2D 線性映射權重使用 Muon 最佳化器訓練,同時對嵌入、路由器與部分低秩參數保留 AdamW。團隊亦重新擬合了此新架構的縮放律,並報告無需批次大小暖啟,於實驗中避免了 18.8% 的額外最佳化步數。

5. 超稀疏 MoE 與多 Token 預測

模型保留大型專家池,但每個 Token 只路由少量專家。同時使用多 Token 預測,有助於推測式解碼提升接受率,並在訓練期間改進主幹表現。這些選擇共同強化同一設計目標:在不為每個 Token 支付旗艦級計算成本的前提下,獲得更高的容量與吞吐。

Qwen3.8-Flash 基準測試表現

程式碼基準測試

阿里巴巴以 Qwen3.8-Flash-Next(生產版 Qwen3.8-Flash 的開放權重對應)發佈了測試套件。下表採用 Qwen 公佈的釋出分數,並聚焦 CometAPI 上亦可用的同儕。

什麼是 Qwen3.8-Flash?規格、基準測試、架構、定價與 API 指南

Official Qwen language benchmark chart

基準測試Qwen3.8-FlashDeepSeek V4 FlashClaude Opus 4.6
DeepSWE 1.158.754.4
SWE-bench Pro62.556.053.4
SWE-bench Multilingual81.077.5
NL2Repo-Bench48.154.247.6
CoWorkBench73.945.168.2
JobBench55.741.336.6
Toolathlon Verified73.570.3
IFBench81.379.262.5
GPQA Diamond91.790.891.3
HLE35.933.840.0
LiveCodeBench v691.990.688.8

程式結果: Qwen3.8-Flash 在 SWE-bench Pro(62.5)、SWE-bench Multilingual(81.0)與 LiveCodeBench v6(91.9)領先所選同儕。主要例外是 NL2Repo-Bench,DeepSeek V4 Flash 為 54.2,相較 Qwen 的 48.1。

代理結果: Qwen3.8-Flash 在 CoWorkBench 取得 73.9、在 JobBench 取得 55.7,顯著高於 Qwen 釋出表中的所選同儕。在 Toolathlon Verified 上也以 73.5 些微勝過 DeepSeek V4 Flash 的 70.3。

推理結果: 差距較小。Qwen3.8-Flash 在 GPQA Diamond 為 91.7,接近 Claude Opus 4.6 的 91.3 與 DeepSeek V4 Flash 的 90.8。在 HLE 上,Claude Opus 4.6 以 40.0 領先 Qwen 的 35.9。

多模態基準測試

什麼是 Qwen3.8-Flash?規格、基準測試、架構、定價與 API 指南

Official Qwen vision-language benchmark chart

基準測試Qwen3.8-FlashClaude Opus 4.6
ClawEval-MM (Pass@3 / Avg)64.4 / 60.452.5 / 54.7
AndroidWorld84.562.0
ERQA72.340.8
LVBench76.663.0
RealWorldQA88.573.9
MathVision (no CI / with CI)90.6 / 95.765.5 / —
CharXiv RQ (no CI / with CI)84.6 / 90.666.0 / —

這組多模態釋出結果是支持 Qwen3.8-Flash 的關鍵理由之一。Qwen 報告 AndroidWorld 84.5、RealWorldQA 88.5、MathVision(無程式解譯器)90.6。這些分數顯示該模型面向需要讀取螢幕、理解視覺狀態並持續行動的代理,而不僅是回答圖像問題。

基準測試說明: 以上為廠商公佈的釋出結果,並非中立的實驗室正面對比。若干基準使用不同的測評框架或工具設定,部分為內部測試。請將這些數字視為方向性證據,並在自身的提示、工具、延遲目標與驗收標準下驗證模型。

為何 Qwen3.8-Flash 既快又具成本效率

什麼是 Qwen3.8-Flash?規格、基準測試、架構、定價與 API 指南

Official Qwen long-context efficiency chart

在 100 萬 Token 上下文下,Qwen 報告 QSA 注意力核心的 prefill 可達 7.6 倍、decode 可達 4.9 倍加速。在 90% 前綴快取命中率的服務實驗中,Qwen3.8-Flash-Next 達到相較 Qwen3.7-Plus 8.6 倍的 prefill 吞吐量。

更大的系統層面故事在於活躍計算。125B 的主模型看似龐大,但每個 Token 僅啟用 6B 參數。這個活躍規模不到 DeepSeek V4 Flash 報告的 13B 的一半,也遠低於 Qwen3.8-Max 約 95B 的活躍參數。參數數量不會線性對應速度,但此設計為 Qwen3.8-Flash 提供明確的效率目標。

阿里巴巴也報告,訓練所需資源約為 Qwen3.7-Plus 的九分之一,同時提升了程式與辦公任務表現。另據報導,基於該模型的 QwenWork Standard 模式可將每個任務的 Token 消耗降低 75%,並大致將生成速度提高一倍。這些產品層面的數字不應視為通用 API 延遲保證,但顯示了阿里巴巴對模型使用方式的預期。

Qwen3.8-Flash 價格

阿里巴巴的發佈公告列示 QwenCloud 價格為每百萬輸入 Token $0.16、每百萬輸出 Token $0.47。價格可能因區域、產品介面、快取或後續更新而變動,生產團隊在估算大量工作負載前應以供應商即時頁面為準。

本文撰寫時,CometAPI 列示 Qwen3.8-Flash 為每百萬輸入 Token $0.12、每百萬輸出 Token 約 $0.376。CometAPI 模型頁將此標示為相對其參考價的 20% 折扣。

路由輸入 / 每 1M Token輸出 / 每 1M Token範例:10M 輸入 + 2M 輸出
QwenCloud 發佈價$0.16$0.47$2.54
CometAPI 列示價格$0.12~$0.376~$1.95

對於 1000 萬輸入 Token 與 200 萬輸出 Token 的工作負載,按發佈價計算 QwenCloud 約 $2.54,而按當前 CometAPI 列示價格約 $1.95。實際代理帳單可能更高,因為工具呼叫、重試、長推理、重複上下文與外部服務都會增加成本。請比較「每個被接受結果的成本」,而非僅看 Token 單價。

Qwen3.8-Flash vs. Qwen3.8-Max vs DeepSeek V4 Flash

維度Qwen3.8-FlashQwen3.8-MaxGemini 3.7 FlashDeepSeek V4 Flash
定位以效率為先的 Qwen 生產模型Qwen 旗艦模型Google 主力 Flash 模型以效率為先的文字型 MoE
總/活躍參數125B + 51B 查表 / 6B2.4T / ~95B未披露284B / 13B
上下文1M 託管1M1,048,5761M
多模態官方文件記載 Text + visionText + image + videoText + image + video + audio + PDF以文字為主
推理控制low / medium / xhigh高級推理 / 快速模式low / medium / highNon-think / Think / Think Max
CometAPI 輸入價格US$0.12/MUS$1.60/MUS$0.60/MUS$0.176/M
官方供應商價格(輸入/輸出)US$0.15 / US$0.47(阿里雲國際)US$2 / US$6(阿里雲國際)US$0.75 / US$3.75 至 2026 年 12 月 31 日尖峰:US$0.44 / US$1.32;離峰:US$0.22 / US$0.66
最佳適用高量程式任務、代理、協同工作最艱難的 Qwen 任務、長期自主Google 工具生態、廣泛多模態代理高吞吐的文字推理與程式任務

Qwen3.8-Flash 的優勢

  • 活躍計算效率: 每 Token 啟用 6B 參數,在具備強勁代理式程式與多模態分數的模型中極為少見。
  • Qwen 生態價值: 對於不需要旗艦層的工作負載,Qwen3.8-Flash 相較 Qwen3.8-Max 便宜許多。
  • 代理 + 辦公平衡: 在 CoWorkBench、JobBench、Toolathlon、SWE-bench Pro 與多模態代理任務上表現尤佳,而非僅限學術型 QA。
  • 開放權重路徑: Qwen3.8-Flash-Next 提供權重,方便需要在地部署、獨立評估或微調的團隊。

其他模型可能更合適的情況

  • 當追求 Qwen 的峰值能力時使用 Qwen3.8-Max Max 層擁有更大的活躍計算預算,面向最困難的長期任務。
  • 當廣泛輸入模態很重要時使用 Gemini 3.7 Flash Google 的 Flash 模型明確支援音訊、影片、PDF 與深度 Google 工具整合。
  • 當以文字為先的效率是優先事項時使用 DeepSeek V4 Flash 在 Qwen 的比較中,它贏下 NL2Repo-Bench,仍是強勁、成本導向的程式替代方案。
  • 當高價高能正當其價值時使用 Claude Opus 4.6 在 Qwen 的釋出表中,它仍領先 HLE,且在 GPQA 上極具競爭力。

Qwen3.8-Flash 的最佳使用案例

程式代理與版本庫工作

Qwen3.8-Flash 很適合處理 Issue 修復、重構、程式碼審查、倉庫導覽、測試生成、除錯與工具驅動的編碼循環。其 LiveCodeBench 與 SWE-bench Pro 的高分顯示,它不只是低延遲對話模型,而是為多步驟軟體工作設計。

長上下文的企業知識型工作

100 萬 Token 的生產上下文可容納大型文件集、程式碼庫、日誌、會議逐字稿或長期代理歷史。CoWorkBench 與 JobBench 的結果使其對文件綜整、試算表/簡報工作流程、研究支援、合規審查與營運分析尤為吸引。

多模態代理

AndroidWorld、RealWorldQA、ERQA 與 MathVision 的分數,指向需要理解截圖、視覺文件、介面、圖表與真實世界影像的工作流程代理。這使該模型適合瀏覽器代理、UI 測試、視覺 QA、文件代理與具螢幕感知的自動化。

高流量路由

由於 Qwen3.8-Flash 比旗艦模型便宜許多,一種務實架構是將大多數生產流量路由到 Flash,僅將模糊、高風險或極難請求升級到 Qwen3.8-Max 或其他高階模型。像 CometAPI 這樣的統一閘道讓此類路由模式更容易,因為應用可在單一 API 合約下切換供應商。

限制與注意事項

  • 基準測試為自報數據。 部分使用 Qwen 自選框架、內部任務或啟用工具設定。獨立驗證仍很重要。
  • 並非每項基準都獲勝。 在官方比較中,DeepSeek V4 Flash 領先 NL2Repo-Bench,而 Claude Opus 4.6 領先 HLE。
  • 電腦操作仍然是難題。 釋出報告 OSWorld 2.0 的二元分數為 19.4,儘管部分得分表現高得多。
  • 託管與開放權重行為可能不同。 系統提示、工具、上下文管理、量化、服務堆疊與供應商更新都可能使真實表現偏離發佈時的 Flash-Next 基準設定。
  • 價格具動態性。 發佈公告與當前聚合頁可能給出略有不同的參考價。預算時請以即時端點價格為準。

如何透過 CometAPI 使用 Qwen3.8-Flash API

CometAPI 透過 OpenAI-compatible 端點提供 Qwen3.8-Flash,因此既有的 OpenAI SDK 整合通常只需更換 API Key、base URL 與 model ID 即可切換。

為何使用 CometAPI 來調用 Qwen3.8-Flash?

CometAPI 提供統一 API 端點,方便開發者在不維護多家供應商整合的情況下,同時測試 Qwen3.8-Flash 與其他模型。這對基準對比、故障切換路由與基於成本的模型選擇特別有用。

  1. 建立 CometAPI API Key。CometAPI dashboard 生成金鑰,並以環境變數而非原始碼保存。
  2. 使用統一 base URL。 將 SDK base URL 設為 https://api.cometapi.com/v1.
  3. 選擇模型。 使用 qwen3.8-flash 作為 model ID。

Python

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[
        {"role": "system", "content": "你是一位精準的程式設計助理。"},
        {"role": "user", "content": "審查此 API 設計並識別可靠性風險。"},
    ],
)

print(response.choices[0].message.content)

cURL

curl "https://api.cometapi.com/v1/chat/completions" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash",
    "messages": [
      {"role": "user", "content": "總結此遷移計畫中的主要風險。"}
    ]
  }' 
For production, add timeout handling, retry policy, token limits, structured output validation, and model-routing telemetry. If your workflow is agentic, track tool-call failures and accepted-task rate in addition to raw model latency.

常見問題

Qwen3.8-Flash 是否開源?

生產路由 Qwen3.8-Flash 為託管 API。其開放權重對應版本 Qwen3.8-Flash-Next 在 Hugging Face 與 ModelScope 提供權重下載。“開放權重”更為精確,因為使用權限取決於模型授權。

Qwen3.8-Flash 的上下文長度是什麼?

開放模型原生支援 262,144 Token,並可透過 YaRN 擴展至 1,000,000 Token。阿里巴巴表示生產版 Qwen3.8-Flash 服務預設使用 1M 上下文。

Qwen3.8-Flash 有多少參數?

釋出資訊顯示主模型 125B 參數、N-gram 嵌入 51B、每 Token 啟用 6B。低活躍參數量是其效率設計的核心。

Qwen3.8-Flash 是否支援圖像?

是。該釋出為多模態,開放權重部署堆疊支援文本與視覺,生產版官方整合示例亦列出文本與圖像輸入。不同供應商介面可能暴露不同模態組合,部署前請檢查當前 API 能力頁。

Qwen3.8-Flash 是否優於 Qwen3.8-Max?

並非一概而論。當延遲、活躍計算與價格很重要時,Qwen3.8-Flash 更合適;Qwen3.8-Max 則是面向最艱難長期與高價值任務的旗艦選擇。可透過路由系統同時使用兩者。

Qwen3.8-Flash 的費用是多少?

阿里巴巴宣佈 QwenCloud 的價格為每百萬輸入 Token $0.16、每百萬輸出 Token $0.47。CometAPI 目前列示約每百萬輸入 Token $0.12、每百萬輸出 Token $0.376。價格會變動,請以即時價格為準。

結論

Qwen3.8-Flash 清晰體現了當前從「更大模型」轉向「更佳系統經濟性」的趨勢。其主幹 125B 參數看似龐大,但每 Token 僅啟用 6B,並透過查表式 N-gram 嵌入擴展容量。QSA、門控殘差、超稀疏 MoE 路由,以及面向長上下文的服務化設計皆指向同一方向:在不支付旗艦級推理成本的前提下,交付代理式編碼與多模態能力。

該釋出對軟體工程、辦公代理、工具使用與視覺工作流程尤為有說服力。同時,模型並非全方位勝出:在 Qwen 自身表中,DeepSeek V4 Flash 至少在一項倉庫生成基準上領先,Claude Opus 4.6 在 HLE 上更強,而 Qwen3.8-Max 仍是更高能力的 Qwen 層級。

對開發者而言,最務實的下一步是在真實任務上評估 Qwen3.8-Flash,並將「被接受結果的成本」與 Gemini 3.7 Flash、DeepSeek V4 Flash 以及路由堆疊中的高階模型比較。CometAPI 提供單一 OpenAI-compatible 介面,便於進行此類多模型測試與部署。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Sep 4, 2026
最後更新 Sep 6, 2026
0 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多