Qwen3.8-Flash-Next 並不僅僅是 Qwen3.8 系列中更小或更快的成員。Qwen 將其描述為一個「開源權重的多模態 MoE 模型,並且是 Qwen4 將採用架構的早期預覽」。其設計同時改變了注意力機制、殘差連接、嵌入容量與優化策略,目標是在顯著降低每個 token 所需運算量的同時提升能力。
TL;DR
Qwen3.8-Flash-Next 將一個 125B 參數的主模型與額外 51B 的 N-gram Embedding 表相結合,同時每個 token 僅啟用 6B 參數。它原生支援 262,144 個 token,並可透過 YaRN 擴展至 1,000,000 個 token。該架構圍繞 3:1 的 Gated DeltaNet 與 Qwen Sparse Attention 混合、四分支 Gated Residual 連接、N-gram Embedding、超稀疏 MoE 專家池、Multi-Token Prediction,以及基於 Muon 的訓練而構建。
重點在於效率,而非單純的參數數量。Qwen 報告稱,訓練該模型的成本約為 Qwen3.7-Plus 的九分之一,然而其發佈時的測試結果顯示,在許多程式碼、office-agent 與多模態任務上,該模型領先於以往的 Qwen 基準。這些均為供應商自行報告的結果,應視為發佈時的證據,而非獨立驗證。
對開發者而言,開源權重可透過 Qwen 通路取得,而託管的生產版本在 QwenCloud 上稱為 Qwen3.8-Flash。CometAPI 已列出 Qwen3.8-Flash-Next,模型 ID 為 qwen3.8-flash-next,讓開發者可與其他前沿模型一同透過統一路徑使用。
Key Takeaways
- 125B 主模型參數 + 51B N-gram Embedding,每個 token 啟用 6B 參數。
- 3 GDN : 1 QSA 的混合注意力模式,旨在結合高效記憶與精確的長距檢索。
- 262,144-token 的原生上下文,並可透過 YaRN 擴展至 1M。
- Qwen 報告在 1M 上下文下,QSA 可達到最高 7.6 倍的 prefill 以及 4.9 倍的 decode 核心加速。
- 殘差流被擴展為四條受控的分支,以改善跨層資訊流與訓練穩定性。
- 官方發佈表格在 SWE-bench Pro、CoWorkBench、JobBench、Toolathlon、AndroidWorld 與 RealWorldQA 中顯示強勁成績,但並非在所有基準上全面領先。
- Qwen 將此釋出定位為架構預覽,因此其重要性部分在於對 Qwen4 的設計訊號,而不僅是現階段的基準排名。
What Is Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next 是具備視覺編碼器與超稀疏 Mixture-of-Experts 語言骨幹的因果多模態語言模型。官方模型卡描述其為一個48 層架構,擁有 512 個專家、每個 token 路由 10 個專家外加 1 個共享專家,並以每三層 Gated DeltaNet 接一層 Qwen Sparse Attention 的隱藏層佈局反覆堆疊。
此發佈扮演與 Qwen3-Next 類似的角色:在擴展至下一代完整家族前,先公開架構變更。Qwen 明確將該模型稱為將支撐 Qwen4 的架構之實驗性預覽。這使其對關注推理服務效率、長上下文與開源模型架構方向的工程師而言,格外具有吸引力。
4 core components of Qwen3.8-Flash-Next
該模型同時改動四個核心組件:注意力、殘差流、嵌入容量與最佳化。這種共同設計至關重要,因為若某一組件的效率提升被另一組件在長上下文或大規模下的瓶頸所抵消,整體效益將受限。
Hybrid Attention: GDN + Qwen Sparse Attention
大多數層不進行全局注意力。相反,每四層中的三層使用 Gated DeltaNet 將歷史資訊壓縮至固定大小的狀態。第四層則使用全局注意力以進行精確檢索,但該全局注意力被重新設計為 Qwen Sparse Attention(QSA)。
QSA 避免對每個 token 逐一搜尋。輕量級索引器首先將序列分組為微區塊、估計重要區塊,然後僅對選擇區域進行注意力計算。依照 Qwen 的描述,這同時降低了注意力計算與為尋找相關上下文所需的索引開銷。該設計尤其適合混合網路,因為稀疏索引在每個注意力層內獨立構建,而非依賴相鄰注意力層之間的相似性。
效率數據相當可觀。在 1M-token 的上下文下,Qwen 報告QSA 注意力核心可達到最高 7.6 倍更快的 prefill 與 4.9 倍更快的 decode。在一個 90% 前綴快取命中率的高快取重用服務實驗中,完整模型在 1M 上下文下達到相較 Qwen3.7-Plus 的 8.6 倍 prefill 吞吐量。
Gated Residual: Four Paths Instead of One
傳統 Transformer 會反覆讀寫單一殘差流。Qwen3.8-Flash-Next 則使用Gated Residual 將該殘差流擴寬為四條平行分支。逐元素的讀門決定從每個分支取多少資訊,而分支級的寫門決定要寫回哪些內容。
這旨在在深層中保留有用特徵,而不必將所有特徵強行經由同一個持續混合的通道。Qwen 也報告稱,該門控可抑制活化值離群點,且殘差狀態可存於 FP8,降低記憶體流量。關鍵思想不僅是更大的殘差容量,而是跨層的受控資訊路由。
N-gram Embedding: More Capacity Without Proportional Compute
模型除了 125B 的主骨幹外,還加入了51B 的 N-gram Embedding 參數。不同於僅以單一 token 索引的普通嵌入,N-gram Embedding 使用如雙詞與三詞等區域 token 模式。這為模型提供了對常見區域模式的大型查表式記憶。
特別之處在於容量所在的位置。由於在嵌入被使用前就可知道查詢位址,該表可保存在主機記憶體中,並在 GPU 運算進行時非同步預取。這意味著額外的 51B 參數並不會像 51B 的稠密矩陣乘法參數般運作。該架構實際上在擴展兩種不同的資源:計算密集的模型參數,以及計算負載較低的查表記憶體。
Muon and Training Optimization
Qwen 使用Muon optimizer(針對二維線性映射)來訓練該架構中的主要權重,如注意力、GDN 與 MoE 專家;而 embeddings、路由器與低秩的 Gated Residual 參數則繼續使用 AdamW。像 QKV 與 SwiGLU 此類融合矩陣,在正交化之前會拆分為各自獨立的線性變換。
團隊也為新架構重新擬合了縮放律,並報告傳統的 Batch Size Warmup 並非必要。逐步增加批次大小並未改善最終結果,反而需要多 18.8% 的 optimizer 步數。因此最終配方會直接以目標批量大小開始。
Ultra-Sparse MoE and Multi-Token Prediction
官方模型卡列出512 位專家,其中每個 token 啟用 10 位路由專家與 1 位共享專家。大型專家池提升了儲存容量,而不需在每個 token 上啟用整個模型。單層的 Multi-Token Prediction(MTP)模組以多步驟訓練,以提升推測解碼的接受率,同時支援主骨幹。
Qwen3.8-Flash-Next Benchmark Performance
Qwen 發佈了涵蓋語言、程式碼、agent 與視覺語言的廣泛評測。這些數據具有參考價值,因為許多對照模型是在 Qwen 的測試環境中重跑,但仍屬於供應商自行報告的發佈評測,而非獨立基準重現。部分項目也使用了特定基準的測試環境或評審,因此最保險的解讀是方向性的:它們顯示 Qwen3.8-Flash-Next 的強項,以及競品仍具優勢之處。
Coding and Agent Performance
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
在程式碼領域的表現強勁但也有細節。Qwen3.8-Flash-Next 在 SWE-bench Pro、SWE-bench Multilingual、CoWorkBench、JobBench、Toolathlon Verified 與 LiveCodeBench v6 上領先於所列對照組。然而,DeepSeek V4 Flash 在 NL2Repo-Bench 上領先,而 Claude Opus 4.6 在 HLE 上居前。這使得「效率」比「全面基準稱霸」更具說服力,成為更可防守的主軸。
相較此前的 Qwen 基線,最顯著的提升出現在長期任務上。CoWorkBench 從 Qwen3.7-Plus 的 65.1 上升至 73.9,JobBench 從 27.6 升至 55.7。由於 CoWorkBench 為 Qwen 自建基準,這些提升值得獨立重現,但其與該架構強調具成本效益的 agent 與辦公流程相契合。
Multimodal Performance
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | -- |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0 (Binary / Partial) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | -- |
| Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision (without / with CI) | 90.6 / 95.7 | 90.0 / 94.6 | 90.3 / 88.7 | 65.5 / -- |
| CharXiv RQ (without / with CI) | 84.6 / 90.6 | 83.7 / 90.2 | 85.8 / 85.9 | 66.0 / -- |
Data source: Qwen official launch evaluation**.
多模態結果支持這並非僅針對程式的 Flash 模型。Qwen3.8-Flash-Next 在 Qwen 的表格中,AndroidWorld 得分 84.5、Vision2Web 64.0、LVBench 76.6、RealWorldQA 88.5。模型卡也提供了影像與影片輸入範例,包括針對小時級影片工作負載的高幀率採樣建議。video workloads.
Qwen3.8-Flash-Next vs Other Models
有用的比較應區分三個問題:每個 token 啟用多少計算量、模型的模態與上下文廣度、以及在代表性工作流程中的表現。單看總參數數量並不能回答這些問題。
Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus
| Dimension | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|---|
| Model parameters | 125B + 51B N-gram embedding | 27B | 397B |
| Activated parameters | 6B | 27B | 17B |
| Native context | 262K | 262K in Qwen comparison setup | Prior-generation long-context model |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 |
| CoWorkBench | 73.9 | 70.7 | 65.1 |
| JobBench | 55.7 | 33.4 | 27.6 |
| AndroidWorld | 84.5 | 81.9 | 81.0 |
關鍵結果是每個啟用參數所對應的能力。Qwen3.8-Flash-Next 每個 token 僅啟用 6B 參數,而 Qwen3.8-27B 為 27B、Qwen3.7-Plus 為 17B,但它在上述 DeepSWE、CoWorkBench、JobBench 與 AndroidWorld 指標上領先。權衡在於記憶體佔用:稀疏性降低了活躍運算,並未減少最終必須儲存的模型容量。
Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6
| Dimension | Qwen3.8-Flash-Next | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| Weights | Open-weight | Open-weight | Closed |
| Reported parameter profile | 125B main + 51B N-gram; 6B active | 284B total; 13B active | Not publicly disclosed |
| Primary efficiency story | QSA + GDN + 6B active MoE + lookup memory | High-throughput sparse MoE | Managed frontier reasoning and agent stack |
| Native multimodality | Text, image, video -> text | Text-oriented Flash family; vision route available separately on CometAPI | Text + vision/files through hosted APIs |
| SWE-bench Pro* | 62.5 | 56.0 | 53.4 |
| CoWorkBench* | 73.9 | 45.1 | 68.2 |
| NL2Repo-Bench* | 48.1 | 54.2 | 47.6 |
| HLE* | 35.9 | 33.8 | 40.0 |
DeepSeek V4 Flash 在 Qwen 的比較中仍於 NL2Repo-Bench 更強,這對倉庫層級的程式碼生成具有意義。Claude Opus 4.6 在同表中的 HLE 表現更佳,且作為封閉的託管模型,並非開源部署目標。Qwen3.8-Flash-Next 的差異化體現在開源權重、原生多模態、長上下文工程,以及極低的活躍參數預算之組合。
Qwen3.8-Flash-Next vs Qwen3.8-Max
| Dimension | Qwen3.8-Flash-Next | Qwen3.8-Max |
|---|---|---|
| Role | 以效率為先的開放架構預覽 | Qwen3.8 旗艦 |
| Main/total scale | 125B main + 51B N-gram; 6B active | 2.4T total; about 95B active on CometAPI model page |
| Architecture emphasis | QSA, GDN, Gated Residual, N-gram Embedding, Muon | 最大化前沿能力,規模更龐大 |
| Best fit | 高併發 agent、程式助理、多模態自動化、自主部署 | 最困難的推理、大型企業級 agent、以能力為先的工作負載 |
| Context | 262K 原生;透過 YaRN 可達 1M | 目前 Qwen3.8 旗艦路由提供 1M 等級的託管上下文 |
Qwen3.8-Max 的規格基於當前 CometAPI 模型列表。
區別很簡單:Qwen3.8-Max 是以能力為先的旗艦,而 Qwen3.8-Flash-Next 是著重架構與效率的實驗。開發者在二者之間做選擇時,應自問瓶頸在於絕對能力,還是以低成本執行大量長上下文、工具驅動任務的需求。
Qwen3.8-Flash-Next Pricing and Availability
Qwen3.8-Flash-Next 的開源權重已透過 Hugging Face 與 ModelScope 發佈。對於託管服務,Qwen 表示生產版本在 QwenCloud 上稱為 Qwen3.8-Flash,預設啟用 1M 上下文並內建官方工具。
Qwen 列出的託管生產價格為每百萬輸入 token $0.16、每百萬輸出 token $0.47。該價格指的是 QwenCloud 的生產模型 Qwen3.8-Flash,而非自託管開源權重。
| Route | Input | Output |
|---|---|---|
| QwenCloud production model (Qwen3.8-Flash) | $0.16 / 1M tokens | $0.47 / 1M tokens |
| Open-weight self-hosting | Infrastructure-dependent | Infrastructure-dependent |
| CometAPI route | Check live model page | Check live model page |
QwenCloud 價格來自 Qwen 官方發佈文章;CometAPI 的計費應以線上模型頁為準。
對於 CometAPI 用戶,專屬的 Qwen3.8-Flash-Next 模型 以 qwen3.8-flash-next 作為路由識別。由於路由、上游可用性與計費可能獨立於開源權重釋出而變動,生產整合在硬編碼價格假設前應查閱 CometAPI 的即時目錄。
CometAPI Recommendation
Qwen3.8-Flash-Next 預計很快將透過 CometAPI 提供。CometAPI 提供單一與 OpenAI 相容的端點(https://api.cometapi.com/v1),聚合了來自領先供應商的 500+ 模型,包括 Qwen 系列。這種方式可減少廠商綁定,便於在 Qwen3.8-Flash 上進行實驗(當該路由在平台或相關 Qwen 端點可用時),並簡化在生產中混合使用不同模型的部署(例如:以 Qwen 驅動具成本效益的程式 agent,加上另一模型處理專門推理)。文件與快速上手指南可在 apidoc.cometapi.com 與 CometAPI 主站取得。
無論是自託管開源權重、使用 QwenCloud,或透過 CometAPI 這類統一路徑,Qwen3.8-Flash-Next 都降低了打造高效能、長上下文多模態 agent 的門檻。
What Can Qwen3.8-Flash-Next Do?
1. 高併發的程式代理
結合 6B 的活躍參數預算與 Qwen 評測中的 62.5 SWE-bench Pro 分數,使得Qwen3.8-Flash-Next 對需要並行大量會話的程式系統特別有吸引力。例子包括程式碼審查、議題分流、倉庫導覽、測試生成,以及在吞吐量與單次智慧表現同等重要的反覆修補。
2. 長週期的辦公與知識工作
CoWorkBench 與 JobBench 是該模型定位的核心。該架構為反覆讀取上下文、呼叫工具、更新狀態並持續工作的 agent 迴圈而設計,而非一次性回答。這自然對應到文件流程、試算表分析、報告組裝、研究綜整與商務流程自動化。
3. 多模態的電腦與行動代理
影像與影片輸入、AndroidWorld 表現、OSWorld 評測,以及 Vision2Web 結果,讓該模型對 GUI agent 具相關性。它可作為系統的推理層,解讀截圖、操作行動介面、重現應用版面,或將視覺狀態與工具呼叫結合。
4. 長影片與視覺推理
官方模型卡包含明確的影片輸入範例,並提供小時級影片前處理指南。這讓模型適用於影片問答、長影片搜尋、視覺事件抽取,以及結合影片理解與下游工具的工作流程。
5. 百萬 token 的研究與倉庫工作流程
該開源模型原生支援 262,144 個 token,並可透過 YaRN 擴展至 1,000,000。這一點很關鍵:1M 是擴展能力,而非開源模型的原生上下文。對大型倉庫或研究語料而言,QSA 旨在使長上下文的檢索成本比稠密全局注意力更可行。
How Can Developers Run Qwen3.8-Flash-Next?
開發者可從 Hugging Face 下載開源權重,並透過 Transformers、vLLM、SGLang 或 TokenSpeed 運行。Qwen 為文字與多模態輸入提供與 OpenAI 相容的 Chat Completions 範例。
例如,官方模型卡展示了使用 vLLM 服務 Qwen/Qwen3.8-Flash-Next,並透過 /v1/chat/completions 呼叫。同時也示範了透過與 OpenAI 相容的介面進行影像與影片輸入。
Qwen3.8-Flash-Next 預設啟用 thinking 模式。開發者可透過 enable_thinking、preserve_thinking 與 reasoning_effort 控制 thinking 行為;文件中列出的 reasoning-effort 等級為 xhigh、medium 與 low。
What Are the Limitations of Qwen3.8-Flash-Next?
最大的實務限制是硬體成本。儘管僅啟用 6B 的語言模型參數,checkpoint 仍包含 125B 的語言參數外加 51B 的 n-gram embedding 元件與 4B 的 MTP 參數。當前倉庫約為 360 GB,因此本地部署仍是高度依賴基礎設施的任務。
第二個限制是 262K 為原生上下文長度,而非 1M。該模型可擴展至 1M token,但 CometAPI 或模型頁面不應僅列示「1M 原生上下文」。正確說法為 262K 原生上下文,可擴展至 1M。
最後,基準表現並不均衡。Qwen3.8-Flash-Next 在程式與 agent 任務上非常有競爭力,但並非在每個基準上領先。例如,Claude Opus 4.6 在 HLE 上得分 40.0,相較於 Flash-Next 的 35.9;而 DeepSeek-V4-Flash-0731 在所列模型中於 NL2Repo-Bench 領先。
Qwen3.8-Flash-Next : What It Signals for Qwen4
此發佈更廣泛的意義在於,它作為預計支撐 Qwen4 架構的早期預覽。Qwen3.8-Flash-Next 結合了 Qwen Sparse Attention、Gated DeltaNet、四分支的 Gated Residual 連接、N-gram Embedding、超稀疏 MoE 專家池與 Multi-Token Prediction。這些選擇顯示 Qwen 正在探索更高容量、更長上下文、以及更強的多模態與 agent 表現,同時不以相同比例增加每個 token 的活躍運算。
Final Verdict
Qwen3.8-Flash-Next 的重要性在於它改變了效率問題的形態。它不再將所有參數視為等同,而是將相對小的活躍 MoE 路徑與非常大的查表式記憶、以及針對長上下文設計的稀疏檢索機制結合。這讓 Qwen 可以獨立地拉動多個槓桿,在不同比例增加每 token 矩陣計算量的情況下提升容量。
對開發者而言,該模型是高併發程式助理、長上下文 agent、多模態自動化與自託管試驗的有力選項。對更廣泛的 Qwen 路線圖來說,它更具意義:Qwen 明確以此釋出來揭示其打算朝向 Qwen4 精煉的架構方向。
