Qwen3.8-Flash-Next 技術規格
| 規格 | Qwen3.8-Flash-Next |
|---|---|
| 開發者 | Qwen Team, Alibaba Group |
| 模型類型 | 具備視覺編碼器的多模態因果語言模型;超稀疏 MoE |
| 主模型參數 | 125B |
| 激活參數 | 每個 token 6B |
| N-gram 嵌入參數 | 額外 51B |
| MTP 參數 | 4B |
| 層數 | 48 |
| 混合注意力模式 | 12 x [3 個門控 DeltaNet 層 + 1 個 Qwen 稀疏注意力層] |
| MoE 專家 | 總計 512;每個 token 路由 10 個 + 1 個共享 |
| 門控殘差 | 4 個分支;瓶頸秩 320 |
| 原生上下文視窗 | 262,144 個 token |
| 擴展上下文 | 使用 YaRN 可達 1,000,000 個 token |
| 模態 | 文字、影像、影片輸入;文字輸出 |
| 思考控制 | 在支援的 API 中提供思考/非思考與推理投入控制 |
| 部署 | Transformers、vLLM、SGLang、TokenSpeed 及其他支援的框架 |
| 開放權重 | 是 |
| CometAPI 模型 ID | qwen3.8-flash-next |
什麼是 Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next 是來自阿里巴巴 Qwen 團隊的即將推出的開放權重多模態 MoE 模型。更重要的是,它被定位為「預覽將為未來 Qwen4 模型系列提供動力的架構的早期版本」,而不僅僅是另一個 Qwen3.8 的漸進式檢查點。
Qwen 正利用此次發佈,將其新一代架構方向在 Qwen4 更廣泛系列到來之前,提前向開源生態系曝光。這讓推理引擎開發者、量化專案、模型服務框架以及應用程式開發者,有機會提前為即將到來的架構變更做好準備。
目前披露的架構引入了兩個重要組件:基於 GDN 的混合架構與 Qwen 稀疏注意力(QSA)。GDN 指的是一種門控的、DeltaNet 風格的線性注意力方法,延續了先前在 Qwen3-Next 中探索的混合注意力方向。QSA 則被提出為一種新的稀疏注意力機制,儘管其完整技術規格尚未公開文件化。
Qwen3.8-Flash-Next 的主要特性
- Qwen4 架構預覽:Qwen3.8-Flash-Next 明確被定位為將驅動即將到來的 Qwen4 家族之架構方向的早期實作。
- 多模態 MoE 設計:該模型被描述為多模態的專家混合模型,將 Qwen 的高效稀疏模型策略拓展至新一代架構。
- GDN 混合架構:延續 Qwen3-Next 引入的混合注意力研究方向,將高效的線性注意力機制與在精確檢索場景下的重要傳統注意力相結合。Qwen3-Next 已展示此方法能顯著提升長上下文推理效率。
- Qwen 稀疏注意力:QSA 是目前公開強調的兩個架構變更之一;其細節實作與量化效益仍待 Qwen 後續說明。
- 面向開放權重生態:此次發佈旨在讓開源社群提前接觸架構變更,以便在 Qwen4 到來之前,推理執行時環境與下游工具能完成適配。
- Qwen3.8-Flash-Next 的程式設計與 Agent 表現
| 基準測試 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next 對比 Qwen3.8-Max 與 Qwen3.8-27B
| 模型 | 定位 | 架構/規模 | 多模態 | 目前狀態 |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Qwen4 架構預覽/面向效率的開放模型 | 多模態 MoE;完整規格待定 | 是 | 即將推出 |
| Qwen3.8-Max | 旗艦託管版 Qwen3.8 模型 | 大規模 MoE | 是 | 可用 |
| Qwen3.8-27B | 開放權重 Qwen3.8 模型 | 27B 稠密模型 | 模型特定能力 | 可用 |
Qwen3.8-Max 已可透過阿里巴巴雲生態系使用,被定位於進階推理、視覺理解、程式設計與代理型工作負載。Qwen 目前的文件列出 Qwen3.8-Max 具備 1M-token 上下文視窗,而 CometAPI 已經提供 qwen3.8-max。
因此,Flash-Next 應以不同角度看待:在此階段,其主要意義在於架構而非基準測試。它預覽了 Qwen4 的技術方向,並讓開源生態系更早鎖定目標,以便在執行時與部署上進行最佳化。