先回答: Qwen4 不再僅僅是一個臆測的名字。Qwen 現在將 Qwen3.8-Flash-Next 描述為多模態 MoE 模型,以及將成為 Qwen4 基礎的架構之實驗性預覽。這確認了以效率為優先的架構方向,但尚不構成 Qwen4 的產品發布。最終的模型陣容、參數規模、基準測試成績表、API 識別符、授權條款、定價與發布時程仍未披露。
什麼是 Qwen4?
Qwen4 是 Qwen 團隊現已承認的下一代主要架構,雖然目前尚未發布獨立的 Qwen4 模型或產品家族。官方的 Qwen3.8-Flash-Next 資料稱其為 Qwen4 的架構實驗預覽,未披露最終的參數數量、產品陣容、基準測試成績、定價、API 識別符、授權或發布日期。任何無法追溯至 Qwen 或阿里雲的精確數值仍應視為未經證實。
討論 Qwen4 最有用的方式依然是將證據分為三層。已確認資訊包括當前 Qwen 模型、已發布的文件與 Qwen3.8-Flash-Next 的架構預覽。預期方向是基於上述訊號的推論。未知項則是無法負責任地用估計填補的最終產品細節。此區分之所以重要,是因為該預覽確認了架構意圖,但未界定生產版 Qwen4 家族。
| 證據層級 | 使用方式 | 本文中的例子 |
|---|---|---|
| 已確認 | 作為事實陳述,並提供直接的官方連結 | Qwen3.8-Flash-Next 架構預覽;Qwen3.8-Max 的規模與基準測試基線 |
| 預期 | 使用審慎語言並解釋推論 | 預覽架構如何擴展為最終的 Qwen4 模型 |
| 未知 | 不要杜撰數值或發布承諾 | 最終模型陣容、參數、成績表、價格、授權與 API ID |
為何 Qwen4 是合乎邏輯的下一步
Qwen3 這一代建立了混合推理方法。其官方介紹描述了「思考與非思考模式」,讓開發者在回應速度與更深層的審慎推理之間取捨。同一代也擴展了多語支持並強化工具使用,包括面向 MCP 的代理工作流。
Qwen 的路線圖隨後指向「擴展數據、延伸上下文、拓寬模態、以及帶環境回饋的強化學習」。這份路線圖比基於傳聞的發布預測更重要:它將下一代定位為從僅訓練模型轉向訓練能與環境互動並完成長時程工作的代理。
Qwen3.8 系列現在提供了兩個不同的基線。Qwen3.8-Max 仍是當前旗艦能力的基線,採用託管的2.4 兆參數 MoE 系統,面向編碼、辦公、視覺理解、長文檔、長影片與自主規劃。Qwen3.8-Flash-Next 則扮演不同角色:Qwen 明確將其定位為 Qwen4 的架構預覽。未來的 Qwen4 必須結合旗艦的廣度與預覽的效率導向設計。
Qwen3.8-Flash-Next 對 Qwen4 的揭示
Qwen3.8-Flash-Next 是關於 Qwen4 基礎的首個具體公開證據。Qwen 稱其為新架構下的首個開放權重發布,並表示該設計將成為 Qwen4 的基礎。因此,該預覽比路線圖推論更有力,卻仍未確定生產模型的規模與配置。
該模型是一個帶有視覺編碼器的多模態自回歸語言模型。其語言模型包含125B 參數,其中每個標記啟用 6B,另有 51B 的 n-gram 嵌入與 4B 的 MTP 參數。它擁有 48 層,512 個專家,對每個標記路由 10 個專家並有 1 個共享專家同時啟用,原生 262,144 標記上下文,並支持擴展至 1,000,000 標記。
| 架構訊號 | 在 Qwen3.8-Flash-Next 中已確認 | 對 Qwen4 的暗示 |
|---|---|---|
| 超稀疏 MoE | 主模型 125B;每標記啟用 6B;512 個專家 | 每單位有效計算的能力可能成為核心目標 |
| 混合注意力 | 每層以三個 Gated DeltaNet 對應一個 Qwen Sparse Attention | 長上下文延遲與 KV 快取效率可能比單純的視窗大小更重要 |
| 閘控殘差 | 四個加寬殘差分支,帶數據依賴的閘控 | Qwen 在測試更具表達力的深度擴展,同時控制開銷 |
| n-gram 嵌入 | 51B 的二元與三元組嵌入參數 | 可被記憶體卸載的容量可能補充較重計算的 MoE 擴展 |
| 原生多模態 | 帶視覺編碼器的自回歸語言模型 | 文本與視覺可能是架構基礎,而非外掛式變體 |
| 長上下文 | 原生 262K;可擴展至 1M | Qwen4 可能強調高效的長時程代理 |
該預覽由廠商報告的基準測試結果也展示了為何架構重要。儘管每個標記僅啟用 6B 參數,它在下列所選的編碼、辦公、工具使用與多模態代理評測上,超越了稠密的 Qwen3.8-27B 基線。這些結果不是 Qwen4 的分數;它們證明新架構旨在提高每個啟用參數的能力。
| 基準測試 | Qwen3.8-Flash-Next | Qwen3.8-27B |
|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 |
| SWE-bench Pro | 62.5 | 61.7 |
| CoWorkBench | 73.9 | 70.7 |
| Toolathlon Verified | 73.5 | 67.1 |
| ClawEval-MM (Pass@3) | 64.4 | 57.4 |
| AndroidWorld | 84.5 | 81.9 |
解讀:Flash-Next 將三項 Qwen4 的預期變成更強的訊號:超稀疏啟用、混合長上下文注意力與原生多模態。它並未揭示 Qwen4 的最終參數數量、精確的上下文配置、產品層級或發布時程。
預期的 Qwen4 規格
由於尚無最終的 Qwen4 規格,下表以 Qwen3.8-Max 作為已確認的生產基線,並以 Qwen3.8-Flash-Next 作為已確認的架構訊號。該預覽提升了對若干方向的信心,但在 Qwen 發布模型之前,每個 Qwen4 的最終欄位仍屬預期或未知。
| 規格 | Qwen3.8-Max 已確認基線 | Qwen4 預期 | 信心 |
|---|---|---|---|
| 狀態 | 已發布 | 架構預覽已確認;模型未發布 | 已確認 |
| 架構 | 基於稀疏 MoE 的混合注意力基礎 | 預期基於 Flash-Next 的 GDN + QSA、閘控殘差與 n-gram 嵌入 | 高 |
| 總參數 | 2.4T | 未知;可能不需要超過 2.4T | 低 |
| 啟用參數 | 開放權重模型每步約 95B | 可能採用超稀疏路由;精確有效計算未知 | 中高 |
| 上下文視窗 | 1,000,000 標記 | 優化長上下文;最終原生與預設上限未知 | 高 |
| 最大輸出 | 131,072 標記 | 可能維持或擴展 | 中 |
| 託管輸入 | 文本、圖像與影片 | 多模態方向已確認;精確的音訊支持未知 | 高 |
| 輸出模態 | 文本 | 可能為文本;原生媒體輸出未確認 | 中 |
| 推理 | 思考與更快推理的工作流 | 可能保留思考控制;最終 API 行為未知 | 中高 |
| 工具支持 | 函數調用與結構化輸出 | 預期更強的工具選擇、狀態保留與恢復 | 高 |
| 權重與授權 | 存在開放權重的旗艦檢查點 | 預覽為開放權重;最終 Qwen4 的授權與檢查點未知 | 中 |
| API 模型 ID | qwen3.8-max | 不可用 | 已確認 |
解讀:Flash-Next 提升了對超稀疏 MoE 路由、混合長上下文注意力、閘控殘差、n-gram 嵌入與原生多模態的信心。它並不證明最終的 Qwen4 模型將使用 125B 參數、每標記啟用 6B,或採用相同的上下文限制。
Qwen4 預期建立於何種架構?
超稀疏 MoE 已成為最強訊號
架構問題現在不再那麼臆測。Qwen3.8-Flash-Next 的模型卡記錄了主體 125B 參數、每標記僅啟用 6B,另有 51B 的 n-gram 嵌入。這種超稀疏設計表明,Qwen4 可能優先考量每單位有效計算的總任務能力,而不是讓啟用參數數量與存儲容量等比擴張。
重要問題不是 Qwen4 是否包含更多專家,而是路由、記憶體訪問與專家專精在長任務中是否保持穩定。Flash-Next 的 n-gram 嵌入也表明,Qwen 正在探索比傳統 MoE 擴展更省計算且更易卸載的容量。
混合注意力瞄準長上下文效率
Flash-Next 將先前的 Gated DeltaNet 與全注意力配對,改為 Gated DeltaNet 與在微塊層級運行的 Qwen Sparse Attention。其 48 層以三個 Gated DeltaNet 塊後接一個稀疏注意力塊的方式重複。這是最明確的信號,表明 Qwen4 可能旨在降低長上下文延遲與 KV 快取壓力,而非依賴更大的稠密注意力視窗。
長上下文應成為代理記憶,而非僅更大的提示
百萬標記視窗只有在模型能檢索正確證據、保持目標並避免累積矛盾狀態時才有用。因此,Qwen4 應在工具調用、檔案變更、中間結果與錯誤恢復的過程中,評估其如何運用長上下文。原始上下文長度不如檢索準確率與長軌跡任務完成度來得資訊量更大。
推理控制可能變得更細粒度
Qwen3 的混合思考設計已允許快速與審慎行為。Flash-Next 透過支持 enable_thinking、preserve_thinking 與 reasoning_effort 控制項強化了這一訊號。具有意義的 Qwen4 升級可能會動態分配推理,並僅保留有助於多步一致性的狀態,從而降低整體工作流成本,而非單純產生更長的可見推理。
多模態可能更貼近電腦操作
多模態已成為更強的預期,因為託管的 Qwen3.8-Max 服務與開放權重的 Flash-Next 預覽都支持視覺輸入。Qwen4 可能將此感知與更可靠的行動結合:理解螢幕截圖、選擇 UI 控制、檢查結果並修正計畫。原生音訊、圖像生成、語音輸出與影片生成仍未確認。
預期的 Qwen4 功能
- 更可靠的長時程代理。更低的工具調用失敗率、更強的目標保持、更佳的恢復能力,以及在數百步行動後更一致的交付成果。
- 面向儲存庫規模的軟體工程。跨大型代碼庫、測試、終端機、問題追蹤與部署環境的更佳規劃。
- 端到端的知識工作。從研究與文件分析到試算表、簡報、報告與可決策輸出的更強路徑。
- 多模態工具使用。以視覺理解輔助 UI 互動、文檔操作與基於環境的推理。
- 自適應推理預算。當不確定性或任務複雜度提升時,從快速回應自動升級至更深入的推理。
- 更高的每單位有效參數能力。更好的專家路由、n-gram 容量、稀疏注意力、快取與後訓練,而非為擴展而擴展。
- 更廣的模型家族。可能的 Max、Plus、Coder、小型 MoE、VL 或 Omni 變體,但上述名稱均未確認。
Qwen4 基準測試展望:Qwen3.8-Max 基線顯示了什麼
目前沒有 Qwen4 的基準測試分數。Flash-Next 與 Max 回答的是不同問題:Flash-Next 的成績表測試新架構的效率導向能力,而官方 Qwen3.8-Max 成績表仍然是在編碼代理、研究復現、專業協作、視覺推理、行動使用與電腦操作上的更強生產能力基線。Qwen4 需要在匹配的評測下結合兩個方向。
| 基準測試 | Qwen3.8-Max 報告分數 | Qwen4 需要證明的事項 |
|---|---|---|
| SWE-Pro | 67.7 | 縮小在專業儲存庫級問題解決上的差距 |
| TerminalBench 2.1 | 86.6 | 在相同測試框架下提升終端代理的可靠性 |
| PaperBench | 93.0 | 以獨立復現維持研究實力 |
| FrontierSWE | 73.5 | 將長時程推理轉化為更多完成的工程工作 |
| CoWorkBench | 74.8 | 產出更可靠的專業交付物 |
| OSWorld-Verified | 86.1 | 在電腦使用工作流中降低視覺-行動錯誤 |
這兩個基線指向雙重要求。Flash-Next 顯示低有效計算仍可提供強勁的代理與多模態結果;Max 則展示新旗艦必須超越的更高能力上限。因此,Qwen4 應同時以匹配任務成功率與整體工作流成本來評估,並將廠商報告的分數與獨立復現分開看待。
官方 Qwen3.8-Max 基準測試結果。來源:Qwen3.8-Max 官方發布。
Qwen4 對比當前前沿模型:已確認基線與未知項
最有用的比較不只是 Qwen4 對比 Qwen3.8-Max,而是 Qwen4 對比 Kimi K3、DeepSeek V4 Pro 與 GLM-5.3 已可見的設計選擇。下表比較了當前模型的已確認屬性與仍未知的 Qwen4 一欄。
| 維度 | Qwen4 | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Pro | GLM-5.3 |
|---|---|---|---|---|---|
| 狀態 | 架構預覽已確認;模型未發布 | 已發布 | 已發布 | 已發布 | 已發布 |
| 規模 | 未知 | 2.4T / 約 95B 啟用 | 2.8T / 896 中啟用 16 | 1.6T / 49B 啟用 | 本次發布未披露 |
| 上下文 | 預期 1M+ | 1M | 1M | 1M | 1M |
| 輸入 | 多模態方向已確認;最終介面未知 | 文本、圖像、影片 | 文本與原生視覺 | 偏文本導向 | 僅文本 |
| 推理 | 未知 | 思考與快速工作流 | 低/高/最大努力 | 思考/非思考 | 始終開啟;低/高/最大 |
| 開放生態 | 最終權重與授權未確認 | 存在開放權重旗艦 | 開源定位 | 開放權重 | 開源定位 |
| 核心重點 | 預期為高效的多模態代理 | 編碼、協作、視覺代理 | 編碼與知識工作 | 高效推理與編碼代理 | 編碼與網路安全 |
模型規模與推理效率
Kimi 的文件描述了「2.8T 參數與 896 中啟用 16 個專家」。DeepSeek V4 Pro 採取不同路線,為「總計 1.6T、啟用 49B 參數」。Qwen4 不需要成為最大的模型才能在比較中獲勝;它需要將有效計算轉化為更多可完成的工作。
上下文與多模態
百萬標記已成為常見旗艦基線,因此僅憑上下文長度無法區分 Qwen4。Qwen 的更大機會在於多模態上下文使用:在文件、代碼、螢幕截圖與影片中找到正確證據,然後採取正確行動。Kimi K3 也具有原生視覺理解,而 GLM-5.3 的當前介面「僅文本,具 1M 上下文與 128K 最大輸出」。
編碼、代理與專長
Qwen3.8-Max 帶來廣泛的編碼、研究、協作與視覺代理能力。Qwen3.8-Flash-Next 則新增以效率為導向的多模態架構,提升每個有效參數的能力。Kimi K3 強調長時程編碼與知識工作,DeepSeek V4 Pro 強調高效推理與代理編碼,而 GLM-5.3 則具獨特的網路安全重點。一個可信的 Qwen4 發布需結合廣泛的代理可靠性,並在軟體工程與視覺電腦操作上達到專家水準。
開放權重不是全部部署故事
開放權重能提升控制、客製與供應商選擇,但實際比較也包括授權條款、硬體需求、量化品質、微調支持與優化服務堆棧的可用性。「開放」一詞不應成為忽略各發布具體授權與部署條件的藉口。
比較結論:Qwen4 的最強潛在定位,是一個廣泛的多模態代理,結合 Qwen3.8-Max 的視覺與協作強項,以及 Flash-Next 的低有效計算架構與更好的軟體工程可靠性。在有匹配的評測與生產行為可參照之前,無法宣稱其勝出。
Qwen4 的潛在用例
自主軟體工程
更強的 Qwen 代理可以檢查儲存庫、復現問題、編輯多個檔案、執行測試、審查失敗,並準備可提交 PR 的變更。重要指標是無需人工介入即可完成任務的比例,而非生成代碼的數量。
企業知識工作
長上下文與多模態理解可支持從合同、PDF、試算表、圖表與會議紀錄開始,最終產出決策備忘錄、分析或結構化行動方案的工作流。企業仍需要在模型周邊維持檢索控制、審計日誌與來源驗證。
多模態電腦操作代理
Qwen4 可用於代理需解讀螢幕截圖、導航應用、驗證 UI 狀態,並在點擊或提交表單產生意外結果時恢復的場景。這是 Qwen3.8-Max 強勢的視覺與 OSWorld 類基線的自然延伸,但原生的電腦控制支持尚未宣布。
科學與工程研究
研究工作流結合文獻回顧、代碼、模擬、數據分析與報告撰寫。未來的 Qwen 模型可協調這些步驟並保持更長的實驗歷史。PaperBench 表現使之成為可信方向,但可重現性與獨立驗證仍至關重要。
我們尚未知道的事項
儘管 Qwen 已通過 Flash-Next 承認架構,但以下生產細節仍未公開,且在官方 Qwen4 公告前應保持明確的未知狀態:
- 精確的產品名稱,以及 Qwen4 是以單一模型還是家族形式發布。
- 發布日期或預覽時程。
- 最終模型是否保留 Flash-Next 的 GDN/QSA 比例、閘控殘差設計、n-gram 嵌入規模與專家路由。
- 每個 Qwen4 模型的總參數、啟用參數、專家數與訓練數據規模。
- 每條產品線的原生上下文長度、預設上下文、最大輸出與支持的模態。
- 原生音訊、圖像生成、語音或影片生成能力。
- 官方基準測試結果與每項分數所用的評測框架。
- 開放權重的可用性、授權條款與商業使用條件。
- API 定價、區域可用性、速率限制與最終模型 ID。
驗證規則:除非可直接追溯至 Qwen、阿里雲或官方模型倉庫,否則將任何精確的 Qwen4 規格、基準圖表、定價表或 API 識別符視為未經證實。
Qwen4 何時發布?
目前沒有可辯護的公開發布日期。Qwen3.8-Flash-Next 確認 Qwen 正在測試將成為 Qwen4 基礎的架構,但公開材料未提供生產版 Qwen4 的時程。訓練完成、服務效率、安全評估、權重授權與產品整合,都可能影響發布的時間與形態。
最安全的發布溝通做法是避免月份或季度的預測。讀者應關注 Qwen 官方網站、阿里雲 Model Studio 文件、經驗證的模型倉庫與 CometAPI 模型目錄。只有在模型實際上架後,才應新增 Qwen4 的模型頁面。
開發者如何為 Qwen4 做好準備
- 建立兩個基線。使用 Qwen3.8-Flash-Next 衡量架構效率,並以 Qwen3.8-Max 衡量當前旗艦能力。
- 將模型 ID 與業務邏輯分離。將路由與配置置於應用代碼之外,以便安全切換模型。
- 構建任務層級評估。衡量完成的軟體修復、正確的研究輸出、成功的工具鏈與可用交付物。
- 記錄整體工作流成本。追蹤延遲、輸入與輸出標記、快取使用、重試、失敗動作與人工返工。
- 保留後備路徑。使用模型路由與供應商後備,而非讓一個未發布模型成為單點故障。
- 不要杜撰模型 ID。在官方識別符發布前,避免將 qwen4 或 qwen4-max 加入生產配置。
透過 CometAPI 體驗 Qwen3.8-Flash-Next 與 Qwen3.8-Max
開發者現在可以透過 Qwen3.8-Flash-Next 在 CometAPI 上進行測試,並保留 Qwen3.8-Max 作為旗艦比較。建立一個 API 金鑰,將其存放於環境變數,並透過相容於 OpenAI 的客戶端調用現有模型。該範例刻意使用 qwen3.8-flash-next;並未假設未來的 Qwen4 識別符。
結論
Qwen4 現已不只是傳聞:Qwen 明確指出 Qwen3.8-Flash-Next 是將成為其基礎的架構實驗預覽。該預覽確認了圍繞 Gated DeltaNet、Qwen Sparse Attention、閘控殘差與 n-gram 嵌入的多模態、超稀疏 MoE 方向。Qwen3.8-Max 仍是目前更強的能力基線。
Qwen4 的真正考驗不在於參數數量是否更大,而在於最終模型能否結合 Flash-Next 的效率與 Max 級能力,以更少失敗完成更長的工作,並更可靠地使用多模態證據。架構方向已公開,但最終的規格、基準測試、授權、價格、API ID 與發布日期仍未知。
