TLDR 阿里巴巴 Qwen 團隊於 2026 年 8 月 3 日正式發佈 Qwen3.8-Max —— 一款稀疏 Mixture-of-Experts(MoE)模型,具備 2.4 兆總參數(啟用 950 億)、100 萬 token 上下文視窗,並原生支援多模態(文本 + 圖像 + 視頻)。
這是首個計劃開放權重的 Max 級 Qwen 模型(預計於下一週)。其定價極具競爭力:每百萬輸入 token 2 美元、每百萬輸出 token 6 美元,並在長時程代理任務、自主軟體工程(含記錄在案的 16 天自我進化編碼專案)、研究復現以及多模態基準上表現強勁。能力上與 Kimi K3 旗鼓相當,且高於 DeepSeek V4 Flash 等輕量選項,同時在輸出密集型工作負載上遠較西方頂級前沿模型具成本效率。開發者今日即可透過 QwenCloud / 阿里雲 Model Studio,以及 CometAPI 等統一平台使用。
Key Takeaways
- Scale and efficiency: 基於 Qwen 3.5 的 2.4T 總參數 / 95B 啟用的 MoE 架構,在可接受的推理成本下達到前沿水準表現。
- Long-horizon strength: 展現跨多日的自主編碼(約 16 天內 265 次提交、127 個 PR,零人為介入)、研究論文復現與改進,以及為期一年的模擬電商運營。
- Benchmark highlights: PaperBench 93.0(領先)、Terminal Bench 2.1 取得 86.6,多模態與文件任務表現強;在部分純編碼代理榜單上與 Claude Fable 5 或 GPT-5.6 Sol 競爭但未全面稱霸。
- Pricing advantage: 全 100 萬上下文內均為每 1M token $2 / $6(快取輸入約 $0.25),在輸出價格上低於 Kimi K3 與許多西方模型。
- Availability: 已上線 QwenCloud 與阿里雲 Model Studio(相容 OpenAI 與 Anthropic API);計畫開放權重;已在 CometAPI 以
qwen3.8-max上架,便於與 500+ 模型統一接入。開放權重即將到來;亦計畫推出較小的 Qwen3.8-27B 版本以便本地/邊緣部署。 - Practical edge: 擅長端到端產出可交付成果,而非僅單輪作答——非常適合編碼代理、研究流程、辦公工作流與長時程代理迴圈。
What Is Qwen3.8-Max?
Qwen3.8-Max 是阿里巴巴 Qwen 系列最新且最強大的旗艦模型,於 2026 年 8 月 3 日正式發佈(此前在上海世界人工智能大會中於 7 月中旬預覽)。它展現向能以最少監督完成複雜多日任務並產出可直接上線交付物的模型方向的明確轉向。
在架構上,這是一個稀疏 MoE 模型,規模達到「總參數 2.4 兆」,其中每個 token 約「啟用 950 億」。此設計建立於 Qwen 3.5 基礎之上,在巨大容量與推理效率之間取得平衡。模型支援「100 萬 token 上下文視窗」(記錄的最大輸入約 991K token、最大輸出約 131K token),原生多模態輸入(文本、圖像與視頻)與文本輸出。它包含推理強度控制(xhigh / medium / low),並同時支援 OpenAI Chat Completions 與相容 Anthropic 的協議,可直接套用至常見代理框架,如 Claude Code、Codex、Qoder CLI、Qwen Code 與 OpenClaw。
與早期仍封閉的 Max 級模型不同,阿里巴巴承諾於發佈后一週在 Hugging Face 與 ModelScope 釋出 Qwen3.8-Max(以及更小的 Qwen3.8-27B 變體)的權重——這是首次對 Max 級 Qwen 模型開放權重。
此模型定位於編碼代理、真實專業工作(“cowork”)、研究、長時程規劃與多模態代理迴圈。官方示例強調自我進化行為:模型能建立 issue、指派給自己、撰寫與測試程式碼、根據回饋迭代,並在長時間段內改進自身工具。
來源:Official Qwen blog 與 Alibaba Cloud announcements(2026 年 8 月);Artificial Analysis 模型卡;總結 GA 發佈的獨立評測。
What Is New in Qwen3.8-Max?
相較於前代 Qwen3.7-Max,3.8 代在代理式編碼、長時程可靠性、多模態推理與文件/辦公表現上大幅躍升。關鍵創新包括:
True long-horizon autonomy:
模型可在數百輪或多天期間,維持閉環自適應學習。已記錄的示例包括:一個連續 16 天的自主軟體工程專案,產出一款自我進化的 CLI 工具(oh-my-cli),期間完全無人為介入,共 265 次提交、127 個拉取請求、151 個 issue;復現並改進一篇研究論文的方法論(包含 GPU 訓練迴圈與可衡量的基準提升);以及完整模擬一年電商運營且明顯優於基線。
Multimodal as a continuous feedback loop:
視覺不僅僅是輸入模態。模型將視覺理解用於規劃、執行監控與自我校正——支援如截圖到程式碼重建、互動遊戲/動畫生成、以及 2D 到 3D 視覺化等任務。
在發佈後早期數據中,模型於 Text Arena(據報第 5)與 Vision Arena(據報第 2)名列前茅:early post-release data。


End-to-end deliverable focus:
重視跨數百種職能產出可上線的高品質交付物,而非孤立的單一回答。
Thinking and Fast Inference Modes
兩種模式:thinking 模式與 fast inference 模式。thinking 模式用於更深層推理與複雜規劃;fast 模式則在任務簡單時追求更低延遲。阿里雲 OpenCode 文件顯示 thinking 已在 Qwen3.8 路由啟用,且在預覽路由列出了推理控制,包含 xhigh、medium 與 low。
此區分對產品設計價值很高。團隊不應在每個請求都使用最重的推理模式。支援機器人可先廉價判別簡單工單,並以更快模型做摘要,僅在使用者要求複雜政策決策、根因分析、合約審閱或程式碼遷移方案時,才升級到 Qwen3.8-Max 的 thinking 模式。
這些能力透過內部長時間實驗與覆蓋編碼代理、通用代理、多模態推理、文件理解與感知/對齊任務的綜合基準套件驗證。
Benchmarking: Data quantization performance
阿里巴巴在 GA 時公佈了廣泛的內部基準套件。獨立驗證(Artificial Analysis Intelligence Index、LMArena 等)在發佈後數日仍在跟進;早期的 Artificial Analysis 數據將 Qwen3.8-Max 的 Intelligence Index 定位在 53(追蹤集合中約第 16/186),並指出其冗長度較高、速度相對較低。
部分官方/報告分數(Qwen3.8-Max 與若干同儕):
| Benchmark | Qwen3.8-Max | Claude Fable 5 / Opus 4.8 | GPT-5.6 Sol (max) | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| PaperBench | 93.0 | 88.8 / 80.3 | 90.5 | 64.8 |
| SWE-bench Pro | 67.7 | 80.0 / 69.2 | 64.6 | 60.6 |
| FrontierSWE | 73.5 | 88.8 | — | 40.7 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| IFBench | 82.8 | ~63.5 | — | 79.1 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.4 |
| OmniDocBench 1.5 | 92.1 | — | — | — |
| OSWorld-Verified | 86.1 | — | — | — |
Qwen3.8-Max 在多模態推理、文件/辦公任務與部分代理式編碼/研究指標上經常領先或接近頂尖,同時在某些純軟體工程代理套件上落後於最強的封閉模型。對 FrontierSWE 與 DeepSWE 的世代性躍升尤為顯著。請將廠商數據視為趨勢指引;進行獨立重跑與結合實際工作負載的評估仍屬必要。
API Pricing of Qwen3.8-Max
阿里雲 Model Studio / QwenCloud 的 Qwen3.8-Max 官方 GA 定價(2026 年 8 月上旬):
- 輸入:每 1 百萬 token $2.00
- 輸出:每 1 百萬 token $6.00(含 thinking/reasoning token)
- 快取輸入:每 1 百萬 token 約 $0.25(對重複長上下文尤具節省)
定價在整個 100 萬 token 上下文內均一——相較許多對長上下文加價的競品是顯著優勢。依部署地區與方案可能提供批量與其他折扣。
Comparison context(同期大致牌價):
- Kimi K3:約 $3 / $15
- 更高端的 Claude / GPT 前沿模型:常見 $5+ / $15–25+
- DeepSeek V4 Flash 變體:總體更低(許多用例合計常低於 $0.50)
對已使用多家供應商的團隊而言,透過如 CometAPI 的聚合閘道通常可較官方牌價低約 20%,提供單一相容 OpenAI 的端點、統一計費與便捷的模型切換/容錯。這使得試用 Qwen3.8-Max(並同時與 DeepSeek V4 Flash、Kimi 等對比)在運維上更簡便且常更省成本。請查閱 CometAPI 當前價格頁與試用金活動以獲取最新實際費率。
How Qwen3.8-Max Matches Kimi K3 and DeepSeek V4 Flash
| Dimension | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Flash |
|---|---|---|---|
| Total / Active params | 2.4T / ~95B | ~2.8T / ~104B | 284B / 13B |
| Context | 1M | 1M | 1M |
| Multimodal | Text + Image + Video | Text + Image + Video | Text only |
| Pricing (in/out) | $2 / $6 | $3 / $15 | ~$0.14 / $0.28(更便宜) |
| Open weights | Planned (next week) | Already released | MIT, available |
| Strengths | 長時程自主性、多模態、PaperBench、輸出端定價優勢 | 強勁的獨立分數、前端編碼 Arena 領先 | 極致性價比,以體量而言的可靠代理式編碼 |
| Relative standing | 在多個代理與多模態基準具競爭力/領先 | 在部分審核智能指數略佔優勢 | 價值出色;絕對能力較低 |
Qwen3.8-Max 通常在輸出密集型工作與多模態任務的成本效率上匹配或超越 Kimi K3,而 DeepSeek V4 Flash 依舊是大規模文本流量下的性價比之王。許多團隊會同時透過統一閘道使用三者:將簡單流量路由至 Flash 級模型,將複雜代理會話交由 Qwen3.8-Max 或 Kimi K3。
Does Qwen3.8-Max match Kimi K3?
在某些方面是的。二者皆具 1M 上下文、強勢多模態定位,且 Qwen3.8-Max 在官方標準輸入/輸出定價上更便宜。它未達到 Kimi K3 公佈的 2.8T 總參數,且 Kimi 的公開文件目前在工具、上下文快取、結構化輸出與視覺指引上更為詳盡。
Does Qwen3.8-Max match DeepSeek V4 Flash?
二者在 1M 上下文與 MoE 架構上可對照,但產品定位不同。DeepSeek V4 Flash 是經濟快速的路線;Qwen3.8-Max 是更大型且高能力的選擇,適用於當多模態理解、進階推理與企業生產力比極致低價更重要的工作。
What can Qwen3.8-Max do?
Coding and Software Engineering
Qwen3.8-Max 適合全端開發、程式碼審查、倉庫理解、遷移規劃、API 設計、除錯、測試推理與軟體架構。其長上下文在需要同時納入多個檔案、日誌與需求時尤為有用。將其用於艱難的程式任務,而非所有自動補全或簡單 lint 說明。
Office and Knowledge Work
“Cowork” 定位很關鍵。企業員工不只是提問聊天。他們比較 PDF、總結會議、審閱簡報、解讀試算表、檢查合約、撰寫報告,並從雜亂證據中做決策。Qwen3.8-Max 的多模態與長上下文設計使其適合同時推理文本、文件、截圖與結構化資料的辦公工作流。
Agentic Workflows
Qwen3.8-Max 對代理規劃很有幫助:將目標拆解為步驟、決定呼叫哪些工具、評估結果並修正計畫。在 CometAPI 中,這更實用,因為同一應用可將簡單步驟路由給更便宜的模型,並將規劃或驗證保留給 Qwen3.8-Max。
Getting Started and CometAPI Integration Tips
- 直接接入:在 QwenCloud 或阿里雲 Model Studio 使用模型 ID
qwen3.8-max。同時支援相容 OpenAI 與相容 Anthropic 的端點。 - 透過 CometAPI 統一接入:在 CometAPI.com 註冊、取得 API key,將
base_url設為https://api.cometapi.com/v1,並呼叫model="qwen3.8-max"。同一金鑰也適用於 DeepSeek V4 Flash、Kimi K3、Claude、GPT 與數百款模型——方便試驗、控成本與生產路由。CometAPI 主打具競爭力價格、低延遲與快速上新(Qwen3.8-Max 在發佈後不久即上架)。 - 代理框架:可直接插入 Claude Code、OpenClaw 或自訂框架。對複雜長時程任務啟用更高推理強度。
- 開放權重:若需自建或微調部署,請關注 Hugging Face/ModelScope 上即將到來的釋出。
