GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/CometAPI 研究

Qwen 3.8 Max API 定價:輸入 $2、輸出 $6、1M 上下文

Qwen 3.8 Max 的費率為輸入 $2/M、輸出 $6/M。請比較快取費用、工具成本、實際範例、限制,以及 Qwen 3.7 的遷移建議。

CometAPI
Mia MarenAI 模型與 API 研究團隊
更新於 Sep 3, 2026 6 分鐘閱讀
Qwen 3.8 Max API 定價:輸入 $2、輸出 $6、1M 上下文
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max 在 QwenCloud 上的價格為每 100 萬輸入 tokens 收費 $2每 100 萬輸出 tokens 收費 $6。模型專屬快取費率為:隱式快取輸入 $0.25/百萬顯式快取建立 $2.50/百萬顯式快取讀取 $0.17/百萬

相同的標準 token 單價適用於模型支援的 100 萬 token 上下文視窗。較大的提示花費更高是因為包含更多 tokens,而不是進入了更高的長上下文計價級距。

按牌價,Qwen 3.8 Max 比 Qwen 3.7 Max 便宜 20%。但在目前 50% 優惠活動有效期間,Qwen 3.7 Max 更便宜。更好的生產選擇取決於每個被接受任務的成本,包括推理、快取命中、工具、重試、延遲與人工複核。

Qwen 3.8 Max API 定價速覽

ItemCurrent official value
Production model IDqwen3.8-max
Official release dateAugust 3, 2026
Architecture2.4T total parameters; 95B active parameters
Standard input price$2 / 1M tokens
Standard output price$6 / 1M tokens
Implicit cached input$0.25 / 1M tokens
Explicit cache creation$2.50 / 1M tokens
Explicit cache read$0.17 / 1M tokens
Context window1M tokens
Maximum input991K without thinking; 983K with thinking
Maximum output131K
Maximum reasoning262K
Input modalitiesText, image, and video
Output modalityText
QwenCloud reference limits2M TPM and 15K RPM

QwenCloud 模型頁面是目前模型 ID、定價、快取費率、上下文限制與模態的最直接來源。帳戶與區域配額可能不同,設定生產並發時請以你自己主控台顯示的限制為準。

生產版也以 qwen3.8-max 取代預覽識別符,並新增完整的模型專屬費率卡。Qwen 的發佈材料描述了 lowmediumxhigh 的推理強度設定,但請以你實際使用的端點與 API 參考驗證生產行為。

**時效性提醒:**Qwen 宣布開源權重將跟隨 API 發佈。截止 2026 年 8 月 4 日,在官方檢查點與授權條款發布前,請勿將 Qwen 3.8 Max 描述為可下載或可自我託管。

Qwen 3.8 Max 的計費方式

QwenCloud 目前在 Qwen 3.8 Max 支援的 100 萬 token 上下文視窗內採用每 100 萬輸入 tokens 收費 $2、每 100 萬輸出 tokens 收費 $6的單一標準費率。以下官方定價截圖擷取於 2026 年 8 月 4 日;在做生產預算決策前,請務必查看即時模型頁面。

Qwen 3.8 Max API 定價:輸入 $2、輸出 $6、1M 上下文

來源***:*** QwenCloud,「Qwen3.8-Max」官方

Billing itemPrice per 1M tokensWhen it applies
Standard input$2.00New prompt content, tool definitions, and uncached context
Standard output$6.00Generated output and billed reasoning usage
Implicit cache hit$0.25Automatically reused prompt prefixes; hits are not guaranteed
Explicit cache creation$2.50Creating a marked reusable prompt prefix
Explicit cache read$0.17Reusing a valid explicit cache block

因此,90 萬 token 的請求會比 10 萬 token 的請求更貴,是因為處理了九倍的輸入 tokens,而不是因為跨入了更高的分級價格。

推理可能增加輸出成本

可見的回答很短,不代表成本一定低。啟用推理的呼叫可能會生成額外的推理 tokens,因此生產估算應使用 API 回傳的用量欄位,而不是以可見回應長度估算。

若你的端點支援對 qwen3.8-max 的推理控制,請在相同評測集上比較可用設定。不要假設預覽版的預設會沿用到 GA 模型。

快取節省取決於提示穩定性

Qwen 3.8 Max 的模型頁面公布了模型專屬快取費率。進行支出估算時,請使用這些費率,而不是泛用快取比例。

顯式快取項目的有效期為五分鐘,且成功命中會重置有效期。隱式快取是自動的,但不保證命中。當系統提示詞、工具定義、儲存庫上下文或大型文件在頻繁呼叫間保持穩定時,快取最有用。

內建工具會產生額外費用

QwenCloud 目前列出了以下工具費用,需在 token 用量之外另行計費:

Built-in toolCurrent fee
Web Search$10 / 1K calls
Image Search$8 / 1K calls
Web ExtractorFree for a limited time
Code InterpreterFree for a limited time

Function calling 與 MCP 不另收工具費,但工具描述仍會計入輸入 tokens。免費工具優惠可能變更,訂定生產預算前請查看 QwenCloud 價格指南

例如,包含 20K 輸入 tokens、2K 輸出 tokens,並進行兩次 Web Search 呼叫的請求,成本約為:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

在此例中,兩次搜尋呼叫約占總請求成本的 27.8%。

Qwen 3.8 Max 實際成本範例

以下範例使用目前的 QwenCloud 模型專屬費率。不包含稅費、重試、回退與供應商加價。

範例 1:中等複雜代理請求

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

首次嘗試成功的成本約為 $0.13。若完整重試一次,模型成本約升至 $0.26

範例 2:長文件分析

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

該模型在當前費率卡上未對長上下文另行加價,但大型提示仍會帶來可觀的絕對成本。

範例 3:已快取的代理工作階段

假設可重用的 100K-token 前綴、10K 新輸入 tokens、5K 輸出 tokens,且在顯式快取有效期間內進行 50 次呼叫:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

預估節省 = $8.917,或 71.3%

預估節省取決於快取命中與前綴穩定。長時間間隔或頻繁變更系統提示詞與工具結構會降低收益。

Qwen 3.8 Max vs Qwen 3.7 Max:價格比較

Qwen 3.8 Max 的牌價比 Qwen 3.7 Max 便宜 20%,但在 Qwen 3.7 Max 當前 50% 優惠有效期間,Qwen 3.7 Max 便宜 37.5%。

Model and pricing statusInput / 1MOutput / 1MContext
qwen3.8-max standard price$2.00$6.001M
qwen3.7-max list price$2.50$7.501M
qwen3.7-max current promotion$1.25$3.751M

在測試新模型時,請保留 CometAPI Qwen3.7 Max 模型頁面作為回退。

每個 token 的價格只是決策的一部分。如果 Qwen 3.8 Max 能提升首次成功率、更可靠地使用工具、減少重試或降低人工校正,仍可能帶來更佳的總體經濟性。

使用這個生產指標:

Cost per accepted task =

(model tokens + tool calls + retries + fallback spend + review cost)

÷ accepted outputs

供應商報告的基準提升代表值得重新測試艱難的程式與專業工作流程,但不表示所有 Qwen 3.7 的工作負載都應遷移。

如何遷移到 Qwen 3.8 Max

更換模型字串是必要步驟,但並非完整的生產遷移。

1. 測試生產模型 ID

在測試環境中以 qwen3.8-max 取代預覽識別符。不要假設預覽別名、預設、延遲或回應行為會保持不變。

一個最小的 OpenAI 相容請求可如下:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

從最小、已文件化的請求開始。僅在你所用端點的當前 API 參考明確支援時,才加入推理控制。

2. 重新校準成本與效能遙測

至少記錄:

  • input、output 與 reasoning tokens
  • 快取命中與快取建立 tokens
  • first token 時間與總延遲
  • 工具呼叫、重試與回退
  • 被接受與被拒絕的輸出
  • 人工校正時間

3. 重新測試你的應用介面

驗證串流事件、多模態負載、工具結構、結構化輸出、結束原因、用量欄位、錯誤處理與多輪行為。生產模型頁面記錄了 DashScope 與 OpenAI 相容的存取方式;在依賴任何額外相容層前先行驗證。

4. 尊重實際上下文限制

100 萬的上下文視窗不等於 100 萬 token 的使用者提示。QwenCloud 列出未啟用推理時最大輸入為 991K,啟用推理時為 983K。請保留安全邊際,以確保請求仍有空間輸出與進行推理。

5. 並行運行 Qwen 3.7 與 Qwen 3.8

使用相同的提示、工具、驗證器、重試規則與資料集。比較每個被接受任務的成本與延遲,而不是憑肉眼評判單次回應。

如何評估與路由 Qwen 3.8 Max

盡量使用真實工作負載,而非廣泛的基準平均值。

WorkloadSuggested tasksPrimary acceptance signal
Repository coding4Tests pass without human patching
Long-document analysis3Claims are supported by supplied evidence
Multimodal analysis2Relevant image or video details are used correctly
Tool-using agents3Correct tool selection and valid arguments
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

在艱難的儲存庫工作、長期代理、多模態分析,以及 Qwen 3.7 未通過驗收測試的流程上,使用Qwen 3.8 Max。當促銷大幅降低成本且現有模型已達成品質目標時,保留Qwen 3.7 Max

在鎖定閾值前請查看 CometAPI 定價頁與即時路由資訊,因為供應商可用性與路由價格可能獨立於 QwenCloud 的直售牌價而變動。CometAPI Cookbook可協助你建立可重複的請求與一致的評估框架。

常見問題

Qwen 3.8 Max API 要多少錢?

QwenCloud 目前列出 Qwen 3.8 Max 的價格為每 100 萬輸入 tokens $2每 100 萬輸出 tokens $6。快取與內建工具另有費率。

超過 128K tokens 後,Qwen 3.8 Max 會更貴嗎?

當前的模型專屬費率卡未顯示獨立的長上下文分級。長請求之所以更貴,是因為包含更多 tokens,而不是因為跨入了更高的單價級距。

Qwen 3.8 Max 的推理 tokens 會計費嗎?

推理可能增加生成用量與總成本。請使用端點回傳的推理與輸出 token 欄位,而不是以可見答案估算。

Qwen 3.8 Max 是開源的嗎?

Qwen 宣布開源權重將跟隨 API 發佈。在官方檢查點與授權條款可用前,請勿將該模型描述為可下載或可自我託管。

Qwen 3.7 Max 用戶應立即遷移嗎?

不必然。Qwen 3.8 Max 的標準牌價更低,而在當前促銷期間 Qwen 3.7 Max 更便宜。當你的品質、延遲、快取行為與每個被接受任務的成本數據支持變更時再遷移。

使用 CometAPI 測試 Qwen 3.8 Max

使用 CometAPI 快速入門來設定 OpenAI 相容的用戶端。在送出生產流量前,確認 qwen3.8-max 已在你的帳戶上線,並驗證那裡顯示的路由價格。

以相同的提示、驗證器、重試策略與遙測,與你的 Qwen 3.7 基線進行比較。這能讓評估聚焦於模型本身,而非測試工具的變動。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Aug 4, 2026
最後更新 Sep 3, 2026
199 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多