GPT-5.6 Luna price down 80%, Terra down 20% →

Qwen 3.8 Max API 定價:$2 輸入、$6 輸出,1M 上下文

CometAPI
Mia MarenAug 4, 2026
Qwen 3.8 Max API 定價:$2 輸入、$6 輸出,1M 上下文

Qwen 3.8 Max API 定價:輸入 $2、輸出 $6、1M 上下文

TL;DR

Qwen 3.8 Max 在 QwenCloud 上的費率為每 100 萬輸入 tokens $2、每 100 萬輸出 tokens $6。模型專屬快取費率為「隱式快取命中」$0.25/M、「顯式快取建立」$2.50/M、「顯式快取讀取」$0.17/M。

同一組標準 token 單價適用於該模型支援的 1M-token 上下文視窗。較大的提示詞成本更高,是因為包含更多 tokens,而非因為進入了更高的長上下文定價級距。

按牌價,Qwen 3.8 Max 比 Qwen 3.7 Max 便宜 20%。然而在 Qwen 3.7 Max 目前 50% 優惠活動期間,後者更便宜。更好的生產選擇取決於「每個被接受任務的成本」,涵蓋推理、快取命中率、工具、重試、延遲與人工審核等因素。

Qwen 3.8 Max API 定價速覽

項目目前官方數值
生產用模型 IDqwen3.8-max
官方發佈日期August 3, 2026
架構2.4T 總參數;95B 啟用參數
標準輸入價格$2 / 1M tokens
標準輸出價格$6 / 1M tokens
隱式快取輸入$0.25 / 1M tokens
顯式快取建立$2.50 / 1M tokens
顯式快取讀取$0.17 / 1M tokens
上下文視窗1M tokens
最大輸入未啟用推理 991K;啟用推理 983K
最大輸出131K
最大推理262K
輸入模態文字、影像與影片
輸出模態文字
QwenCloud 參考限制2M TPM 與 15K RPM

QwenCloud 模型頁面 是取得當前模型 ID、定價、快取費率、上下限與模態的最直接來源。帳戶與區域配額可能不同,因此在設定生產併發時,請以自己主控台顯示的限制為準。

生產版本也會以 qwen3.8-max 取代預覽識別碼,並新增完整的模型專屬費率卡。Qwen 的發佈材料描述了 lowmediumxhigh 推理強度設定,但生產行為應以實際使用的端點與 API 參考為準加以驗證。

時間敏感提示:Qwen 宣布將在 API 發佈後提供開放權重。截至 2026 年 8 月 4 日,在官方檢查點與授權發布之前,請勿將 Qwen 3.8 Max 描述為可下載或可自我託管。

Qwen 3.8 Max 定價機制

QwenCloud 目前針對 Qwen 3.8 Max 支援的 1M-token 上下文視窗,列示統一的標準費率:每 1M 輸入 tokens $2、每 1M 輸出 tokens $6。以下官方定價快照截於 2026 年 8 月 4 日;在做生產預算決策前請務必查閱即時模型頁面。

Qwen 3.8 Max API 定價:$2 輸入、$6 輸出,1M 上下文

來源***:*** QwenCloud, “Qwen3.8-Max” official

計費項目每 1M tokens 價格適用時機
標準輸入$2.00新的提示內容、工具定義與未快取的上下文
標準輸出$6.00產生的輸出與計費的推理用量
隱式快取命中$0.25自動重用的提示前綴;不保證命中
顯式快取建立$2.50建立標記為可重用的提示前綴
顯式快取讀取$0.17重用有效的顯式快取區塊

因此,900K-token 的請求之所以比 100K-token 的請求花費更高,是因為處理了多 9 倍的輸入 tokens,而不是因為跨入更高的價格級距。

推理可能增加輸出成本

可見的短答案不一定代表低成本。啟用推理的呼叫可能產生額外的推理 tokens,因此生產估算應以 API 回傳的用量欄位為準,而非以可見回覆長度估計。

若你的端點支援 qwen3.8-max 的推理控制,請在同一評測集合上比較可用設定。不要假設預覽版本的預設行為能延續到正式 GA 模型。

快取節省取決於提示穩定性

Qwen 3.8 Max 的模型頁面公布了模型專屬快取費率。進行支出估算時,請使用這些費率,而非通用快取比例。

顯式快取項目具有 5 分鐘有效期,且成功命中會重置有效期。隱式快取是自動的,但不保證命中。當系統提示、工具定義、版本庫上下文或大型文件在頻繁呼叫間保持穩定時,快取最有用。

內建工具會產生額外收費

QwenCloud 目前列示以下內建工具費用,需另計於 token 用量之外:

內建工具目前費用
Web Search$10 / 1K calls
Image Search$8 / 1K calls
Web Extractor限時免費
Code Interpreter限時免費

Function calling 與 MCP 不另收工具費,但工具描述仍計入輸入 tokens。免費工具優惠可能變動,最終制定生產預算前,請查閱 QwenCloud 定價指南

例如,一次請求包含 20K 輸入 tokens、2K 輸出 tokens,以及兩次 Web Search 呼叫,成本約為:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

在此例中,兩次搜尋呼叫約占總請求成本的 27.8%。

Qwen 3.8 Max 實際成本範例

以下範例使用當前 QwenCloud 的模型專屬費率。不含稅金、重試、備援與供應商加價。

範例 1:中型代理請求

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

首次嘗試成功約為 $0.13。若完整重試一次,模型成本約為 $0.26。

範例 2:長文件分析

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

該模型目前的費率卡未對長上下文另行收取附加費,但大型提示仍會帶來可觀的絕對成本。

範例 3:使用快取的代理工作階段

假設可重用的 100K-token 前綴、10K 新輸入 tokens、5K 輸出 tokens,且在顯式快取有效期間共呼叫 50 次:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

預估節省 = $8.917,或 71.3%

節省金額取決於快取命中與前綴的穩定性。長時間間隔或系統提示與工具結構頻繁變更將降低快取效益。

Qwen 3.8 Max vs Qwen 3.7 Max:定價比較

Qwen 3.8 Max 的標準牌價較 Qwen 3.7 Max 低 20%,但在 Qwen 3.7 Max 目前 50% 優惠期間,後者便宜 37.5%。

模型與定價狀態輸入 / 1M輸出 / 1M上下文
qwen3.8-max 標準價格$2.00$6.001M
qwen3.7-max 牌價$2.50$7.501M
qwen3.7-max 目前優惠$1.25$3.751M

在測試新模型時,請保留 CometAPI Qwen3.7 Max 模型頁面 作為備援。

每 token 單價只是決策的一部分。若 Qwen 3.8 Max 能提升首次成功率、更可靠地使用工具、降低重試,或減少人為修正,它仍可能更經濟。

請使用以下生產指標:

每個被接受任務的成本 =

(模型 tokens + 工具呼叫 + 重試 + 備援支出 + 審核成本)

÷ 被接受的輸出數

供應商報告的基準測試提升是重新測試高要求程式設計與專業工作流程的理由,但並不代表所有 Qwen 3.7 的工作負載都應遷移。

如何遷移至 Qwen 3.8 Max

更換模型字串是必要步驟,但不是完整的生產遷移。

1. 測試生產用模型 ID

在測試環境中以 qwen3.8-max 取代預覽識別碼。不要假設預覽別名、預設值、延遲或回應行為會保持不變。

一個最小的 OpenAI 相容請求如下:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

請從最小、文件化的請求開始。僅在你的端點目前 API 參考明確支援時,才加入推理控制。

2. 重新建立成本與效能基線遙測

至少記錄:

  • 輸入、輸出與推理 tokens
  • 快取命中與快取建立 tokens
  • 首字元時間與總延遲
  • 工具呼叫、重試與備援
  • 被接受與被拒絕的輸出
  • 人工修正時間

3. 重新測試你的應用介面

驗證串流事件、多模態載荷、工具結構、結構化輸出、結束原因、用量欄位、錯誤處理與多輪行為。生產模型頁面提供了 DashScope 與 OpenAI 相容的存取方式;在依賴任何額外的相容層之前,務必先加以驗證。

4. 尊重實際上下文限制

1M 的上下文視窗不等於 1M-token 的使用者提示。QwenCloud 列示的最大輸入為:未啟用推理 991K、啟用推理 983K。請預留安全邊際,讓請求仍有輸出與推理空間。

5. 並行運行 Qwen 3.7 與 Qwen 3.8

使用相同的提示、工具、驗證、重試規則與資料集。比較「每個被接受任務的成本」與延遲,而非以肉眼判斷單次回覆。

如何評估與路由 Qwen 3.8 Max

請使用實際工作負載,而非寬泛的基準平均值。

工作負載建議任務數主要驗收訊號
版本庫程式開發4測試可在無人工修補下通過
長文件分析3論述可被提供的證據所支持
多模態分析2正確使用相關的圖片或影片細節
使用工具的代理3正確的工具選擇與有效的引數
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

在困難的版本庫工作、長期任務代理、多模態分析,以及 Qwen 3.7 未通過驗收測試的流程中,使用 Qwen 3.8 Max。若優惠能實質降低成本且現有模型已達成品質目標,則維持使用 Qwen 3.7 Max。

在鎖定門檻前,請檢查 CometAPI 定價頁 與即時路由資訊,因為供應商可用性與路由定價可能獨立於 QwenCloud 的直接牌價而變動。CometAPI Cookbook 可協助你建立可重現的請求與一致的評估機制。

常見問題

Qwen 3.8 Max API 要花多少錢?

QwenCloud 目前列示 Qwen 3.8 Max 為每 100 萬輸入 tokens $2、每 100 萬輸出 tokens $6。快取使用與內建工具有單獨費率。

超過 128K tokens 後,Qwen 3.8 Max 會更貴嗎?

目前模型專屬費率卡未顯示獨立的長上下文級距。長請求成本更高,是因為含有更多 tokens,而不是跨入更高的單價級距。

Qwen 3.8 Max 的推理 tokens 會計費嗎?

推理可能增加產生的用量與總成本。請以端點回傳的推理與輸出 token 欄位為準,而非依可見答案估計。

Qwen 3.8 Max 是開源的嗎?

Qwen 宣布將在 API 發佈後提供開放權重。在官方檢查點與授權發布可用之前,請勿將該模型描述為可下載或可自我託管。

Qwen 3.7 Max 使用者應立即遷移嗎?

不一定。Qwen 3.8 Max 的標準牌價更低,而 Qwen 3.7 Max 在目前優惠期間更便宜。當你的品質、延遲、快取行為與「每個被接受任務的成本」資料支持遷移時,再進行更換。

使用 CometAPI 測試 Qwen 3.8 Max

使用 CometAPI 快速開始 設定 OpenAI 相容的客戶端。在導入生產流量前,請確認 qwen3.8-max 已在你的帳戶中上線,並驗證其中顯示的路由價格。

請以相同的提示、驗證器、重試政策與遙測,將其與你的 Qwen 3.7 基線進行比較。這能確保評估聚焦於模型本身,而非測試工具變更。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多