Qwen 3.8 Max API 定價:$2 輸入、$6 輸出,1M 上下文
以下內容基於您給定的價格基準:Qwen 3.8 Max 價格為 $2/百萬輸入 tokens、$6/百萬輸出 tokens。
- 快取(Prompt Cache)費用與策略
- 常見計費模式
- 首次上傳至快取:按輸入單價計費($2/M)。
- 後續命中快取:常見為輸入單價的折扣(例如 25%–50%),具體以實際文檔為準。
- 命中條件:通常要求字節級或分段級精確匹配;內容微調(空格、標點、版本號)可能導致失效。
- 配置要點:TTL/有效期、最大可快取 tokens、跨請求是否共享、是否按 chunk/段落快取。
- 成本示例(假設快取重用按輸入價的 25% 計費)
- 一次性上傳 60k tokens:60,000 × $0.000002 = $0.12。
- 後續每次重用 60k tokens:60,000 × ($0.000002 × 25%) = $0.03。
- 連續重用 20 次:初次 $0.12 + 20 × $0.03 = $0.72;若無快取則為 21 次 × $0.12 = $2.52,節省約 $1.80。
- 與 Qwen 3.7 對比與遷移要點
- 若 3.7 未啟用跨請求快取或折扣較弱,3.8 可通過將長系統提示/固定說明文檔抽離為可重用段落獲得顯著降本。
- 建議:將提示拆分為「穩定大段(快取)」與「動態小段(不快取)」;為快取段建立一致的鍵/版本;在部署管線中嚴格控管空白與標點以維持命中率。
- 工具/函數調用成本(Tools/Function Calling)
- 計費歸屬(通用口徑)
- 模型輸出的工具參數(JSON/文字)→ 計為輸出 tokens($6/M)。
- 工具返回給模型的結果 → 計為下一輪模型輸入 tokens($2/M)。
- 多輪工具迭代會多次累計以上成本;結構化 schema/長參數會推高輸出成本。
- 成本示例
- 單輪:模型產生 300 tokens 工具參數(輸出)+ 工具返回 800 tokens(輸入)+ 模型最終回答 400 tokens(輸出)
- 工具參數:300 × $0.000006 = $0.0018
- 工具返回:800 × $0.000002 = $0.0016
- 最終回答:400 × $0.000006 = $0.0024
- 小計 ≈ $0.0058(未含其餘對話輸入)
- 最佳實踐
- 縮短工具返回:傳遞嚴格的結構化摘要或壓縮文本,避免冗長日誌/堆疊。
- 控制 tool loop:設置最大輪次與截斷策略;參數 schema 嚴謹以減少冗字。
- 對於恆定的工具說明與 schema,可納入快取段,降低重複提示成本。
- 與 Qwen 3.7 對比與遷移要點
- 若 3.8 的工具接口/選擇策略(如 auto/required)或 JSON 約束更嚴,需要調整函數定義與參數驗證,避免因不合規重試而放大 tokens。
- 觀察 3.8 是否更傾向輸出冗長解釋;必要時以 system 指令或嚴格 schema 抑制。
- 真實場景成本試算(以 $2/M 入、$6/M 出)
- 一般對話(無工具):輸入 2,000 tokens、輸出 600 tokens
- 成本 = 2,000 × $0.000002 + 600 × $0.000006 = $0.004 + $0.0036 = 約 $0.0076
- RAG 查詢(一次檢索拼接 8,000 tokens 上下文,回答 800 tokens)
- 成本 = 8,000 × $0.000002 + 800 × $0.000006 = $0.016 + $0.0048 = 約 $0.0208
- 若檢索上下文可快取且被多次重用(25% 折扣),重用成本為 8,000 × ($0.000002 × 25%) = $0.004/次。
- 長檔案代理(初次載入 60k tokens 規範文,往後每工單重用)
- 無快取,10 次:10 × (60k × $0.000002) = 10 × $0.12 = $1.20
- 有快取(25% 重用):初次 $0.12 + 9 × $0.03 = $0.39,節省 ~67.5%
- 限制與配額(需以實際文檔為準,下面為核查清單)
- 上下文長度:最大可接受 tokens(總上下文 = 系統 + 用戶 + 工具返回 + 中間思考);長上下文時請為中間回答設置合理 max_output_tokens。
- 單次輸出上限:max_output_tokens/最大回傳 tokens;超限會截斷或報錯。
- 速率限制:每分鐘請求數(RPM)、每分鐘 tokens(TPM)、並發連線數;流式與非流式可能不同。
- 工具深度:單輪允許的工具調用數、連續調用輪次上限;單次工具 payload 大小。
- 快取限制:單鍵最大 tokens、總快取容量、TTL、跨專案/租戶可見性。
- 內容上傳:文件大小/數量上限(若使用文件接口)。
- JSON/格式嚴格度:是否提供嚴格 JSON 模式;超過長度/結構錯誤時的重試策略。
- 從 Qwen 3.7 遷移至 3.8 的建議
- 兼容性與參數
- 確認 model 名稱與端點變更;檢查默認參數(temperature、top_p、max_output_tokens、tool_choice)是否有新預設。
- 若 tokenizer 更新,實際 token 數可能變化:重新校準提示長度與成本預估。
- 提示與格式
- 將長期不變的 system 指令、業務規範、工具 schema 拆分為快取段;動態 few-shot 例子與用戶上下文分離。
- 若 3.8 對結構化輸出更穩定,可啟用嚴格 JSON/模式校驗;同時調整容錯重試避免二次膨脹。
- 工具/函數
- 對齊 3.8 的工具調用協議(例如 tool_choice 選項、參數命名/必填規則);收緊參數長度與型別,減少無效回合。
- 對工具返回實施「結果摘要層」:只回傳模型決策所需字段,避免把全文或日誌回灌模型。
- 生成風格與安全
- 針對格式嚴格場景(代碼、表格、JSON),建立回歸測試;如有風格差異(更健談或更保守),用 system 指令或後處理器校正。
- 性能與成本
- 先做 A/B/canary:小流量觀察延遲、tokens/回、工具輪次、失敗率,再擴大流量。
- 打開流式回傳以提升體感;在保證體驗的前提下降 max_output_tokens、減少不必要 few-shot。
- 啟用快取並監控命中率;命中率低時調整分段與版本策略。
- 回歸測試與監控
- 建立任務級基準(答案正確率、格式合規率、延遲、每回成本);出現長尾重試時,調整超時與退避策略。
- 快速計算公式
- 總成本 ≈ 輸入_tokens × $0.000002 + 輸出_tokens × $0.000006 + 快取重用_tokens × 折扣係數 × $0.000002
- 其中折扣係數示例:0.25(若重用按 25% 輸入單價計費);實際值以產品文檔為準。
如需基於您實際上下文長度、工具輪次與快取策略的專屬測算,請提供典型對話/任務的 token 分佈與流程,我可按上述價格基準給出精確成本表。