GPT-5.6 Luna price down 80%, Terra down 20% →

qwen 3.8 Max 部落格

Qwen 3.8 Max API 定價:$2 輸入、$6 輸出,1M 上下文
Aug 4, 2026
qwen 3.8 Max

Qwen 3.8 Max API 定價:$2 輸入、$6 輸出,1M 上下文

以下內容基於您給定的價格基準:Qwen 3.8 Max 價格為 $2/百萬輸入 tokens、$6/百萬輸出 tokens。 - 快取(Prompt Cache)費用與策略 - 常見計費模式 - 首次上傳至快取:按輸入單價計費($2/M)。 - 後續命中快取:常見為輸入單價的折扣(例如 25%–50%),具體以實際文檔為準。 - 命中條件:通常要求字節級或分段級精確匹配;內容微調(空格、標點、版本號)可能導致失效。 - 配置要點:TTL/有效期、最大可快取 tokens、跨請求是否共享、是否按 chunk/段落快取。 - 成本示例(假設快取重用按輸入價的 25% 計費) - 一次性上傳 60k tokens:60,000 × $0.000002 = $0.12。 - 後續每次重用 60k tokens:60,000 × ($0.000002 × 25%) = $0.03。 - 連續重用 20 次:初次 $0.12 + 20 × $0.03 = $0.72;若無快取則為 21 次 × $0.12 = $2.52,節省約 $1.80。 - 與 Qwen 3.7 對比與遷移要點 - 若 3.7 未啟用跨請求快取或折扣較弱,3.8 可通過將長系統提示/固定說明文檔抽離為可重用段落獲得顯著降本。 - 建議:將提示拆分為「穩定大段(快取)」與「動態小段(不快取)」;為快取段建立一致的鍵/版本;在部署管線中嚴格控管空白與標點以維持命中率。 - 工具/函數調用成本(Tools/Function Calling) - 計費歸屬(通用口徑) - 模型輸出的工具參數(JSON/文字)→ 計為輸出 tokens($6/M)。 - 工具返回給模型的結果 → 計為下一輪模型輸入 tokens($2/M)。 - 多輪工具迭代會多次累計以上成本;結構化 schema/長參數會推高輸出成本。 - 成本示例 - 單輪:模型產生 300 tokens 工具參數(輸出)+ 工具返回 800 tokens(輸入)+ 模型最終回答 400 tokens(輸出) - 工具參數:300 × $0.000006 = $0.0018 - 工具返回:800 × $0.000002 = $0.0016 - 最終回答:400 × $0.000006 = $0.0024 - 小計 ≈ $0.0058(未含其餘對話輸入) - 最佳實踐 - 縮短工具返回:傳遞嚴格的結構化摘要或壓縮文本,避免冗長日誌/堆疊。 - 控制 tool loop:設置最大輪次與截斷策略;參數 schema 嚴謹以減少冗字。 - 對於恆定的工具說明與 schema,可納入快取段,降低重複提示成本。 - 與 Qwen 3.7 對比與遷移要點 - 若 3.8 的工具接口/選擇策略(如 auto/required)或 JSON 約束更嚴,需要調整函數定義與參數驗證,避免因不合規重試而放大 tokens。 - 觀察 3.8 是否更傾向輸出冗長解釋;必要時以 system 指令或嚴格 schema 抑制。 - 真實場景成本試算(以 $2/M 入、$6/M 出) - 一般對話(無工具):輸入 2,000 tokens、輸出 600 tokens - 成本 = 2,000 × $0.000002 + 600 × $0.000006 = $0.004 + $0.0036 = 約 $0.0076 - RAG 查詢(一次檢索拼接 8,000 tokens 上下文,回答 800 tokens) - 成本 = 8,000 × $0.000002 + 800 × $0.000006 = $0.016 + $0.0048 = 約 $0.0208 - 若檢索上下文可快取且被多次重用(25% 折扣),重用成本為 8,000 × ($0.000002 × 25%) = $0.004/次。 - 長檔案代理(初次載入 60k tokens 規範文,往後每工單重用) - 無快取,10 次:10 × (60k × $0.000002) = 10 × $0.12 = $1.20 - 有快取(25% 重用):初次 $0.12 + 9 × $0.03 = $0.39,節省 ~67.5% - 限制與配額(需以實際文檔為準,下面為核查清單) - 上下文長度:最大可接受 tokens(總上下文 = 系統 + 用戶 + 工具返回 + 中間思考);長上下文時請為中間回答設置合理 max_output_tokens。 - 單次輸出上限:max_output_tokens/最大回傳 tokens;超限會截斷或報錯。 - 速率限制:每分鐘請求數(RPM)、每分鐘 tokens(TPM)、並發連線數;流式與非流式可能不同。 - 工具深度:單輪允許的工具調用數、連續調用輪次上限;單次工具 payload 大小。 - 快取限制:單鍵最大 tokens、總快取容量、TTL、跨專案/租戶可見性。 - 內容上傳:文件大小/數量上限(若使用文件接口)。 - JSON/格式嚴格度:是否提供嚴格 JSON 模式;超過長度/結構錯誤時的重試策略。 - 從 Qwen 3.7 遷移至 3.8 的建議 - 兼容性與參數 - 確認 model 名稱與端點變更;檢查默認參數(temperature、top_p、max_output_tokens、tool_choice)是否有新預設。 - 若 tokenizer 更新,實際 token 數可能變化:重新校準提示長度與成本預估。 - 提示與格式 - 將長期不變的 system 指令、業務規範、工具 schema 拆分為快取段;動態 few-shot 例子與用戶上下文分離。 - 若 3.8 對結構化輸出更穩定,可啟用嚴格 JSON/模式校驗;同時調整容錯重試避免二次膨脹。 - 工具/函數 - 對齊 3.8 的工具調用協議(例如 tool_choice 選項、參數命名/必填規則);收緊參數長度與型別,減少無效回合。 - 對工具返回實施「結果摘要層」:只回傳模型決策所需字段,避免把全文或日誌回灌模型。 - 生成風格與安全 - 針對格式嚴格場景(代碼、表格、JSON),建立回歸測試;如有風格差異(更健談或更保守),用 system 指令或後處理器校正。 - 性能與成本 - 先做 A/B/canary:小流量觀察延遲、tokens/回、工具輪次、失敗率,再擴大流量。 - 打開流式回傳以提升體感;在保證體驗的前提下降 max_output_tokens、減少不必要 few-shot。 - 啟用快取並監控命中率;命中率低時調整分段與版本策略。 - 回歸測試與監控 - 建立任務級基準(答案正確率、格式合規率、延遲、每回成本);出現長尾重試時,調整超時與退避策略。 - 快速計算公式 - 總成本 ≈ 輸入_tokens × $0.000002 + 輸出_tokens × $0.000006 + 快取重用_tokens × 折扣係數 × $0.000002 - 其中折扣係數示例:0.25(若重用按 25% 輸入單價計費);實際值以產品文檔為準。 如需基於您實際上下文長度、工具輪次與快取策略的專屬測算,請提供典型對話/任務的 token 分佈與流程,我可按上述價格基準給出精確成本表。