TL;DR Qwen 3.8 Max は、QwenCloud 上で1 million 個の入力トークンあたり $2、1 million 個の出力トークンあたり $6。モデル固有のキャッシュ単価は、暗黙キャッシュ入力 $0.25/M、明示キャッシュ作成 $2.50/M、明示キャッシュ読み取り $0.17/M。
同一の標準トークン単価が、モデルがサポートする1M-token コンテキストウィンドウ全体に適用されます。長いプロンプトはトークン数が多いために高くつきますが、より高い長コンテキスト価格帯に入るからではありません。
定価ベースでは、Qwen 3.8 Max はQwen 3.7 Max より 20% 安価です。ただし、Qwen 3.7 Max は現在の 50% プロモーションが有効な間はより安価です。より良い本番選択は、推論、キャッシュヒット、ツール、リトライ、レイテンシ、人間レビューを含む受理タスクあたりコストに依存します。
Qwen 3.8 Max API 料金の概要
| Item | Current official value |
|---|---|
| Production model ID | qwen3.8-max |
| Official release date | August 3, 2026 |
| Architecture | 総パラメータ 2.4T;アクティブパラメータ 95B |
| Standard input price | $2 / 1M tokens |
| Standard output price | $6 / 1M tokens |
| Implicit cached input | $0.25 / 1M tokens |
| Explicit cache creation | $2.50 / 1M tokens |
| Explicit cache read | $0.17 / 1M tokens |
| Context window | 1M tokens |
| Maximum input | thinking なしで 991K;thinking ありで 983K |
| Maximum output | 131K |
| Maximum reasoning | 262K |
| Input modalities | テキスト、画像、動画 |
| Output modality | テキスト |
| QwenCloud reference limits | 2M TPM および 15K RPM |
QwenCloud のモデルページは、最新のモデル ID、料金、キャッシュ単価、コンテキスト上限、モダリティを確認する最も直接的な情報源です。アカウントやリージョンによってクォータが異なる場合があるため、本番の同時実行を設定する際は、ご自身のコンソールに表示される上限値を使用してください。
本番リリースでは、プレビュー識別子が qwen3.8-max に置き換えられ、モデル固有の完全なレートカードが追加されます。Qwen のローンチ資料では推論強度設定として low、medium、xhigh が説明されていますが、実際の挙動は使用するエンドポイントおよび API リファレンスに照らして検証してください。
時間に敏感な注意: Qwen は API リリースに続いてオープンウェイトを公開すると発表しました。2026 年 8 月 4 日時点では、公式のチェックポイントとライセンスが公開されるまで、Qwen 3.8 Max をダウンロード可能またはセルフホスト可能と記述しないでください。
Qwen 3.8 Max の料金の仕組み
QwenCloud は現在、Qwen 3.8 Max のサポートする 1M トークンのコンテキストウィンドウ全体にわたり、入力 1M トークンごと $2、出力 1M トークンごと $6 のフラットな標準レートを掲載しています。以下の公式の料金スナップショットは 2026 年 8 月 4 日に取得したものです。本番の予算判断の前に、必ずライブのモデルページを確認してください。

出典***:*** QwenCloud「Qwen3.8-Max」公式
| Billing item | Price per 1M tokens | When it applies |
|---|---|---|
| Standard input | $2.00 | 新規プロンプト内容、ツール定義、未キャッシュのコンテキスト |
| Standard output | $6.00 | 生成出力および課金対象の推論使用量 |
| Implicit cache hit | $0.25 | 自動的に再利用されるプロンプト接頭辞;ヒットは保証されない |
| Explicit cache creation | $2.50 | マークされた再利用可能なプロンプト接頭辞の作成 |
| Explicit cache read | $0.17 | 有効な明示キャッシュブロックの再利用 |
したがって、900K トークンのリクエストは 100K トークンのリクエストより高くなります。これは処理する入力トークンが 9 倍であるためであり、より高い価格帯に跨るからではありません。
推論は出力コストを増加させうる
見た目に短い回答が常に低コストとは限りません。推論を有効化した呼び出しでは追加の推論トークンが生成される可能性があるため、目視の回答長ではなく、API が返す使用量フィールドに基づいて本番の見積もりを行ってください。
エンドポイントが qwen3.8-max の推論制御をサポートしている場合は、同一の評価セットで利用可能な設定を比較してください。プレビューのデフォルトが GA モデルに引き継がれると仮定しないでください。
キャッシュの節約効果はプロンプトの安定性に依存
Qwen 3.8 Max のモデルページは、モデル固有のキャッシュ単価を公開しています。支出の見積もりには一般的なキャッシュ比率ではなく、これらの単価を使用してください。
明示キャッシュの有効期間は 5 分で、ヒットすると有効期間がリセットされます。暗黙キャッシュは自動ですが、ヒットは保証されません。システムプロンプト、ツール定義、リポジトリコンテキスト、あるいは大きな文書が頻繁な呼び出し間で安定している場合に、キャッシュは最も有用です。
組み込みツールには別料金が発生
QwenCloud は現在、トークン使用量に加えて次のツール料金を掲載しています。
| Built-in tool | Current fee |
|---|---|
| Web Search | $10 / 1K calls |
| Image Search | $8 / 1K calls |
| Web Extractor | 期間限定で無料 |
| Code Interpreter | 期間限定で無料 |
関数呼び出しや MCP にツール料金はありませんが、ツールの説明は入力トークンとして計上されます。無料プロモーションは変更されうるため、本番予算を確定する前にQwenCloud の料金ガイドを確認してください。
例えば、20K の入力トークン、2K の出力トークン、Web Search を 2 回呼び出すリクエストの概算コストは次のとおりです。
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
この例では、2 回の検索呼び出しが総コストの約 27.8% を占めます。
Qwen 3.8 Max の実コスト例
これらの例は現在の QwenCloud のモデル固有単価を用いています。税金、リトライ、フォールバック、プロバイダ固有のマークアップは除外しています。
例 1: 中規模エージェントのリクエスト
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
最初の試行が成功した場合、コストは約**$0.13です。完全なリトライを 1 回行うと、モデルコストはおよそ$0.26**に増加します。
例 2: 長文書の分析
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
現行のレートカードでは、長コンテキストに対する別料金は適用されませんが、大きなプロンプトは絶対額として相応のコストを生みます。
例 3: キャッシュを用いたエージェントセッション
再利用可能な 100K トークンの接頭辞、10K の新規入力トークン、5K の出力トークン、明示キャッシュが有効な間に 50 回の呼び出しを想定:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
推定節約額 = $8.917, または 71.3%
この推定節約額は、キャッシュヒットの成功と接頭辞の安定性に依存します。長い間隔やシステムプロンプトやツールスキーマの頻繁な変更は効果を減少させます。
Qwen 3.8 Max と Qwen 3.7 Max:価格比較
定価では Qwen 3.8 Max は Qwen 3.7 Max より 20% 安価ですが、現在の 50% プロモーション中は Qwen 3.7 Max のほうが 37.5% 安価です。
| Model and pricing status | Input / 1M | Output / 1M | Context |
|---|---|---|---|
| qwen3.8-max standard price | $2.00 | $6.00 | 1M |
| qwen3.7-max list price | $2.50 | $7.50 | 1M |
| qwen3.7-max current promotion | $1.25 | $3.75 | 1M |
新モデルのテスト中は、CometAPI の Qwen3.7 Max モデルページをフォールバックとして手元に置いてください。
トークン単価は意思決定の一要素にすぎません。Qwen 3.8 Max が初回成功率を改善し、ツールをより確実に使用し、リトライを減らし、人手による修正が少なくて済むなら、より経済的になり得ます。
本番では次の指標を使用してください:
受理タスクあたりコスト =
(モデルトークン + ツール呼び出し + リトライ + フォールバック費用 + レビューコスト)
÷ 受理された出力
ベンダー報告のベンチマーク向上は、厳しいコーディングやプロフェッショナル業務の再評価を促す理由にはなりますが、Qwen 3.7 のすべてのワークロードが移行すべきことの証拠ではありません。
Qwen 3.8 Max への移行方法
モデル文字列の変更は必要ですが、それだけでは完全な本番移行にはなりません。
1. 本番モデル ID をテストする
テスト環境でプレビュー識別子を qwen3.8-max に置き換えます。プレビューのエイリアス、デフォルト、レイテンシ、応答挙動がそのまま維持されると仮定しないでください。
最小構成の OpenAI 互換リクエストは次のようになります。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
ドキュメントに記載された最小限のリクエストから始めてください。現在使用中のエンドポイントの API リファレンスが明示的にサポートしている場合にのみ、推論制御を追加してください。
2. コストとパフォーマンスのテレメトリを再ベースライン化
最低限、次を記録します:
- 入力トークン、出力トークン、推論トークン
- キャッシュヒットとキャッシュ作成トークン
- 最初のトークンまでの時間と総レイテンシ
- ツール呼び出し、リトライ、フォールバック
- 受理出力と却下出力の比率
- 人手による修正時間
3. アプリケーションが使用するインターフェースを再テスト
ストリーミングイベント、マルチモーダルペイロード、ツールスキーマ、構造化出力、終了理由、使用量フィールド、エラーハンドリング、マルチターン挙動を検証します。本番モデルページは DashScope と OpenAI 互換のアクセスについて記載しています。追加の互換レイヤーを使う場合は、本番依存前に検証してください。
4. 現実的なコンテキスト上限を順守
1M のコンテキストウィンドウは、1M トークンのユーザープロンプトと同義ではありません。QwenCloud は、thinking なしの最大入力を 991K、thinking ありで 983K としています。出力と推論のための余地が残るよう、安全マージンを確保してください。
5. Qwen 3.7 と Qwen 3.8 を並行運用
同一のプロンプト、ツール、バリデータ、リトライルール、データセットを用い、受理タスクあたりコストとレイテンシで比較してください。目視で単発の応答を評価して判断しないこと。
Qwen 3.8 Max の評価とルーティング方法
広範なベンチマーク平均ではなく、実際のワークロードを使用してください。
| Workload | Suggested tasks | Primary acceptance signal |
|---|---|---|
| Repository coding | 4 | テストが人手の修正なしで合格する |
| Long-document analysis | 3 | 主張が提供された根拠に裏付けられている |
| Multimodal analysis | 2 | 画像または動画の関連する詳細が正しく用いられている |
| Tool-using agents | 3 | 適切なツール選択と有効な引数 |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
困難なリポジトリ作業、長期的なエージェント、マルチモーダル分析、Qwen 3.7 が受理テストに失敗するワークフローには、Qwen 3.8 Max を使用してください。プロモーションで大幅にコストが下がり、既存モデルがすでに品質目標を満たしている場合は、Qwen 3.7 Max を維持します。
しきい値の固定前にCometAPI の料金ページとライブのルーティング情報を確認してください。プロバイダの可用性とルーティング価格は、QwenCloud の直接の掲示価格と独立して変動し得ます。CometAPI Cookbookは、再現性のあるリクエストと一貫した評価ハーネスの構築に役立ちます。
FAQ
Qwen 3.8 Max API の料金はいくらですか?
QwenCloud は現在、Qwen 3.8 Max を入力 1 million トークンあたり $2、出力 1 million トークンあたり $6と掲載しています。キャッシュ利用と組み込みツールには別の単価が適用されます。
128K トークンを超えると Qwen 3.8 Max は高くなりますか?
現在のモデル固有レートカードに別の長コンテキスト料金帯は表示されていません。長いリクエストが高くつくのは、より多くのトークンを含むためであり、単価の高い帯に入るからではありません。
Qwen 3.8 Max の推論トークンは課金対象ですか?
推論により生成使用量および総コストが増える可能性があります。目視の回答長ではなく、エンドポイントが返す推論トークンおよび出力トークンのフィールドを使用してください。
Qwen 3.8 Max はオープンソースですか?
Qwen は API リリースに続きオープンウェイトを公開すると発表しました。公式チェックポイントとライセンスが利用可能になるまで、ダウンロード可能またはセルフホスト可能と記述しないでください。
Qwen 3.7 Max のユーザーは今すぐ移行すべきですか?
自動的に、というわけではありません。Qwen 3.8 Max は標準のリスト価格が低い一方、現在のプロモーション期間中は Qwen 3.7 Max のほうが安価です。品質、レイテンシ、キャッシュ挙動、受理タスクあたりコストといった自組織のデータが移行を支持する場合に移行してください。
CometAPI で Qwen 3.8 Max を試す
CometAPI クイックスタートを用いて、OpenAI 互換クライアントを設定します。本番トラフィックを送る前に、qwen3.8-max がアカウントで利用可能であることと、そこに表示されるルーティング先の価格を確認してください。
同一のプロンプト、バリデータ、リトライポリシー、テレメトリを用いて Qwen 3.7 のベースラインと比較し、評価がテストハーネスの変更ではなくモデルに焦点が当たるようにしてください。
