TL;DR Qwen 3.8 Max berharga $2 bagi setiap 1 juta token input dan $6 bagi setiap 1 juta token output di QwenCloud. Kadar cache khusus model ialah $0.25/M untuk input cache tersirat, $2.50/M untuk penciptaan cache eksplisit, dan $0.17/M untuk bacaan cache eksplisit.
Kadar token standard yang sama terpakai merentasi tetingkap konteks 1M token yang disokong model. Prompt yang lebih besar menelan kos lebih kerana mengandungi lebih banyak token, bukan kerana memasuki aras harga konteks panjang yang lebih tinggi.
Pada harga senarai, Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max. Namun, Qwen 3.7 Max lebih murah sementara promosi 50% semasanya masih aktif. Pilihan produksi yang lebih baik bergantung pada kos per tugasan diterima, termasuk penaakulan, hit cache, alat, percubaan semula, kependaman, dan semakan manusia.
Harga API Qwen 3.8 Max Sekilas Pandang
| Butiran | Nilai rasmi semasa |
|---|---|
| ID model produksi | qwen3.8-max |
| Tarikh keluaran rasmi | August 3, 2026 |
| Seni bina | 2.4T jumlah parameter; 95B parameter aktif |
| Harga input standard | $2 / 1M token |
| Harga output standard | $6 / 1M token |
| Input cache tersirat | $0.25 / 1M token |
| Penciptaan cache eksplisit | $2.50 / 1M token |
| Bacaan cache eksplisit | $0.17 / 1M token |
| Tetingkap konteks | 1M token |
| Input maksimum | 991K tanpa penaakulan; 983K dengan penaakulan |
| Output maksimum | 131K |
| Penaakulan maksimum | 262K |
| Modaliti input | Teks, imej, dan video |
| Modaliti output | Teks |
| Had rujukan QwenCloud | 2M TPM dan 15K RPM |
Halaman model QwenCloud ialah sumber paling langsung untuk ID model semasa, harga, kadar cache, had konteks, dan modaliti. Kuota khusus akaun dan wilayah mungkin berbeza, jadi gunakan had yang ditunjukkan dalam konsol anda sendiri apabila menetapkan keupayaan produksi serentak.
Keluaran produksi juga menggantikan pengecam pratonton dengan qwen3.8-max dan menambah kad kadar khusus model yang lengkap. Bahan pelancaran Qwen menerangkan tetapan usaha penaakulan low, medium, dan xhigh, tetapi tingkah laku produksi harus disahkan terhadap titik akhir dan rujukan API yang anda gunakan.
Nota sensitif masa: Qwen mengumumkan bahawa open weights akan menyusul selepas keluaran API. Sehingga August 4, 2026, jangan huraikan Qwen 3.8 Max sebagai boleh dimuat turun atau dihoskan sendiri sehingga titik semak dan lesen rasmi diterbitkan.
Cara Harga Qwen 3.8 Max Berfungsi
QwenCloud kini menyenaraikan kadar standard rata $2 bagi setiap 1M token input dan $6 bagi setiap 1M token output merentasi tetingkap konteks 1M token yang disokong Qwen 3.8 Max. Petikan harga rasmi di bawah telah diambil pada August 4, 2026; sentiasa semak halaman model langsung sebelum membuat keputusan bajet produksi.

Sumber***:*** QwenCloud, “Qwen3.8-Max” official
| Item bil | Harga per 1M token | Apabila dikenakan |
|---|---|---|
| Input standard | $2.00 | Kandungan prompt baharu, definisi alat, dan konteks tidak di-cache |
| Output standard | $6.00 | Output yang dijana dan penggunaan penaakulan yang dibilkan |
| Hit cache tersirat | $0.25 | Prefiks prompt diguna semula secara automatik; hit tidak dijamin |
| Penciptaan cache eksplisit | $2.50 | Mewujudkan prefiks prompt boleh guna semula yang ditanda |
| Bacaan cache eksplisit | $0.17 | Menggunakan semula blok cache eksplisit yang sah |
Oleh itu, permintaan 900K token menelan kos lebih daripada permintaan 100K token kerana memproses sembilan kali lebih banyak token—bukan kerana memasuki aras harga yang lebih tinggi.
Penaakulan boleh meningkatkan kos output
Jawapan ringkas yang kelihatan tidak semestinya jawapan berharga rendah. Panggilan dengan penaakulan mungkin menjana token penaakulan tambahan, jadi anggaran produksi harus menggunakan medan penggunaan yang dikembalikan oleh API dan bukan panjang respons yang kelihatan.
Di tempat titik akhir anda menyokong kawalan penaakulan untuk qwen3.8-max, bandingkan tetapan yang tersedia pada set penilaian yang sama. Jangan anggap lalai pratonton dibawa ke model GA.
Penjimatan cache bergantung pada kestabilan prompt
Halaman model Qwen 3.8 Max menerbitkan kadar cache khusus model. Gunakan kadar tersebut—bukan nisbah cache generik—apabila menganggar perbelanjaan.
Entri cache eksplisit mempunyai tempoh kesahan lima minit, dan hit yang berjaya menetapkan semula tempoh tersebut. Cache tersirat adalah automatik, tetapi hit tidak dijamin. Caching paling berguna apabila prompt sistem, definisi alat, konteks repositori, atau dokumen besar kekal stabil merentasi panggilan kerap.
Alat terbina dalam menghasilkan caj berasingan
QwenCloud kini menyenaraikan yuran alat berikut sebagai tambahan kepada penggunaan token:
| Alat terbina dalam | Yuran semasa |
|---|---|
| Carian Web | $10 / 1K panggilan |
| Carian Imej | $8 / 1K panggilan |
| Pengekstrak Web | Percuma untuk masa terhad |
| Pentafsir Kod | Percuma untuk masa terhad |
Function calling dan MCP tidak mempunyai yuran alat berasingan, tetapi keterangan alat masih dikira sebagai token input. Promosi alat percuma mungkin berubah, jadi semak panduan harga QwenCloud sebelum memuktamadkan bajet produksi.
Sebagai contoh, permintaan dengan 20K token input, 2K token output, dan dua panggilan Carian Web menelan kos kira-kira:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
Dalam contoh ini, dua panggilan carian menyumbang kira-kira 27.8% daripada jumlah kos permintaan.
Contoh Kos Dunia Sebenar Qwen 3.8 Max
Contoh ini menggunakan kadar khusus model QwenCloud semasa. Ia tidak termasuk cukai, percubaan semula, fallback, dan markup khusus penyedia.
Contoh 1: Permintaan ejen sederhana
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Percubaan pertama yang berjaya berharga kira-kira $0.13. Satu percubaan semula penuh akan meningkatkan kos model kepada kira-kira $0.26.
Contoh 2: Analisis dokumen panjang
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Model tidak mengenakan surcaj konteks panjang yang berasingan pada kad kadar semasanya, tetapi prompt besar masih menghasilkan kos mutlak yang ketara.
Contoh 3: Sesi ejen dengan cache
Andaikan prefiks boleh guna semula 100K token, 10K token input baharu, 5K token output, dan 50 panggilan sementara cache eksplisit kekal sah:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Anggaran penjimatan = $8.917, atau 71.3%
Anggaran penjimatan bergantung pada hit cache yang berjaya dan prefiks yang stabil. Jeda panjang atau perubahan kerap pada prompt sistem dan skema alat akan mengurangkan manfaat.
Qwen 3.8 Max vs Qwen 3.7 Max:Perbandingan Harga
Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max pada harga senarai, tetapi Qwen 3.7 Max 37.5% lebih murah sementara promosi 50% semasanya aktif.
| Model dan status harga | Input / 1M | Output / 1M | Konteks |
|---|---|---|---|
| qwen3.8-max harga standard | $2.00 | $6.00 | 1M |
| qwen3.7-max harga senarai | $2.50 | $7.50 | 1M |
| qwen3.7-max promosi semasa | $1.25 | $3.75 | 1M |
Simpan halaman model CometAPI Qwen3.7 Max sebagai fallback sementara menguji model baharu.
Harga per token hanya satu bahagian daripada keputusan. Qwen 3.8 Max masih boleh lebih ekonomik jika ia meningkatkan kejayaan percubaan pertama, menggunakan alat dengan lebih boleh dipercayai, mengurangkan percubaan semula, atau memerlukan pembetulan manusia yang lebih sedikit.
Gunakan metrik produksi ini:
Kos per tugasan diterima =
(token model + panggilan alat + percubaan semula + perbelanjaan fallback + kos semakan)
÷ output yang diterima
Keuntungan penanda aras yang dilaporkan vendor ialah alasan untuk menilai semula aliran kerja pengekodan dan profesional yang mencabar, bukan bukti bahawa setiap beban kerja Qwen 3.7 harus berpindah.
Cara Migrasi ke Qwen 3.8 Max
Menukar rentetan model adalah perlu, tetapi ia bukan migrasi produksi yang lengkap.
1. Uji ID model produksi
Gantikan pengecam pratonton dengan qwen3.8-max dalam persekitaran ujian. Jangan anggap alias, lalai, kependaman, atau tingkah laku respons pratonton akan kekal tidak berubah.
Permintaan minimum yang serasi dengan OpenAI boleh kelihatan seperti berikut:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Mulakan dengan permintaan minimum yang didokumenkan. Tambah kawalan penaakulan hanya apabila rujukan API semasa untuk titik akhir anda jelas menyokongnya.
2. Tetapkan semula garis asas telemetri kos dan prestasi
Rekod sekurang-kurangnya:
- token input, output, dan penaakulan
- hit cache dan token penciptaan cache
- masa ke token pertama dan jumlah kependaman
- panggilan alat, percubaan semula, dan fallback
- output diterima berbanding ditolak
- masa pembetulan manusia
3. Uji semula antara muka yang digunakan aplikasi anda
Sahkan acara penstriman, payload multimodal, skema alat, output berstruktur, sebab tamat, medan penggunaan, pengendalian ralat, dan tingkah laku pelbagai pusingan. Halaman model produksi mendokumenkan akses serasi DashScope dan OpenAI; sahkan sebarang lapisan keserasian tambahan sebelum bergantung padanya.
4. Hormati had konteks praktikal
Tetingkap konteks 1M tidak sama dengan prompt pengguna 1M token. QwenCloud menyenaraikan input maksimum 991K tanpa penaakulan dan 983K dengan penaakulan. Tambah margin keselamatan supaya permintaan masih mempunyai ruang untuk output dan penaakulan.
5. Jalankan Qwen 3.7 dan Qwen 3.8 secara selari
Gunakan prompt, alat, validator, peraturan percubaan semula, dan set data yang sama. Bandingkan kos per tugasan diterima dan kependaman dan bukannya menilai respons terpencil secara visual.
Cara Menilai dan Menghala Qwen 3.8 Max
Gunakan beban kerja sebenar dan bukannya purata penanda aras yang luas.
| Beban kerja | Tugasan dicadangkan | Isyarat penerimaan utama |
|---|---|---|
| Pengkodan repositori | 4 | Ujian lulus tanpa tampalan manusia |
| Analisis dokumen panjang | 3 | Dakwaan disokong oleh bukti yang dibekalkan |
| Analisis multimodal | 2 | Perincian imej atau video yang relevan digunakan dengan betul |
| Ejen menggunakan alat | 3 | Pemilihan alat yang betul dan argumen yang sah |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Gunakan Qwen 3.8 Max untuk kerja repositori yang sukar, ejen jangka panjang, analisis multimodal, dan aliran kerja di mana Qwen 3.7 gagal ujian penerimaan. Kekalkan Qwen 3.7 Max apabila promosi menurunkan kos dengan ketara dan model sedia ada sudah memenuhi sasaran kualiti anda.
Semak halaman harga CometAPI dan maklumat penghalaan langsung sebelum menetapkan ambang kerana ketersediaan penyedia dan harga penghalaan boleh berubah secara bebas daripada harga senarai langsung QwenCloud. CometAPI Cookbook boleh membantu anda membina permintaan yang boleh diulang dan rangka kerja penilaian yang konsisten.
Soalan Lazim
Berapakah kos API Qwen 3.8 Max?
QwenCloud kini menyenaraikan Qwen 3.8 Max pada $2 bagi setiap 1 juta token input dan $6 bagi setiap 1 juta token output. Penggunaan cache dan alat terbina dalam mempunyai kadar berasingan.
Adakah Qwen 3.8 Max lebih mahal melebihi 128K token?
Tiada aras konteks panjang berasingan ditunjukkan pada kad kadar khusus model semasa. Permintaan panjang menelan kos lebih kerana ia mengandungi lebih banyak token, bukan kerana ia melintasi aras harga unit yang lebih tinggi.
Adakah token penaakulan Qwen 3.8 Max dibilkan?
Penaakulan boleh meningkatkan penggunaan yang dijana dan jumlah kos. Gunakan medan token penaakulan dan output yang dikembalikan oleh titik akhir dan bukannya menganggar daripada jawapan yang kelihatan.
Adakah Qwen 3.8 Max sumber terbuka?
Qwen mengumumkan bahawa open weights akan menyusul selepas keluaran API. Jangan huraikan model sebagai boleh dimuat turun atau dihoskan sendiri sehingga titik semak dan lesen rasmi tersedia.
Patutkah pengguna Qwen 3.7 Max berpindah serta-merta?
Tidak secara automatik. Qwen 3.8 Max mempunyai harga senarai standard yang lebih rendah, manakala Qwen 3.7 Max lebih murah semasa promosinya. Berpindah apabila data kualiti, kependaman, tingkah laku cache, dan kos per tugasan diterima anda sendiri menyokong perubahan tersebut.
Uji Qwen 3.8 Max Dengan CometAPI
Gunakan CometAPI Quickstart untuk mengkonfigurasi klien serasi OpenAI. Sebelum menghantar trafik produksi, sahkan bahawa qwen3.8-max aktif dalam akaun anda dan sahkan harga penghalaan yang dipaparkan di sana.
Bandingkan dengan garis dasar Qwen 3.7 anda menggunakan prompt, validator, dasar percubaan semula, dan telemetri yang sama. Ini memastikan penilaian memfokuskan pada model dan bukannya perubahan dalam rangka ujian.
