TL;DR Qwen 3.8 Max berbiaya $2 per 1 juta token input dan $6 per 1 juta token output di QwenCloud. Tarif cache khusus model adalah $0.25/M untuk input yang dicache secara implisit, $2.50/M untuk pembuatan cache eksplisit, dan $0.17/M untuk pembacaan cache eksplisit.
Tarif token standar yang sama berlaku di seluruh jendela konteks 1M token yang didukung model. Prompt yang lebih besar berbiaya lebih tinggi karena berisi lebih banyak token, bukan karena masuk ke tingkat harga konteks panjang yang lebih tinggi.
Pada harga daftar, Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max. Namun, Qwen 3.7 Max lebih murah selama promosi 50% saat ini tetap aktif. Pilihan produksi yang lebih baik bergantung pada biaya per tugas yang diterima, termasuk reasoning, hit cache, alat, percobaan ulang, latensi, dan tinjauan manusia.
Sekilas Harga API Qwen 3.8 Max
| Item | Nilai resmi saat ini |
|---|---|
| ID model produksi | qwen3.8-max |
| Tanggal rilis resmi | August 3, 2026 |
| Arsitektur | 2.4T total parameters; 95B active parameters |
| Harga standar input | $2 / 1M token |
| Harga standar output | $6 / 1M token |
| Input cache implisit | $0.25 / 1M token |
| Pembuatan cache eksplisit | $2.50 / 1M token |
| Pembacaan cache eksplisit | $0.17 / 1M token |
| Jendela konteks | 1M token |
| Input maksimum | 991K tanpa reasoning; 983K dengan reasoning |
| Output maksimum | 131K |
| Reasoning maksimum | 262K |
| Modalitas input | Teks, gambar, dan video |
| Modalitas output | Teks |
| Batas referensi QwenCloud | 2M TPM dan 15K RPM |
Halaman model QwenCloud adalah sumber paling langsung untuk ID model saat ini, harga, tarif cache, batas konteks, dan modalitas. Kuota spesifik akun dan wilayah dapat berbeda, jadi gunakan batas yang ditampilkan di konsol Anda sendiri saat menetapkan konkurensi produksi.
Rilis produksi juga mengganti pengenal pratinjau dengan qwen3.8-max dan menambahkan kartu tarif khusus model yang lengkap. Materi peluncuran Qwen menggambarkan pengaturan upaya reasoning low, medium, dan xhigh, tetapi perilaku produksi harus diverifikasi terhadap endpoint dan referensi API yang benar-benar Anda gunakan.
Catatan sensitif waktu: Qwen mengumumkan bahwa bobot terbuka akan menyusul rilis API. Per August 4, 2026, jangan menggambarkan Qwen 3.8 Max sebagai dapat diunduh atau di-host sendiri sampai checkpoint dan lisensi resmi dipublikasikan.
Cara Kerja Harga Qwen 3.8 Max
QwenCloud saat ini mencantumkan tarif standar flat $2 per 1M token input dan $6 per 1M token output di seluruh jendela konteks 1M token yang didukung Qwen 3.8 Max. Snapshot harga resmi di bawah ini diambil pada August 4, 2026; selalu periksa halaman model live sebelum membuat keputusan anggaran produksi.

Sumber***:*** QwenCloud, “Qwen3.8-Max” official
| Item penagihan | Harga per 1M token | Kapan diterapkan |
|---|---|---|
| Standar input | $2.00 | Konten prompt baru, definisi alat, dan konteks tanpa cache |
| Standar output | $6.00 | Output yang dihasilkan dan penggunaan reasoning yang ditagihkan |
| Hit cache implisit | $0.25 | Prefiks prompt yang digunakan kembali secara otomatis; hit tidak dijamin |
| Pembuatan cache eksplisit | $2.50 | Membuat prefiks prompt yang ditandai dapat digunakan kembali |
| Pembacaan cache eksplisit | $0.17 | Menggunakan kembali blok cache eksplisit yang valid |
Oleh karena itu, permintaan 900K token berbiaya lebih tinggi daripada permintaan 100K token karena memproses sembilan kali lebih banyak token input—bukan karena melintasi tingkat harga yang lebih tinggi.
Reasoning dapat meningkatkan biaya output
Jawaban terlihat yang singkat tidak selalu jawaban berbiaya rendah. Panggilan dengan reasoning dapat menghasilkan token reasoning tambahan, sehingga estimasi produksi harus menggunakan bidang penggunaan yang dikembalikan oleh API, bukan panjang respons yang terlihat.
Di mana endpoint Anda mendukung kontrol reasoning untuk qwen3.8-max, bandingkan pengaturan yang tersedia pada set evaluasi yang sama. Jangan berasumsi bahwa default pratinjau terbawa ke model GA.
Penghematan cache bergantung pada stabilitas prompt
Halaman model Qwen 3.8 Max mempublikasikan tarif cache khusus model. Gunakan tarif tersebut—bukan rasio cache generik—saat memperkirakan pengeluaran.
Entri cache eksplisit memiliki masa berlaku lima menit, dan hit yang berhasil akan mengatur ulang periode tersebut. Caching bersifat otomatis untuk implisit, tetapi hit tidak dijamin. Caching paling berguna ketika prompt sistem, definisi alat, konteks repositori, atau dokumen besar tetap stabil di banyak panggilan.
Alat bawaan menimbulkan biaya terpisah
QwenCloud saat ini mencantumkan biaya alat berikut selain penggunaan token:
| Alat bawaan | Biaya saat ini |
|---|---|
| Web Search | $10 / 1K panggilan |
| Image Search | $8 / 1K panggilan |
| Web Extractor | Gratis untuk waktu terbatas |
| Code Interpreter | Gratis untuk waktu terbatas |
Pemanggilan fungsi dan MCP tidak memiliki biaya alat terpisah, tetapi deskripsi alat tetap dihitung sebagai token input. Promosi alat gratis dapat berubah, jadi periksa panduan harga QwenCloud sebelum menyelesaikan anggaran produksi.
Sebagai contoh, permintaan dengan 20K token input, 2K token output, dan dua panggilan Web Search berbiaya kira-kira:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
Dalam contoh ini, dua panggilan pencarian menyumbang sekitar 27,8% dari total biaya permintaan.
Contoh Biaya Dunia Nyata Qwen 3.8 Max
Contoh-contoh ini menggunakan tarif khusus model QwenCloud saat ini. Mereka mengecualikan pajak, percobaan ulang, fallback, dan markup khusus penyedia.
Contoh 1: Permintaan agen tingkat sedang
Asumsikan 50K token input dan 5K token output:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Upaya pertama yang berhasil berbiaya sekitar $0.13. Satu percobaan ulang penuh akan meningkatkan biaya model menjadi kira-kira $0.26.
Contoh 2: Analisis dokumen panjang
Asumsikan 800K token input dan 20K token output:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Model tidak menerapkan biaya terpisah konteks panjang pada kartu tarif saat ini, tetapi prompt besar tetap menghasilkan biaya absolut yang signifikan.
Contoh 3: Sesi agen dengan cache
Asumsikan prefiks 100K token yang dapat digunakan kembali, 10K token input baru, 5K token output, dan 50 panggilan saat cache eksplisit masih valid:
Panggilan pertama:
100K pembuatan cache × $2.50/M = $0.250
10K input baru × $2/M = $0.020
5K output × $6/M = $0.030
Total panggilan pertama = $0.300
Masing-masing 49 panggilan berikutnya:
100K pembacaan cache × $0.17/M = $0.017
10K input baru × $2/M = $0.020
5K output × $6/M = $0.030
Total per panggilan = $0.067
Total sesi dengan cache = $3.583
50 panggilan yang sama tanpa cache = $12.500
Penghematan estimasi = $8.917, atau 71.3%
Penghematan estimasi bergantung pada hit cache yang berhasil dan prefiks yang stabil. Jeda panjang atau perubahan sering pada prompt sistem dan skema alat akan mengurangi manfaat.
Qwen 3.8 Max vs Qwen 3.7 Max:Perbandingan Harga
Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max pada harga daftar, tetapi Qwen 3.7 Max 37,5% lebih murah saat promosi 50% saat ini aktif.
| Model dan status harga | Input / 1M | Output / 1M | Konteks |
|---|---|---|---|
| qwen3.8-max harga standar | $2.00 | $6.00 | 1M |
| qwen3.7-max harga daftar | $2.50 | $7.50 | 1M |
| qwen3.7-max promosi saat ini | $1.25 | $3.75 | 1M |
Tetap sediakan halaman model CometAPI Qwen3.7 Max sebagai fallback saat menguji model baru.
Harga per token hanyalah satu bagian dari keputusan. Qwen 3.8 Max masih bisa lebih ekonomis jika meningkatkan keberhasilan percobaan pertama, menggunakan alat lebih andal, mengurangi percobaan ulang, atau membutuhkan lebih sedikit koreksi manusia.
Gunakan metrik produksi ini:
Biaya per tugas yang diterima =
(token model + panggilan alat + percobaan ulang + pengeluaran fallback + biaya tinjauan)
÷ output yang diterima
Keuntungan benchmark yang dilaporkan vendor adalah alasan untuk menguji ulang alur kerja pengodean dan profesional yang menuntut, bukan bukti bahwa setiap beban kerja Qwen 3.7 harus bermigrasi.
Cara Migrasi ke Qwen 3.8 Max
Mengubah string model itu perlu, tetapi bukan migrasi produksi yang lengkap.
1. Uji ID model produksi
Ganti pengenal pratinjau dengan qwen3.8-max di lingkungan uji. Jangan berasumsi alias pratinjau, default, latensi, atau perilaku respons akan tetap tidak berubah.
Permintaan minimal yang kompatibel dengan OpenAI dapat terlihat seperti ini:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Mulailah dengan permintaan minimum yang didokumentasikan. Tambahkan kontrol reasoning hanya ketika referensi API saat ini untuk endpoint Anda secara eksplisit mendukungnya.
2. Kalibrasi ulang telemetri biaya dan performa
Catat setidaknya:
- token input, output, dan reasoning
- hit cache dan token pembuatan cache
- waktu ke token pertama dan total latensi
- panggilan alat, percobaan ulang, dan fallback
- output yang diterima versus ditolak
- waktu koreksi manusia
3. Uji ulang antarmuka yang digunakan aplikasi Anda
Validasi event streaming, payload multimodal, skema alat, output terstruktur, alasan selesai, bidang penggunaan, penanganan error, dan perilaku multi-turn. Halaman model produksi mendokumentasikan akses yang kompatibel dengan DashScope dan OpenAI; verifikasi setiap lapisan kompatibilitas tambahan sebelum mengandalkannya.
4. Hormati batas konteks praktis
Jendela konteks 1M bukanlah prompt pengguna 1M token yang sama. QwenCloud mencantumkan input maksimum 991K tanpa reasoning dan 983K dengan reasoning. Tambahkan margin aman agar permintaan masih memiliki ruang untuk output dan reasoning.
5. Jalankan Qwen 3.7 dan Qwen 3.8 berdampingan
Gunakan prompt, alat, validator, aturan percobaan ulang, dan dataset yang identik. Bandingkan biaya per tugas yang diterima dan latensi alih-alih menilai respons terisolasi dengan mata.
Cara Mengevaluasi dan Merutekan Qwen 3.8 Max
Gunakan beban kerja nyata alih-alih rata-rata benchmark yang luas.
| Beban kerja | Tugas yang disarankan | Sinyal penerimaan utama |
|---|---|---|
| Pengodean repositori | 4 | Tes lulus tanpa penambalan manusia |
| Analisis dokumen panjang | 3 | Klaim didukung oleh bukti yang disediakan |
| Analisis multimodal | 2 | Detail gambar atau video yang relevan digunakan dengan benar |
| Agen yang menggunakan alat | 3 | Pemilihan alat yang benar dan argumen yang valid |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Gunakan Qwen 3.8 Max untuk pekerjaan repositori yang sulit, agen horizon panjang, analisis multimodal, dan alur kerja di mana Qwen 3.7 gagal dalam uji penerimaan. Pertahankan Qwen 3.7 Max ketika promosi secara material menurunkan biaya dan model yang ada sudah memenuhi target kualitas Anda.
Periksa halaman harga CometAPI dan informasi perutean live sebelum mengunci ambang batas karena ketersediaan penyedia dan harga yang dirutekan dapat berubah secara independen dari harga daftar langsung QwenCloud. CometAPI Cookbook dapat membantu Anda membangun permintaan yang dapat diulang dan kerangka evaluasi yang konsisten.
FAQ
Berapa biaya API Qwen 3.8 Max?
QwenCloud saat ini mencantumkan Qwen 3.8 Max pada $2 per 1 juta token input dan $6 per 1 juta token output. Penggunaan cache dan alat bawaan memiliki tarif terpisah.
Apakah Qwen 3.8 Max lebih mahal di atas 128K token?
Tidak ada tingkat konteks panjang terpisah yang ditampilkan pada kartu tarif khusus model saat ini. Permintaan panjang berbiaya lebih tinggi karena berisi lebih banyak token, bukan karena melintasi tingkat harga per unit yang lebih tinggi.
Apakah token reasoning Qwen 3.8 Max ditagihkan?
Reasoning dapat meningkatkan penggunaan yang dihasilkan dan total biaya. Gunakan bidang token reasoning dan output yang dikembalikan oleh endpoint daripada memperkirakan dari jawaban yang terlihat.
Apakah Qwen 3.8 Max bersifat open source?
Qwen mengumumkan bahwa bobot terbuka akan menyusul rilis API. Jangan menggambarkan model sebagai dapat diunduh atau di-host sendiri sampai checkpoint dan lisensi resmi tersedia.
Haruskah pengguna Qwen 3.7 Max segera bermigrasi?
Tidak secara otomatis. Qwen 3.8 Max memiliki harga standar daftar yang lebih rendah, sementara Qwen 3.7 Max lebih murah selama promosi saat ini. Bermigrasilah ketika data kualitas, latensi, perilaku cache, dan biaya per tugas yang diterima milik Anda sendiri mendukung perubahan tersebut.
Uji Qwen 3.8 Max Dengan CometAPI
Gunakan CometAPI Quickstart untuk mengonfigurasi klien yang kompatibel dengan OpenAI. Sebelum mengirim trafik produksi, konfirmasi bahwa qwen3.8-max sudah live di akun Anda dan verifikasi harga yang dirutekan yang ditampilkan di sana.
Bandingkan dengan baseline Qwen 3.7 Anda menggunakan prompt, validator, kebijakan percobaan ulang, dan telemetri yang identik. Ini menjaga evaluasi tetap fokus pada model alih-alih perubahan pada harness uji.
