Harga API Qwen 3.8 Max: $2 untuk Input, $6 untuk Output, Konteks 1M
TL;DR
Qwen 3.8 Max berharga $2 per 1 juta token input dan $6 per 1 juta token output di QwenCloud. Tarif cache khusus model adalah $0.25/M untuk input yang di-cache secara implisit, $2.50/M untuk pembuatan cache eksplisit, dan $0.17/M untuk pembacaan cache eksplisit.
Tarif token standar yang sama berlaku di seluruh jendela konteks 1M token yang didukung model. Prompt yang lebih besar biayanya lebih tinggi karena berisi lebih banyak token, bukan karena memasuki tingkatan harga konteks panjang yang lebih tinggi.
Pada harga daftar, Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max. Namun, Qwen 3.7 Max lebih murah selama promosi 50% saat ini masih aktif. Pilihan produksi yang lebih baik bergantung pada biaya per tugas yang diterima, termasuk penalaran, hit cache, alat, retry, latensi, dan tinjauan manusia.
Sekilas Harga API Qwen 3.8 Max
| Item | Nilai resmi saat ini |
|---|---|
| ID model produksi | qwen3.8-max |
| Tanggal rilis resmi | August 3, 2026 |
| Arsitektur | 2.4T total parameter; 95B parameter aktif |
| Harga input standar | $2 / 1M token |
| Harga output standar | $6 / 1M token |
| Input yang di-cache implisit | $0.25 / 1M token |
| Pembuatan cache eksplisit | $2.50 / 1M token |
| Pembacaan cache eksplisit | $0.17 / 1M token |
| Jendela konteks | 1M token |
| Input maksimum | 991K tanpa penalaran; 983K dengan penalaran |
| Output maksimum | 131K |
| Penalaran maksimum | 262K |
| Modalitas input | Teks, gambar, dan video |
| Modalitas output | Teks |
| Batas referensi QwenCloud | 2M TPM dan 15K RPM |
Halaman model QwenCloud adalah sumber paling langsung untuk ID model saat ini, harga, tarif cache, batas konteks, dan modalitas. Kuota spesifik akun dan wilayah dapat berbeda, jadi gunakan batas yang ditampilkan di konsol Anda sendiri saat menetapkan konkurensi produksi.
Rilis produksi juga mengganti pengidentifikasi pratinjau dengan qwen3.8-max dan menambahkan kartu tarif khusus model yang lengkap. Materi peluncuran Qwen mendeskripsikan pengaturan upaya penalaran low, medium, dan xhigh, tetapi perilaku produksi harus diverifikasi terhadap endpoint dan referensi API yang Anda gunakan.
Catatan sensitif waktu: Qwen mengumumkan bahwa bobot terbuka akan menyusul setelah rilis API. Per tanggal August 4, 2026, jangan gambarkan Qwen 3.8 Max sebagai dapat diunduh atau dapat di-host sendiri hingga checkpoint dan lisensi resmi dipublikasikan.
Cara Kerja Harga Qwen 3.8 Max
QwenCloud saat ini mencantumkan tarif standar flat sebesar $2 per 1M token input dan $6 per 1M token output di seluruh jendela konteks 1M token yang didukung Qwen 3.8 Max. Cuplikan harga resmi di bawah ini diambil pada August 4, 2026; selalu periksa halaman model live sebelum membuat keputusan anggaran produksi.

Sumber***:*** QwenCloud, “Qwen3.8-Max” resmi
| Item penagihan | Harga per 1M token | Kapan diterapkan |
|---|---|---|
| Input standar | $2.00 | Konten prompt baru, definisi alat, dan konteks yang tidak di-cache |
| Output standar | $6.00 | Output yang dihasilkan dan penggunaan penalaran yang ditagihkan |
| Hit cache implisit | $0.25 | Prefiks prompt yang digunakan ulang secara otomatis; hit tidak dijamin |
| Pembuatan cache eksplisit | $2.50 | Membuat prefiks prompt yang dapat digunakan ulang |
| Pembacaan cache eksplisit | $0.17 | Menggunakan ulang blok cache eksplisit yang valid |
Permintaan 900K token karena itu biayanya lebih besar daripada permintaan 100K token karena memproses sembilan kali lebih banyak token input—bukan karena melewati tingkatan harga yang lebih tinggi.
Penalaran dapat meningkatkan biaya output
Jawaban terlihat yang pendek tidak selalu berbiaya rendah. Panggilan dengan penalaran dapat menghasilkan token penalaran tambahan, jadi estimasi produksi harus menggunakan bidang penggunaan yang dikembalikan oleh API, bukan panjang respons yang terlihat.
Di mana endpoint Anda mendukung kontrol penalaran untuk qwen3.8-max, bandingkan pengaturan yang tersedia pada set evaluasi yang sama. Jangan berasumsi bahwa default pratinjau terbawa ke model GA.
Penghematan cache bergantung pada stabilitas prompt
Halaman model Qwen 3.8 Max memublikasikan tarif cache khusus model. Gunakan tarif tersebut—bukan rasio cache generik—saat memperkirakan pengeluaran.
Entri cache eksplisit memiliki masa berlaku lima menit, dan hit yang berhasil mengatur ulang periode tersebut. Caching bersifat otomatis untuk cache implisit, tetapi hit tidak dijamin. Caching paling berguna ketika prompt sistem, definisi alat, konteks repositori, atau dokumen besar tetap stabil di banyak panggilan.
Alat bawaan menimbulkan biaya terpisah
QwenCloud saat ini mencantumkan biaya alat berikut di samping penggunaan token:
| Alat bawaan | Biaya saat ini |
|---|---|
| Pencarian Web | $10 / 1K panggilan |
| Pencarian Gambar | $8 / 1K panggilan |
| Web Extractor | Gratis untuk waktu terbatas |
| Code Interpreter | Gratis untuk waktu terbatas |
Function calling dan MCP tidak memiliki biaya alat terpisah, tetapi deskripsi alat tetap dihitung sebagai token input. Promosi alat gratis dapat berubah, jadi periksa panduan harga QwenCloud sebelum memfinalisasi anggaran produksi.
Sebagai contoh, permintaan dengan 20K token input, 2K token output, dan dua panggilan Pencarian Web berbiaya kira-kira:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
Dalam contoh ini, dua panggilan pencarian menyumbang sekitar 27.8% dari total biaya permintaan.
Contoh Biaya Qwen 3.8 Max di Dunia Nyata
Contoh ini menggunakan tarif khusus model QwenCloud saat ini. Mereka tidak termasuk pajak, retry, fallback, dan markup spesifik penyedia.
Contoh 1: Permintaan agen medium
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Upaya pertama yang berhasil berbiaya sekitar $0.13. Satu retry penuh akan meningkatkan biaya model menjadi kira-kira $0.26.
Contoh 2: Analisis dokumen panjang
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Model tidak menerapkan biaya tambahan konteks panjang pada kartu tarif saat ini, tetapi prompt besar tetap menciptakan biaya absolut yang substansial.
Contoh 3: Sesi agen dengan cache
Asumsikan prefiks yang dapat digunakan ulang 100K token, 10K token input baru, 5K token output, dan 50 panggilan saat cache eksplisit masih valid:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Perkiraan penghematan = $8.917, atau 71.3%
Perkiraan penghematan bergantung pada hit cache yang berhasil dan prefiks yang stabil. Jeda panjang atau perubahan sering terhadap prompt sistem dan skema alat akan mengurangi manfaat.
Qwen 3.8 Max vs Qwen 3.7 Max:Perbandingan Harga
Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max pada harga daftar, tetapi Qwen 3.7 Max 37.5% lebih murah selama promosi 50% saat ini aktif.
| Model dan status harga | Input / 1M | Output / 1M | Konteks |
|---|---|---|---|
| qwen3.8-max harga standar | $2.00 | $6.00 | 1M |
| qwen3.7-max harga daftar | $2.50 | $7.50 | 1M |
| qwen3.7-max promosi saat ini | $1.25 | $3.75 | 1M |
Simpan halaman model CometAPI Qwen3.7 Max sebagai fallback saat menguji model baru.
Harga per token hanyalah satu bagian dari keputusan. Qwen 3.8 Max masih bisa lebih ekonomis jika meningkatkan keberhasilan-pass-pertama, menggunakan alat lebih andal, mengurangi retry, atau membutuhkan lebih sedikit koreksi manusia.
Gunakan metrik produksi ini:
Biaya per tugas yang diterima =
(token model + panggilan alat + retry + pengeluaran fallback + biaya tinjauan)
÷ output yang diterima
Peningkatan benchmark yang dilaporkan vendor adalah alasan untuk menguji ulang alur kerja coding dan profesional yang menuntut, bukan bukti bahwa setiap beban kerja Qwen 3.7 harus bermigrasi.
Cara Bermigrasi ke Qwen 3.8 Max
Mengubah string model itu perlu, tetapi bukan migrasi produksi yang lengkap.
1. Uji ID model produksi
Ganti pengidentifikasi pratinjau dengan qwen3.8-max di lingkungan pengujian. Jangan berasumsi alias pratinjau, default, latensi, atau perilaku respons akan tetap tidak berubah.
Permintaan yang kompatibel dengan OpenAI minimum dapat terlihat seperti ini:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Mulailah dengan permintaan minimum yang didokumentasikan. Tambahkan kontrol penalaran hanya ketika referensi API saat ini untuk endpoint Anda secara eksplisit mendukungnya.
2. Tetapkan ulang baseline telemetri biaya dan performa
Catat setidaknya:
- token input, output, dan penalaran
- hit cache dan token pembuatan cache
- waktu ke token pertama dan total latensi
- panggilan alat, retry, dan fallback
- output yang diterima versus ditolak
- waktu koreksi manusia
3. Uji ulang antarmuka yang digunakan aplikasi Anda
Validasi event streaming, payload multimodal, skema alat, output terstruktur, alasan selesai, bidang penggunaan, penanganan error, dan perilaku multi-putaran. Halaman model produksi mendokumentasikan akses DashScope dan kompatibel OpenAI; verifikasi layer kompatibilitas tambahan apa pun sebelum mengandalkannya.
4. Hormati batas konteks praktis
Jendela konteks 1M bukanlah hal yang sama dengan prompt pengguna 1M token. QwenCloud mencantumkan input maksimum 991K tanpa penalaran dan 983K dengan penalaran. Tambahkan margin keamanan agar permintaan masih memiliki ruang untuk output dan penalaran.
5. Jalankan Qwen 3.7 dan Qwen 3.8 berdampingan
Gunakan prompt, alat, validator, aturan retry, dan dataset yang identik. Bandingkan biaya per tugas yang diterima dan latensi, alih-alih menilai respons terisolasi dengan mata.
Cara Mengevaluasi dan Merutekan Qwen 3.8 Max
Gunakan beban kerja nyata alih-alih rata-rata benchmark yang luas.
| Beban kerja | Tugas yang disarankan | Sinyal penerimaan utama |
|---|---|---|
| Pengkodean repositori | 4 | Tes lulus tanpa perbaikan manual |
| Analisis dokumen panjang | 3 | Klaim didukung oleh bukti yang disediakan |
| Analisis multimodal | 2 | Detail gambar atau video yang relevan digunakan dengan benar |
| Agen yang menggunakan alat | 3 | Pemilihan alat yang benar dan argumen yang valid |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Gunakan Qwen 3.8 Max untuk pekerjaan repositori yang sulit, agen long-horizon, analisis multimodal, dan alur kerja di mana Qwen 3.7 gagal uji penerimaan. Pertahankan Qwen 3.7 Max ketika promosi secara material menurunkan biaya dan model yang ada sudah memenuhi target kualitas Anda.
Periksa halaman harga CometAPI dan informasi perutean live sebelum mengunci ambang batas karena ketersediaan penyedia dan harga yang dirutekan dapat berubah secara independen dari harga langsung QwenCloud. CometAPI Cookbook dapat membantu Anda membangun permintaan yang dapat diulang dan kerangka evaluasi yang konsisten.
FAQ
Berapa biaya API Qwen 3.8 Max?
QwenCloud saat ini mencantumkan Qwen 3.8 Max pada $2 per 1 juta token input dan $6 per 1 juta token output. Penggunaan cache dan alat bawaan memiliki tarif terpisah.
Apakah Qwen 3.8 Max lebih mahal di atas 128K token?
Tidak ada tingkatan konteks panjang terpisah yang ditampilkan pada kartu tarif khusus model saat ini. Permintaan panjang biayanya lebih besar karena mengandung lebih banyak token, bukan karena melewati tingkatan harga satuan yang lebih tinggi.
Apakah token penalaran Qwen 3.8 Max ditagihkan?
Penalaran dapat meningkatkan penggunaan yang dihasilkan dan total biaya. Gunakan bidang token penalaran dan output yang dikembalikan oleh endpoint, bukan memperkirakan dari jawaban yang terlihat.
Apakah Qwen 3.8 Max bersifat open source?
Qwen mengumumkan bahwa bobot terbuka akan menyusul rilis API. Jangan gambarkan model sebagai dapat diunduh atau dapat di-host sendiri hingga checkpoint dan lisensi resmi tersedia.
Haruskah pengguna Qwen 3.7 Max segera bermigrasi?
Tidak secara otomatis. Qwen 3.8 Max memiliki harga daftar standar yang lebih rendah, sementara Qwen 3.7 Max lebih murah selama promosi saat ini. Bermigrasilah ketika data kualitas, latensi, perilaku cache, dan biaya per tugas yang diterima Anda sendiri mendukung perubahan tersebut.
Uji Qwen 3.8 Max Dengan CometAPI
Gunakan CometAPI Quickstart untuk mengonfigurasi klien yang kompatibel dengan OpenAI. Sebelum mengirim trafik produksi, konfirmasikan bahwa qwen3.8-max live di akun Anda dan verifikasi harga yang dirutekan yang ditampilkan di sana.
Bandingkan dengan baseline Qwen 3.7 Anda menggunakan prompt, validator, kebijakan retry, dan telemetri yang identik. Ini menjaga evaluasi berfokus pada model alih-alih perubahan pada harness pengujian.
