GPT-5.6 Luna price down 80%, Terra down 20% →

Harga API Qwen 3.8 Max: $2 Input, $6 Output, Konteks 1M

CometAPI
Mia MarenAug 4, 2026
Harga API Qwen 3.8 Max: $2 Input, $6 Output, Konteks 1M

Harga API Qwen 3.8 Max: $2 untuk Input, $6 untuk Output, Konteks 1M

TL;DR

Qwen 3.8 Max berharga $2 per 1 juta token input dan $6 per 1 juta token output di QwenCloud. Tarif cache khusus model adalah $0.25/M untuk input yang di-cache secara implisit, $2.50/M untuk pembuatan cache eksplisit, dan $0.17/M untuk pembacaan cache eksplisit.

Tarif token standar yang sama berlaku di seluruh jendela konteks 1M token yang didukung model. Prompt yang lebih besar biayanya lebih tinggi karena berisi lebih banyak token, bukan karena memasuki tingkatan harga konteks panjang yang lebih tinggi.

Pada harga daftar, Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max. Namun, Qwen 3.7 Max lebih murah selama promosi 50% saat ini masih aktif. Pilihan produksi yang lebih baik bergantung pada biaya per tugas yang diterima, termasuk penalaran, hit cache, alat, retry, latensi, dan tinjauan manusia.

Sekilas Harga API Qwen 3.8 Max

ItemNilai resmi saat ini
ID model produksiqwen3.8-max
Tanggal rilis resmiAugust 3, 2026
Arsitektur2.4T total parameter; 95B parameter aktif
Harga input standar$2 / 1M token
Harga output standar$6 / 1M token
Input yang di-cache implisit$0.25 / 1M token
Pembuatan cache eksplisit$2.50 / 1M token
Pembacaan cache eksplisit$0.17 / 1M token
Jendela konteks1M token
Input maksimum991K tanpa penalaran; 983K dengan penalaran
Output maksimum131K
Penalaran maksimum262K
Modalitas inputTeks, gambar, dan video
Modalitas outputTeks
Batas referensi QwenCloud2M TPM dan 15K RPM

Halaman model QwenCloud adalah sumber paling langsung untuk ID model saat ini, harga, tarif cache, batas konteks, dan modalitas. Kuota spesifik akun dan wilayah dapat berbeda, jadi gunakan batas yang ditampilkan di konsol Anda sendiri saat menetapkan konkurensi produksi.

Rilis produksi juga mengganti pengidentifikasi pratinjau dengan qwen3.8-max dan menambahkan kartu tarif khusus model yang lengkap. Materi peluncuran Qwen mendeskripsikan pengaturan upaya penalaran low, medium, dan xhigh, tetapi perilaku produksi harus diverifikasi terhadap endpoint dan referensi API yang Anda gunakan.

Catatan sensitif waktu: Qwen mengumumkan bahwa bobot terbuka akan menyusul setelah rilis API. Per tanggal August 4, 2026, jangan gambarkan Qwen 3.8 Max sebagai dapat diunduh atau dapat di-host sendiri hingga checkpoint dan lisensi resmi dipublikasikan.

Cara Kerja Harga Qwen 3.8 Max

QwenCloud saat ini mencantumkan tarif standar flat sebesar $2 per 1M token input dan $6 per 1M token output di seluruh jendela konteks 1M token yang didukung Qwen 3.8 Max. Cuplikan harga resmi di bawah ini diambil pada August 4, 2026; selalu periksa halaman model live sebelum membuat keputusan anggaran produksi.

Harga API Qwen 3.8 Max: $2 Input, $6 Output, Konteks 1M

Sumber***:*** QwenCloud, “Qwen3.8-Max” resmi

Item penagihanHarga per 1M tokenKapan diterapkan
Input standar$2.00Konten prompt baru, definisi alat, dan konteks yang tidak di-cache
Output standar$6.00Output yang dihasilkan dan penggunaan penalaran yang ditagihkan
Hit cache implisit$0.25Prefiks prompt yang digunakan ulang secara otomatis; hit tidak dijamin
Pembuatan cache eksplisit$2.50Membuat prefiks prompt yang dapat digunakan ulang
Pembacaan cache eksplisit$0.17Menggunakan ulang blok cache eksplisit yang valid

Permintaan 900K token karena itu biayanya lebih besar daripada permintaan 100K token karena memproses sembilan kali lebih banyak token input—bukan karena melewati tingkatan harga yang lebih tinggi.

Penalaran dapat meningkatkan biaya output

Jawaban terlihat yang pendek tidak selalu berbiaya rendah. Panggilan dengan penalaran dapat menghasilkan token penalaran tambahan, jadi estimasi produksi harus menggunakan bidang penggunaan yang dikembalikan oleh API, bukan panjang respons yang terlihat.

Di mana endpoint Anda mendukung kontrol penalaran untuk qwen3.8-max, bandingkan pengaturan yang tersedia pada set evaluasi yang sama. Jangan berasumsi bahwa default pratinjau terbawa ke model GA.

Penghematan cache bergantung pada stabilitas prompt

Halaman model Qwen 3.8 Max memublikasikan tarif cache khusus model. Gunakan tarif tersebut—bukan rasio cache generik—saat memperkirakan pengeluaran.

Entri cache eksplisit memiliki masa berlaku lima menit, dan hit yang berhasil mengatur ulang periode tersebut. Caching bersifat otomatis untuk cache implisit, tetapi hit tidak dijamin. Caching paling berguna ketika prompt sistem, definisi alat, konteks repositori, atau dokumen besar tetap stabil di banyak panggilan.

Alat bawaan menimbulkan biaya terpisah

QwenCloud saat ini mencantumkan biaya alat berikut di samping penggunaan token:

Alat bawaanBiaya saat ini
Pencarian Web$10 / 1K panggilan
Pencarian Gambar$8 / 1K panggilan
Web ExtractorGratis untuk waktu terbatas
Code InterpreterGratis untuk waktu terbatas

Function calling dan MCP tidak memiliki biaya alat terpisah, tetapi deskripsi alat tetap dihitung sebagai token input. Promosi alat gratis dapat berubah, jadi periksa panduan harga QwenCloud sebelum memfinalisasi anggaran produksi.

Sebagai contoh, permintaan dengan 20K token input, 2K token output, dan dua panggilan Pencarian Web berbiaya kira-kira:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

Dalam contoh ini, dua panggilan pencarian menyumbang sekitar 27.8% dari total biaya permintaan.

Contoh Biaya Qwen 3.8 Max di Dunia Nyata

Contoh ini menggunakan tarif khusus model QwenCloud saat ini. Mereka tidak termasuk pajak, retry, fallback, dan markup spesifik penyedia.

Contoh 1: Permintaan agen medium

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Upaya pertama yang berhasil berbiaya sekitar $0.13. Satu retry penuh akan meningkatkan biaya model menjadi kira-kira $0.26.

Contoh 2: Analisis dokumen panjang

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Model tidak menerapkan biaya tambahan konteks panjang pada kartu tarif saat ini, tetapi prompt besar tetap menciptakan biaya absolut yang substansial.

Contoh 3: Sesi agen dengan cache

Asumsikan prefiks yang dapat digunakan ulang 100K token, 10K token input baru, 5K token output, dan 50 panggilan saat cache eksplisit masih valid:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Perkiraan penghematan = $8.917, atau 71.3%

Perkiraan penghematan bergantung pada hit cache yang berhasil dan prefiks yang stabil. Jeda panjang atau perubahan sering terhadap prompt sistem dan skema alat akan mengurangi manfaat.

Qwen 3.8 Max vs Qwen 3.7 Max:Perbandingan Harga

Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max pada harga daftar, tetapi Qwen 3.7 Max 37.5% lebih murah selama promosi 50% saat ini aktif.

Model dan status hargaInput / 1MOutput / 1MKonteks
qwen3.8-max harga standar$2.00$6.001M
qwen3.7-max harga daftar$2.50$7.501M
qwen3.7-max promosi saat ini$1.25$3.751M

Simpan halaman model CometAPI Qwen3.7 Max sebagai fallback saat menguji model baru.

Harga per token hanyalah satu bagian dari keputusan. Qwen 3.8 Max masih bisa lebih ekonomis jika meningkatkan keberhasilan-pass-pertama, menggunakan alat lebih andal, mengurangi retry, atau membutuhkan lebih sedikit koreksi manusia.

Gunakan metrik produksi ini:

Biaya per tugas yang diterima =

(token model + panggilan alat + retry + pengeluaran fallback + biaya tinjauan)

÷ output yang diterima

Peningkatan benchmark yang dilaporkan vendor adalah alasan untuk menguji ulang alur kerja coding dan profesional yang menuntut, bukan bukti bahwa setiap beban kerja Qwen 3.7 harus bermigrasi.

Cara Bermigrasi ke Qwen 3.8 Max

Mengubah string model itu perlu, tetapi bukan migrasi produksi yang lengkap.

1. Uji ID model produksi

Ganti pengidentifikasi pratinjau dengan qwen3.8-max di lingkungan pengujian. Jangan berasumsi alias pratinjau, default, latensi, atau perilaku respons akan tetap tidak berubah.

Permintaan yang kompatibel dengan OpenAI minimum dapat terlihat seperti ini:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Mulailah dengan permintaan minimum yang didokumentasikan. Tambahkan kontrol penalaran hanya ketika referensi API saat ini untuk endpoint Anda secara eksplisit mendukungnya.

2. Tetapkan ulang baseline telemetri biaya dan performa

Catat setidaknya:

  • token input, output, dan penalaran
  • hit cache dan token pembuatan cache
  • waktu ke token pertama dan total latensi
  • panggilan alat, retry, dan fallback
  • output yang diterima versus ditolak
  • waktu koreksi manusia

3. Uji ulang antarmuka yang digunakan aplikasi Anda

Validasi event streaming, payload multimodal, skema alat, output terstruktur, alasan selesai, bidang penggunaan, penanganan error, dan perilaku multi-putaran. Halaman model produksi mendokumentasikan akses DashScope dan kompatibel OpenAI; verifikasi layer kompatibilitas tambahan apa pun sebelum mengandalkannya.

4. Hormati batas konteks praktis

Jendela konteks 1M bukanlah hal yang sama dengan prompt pengguna 1M token. QwenCloud mencantumkan input maksimum 991K tanpa penalaran dan 983K dengan penalaran. Tambahkan margin keamanan agar permintaan masih memiliki ruang untuk output dan penalaran.

5. Jalankan Qwen 3.7 dan Qwen 3.8 berdampingan

Gunakan prompt, alat, validator, aturan retry, dan dataset yang identik. Bandingkan biaya per tugas yang diterima dan latensi, alih-alih menilai respons terisolasi dengan mata.

Cara Mengevaluasi dan Merutekan Qwen 3.8 Max

Gunakan beban kerja nyata alih-alih rata-rata benchmark yang luas.

Beban kerjaTugas yang disarankanSinyal penerimaan utama
Pengkodean repositori4Tes lulus tanpa perbaikan manual
Analisis dokumen panjang3Klaim didukung oleh bukti yang disediakan
Analisis multimodal2Detail gambar atau video yang relevan digunakan dengan benar
Agen yang menggunakan alat3Pemilihan alat yang benar dan argumen yang valid
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Gunakan Qwen 3.8 Max untuk pekerjaan repositori yang sulit, agen long-horizon, analisis multimodal, dan alur kerja di mana Qwen 3.7 gagal uji penerimaan. Pertahankan Qwen 3.7 Max ketika promosi secara material menurunkan biaya dan model yang ada sudah memenuhi target kualitas Anda.

Periksa halaman harga CometAPI dan informasi perutean live sebelum mengunci ambang batas karena ketersediaan penyedia dan harga yang dirutekan dapat berubah secara independen dari harga langsung QwenCloud. CometAPI Cookbook dapat membantu Anda membangun permintaan yang dapat diulang dan kerangka evaluasi yang konsisten.

FAQ

Berapa biaya API Qwen 3.8 Max?

QwenCloud saat ini mencantumkan Qwen 3.8 Max pada $2 per 1 juta token input dan $6 per 1 juta token output. Penggunaan cache dan alat bawaan memiliki tarif terpisah.

Apakah Qwen 3.8 Max lebih mahal di atas 128K token?

Tidak ada tingkatan konteks panjang terpisah yang ditampilkan pada kartu tarif khusus model saat ini. Permintaan panjang biayanya lebih besar karena mengandung lebih banyak token, bukan karena melewati tingkatan harga satuan yang lebih tinggi.

Apakah token penalaran Qwen 3.8 Max ditagihkan?

Penalaran dapat meningkatkan penggunaan yang dihasilkan dan total biaya. Gunakan bidang token penalaran dan output yang dikembalikan oleh endpoint, bukan memperkirakan dari jawaban yang terlihat.

Apakah Qwen 3.8 Max bersifat open source?

Qwen mengumumkan bahwa bobot terbuka akan menyusul rilis API. Jangan gambarkan model sebagai dapat diunduh atau dapat di-host sendiri hingga checkpoint dan lisensi resmi tersedia.

Haruskah pengguna Qwen 3.7 Max segera bermigrasi?

Tidak secara otomatis. Qwen 3.8 Max memiliki harga daftar standar yang lebih rendah, sementara Qwen 3.7 Max lebih murah selama promosi saat ini. Bermigrasilah ketika data kualitas, latensi, perilaku cache, dan biaya per tugas yang diterima Anda sendiri mendukung perubahan tersebut.

Uji Qwen 3.8 Max Dengan CometAPI

Gunakan CometAPI Quickstart untuk mengonfigurasi klien yang kompatibel dengan OpenAI. Sebelum mengirim trafik produksi, konfirmasikan bahwa qwen3.8-max live di akun Anda dan verifikasi harga yang dirutekan yang ditampilkan di sana.

Bandingkan dengan baseline Qwen 3.7 Anda menggunakan prompt, validator, kebijakan retry, dan telemetri yang identik. Ini menjaga evaluasi berfokus pada model alih-alih perubahan pada harness pengujian.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya