GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Riset CometAPI

Harga API Qwen 3.8 Max: $2 Input, $6 Output, 1M Konteks

Qwen 3.8 Max mengenakan biaya $2/M untuk input dan $6/M untuk output. Bandingkan biaya cache, biaya tool, contoh nyata, batasan, serta saran migrasi Qwen 3.7.

CometAPI
Mia MarenTim riset model AI dan API
Diperbarui Sep 3, 2026 10 menit baca
Harga API Qwen 3.8 Max: $2 Input, $6 Output, 1M Konteks
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max berbiaya $2 per 1 juta token input dan $6 per 1 juta token output di QwenCloud. Tarif cache khusus model adalah $0.25/M untuk input yang dicache secara implisit, $2.50/M untuk pembuatan cache eksplisit, dan $0.17/M untuk pembacaan cache eksplisit.

Tarif token standar yang sama berlaku di seluruh jendela konteks 1M token yang didukung model. Prompt yang lebih besar berbiaya lebih tinggi karena berisi lebih banyak token, bukan karena masuk ke tingkat harga konteks panjang yang lebih tinggi.

Pada harga daftar, Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max. Namun, Qwen 3.7 Max lebih murah selama promosi 50% saat ini tetap aktif. Pilihan produksi yang lebih baik bergantung pada biaya per tugas yang diterima, termasuk reasoning, hit cache, alat, percobaan ulang, latensi, dan tinjauan manusia.

Sekilas Harga API Qwen 3.8 Max

ItemNilai resmi saat ini
ID model produksiqwen3.8-max
Tanggal rilis resmiAugust 3, 2026
Arsitektur2.4T total parameters; 95B active parameters
Harga standar input$2 / 1M token
Harga standar output$6 / 1M token
Input cache implisit$0.25 / 1M token
Pembuatan cache eksplisit$2.50 / 1M token
Pembacaan cache eksplisit$0.17 / 1M token
Jendela konteks1M token
Input maksimum991K tanpa reasoning; 983K dengan reasoning
Output maksimum131K
Reasoning maksimum262K
Modalitas inputTeks, gambar, dan video
Modalitas outputTeks
Batas referensi QwenCloud2M TPM dan 15K RPM

Halaman model QwenCloud adalah sumber paling langsung untuk ID model saat ini, harga, tarif cache, batas konteks, dan modalitas. Kuota spesifik akun dan wilayah dapat berbeda, jadi gunakan batas yang ditampilkan di konsol Anda sendiri saat menetapkan konkurensi produksi.

Rilis produksi juga mengganti pengenal pratinjau dengan qwen3.8-max dan menambahkan kartu tarif khusus model yang lengkap. Materi peluncuran Qwen menggambarkan pengaturan upaya reasoning low, medium, dan xhigh, tetapi perilaku produksi harus diverifikasi terhadap endpoint dan referensi API yang benar-benar Anda gunakan.

Catatan sensitif waktu: Qwen mengumumkan bahwa bobot terbuka akan menyusul rilis API. Per August 4, 2026, jangan menggambarkan Qwen 3.8 Max sebagai dapat diunduh atau di-host sendiri sampai checkpoint dan lisensi resmi dipublikasikan.

Cara Kerja Harga Qwen 3.8 Max

QwenCloud saat ini mencantumkan tarif standar flat $2 per 1M token input dan $6 per 1M token output di seluruh jendela konteks 1M token yang didukung Qwen 3.8 Max. Snapshot harga resmi di bawah ini diambil pada August 4, 2026; selalu periksa halaman model live sebelum membuat keputusan anggaran produksi.

Harga API Qwen 3.8 Max: $2 Input, $6 Output, 1M Konteks

Sumber***:*** QwenCloud, “Qwen3.8-Max” official

Item penagihanHarga per 1M tokenKapan diterapkan
Standar input$2.00Konten prompt baru, definisi alat, dan konteks tanpa cache
Standar output$6.00Output yang dihasilkan dan penggunaan reasoning yang ditagihkan
Hit cache implisit$0.25Prefiks prompt yang digunakan kembali secara otomatis; hit tidak dijamin
Pembuatan cache eksplisit$2.50Membuat prefiks prompt yang ditandai dapat digunakan kembali
Pembacaan cache eksplisit$0.17Menggunakan kembali blok cache eksplisit yang valid

Oleh karena itu, permintaan 900K token berbiaya lebih tinggi daripada permintaan 100K token karena memproses sembilan kali lebih banyak token input—bukan karena melintasi tingkat harga yang lebih tinggi.

Reasoning dapat meningkatkan biaya output

Jawaban terlihat yang singkat tidak selalu jawaban berbiaya rendah. Panggilan dengan reasoning dapat menghasilkan token reasoning tambahan, sehingga estimasi produksi harus menggunakan bidang penggunaan yang dikembalikan oleh API, bukan panjang respons yang terlihat.

Di mana endpoint Anda mendukung kontrol reasoning untuk qwen3.8-max, bandingkan pengaturan yang tersedia pada set evaluasi yang sama. Jangan berasumsi bahwa default pratinjau terbawa ke model GA.

Penghematan cache bergantung pada stabilitas prompt

Halaman model Qwen 3.8 Max mempublikasikan tarif cache khusus model. Gunakan tarif tersebut—bukan rasio cache generik—saat memperkirakan pengeluaran.

Entri cache eksplisit memiliki masa berlaku lima menit, dan hit yang berhasil akan mengatur ulang periode tersebut. Caching bersifat otomatis untuk implisit, tetapi hit tidak dijamin. Caching paling berguna ketika prompt sistem, definisi alat, konteks repositori, atau dokumen besar tetap stabil di banyak panggilan.

Alat bawaan menimbulkan biaya terpisah

QwenCloud saat ini mencantumkan biaya alat berikut selain penggunaan token:

Alat bawaanBiaya saat ini
Web Search$10 / 1K panggilan
Image Search$8 / 1K panggilan
Web ExtractorGratis untuk waktu terbatas
Code InterpreterGratis untuk waktu terbatas

Pemanggilan fungsi dan MCP tidak memiliki biaya alat terpisah, tetapi deskripsi alat tetap dihitung sebagai token input. Promosi alat gratis dapat berubah, jadi periksa panduan harga QwenCloud sebelum menyelesaikan anggaran produksi.

Sebagai contoh, permintaan dengan 20K token input, 2K token output, dan dua panggilan Web Search berbiaya kira-kira:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

Dalam contoh ini, dua panggilan pencarian menyumbang sekitar 27,8% dari total biaya permintaan.

Contoh Biaya Dunia Nyata Qwen 3.8 Max

Contoh-contoh ini menggunakan tarif khusus model QwenCloud saat ini. Mereka mengecualikan pajak, percobaan ulang, fallback, dan markup khusus penyedia.

Contoh 1: Permintaan agen tingkat sedang

Asumsikan 50K token input dan 5K token output:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Upaya pertama yang berhasil berbiaya sekitar $0.13. Satu percobaan ulang penuh akan meningkatkan biaya model menjadi kira-kira $0.26.

Contoh 2: Analisis dokumen panjang

Asumsikan 800K token input dan 20K token output:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Model tidak menerapkan biaya terpisah konteks panjang pada kartu tarif saat ini, tetapi prompt besar tetap menghasilkan biaya absolut yang signifikan.

Contoh 3: Sesi agen dengan cache

Asumsikan prefiks 100K token yang dapat digunakan kembali, 10K token input baru, 5K token output, dan 50 panggilan saat cache eksplisit masih valid:

Panggilan pertama:
100K pembuatan cache × $2.50/M = $0.250
10K input baru × $2/M          = $0.020
5K output × $6/M               = $0.030
Total panggilan pertama        = $0.300
Masing-masing 49 panggilan berikutnya:
100K pembacaan cache × $0.17/M = $0.017
10K input baru × $2/M          = $0.020
5K output × $6/M               = $0.030
Total per panggilan            = $0.067
Total sesi dengan cache        = $3.583
50 panggilan yang sama tanpa cache = $12.500

Penghematan estimasi = $8.917, atau 71.3%

Penghematan estimasi bergantung pada hit cache yang berhasil dan prefiks yang stabil. Jeda panjang atau perubahan sering pada prompt sistem dan skema alat akan mengurangi manfaat.

Qwen 3.8 Max vs Qwen 3.7 Max:Perbandingan Harga

Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max pada harga daftar, tetapi Qwen 3.7 Max 37,5% lebih murah saat promosi 50% saat ini aktif.

Model dan status hargaInput / 1MOutput / 1MKonteks
qwen3.8-max harga standar$2.00$6.001M
qwen3.7-max harga daftar$2.50$7.501M
qwen3.7-max promosi saat ini$1.25$3.751M

Tetap sediakan halaman model CometAPI Qwen3.7 Max sebagai fallback saat menguji model baru.

Harga per token hanyalah satu bagian dari keputusan. Qwen 3.8 Max masih bisa lebih ekonomis jika meningkatkan keberhasilan percobaan pertama, menggunakan alat lebih andal, mengurangi percobaan ulang, atau membutuhkan lebih sedikit koreksi manusia.

Gunakan metrik produksi ini:

Biaya per tugas yang diterima =
(token model + panggilan alat + percobaan ulang + pengeluaran fallback + biaya tinjauan)
÷ output yang diterima

Keuntungan benchmark yang dilaporkan vendor adalah alasan untuk menguji ulang alur kerja pengodean dan profesional yang menuntut, bukan bukti bahwa setiap beban kerja Qwen 3.7 harus bermigrasi.

Cara Migrasi ke Qwen 3.8 Max

Mengubah string model itu perlu, tetapi bukan migrasi produksi yang lengkap.

1. Uji ID model produksi

Ganti pengenal pratinjau dengan qwen3.8-max di lingkungan uji. Jangan berasumsi alias pratinjau, default, latensi, atau perilaku respons akan tetap tidak berubah.

Permintaan minimal yang kompatibel dengan OpenAI dapat terlihat seperti ini:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Mulailah dengan permintaan minimum yang didokumentasikan. Tambahkan kontrol reasoning hanya ketika referensi API saat ini untuk endpoint Anda secara eksplisit mendukungnya.

2. Kalibrasi ulang telemetri biaya dan performa

Catat setidaknya:

  • token input, output, dan reasoning
  • hit cache dan token pembuatan cache
  • waktu ke token pertama dan total latensi
  • panggilan alat, percobaan ulang, dan fallback
  • output yang diterima versus ditolak
  • waktu koreksi manusia

3. Uji ulang antarmuka yang digunakan aplikasi Anda

Validasi event streaming, payload multimodal, skema alat, output terstruktur, alasan selesai, bidang penggunaan, penanganan error, dan perilaku multi-turn. Halaman model produksi mendokumentasikan akses yang kompatibel dengan DashScope dan OpenAI; verifikasi setiap lapisan kompatibilitas tambahan sebelum mengandalkannya.

4. Hormati batas konteks praktis

Jendela konteks 1M bukanlah prompt pengguna 1M token yang sama. QwenCloud mencantumkan input maksimum 991K tanpa reasoning dan 983K dengan reasoning. Tambahkan margin aman agar permintaan masih memiliki ruang untuk output dan reasoning.

5. Jalankan Qwen 3.7 dan Qwen 3.8 berdampingan

Gunakan prompt, alat, validator, aturan percobaan ulang, dan dataset yang identik. Bandingkan biaya per tugas yang diterima dan latensi alih-alih menilai respons terisolasi dengan mata.

Cara Mengevaluasi dan Merutekan Qwen 3.8 Max

Gunakan beban kerja nyata alih-alih rata-rata benchmark yang luas.

Beban kerjaTugas yang disarankanSinyal penerimaan utama
Pengodean repositori4Tes lulus tanpa penambalan manusia
Analisis dokumen panjang3Klaim didukung oleh bukti yang disediakan
Analisis multimodal2Detail gambar atau video yang relevan digunakan dengan benar
Agen yang menggunakan alat3Pemilihan alat yang benar dan argumen yang valid
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Gunakan Qwen 3.8 Max untuk pekerjaan repositori yang sulit, agen horizon panjang, analisis multimodal, dan alur kerja di mana Qwen 3.7 gagal dalam uji penerimaan. Pertahankan Qwen 3.7 Max ketika promosi secara material menurunkan biaya dan model yang ada sudah memenuhi target kualitas Anda.

Periksa halaman harga CometAPI dan informasi perutean live sebelum mengunci ambang batas karena ketersediaan penyedia dan harga yang dirutekan dapat berubah secara independen dari harga daftar langsung QwenCloud. CometAPI Cookbook dapat membantu Anda membangun permintaan yang dapat diulang dan kerangka evaluasi yang konsisten.

FAQ

Berapa biaya API Qwen 3.8 Max?

QwenCloud saat ini mencantumkan Qwen 3.8 Max pada $2 per 1 juta token input dan $6 per 1 juta token output. Penggunaan cache dan alat bawaan memiliki tarif terpisah.

Apakah Qwen 3.8 Max lebih mahal di atas 128K token?

Tidak ada tingkat konteks panjang terpisah yang ditampilkan pada kartu tarif khusus model saat ini. Permintaan panjang berbiaya lebih tinggi karena berisi lebih banyak token, bukan karena melintasi tingkat harga per unit yang lebih tinggi.

Apakah token reasoning Qwen 3.8 Max ditagihkan?

Reasoning dapat meningkatkan penggunaan yang dihasilkan dan total biaya. Gunakan bidang token reasoning dan output yang dikembalikan oleh endpoint daripada memperkirakan dari jawaban yang terlihat.

Apakah Qwen 3.8 Max bersifat open source?

Qwen mengumumkan bahwa bobot terbuka akan menyusul rilis API. Jangan menggambarkan model sebagai dapat diunduh atau di-host sendiri sampai checkpoint dan lisensi resmi tersedia.

Haruskah pengguna Qwen 3.7 Max segera bermigrasi?

Tidak secara otomatis. Qwen 3.8 Max memiliki harga standar daftar yang lebih rendah, sementara Qwen 3.7 Max lebih murah selama promosi saat ini. Bermigrasilah ketika data kualitas, latensi, perilaku cache, dan biaya per tugas yang diterima milik Anda sendiri mendukung perubahan tersebut.

Uji Qwen 3.8 Max Dengan CometAPI

Gunakan CometAPI Quickstart untuk mengonfigurasi klien yang kompatibel dengan OpenAI. Sebelum mengirim trafik produksi, konfirmasi bahwa qwen3.8-max sudah live di akun Anda dan verifikasi harga yang dirutekan yang ditampilkan di sana.

Bandingkan dengan baseline Qwen 3.7 Anda menggunakan prompt, validator, kebijakan percobaan ulang, dan telemetri yang identik. Ini menjaga evaluasi tetap fokus pada model alih-alih perubahan pada harness uji.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Aug 4, 2026
Terakhir diperbarui Sep 3, 2026
199 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya