DeepSeek Vision and Grok Imagine models are now live on CometAPI →
new/Penyelidikan CometAPI

Harga API Qwen 3.8 Max: $2 Input, $6 Output, 1M Konteks

Qwen 3.8 Max mengenakan kos $2/M bagi input dan $6/M bagi output. Bandingkan fi cache, kos alat, contoh sebenar, had, dan nasihat migrasi Qwen 3.7.

CometAPI
Mia MarenPasukan penyelidikan model AI dan API
Dikemas kini Aug 24, 2026 10 min baca
Harga API Qwen 3.8 Max: $2 Input, $6 Output, 1M Konteks
Guna corak ini

Buat panggilan API pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max berharga $2 bagi setiap 1 juta token input dan $6 bagi setiap 1 juta token output di QwenCloud. Kadar cache khusus model ialah $0.25/M untuk input cache tersirat, $2.50/M untuk penciptaan cache eksplisit, dan $0.17/M untuk bacaan cache eksplisit.

Kadar token standard yang sama terpakai merentasi tetingkap konteks 1M token yang disokong model. Prompt yang lebih besar menelan kos lebih kerana mengandungi lebih banyak token, bukan kerana memasuki aras harga konteks panjang yang lebih tinggi.

Pada harga senarai, Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max. Namun, Qwen 3.7 Max lebih murah sementara promosi 50% semasanya masih aktif. Pilihan produksi yang lebih baik bergantung pada kos per tugasan diterima, termasuk penaakulan, hit cache, alat, percubaan semula, kependaman, dan semakan manusia.

Harga API Qwen 3.8 Max Sekilas Pandang

ButiranNilai rasmi semasa
ID model produksiqwen3.8-max
Tarikh keluaran rasmiAugust 3, 2026
Seni bina2.4T jumlah parameter; 95B parameter aktif
Harga input standard$2 / 1M token
Harga output standard$6 / 1M token
Input cache tersirat$0.25 / 1M token
Penciptaan cache eksplisit$2.50 / 1M token
Bacaan cache eksplisit$0.17 / 1M token
Tetingkap konteks1M token
Input maksimum991K tanpa penaakulan; 983K dengan penaakulan
Output maksimum131K
Penaakulan maksimum262K
Modaliti inputTeks, imej, dan video
Modaliti outputTeks
Had rujukan QwenCloud2M TPM dan 15K RPM

Halaman model QwenCloud ialah sumber paling langsung untuk ID model semasa, harga, kadar cache, had konteks, dan modaliti. Kuota khusus akaun dan wilayah mungkin berbeza, jadi gunakan had yang ditunjukkan dalam konsol anda sendiri apabila menetapkan keupayaan produksi serentak.

Keluaran produksi juga menggantikan pengecam pratonton dengan qwen3.8-max dan menambah kad kadar khusus model yang lengkap. Bahan pelancaran Qwen menerangkan tetapan usaha penaakulan low, medium, dan xhigh, tetapi tingkah laku produksi harus disahkan terhadap titik akhir dan rujukan API yang anda gunakan.

Nota sensitif masa: Qwen mengumumkan bahawa open weights akan menyusul selepas keluaran API. Sehingga August 4, 2026, jangan huraikan Qwen 3.8 Max sebagai boleh dimuat turun atau dihoskan sendiri sehingga titik semak dan lesen rasmi diterbitkan.

Cara Harga Qwen 3.8 Max Berfungsi

QwenCloud kini menyenaraikan kadar standard rata $2 bagi setiap 1M token input dan $6 bagi setiap 1M token output merentasi tetingkap konteks 1M token yang disokong Qwen 3.8 Max. Petikan harga rasmi di bawah telah diambil pada August 4, 2026; sentiasa semak halaman model langsung sebelum membuat keputusan bajet produksi.

Harga API Qwen 3.8 Max: $2 Input, $6 Output, 1M Konteks

Sumber***:*** QwenCloud, “Qwen3.8-Max” official

Item bilHarga per 1M tokenApabila dikenakan
Input standard$2.00Kandungan prompt baharu, definisi alat, dan konteks tidak di-cache
Output standard$6.00Output yang dijana dan penggunaan penaakulan yang dibilkan
Hit cache tersirat$0.25Prefiks prompt diguna semula secara automatik; hit tidak dijamin
Penciptaan cache eksplisit$2.50Mewujudkan prefiks prompt boleh guna semula yang ditanda
Bacaan cache eksplisit$0.17Menggunakan semula blok cache eksplisit yang sah

Oleh itu, permintaan 900K token menelan kos lebih daripada permintaan 100K token kerana memproses sembilan kali lebih banyak token—bukan kerana memasuki aras harga yang lebih tinggi.

Penaakulan boleh meningkatkan kos output

Jawapan ringkas yang kelihatan tidak semestinya jawapan berharga rendah. Panggilan dengan penaakulan mungkin menjana token penaakulan tambahan, jadi anggaran produksi harus menggunakan medan penggunaan yang dikembalikan oleh API dan bukan panjang respons yang kelihatan.

Di tempat titik akhir anda menyokong kawalan penaakulan untuk qwen3.8-max, bandingkan tetapan yang tersedia pada set penilaian yang sama. Jangan anggap lalai pratonton dibawa ke model GA.

Penjimatan cache bergantung pada kestabilan prompt

Halaman model Qwen 3.8 Max menerbitkan kadar cache khusus model. Gunakan kadar tersebut—bukan nisbah cache generik—apabila menganggar perbelanjaan.

Entri cache eksplisit mempunyai tempoh kesahan lima minit, dan hit yang berjaya menetapkan semula tempoh tersebut. Cache tersirat adalah automatik, tetapi hit tidak dijamin. Caching paling berguna apabila prompt sistem, definisi alat, konteks repositori, atau dokumen besar kekal stabil merentasi panggilan kerap.

Alat terbina dalam menghasilkan caj berasingan

QwenCloud kini menyenaraikan yuran alat berikut sebagai tambahan kepada penggunaan token:

Alat terbina dalamYuran semasa
Carian Web$10 / 1K panggilan
Carian Imej$8 / 1K panggilan
Pengekstrak WebPercuma untuk masa terhad
Pentafsir KodPercuma untuk masa terhad

Function calling dan MCP tidak mempunyai yuran alat berasingan, tetapi keterangan alat masih dikira sebagai token input. Promosi alat percuma mungkin berubah, jadi semak panduan harga QwenCloud sebelum memuktamadkan bajet produksi.

Sebagai contoh, permintaan dengan 20K token input, 2K token output, dan dua panggilan Carian Web menelan kos kira-kira:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

Dalam contoh ini, dua panggilan carian menyumbang kira-kira 27.8% daripada jumlah kos permintaan.

Contoh Kos Dunia Sebenar Qwen 3.8 Max

Contoh ini menggunakan kadar khusus model QwenCloud semasa. Ia tidak termasuk cukai, percubaan semula, fallback, dan markup khusus penyedia.

Contoh 1: Permintaan ejen sederhana

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Percubaan pertama yang berjaya berharga kira-kira $0.13. Satu percubaan semula penuh akan meningkatkan kos model kepada kira-kira $0.26.

Contoh 2: Analisis dokumen panjang

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Model tidak mengenakan surcaj konteks panjang yang berasingan pada kad kadar semasanya, tetapi prompt besar masih menghasilkan kos mutlak yang ketara.

Contoh 3: Sesi ejen dengan cache

Andaikan prefiks boleh guna semula 100K token, 10K token input baharu, 5K token output, dan 50 panggilan sementara cache eksplisit kekal sah:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Anggaran penjimatan = $8.917, atau 71.3%

Anggaran penjimatan bergantung pada hit cache yang berjaya dan prefiks yang stabil. Jeda panjang atau perubahan kerap pada prompt sistem dan skema alat akan mengurangkan manfaat.

Qwen 3.8 Max vs Qwen 3.7 Max:Perbandingan Harga

Qwen 3.8 Max 20% lebih murah daripada Qwen 3.7 Max pada harga senarai, tetapi Qwen 3.7 Max 37.5% lebih murah sementara promosi 50% semasanya aktif.

Model dan status hargaInput / 1MOutput / 1MKonteks
qwen3.8-max harga standard$2.00$6.001M
qwen3.7-max harga senarai$2.50$7.501M
qwen3.7-max promosi semasa$1.25$3.751M

Simpan halaman model CometAPI Qwen3.7 Max sebagai fallback sementara menguji model baharu.

Harga per token hanya satu bahagian daripada keputusan. Qwen 3.8 Max masih boleh lebih ekonomik jika ia meningkatkan kejayaan percubaan pertama, menggunakan alat dengan lebih boleh dipercayai, mengurangkan percubaan semula, atau memerlukan pembetulan manusia yang lebih sedikit.

Gunakan metrik produksi ini:

Kos per tugasan diterima =

(token model + panggilan alat + percubaan semula + perbelanjaan fallback + kos semakan)

÷ output yang diterima

Keuntungan penanda aras yang dilaporkan vendor ialah alasan untuk menilai semula aliran kerja pengekodan dan profesional yang mencabar, bukan bukti bahawa setiap beban kerja Qwen 3.7 harus berpindah.

Cara Migrasi ke Qwen 3.8 Max

Menukar rentetan model adalah perlu, tetapi ia bukan migrasi produksi yang lengkap.

1. Uji ID model produksi

Gantikan pengecam pratonton dengan qwen3.8-max dalam persekitaran ujian. Jangan anggap alias, lalai, kependaman, atau tingkah laku respons pratonton akan kekal tidak berubah.

Permintaan minimum yang serasi dengan OpenAI boleh kelihatan seperti berikut:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Mulakan dengan permintaan minimum yang didokumenkan. Tambah kawalan penaakulan hanya apabila rujukan API semasa untuk titik akhir anda jelas menyokongnya.

2. Tetapkan semula garis asas telemetri kos dan prestasi

Rekod sekurang-kurangnya:

  • token input, output, dan penaakulan
  • hit cache dan token penciptaan cache
  • masa ke token pertama dan jumlah kependaman
  • panggilan alat, percubaan semula, dan fallback
  • output diterima berbanding ditolak
  • masa pembetulan manusia

3. Uji semula antara muka yang digunakan aplikasi anda

Sahkan acara penstriman, payload multimodal, skema alat, output berstruktur, sebab tamat, medan penggunaan, pengendalian ralat, dan tingkah laku pelbagai pusingan. Halaman model produksi mendokumenkan akses serasi DashScope dan OpenAI; sahkan sebarang lapisan keserasian tambahan sebelum bergantung padanya.

4. Hormati had konteks praktikal

Tetingkap konteks 1M tidak sama dengan prompt pengguna 1M token. QwenCloud menyenaraikan input maksimum 991K tanpa penaakulan dan 983K dengan penaakulan. Tambah margin keselamatan supaya permintaan masih mempunyai ruang untuk output dan penaakulan.

5. Jalankan Qwen 3.7 dan Qwen 3.8 secara selari

Gunakan prompt, alat, validator, peraturan percubaan semula, dan set data yang sama. Bandingkan kos per tugasan diterima dan kependaman dan bukannya menilai respons terpencil secara visual.

Cara Menilai dan Menghala Qwen 3.8 Max

Gunakan beban kerja sebenar dan bukannya purata penanda aras yang luas.

Beban kerjaTugasan dicadangkanIsyarat penerimaan utama
Pengkodan repositori4Ujian lulus tanpa tampalan manusia
Analisis dokumen panjang3Dakwaan disokong oleh bukti yang dibekalkan
Analisis multimodal2Perincian imej atau video yang relevan digunakan dengan betul
Ejen menggunakan alat3Pemilihan alat yang betul dan argumen yang sah
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Gunakan Qwen 3.8 Max untuk kerja repositori yang sukar, ejen jangka panjang, analisis multimodal, dan aliran kerja di mana Qwen 3.7 gagal ujian penerimaan. Kekalkan Qwen 3.7 Max apabila promosi menurunkan kos dengan ketara dan model sedia ada sudah memenuhi sasaran kualiti anda.

Semak halaman harga CometAPI dan maklumat penghalaan langsung sebelum menetapkan ambang kerana ketersediaan penyedia dan harga penghalaan boleh berubah secara bebas daripada harga senarai langsung QwenCloud. CometAPI Cookbook boleh membantu anda membina permintaan yang boleh diulang dan rangka kerja penilaian yang konsisten.

Soalan Lazim

Berapakah kos API Qwen 3.8 Max?

QwenCloud kini menyenaraikan Qwen 3.8 Max pada $2 bagi setiap 1 juta token input dan $6 bagi setiap 1 juta token output. Penggunaan cache dan alat terbina dalam mempunyai kadar berasingan.

Adakah Qwen 3.8 Max lebih mahal melebihi 128K token?

Tiada aras konteks panjang berasingan ditunjukkan pada kad kadar khusus model semasa. Permintaan panjang menelan kos lebih kerana ia mengandungi lebih banyak token, bukan kerana ia melintasi aras harga unit yang lebih tinggi.

Adakah token penaakulan Qwen 3.8 Max dibilkan?

Penaakulan boleh meningkatkan penggunaan yang dijana dan jumlah kos. Gunakan medan token penaakulan dan output yang dikembalikan oleh titik akhir dan bukannya menganggar daripada jawapan yang kelihatan.

Adakah Qwen 3.8 Max sumber terbuka?

Qwen mengumumkan bahawa open weights akan menyusul selepas keluaran API. Jangan huraikan model sebagai boleh dimuat turun atau dihoskan sendiri sehingga titik semak dan lesen rasmi tersedia.

Patutkah pengguna Qwen 3.7 Max berpindah serta-merta?

Tidak secara automatik. Qwen 3.8 Max mempunyai harga senarai standard yang lebih rendah, manakala Qwen 3.7 Max lebih murah semasa promosinya. Berpindah apabila data kualiti, kependaman, tingkah laku cache, dan kos per tugasan diterima anda sendiri menyokong perubahan tersebut.

Uji Qwen 3.8 Max Dengan CometAPI

Gunakan CometAPI Quickstart untuk mengkonfigurasi klien serasi OpenAI. Sebelum menghantar trafik produksi, sahkan bahawa qwen3.8-max aktif dalam akaun anda dan sahkan harga penghalaan yang dipaparkan di sana.

Bandingkan dengan garis dasar Qwen 3.7 anda menggunakan prompt, validator, dasar percubaan semula, dan telemetri yang sama. Ini memastikan penilaian memfokuskan pada model dan bukannya perubahan dalam rangka ujian.

Terus belajar

Sambungkan artikel ini ke keputusan seterusnya.

Lihat semua topik
Diterbitkan pada Aug 4, 2026
Terakhir dikemas kini Aug 24, 2026
130 paparan
Disemak untuk kejelasan, atribusi sumber dan terminologi API semasa.

Bersedia untuk mengurangkan kos pembangunan AI sebanyak 20%?

Mulakan secara percuma dalam beberapa minit. Kredit percubaan percuma disertakan. Tiada kad kredit diperlukan.

Baca Lagi