Qwen3.8-Flash dijelaskan: konteks 1M, desain MoE aktif 6B, benchmark pengodean dan multimodal, harga-kinerja, perbandingan, dan akses CometAPI.
TL;DR Alibaba's Qwen3.8-Flash adalah model produksi untuk pengodean volume tinggi, agen, pekerjaan konteks panjang, dan tugas multimodal. Model ini mendukung konteks ter-host 1M token dan menggabungkan hasil benchmark kuat dengan harga API rendah. Mitra open-weight, Qwen3.8-Flash-Next, tersedia untuk evaluasi dan penerapan lokal.
Poin Utama
- Penamaan produksi vs. open-weight: Qwen3.8-Flash adalah model produksi ter-host; Qwen3.8-Flash-Next adalah rilis arsitektur open-weight yang digunakan untuk memublikasikan detail model dan benchmark.
- Aktivasi sangat jarang: 125B parameter utama + 51B embedding N-gram, dengan hanya 6B parameter aktif per token.
- Konteks panjang: 262K konteks native untuk model open, dapat diperluas hingga 1M dengan YaRN; rute produksi QwenCloud mengekspose konteks 1M secara default.
- Pengodean agen yang kuat: Qwen melaporkan 62.5 pada SWE-bench Pro, 73.9 pada CoWorkBench, 73.5 pada Toolathlon Verified, dan 91.9 pada LiveCodeBench v6.
- Kekuatan multimodal: Qwen melaporkan 84.5 pada AndroidWorld, 88.5 pada RealWorldQA, dan 90.6 pada MathVision tanpa code interpreter.
- Efisiensi: QSA mencapai hingga 7.6x prefill dan 4.9x percepatan kernel decode pada 1M token, dan Qwen melaporkan throughput prefill 1M token 8.6x lebih tinggi daripada Qwen3.7-Plus dalam setup penyajian dengan tingkat hit cache prefiks tinggi.
- Harga: Alibaba Cloud saat ini mencantumkan US$0.15/M input dan US$0.47/M output untuk penempatan internasional; CometAPI mencantumkan US$0.12/M input dan US$0.376/M output.
Gambar peluncuran resmi Qwen3.8-Flash — sumber Alibaba/Qwen
Apa Itu Qwen3.8-Flash?
Qwen3.8-Flash adalah model produksi berorientasi efisiensi dari Alibaba Qwen untuk pengodean, agen, pekerjaan pengetahuan ber-konteks panjang, dan tugas multimodal. Model ini diumumkan bersama mitra open-weight bernama Qwen3.8-Flash-Next. Alibaba menggambarkannya sebagai model MoE multimodal open-weight yang dioptimalkan untuk kapabilitas, latensi, dan biaya, serta menyatakan arsitektur ini adalah pratinjau awal ide-ide untuk Qwen4.
Label “Flash” penting. Qwen3.8-Max adalah tier flagship yang lebih besar untuk kapabilitas maksimum, sementara Qwen3.8-Flash dibangun untuk menghadirkan sebagian besar performa pengodean dan agen yang berguna dengan komputasi aktif yang jauh lebih rendah. Rilis ini mengaktifkan 6B parameter per token, dibandingkan jejak aktif yang jauh lebih besar pada sistem MoE flagship.
Model produksi disajikan dengan ID model qwen3.8-flash. QwenCloud mendukung Chat Completions dan Responses API yang kompatibel dengan OpenAI plus antarmuka yang kompatibel dengan Anthropic, sehingga memudahkan integrasi ke tumpukan agen dan pengodean yang ada.
Qwen3.8-Flash vs. Qwen3.8-Flash-Next: Apa Bedanya?
Qwen3.8-Flash-Next adalah rilis model open-weight. Ini mengekspose arsitektur, bobot model, panduan penerapan, dan rangkaian benchmark. Bobot tersedia di Hugging Face dan ModelScope. Model open mendukung konteks native 262.144 token dan dapat diperluas hingga 1M dengan YaRN.
Qwen3.8-Flash adalah versi API produksi. Dalam rilis resmi, Alibaba mengatakan versi produksi menggunakan konteks 1M secara default dan mencakup alat bawaan resmi. Dalam praktiknya, pengembang yang mengevaluasi model ter-host sebaiknya menggunakan perilaku dan harga API Qwen3.8-Flash, sementara rilis Flash-Next adalah sumber publik terbaik untuk detail arsitektur dan benchmark.
Spesifikasi Qwen3.8-Flash
| Spesifikasi | Qwen3.8-Flash / Flash-Next |
|---|---|
| Penyedia | Alibaba Qwen |
| ID model produksi | qwen3.8-flash |
| Model open-weight | Qwen3.8-Flash-Next |
| Arsitektur | Multimodal Mixture-of-Experts; atensi hibrida GDN + QSA |
| Parameter utama | 125B |
| Parameter diaktifkan | 6B per token |
| Parameter embedding N-gram | 51B |
| Konteks model open native | 262.144 token |
| Konteks diperluas/ter-host | Hingga 1.000.000 token |
| Modalitas input produksi | Teks + gambar didokumentasikan dalam contoh integrasi resmi |
| Modalitas open-weight | Teks + visi; dirilis sebagai multimodal |
| Kontrol penalaran | low / medium / xhigh dalam contoh QwenCloud |
| Panggilan alat paralel | Didukung dalam konfigurasi model Codex resmi |
| Bobot terbuka | Ya, untuk Qwen3.8-Flash-Next |
| Tanggal peluncuran | Rentang rilis 26–27 Agustus 2026 |
Angka efisiensi kunci adalah 6B parameter diaktifkan per token. Tambahan 51B parameter embedding N-gram adalah kapasitas berbasis lookup; Qwen mencatat bahwa ini tidak masuk ke anggaran perkalian-matriks per token dengan cara yang sama seperti bobot transformer.
Apa yang Baru di Arsitektur Qwen3.8-Flash?
Diagram arsitektur resmi Qwen — Qwen3.8-Flash-Next
1. GDN + Qwen Sparse Attention (QSA)
Model ini mencampur dua mekanisme. Tiga dari setiap empat layer menggunakan Gated DeltaNet (GDN) untuk mengompresi informasi historis menjadi state berukuran tetap, sementara layer yang tersisa menggunakan atensi global untuk pengambilan yang presisi. Layer atensi global kemudian menggunakan Qwen Sparse Attention untuk mengurangi jumlah konteks yang harus diproses langsung.
Tujuan praktisnya sederhana: GDN menangani memori hemat, sementara QSA mengalokasikan atensi penuh hanya di tempat pengambilan informasi penting. Ini sangat berharga untuk aplikasi konteks panjang di mana atensi penuh biasa menjadi mahal baik dalam komputasi maupun lalu lintas KV-cache.
2. Gated Residual dengan Empat Jalur Informasi
Gated Residual memperlebar aliran residual menjadi empat cabang paralel. Sebuah gerbang per-elemen dinamis mengontrol seberapa banyak informasi yang dibaca dari dan ditulis ke setiap cabang. Ini memberi informasi awal lebih banyak cara untuk bertahan di jaringan yang dalam alih-alih terus-menerus bercampur dalam satu aliran. Qwen juga mengatakan state residual dapat disimpan dalam FP8 untuk mengurangi lalu lintas memori.
3. Embedding N-gram Menambah Kapasitas Tanpa Komputasi Proporsional
Qwen menambahkan 51B parameter embedding N-gram yang diakses menggunakan konteks token lokal. Tidak seperti bobot transformer normal, parameter ini diambil melalui operasi lookup dan dapat di-offload ke memori host dengan prefetch asinkron. Desain ini memperluas kapasitas model sambil menjaga aritmetika per token tetap rendah.
4. Optimizer Muon dan Ko-desain Pelatihan
Qwen melatih model dengan optimizer Muon untuk bobot peta linear 2D inti sambil mempertahankan AdamW untuk embedding, router, dan parameter low-rank tertentu. Tim juga menyesuaikan ulang hukum skala untuk arsitektur baru dan melaporkan bahwa warmup ukuran batch tidak diperlukan, menghindari 18.8% langkah optimizer tambahan dalam eksperimennya.
5. MoE Ultra-jarang dan Prediksi Multi-token
Model mempertahankan kumpulan expert besar tetapi hanya merutekan sejumlah kecil expert per token. Model ini juga menggunakan prediksi multi-token, yang membantu decoding spekulatif dengan meningkatkan tingkat penerimaan sekaligus memperbaiki backbone selama pelatihan. Bersama-sama, pilihan ini memperkuat tujuan desain yang sama: lebih banyak kapasitas dan throughput tanpa membayar komputasi level-flagship pada setiap token.
Performa Benchmark Qwen3.8-Flash
Benchmark Pengodean
Alibaba memublikasikan rangkaian benchmark di bawah Qwen3.8-Flash-Next, mitra open-weight dari Qwen3.8-Flash produksi. Tabel berikut menggunakan skor rilis yang dilaporkan Qwen dan berfokus pada rekan yang juga tersedia melalui CometAPI.

Bagan benchmark bahasa resmi Qwen
| Benchmark | Qwen3.8-Flash | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 54.4 | — |
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | — | 77.5 |
| NL2Repo-Bench | 48.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 45.1 | 68.2 |
| JobBench | 55.7 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 70.3 | — |
| IFBench | 81.3 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 90.8 | 91.3 |
| HLE | 35.9 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.6 | 88.8 |
Hasil pengodean: Qwen3.8-Flash memimpin rekan terpilih pada SWE-bench Pro (62.5), SWE-bench Multilingual (81.0), dan LiveCodeBench v6 (91.9). Pengecualian utama adalah NL2Repo-Bench, di mana DeepSeek V4 Flash mencetak 54.2 versus 48.1.
Hasil agen: Qwen3.8-Flash mencatat 73.9 pada CoWorkBench dan 55.7 pada JobBench, secara material di atas rekan terpilih dalam tabel rilis Qwen. Model ini juga sedikit unggul atas DeepSeek V4 Flash pada Toolathlon Verified, 73.5 versus 70.3.
Hasil penalaran: Bidang ini lebih ketat. Qwen3.8-Flash mencetak 91.7 pada GPQA Diamond, dekat dengan Claude Opus 4.6 di 91.3 dan DeepSeek V4 Flash di 90.8. Pada HLE, Claude Opus 4.6 memimpin dengan 40.0 dibanding 35.9 milik Qwen.
Benchmark Multimodal

Bagan benchmark visi-bahasa resmi Qwen
| Benchmark | Qwen3.8-Flash | Claude Opus 4.6 |
|---|---|---|
| ClawEval-MM (Pass@3 / Rata-rata) | 64.4 / 60.4 | 52.5 / 54.7 |
| AndroidWorld | 84.5 | 62.0 |
| ERQA | 72.3 | 40.8 |
| LVBench | 76.6 | 63.0 |
| RealWorldQA | 88.5 | 73.9 |
| MathVision (tanpa CI / dengan CI) | 90.6 / 95.7 | 65.5 / — |
| CharXiv RQ (tanpa CI / dengan CI) | 84.6 / 90.6 | 66.0 / — |
Hasil rilis multimodal adalah salah satu argumen terkuat untuk Qwen3.8-Flash. Qwen melaporkan 84.5 pada AndroidWorld, 88.5 pada RealWorldQA, dan 90.6 pada MathVision tanpa code interpreter. Skor ini menunjukkan model ditujukan untuk agen yang harus membaca layar, memahami status visual, dan terus bertindak alih-alih hanya menjawab pertanyaan gambar.
Catatan benchmark: Ini adalah hasil rilis yang dilaporkan vendor, bukan uji lab head-to-head netral. Beberapa benchmark menggunakan harness atau konfigurasi alat berbeda, dan sebagian bersifat in-house. Perlakukan angka sebagai bukti indikatif, lalu validasi model pada prompt, alat, target latensi, dan kriteria penerimaan Anda sendiri.
Mengapa Qwen3.8-Flash Cepat dan Hemat Biaya

Bagan efisiensi konteks panjang resmi Qwen
Pada konteks 1M token, Qwen melaporkan hingga 7.6x lebih cepat prefill dan 4.9x lebih cepat decode untuk kernel atensi QSA. Dalam eksperimen penyajian dengan tingkat hit cache prefiks 90%, Qwen3.8-Flash-Next mencapai 8.6x throughput prefill Qwen3.7-Plus.
Kisah tingkat sistem yang lebih besar adalah komputasi aktif. Model utama 125B biasanya terdengar besar, tetapi hanya 6B parameter yang diaktifkan per token. Jejak aktif itu kurang dari setengah 13B parameter aktif yang dilaporkan untuk DeepSeek V4 Flash dan jauh di bawah sekitar 95B parameter aktif yang dilaporkan untuk Qwen3.8-Max. Jumlah parameter tidak bertranslasi linear ke kecepatan, tetapi desain ini memberi Qwen3.8-Flash target efisiensi yang jelas.
Alibaba juga melaporkan bahwa pelatihan membutuhkan sekitar sepersembilan sumber daya Qwen3.7-Plus sambil meningkatkan kinerja pengodean dan tugas perkantoran. Terpisah, mode QwenWork Standard yang didukung oleh model ini dilaporkan memangkas konsumsi token per tugas sebesar 75% dan kira-kira menggandakan kecepatan generasi dibanding mode sebelumnya. Angka tingkat produk tersebut tidak boleh dianggap sebagai jaminan latensi API universal, tetapi menunjukkan bagaimana Alibaba mengharapkan model digunakan.
Harga Qwen3.8-Flash
Pengumuman peluncuran Alibaba mencantumkan harga QwenCloud sebesar $0.16 per satu juta token input dan $0.47 per satu juta token output. Harga dapat bervariasi menurut wilayah, permukaan produk, caching, atau pembaruan berikutnya, jadi tim produksi harus selalu memeriksa halaman penyedia live sebelum memperkirakan beban kerja besar.
Pada saat artikel ini disiapkan, CometAPI mencantumkan Qwen3.8-Flash pada $0.12 per satu juta token input dan sekitar $0.376 per satu juta token output. Halaman model CometAPI menandai ini sebagai diskon 20% relatif terhadap harga referensi yang tercantum.
| Rute | Input / 1M token | Output / 1M token | Contoh: 10M input + 2M output |
|---|---|---|---|
| Tarif peluncuran QwenCloud | $0.16 | $0.47 | $2.54 |
| Tarif terdaftar CometAPI | $0.12 | ~$0.376 | ~$1.95 |
Untuk beban kerja dengan 10 juta token input dan 2 juta token output, aritmetika tarif peluncuran sekitar $2.54 di QwenCloud versus sekitar $1.95 pada tarif CometAPI yang saat ini terdaftar. Tagihan agen nyata bisa lebih tinggi karena panggilan alat, retry, penalaran panjang, konteks yang berulang, dan layanan eksternal menambah biaya. Bandingkan biaya per hasil yang diterima alih-alih hanya harga token.
Qwen3.8-Flash vs. Qwen3.8-Max vs DeepSeek V4 Flash
| Dimensi | Qwen3.8-Flash | Qwen3.8-Max | Gemini 3.7 Flash | DeepSeek V4 Flash |
|---|---|---|---|---|
| Pemosisian | Model produksi Qwen berfokus efisiensi | Model flagship Qwen | Model Flash andalan Google | MoE teks berfokus efisiensi |
| Total / parameter aktif | 125B + 51B lookup / 6B | 2.4T / ~95B | Tidak diungkap | 284B / 13B |
| Konteks | 1M ter-host | 1M | 1,048,576 | 1M |
| Multimodal | Teks + visi didokumentasikan | Teks + gambar + video | Teks + gambar + video + audio + PDF | Berfokus teks |
| Kontrol penalaran | low / medium / xhigh | Penalaran lanjutan / mode cepat | low / medium / high | Non-think / Think / Think Max |
| Harga input CometAPI | US$0.12/M | US$1.60/M | US$0.60/M | US$0.176/M |
| Harga penyedia resmi (input / output) | US$0.15 / US$0.47 (Alibaba Cloud internasional) | US$2 / US$6 (Alibaba Cloud internasional) | US$0.75 / US$3.75 hingga 31 Des 2026 | Puncak: US$0.44 / US$1.32; non-puncak: US$0.22 / US$0.66 |
| Kecocokan terbaik | Pengodean volume tinggi, agen, kerja bersama | Tugas Qwen tersulit, otonomi horizon panjang | Ekosistem alat Google, agen multimodal luas | Penalaran teks dan pengodean ber-throughput tinggi |
Di Mana Qwen3.8-Flash Unggul
- Efisiensi komputasi aktif: 6B parameter aktif sangat kecil untuk model yang mencatat skor pengodean agen dan multimodal kuat.
- Nilai ekosistem Qwen: Qwen3.8-Flash jauh lebih murah daripada Qwen3.8-Max untuk beban kerja yang tidak membutuhkan tier flagship.
- Keseimbangan agen + perkantoran: Rilis ini luar biasa kuat pada CoWorkBench, JobBench, Toolathlon, SWE-bench Pro, dan tugas agen multimodal, bukan hanya QA akademis.
- Jalur open-weight: Qwen3.8-Flash-Next menyediakan bobot bagi tim yang memerlukan penerapan lokal, evaluasi independen, atau fine-tuning.
Kapan Model Lain Lebih Baik
- Gunakan Qwen3.8-Max untuk kapabilitas puncak Qwen. Tier Max memiliki anggaran komputasi aktif yang jauh lebih besar dan dirancang untuk pekerjaan horizon panjang yang paling sulit.
- Gunakan Gemini 3.7 Flash saat dukungan modalitas input yang luas penting. Model Flash Google secara eksplisit mencakup audio, video, PDF, dan integrasi alat Google yang mendalam.
- Gunakan DeepSeek V4 Flash saat prioritasnya adalah efisiensi berfokus teks. Model ini menang pada NL2Repo-Bench dalam perbandingan Qwen dan tetap menjadi alternatif pengodean berbiaya rendah yang kuat.
- Gunakan Claude Opus 4.6 saat penalaran premium dan kematangan alur kerja enterprise membenarkan harganya. Dalam tabel rilis Qwen, model ini masih memimpin HLE dan tetap sangat kompetitif pada GPQA.
Use Case Terbaik untuk Qwen3.8-Flash
Agen Pengodean dan Pekerjaan Repositori
Qwen3.8-Flash sangat cocok untuk penyelesaian isu, refaktoring, tinjauan kode, navigasi repositori, pembuatan pengujian, debugging, dan loop pengodean berbasis alat. Hasil LiveCodeBench dan SWE-bench Pro yang tinggi menunjukkan bahwa ini bukan sekadar model chat ber-latensi rendah; model ini dirancang untuk melakukan pekerjaan perangkat lunak multi-langkah.
Pekerjaan Pengetahuan Enterprise Ber-konteks Panjang
Konteks produksi 1M token dapat menampung koleksi dokumen besar, basis kode, log, transkrip rapat, atau riwayat agen jangka panjang. Hasil CoWorkBench dan JobBench membuat model ini menarik untuk sintesis dokumen, alur kerja spreadsheet/slide, dukungan riset, tinjauan kepatuhan, dan analisis operasional.
Agen Multimodal
Skor AndroidWorld, RealWorldQA, ERQA, dan MathVision mengarah pada agen yang harus memahami tangkapan layar, dokumen visual, antarmuka, diagram, dan gambar dunia nyata sebagai bagian dari alur kerja. Ini membuat model relevan untuk agen peramban, pengujian UI, QA visual, agen dokumen, dan otomasi yang peka terhadap layar.
Perouting Volume Tinggi
Karena Qwen3.8-Flash jauh lebih murah daripada model flagship, arsitektur praktisnya adalah merutekan sebagian besar traffic produksi ke Flash dan mengeskalasi hanya permintaan yang ambigu, berisiko tinggi, atau sangat sulit ke Qwen3.8-Max atau model premium lainnya. Gateway terpadu seperti CometAPI memudahkan pola perouting ini karena aplikasi dapat beralih penyedia di balik satu kontrak API.
Keterbatasan dan Peringatan
- Benchmark dilaporkan oleh vendor. Beberapa menggunakan harness pilihan Qwen, tugas in-house, atau pengaturan dengan alat. Verifikasi independen tetap penting.
- Tidak setiap benchmark adalah kemenangan. DeepSeek V4 Flash memimpin NL2Repo-Bench dalam perbandingan resmi, dan Claude Opus 4.6 memimpin HLE.
- Penggunaan komputer tetap sulit secara absolut. Rilis melaporkan skor biner OSWorld 2.0 sebesar 19.4 meskipun kinerja kredit parsial jauh lebih tinggi.
- Perilaku ter-host dan open-weight bisa berbeda. Prompt sistem, alat, manajemen konteks, kuantisasi, tumpukan penyajian, dan pembaruan penyedia dapat menggeser hasil dunia nyata dari setup benchmark Flash-Next yang dipublikasikan.
- Harga bersifat dinamis. Pengumuman peluncuran dan halaman agregator saat ini dapat menampilkan harga referensi yang sedikit berbeda. Gunakan harga endpoint live saat membuat anggaran.
Cara Menggunakan API Qwen3.8-Flash dengan CometAPI
CometAPI mengekspos Qwen3.8-Flash melalui endpoint yang kompatibel dengan OpenAI, sehingga integrasi SDK OpenAI yang ada biasanya dapat beralih dengan mengubah kunci API, base URL, dan ID model.
Mengapa Menggunakan CometAPI untuk Qwen3.8-Flash?
CometAPI memberi pengembang endpoint API terpadu untuk menguji Qwen3.8-Flash bersama model lain tanpa memelihara integrasi penyedia terpisah. Ini sangat berguna untuk perbandingan benchmark, perouting fallback, dan pemilihan model berbasis biaya.
- Buat kunci API CometAPI. Hasilkan kunci di dasbor CometAPI dan simpan di variabel lingkungan, bukan dalam kode sumber.
- Gunakan base URL terpadu. Setel base URL SDK ke
https://api.cometapi.com/v1. - Pilih model. Gunakan qwen3.8-flash sebagai ID model.
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="qwen3.8-flash",
messages=[
{"role": "system", "content": "Anda adalah asisten pengodean yang presisi."},
{"role": "user", "content": "Tinjau desain API ini dan identifikasi risiko keandalannya."},
],
)
print(response.choices[0].message.content)
cURL
curl "https://api.cometapi.com/v1/chat/completions" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{"role": "user", "content": "Ringkas risiko utama dalam rencana migrasi ini."}
]
}'
For production, add timeout handling, retry policy, token limits, structured output validation, and model-routing telemetry. If your workflow is agentic, track tool-call failures and accepted-task rate in addition to raw model latency.
FAQ
Apakah Qwen3.8-Flash open source?
Rute produksi Qwen3.8-Flash adalah API ter-host. Mitra open-weight-nya, Qwen3.8-Flash-Next, memiliki bobot yang dirilis di Hugging Face dan ModelScope. “Open-weight” adalah istilah yang lebih tepat karena hak penggunaan bergantung pada lisensi model.
Berapa konteks jendela Qwen3.8-Flash?
Model open mendukung 262.144 token secara native dan dapat diperluas hingga 1.000.000 token dengan YaRN. Alibaba mengatakan layanan Qwen3.8-Flash produksi menggunakan konteks 1M token secara default.
Berapa banyak parameter yang dimiliki Qwen3.8-Flash?
Rilisnya memiliki model utama 125B parameter, 51B parameter embedding N-gram, dan 6B parameter diaktifkan per token. Jumlah aktif yang rendah adalah inti dari desain efisiensinya.
Apakah Qwen3.8-Flash mendukung gambar?
Ya. Rilisnya bersifat multimodal, tumpukan penerapan open-weight mendukung teks dan visi, dan contoh integrasi resmi mencantumkan input teks dan gambar untuk model ter-host. Permukaan khusus penyedia dapat mengekspose kombinasi modalitas berbeda, jadi periksa halaman kapabilitas API saat ini sebelum penerapan.
Apakah Qwen3.8-Flash lebih baik daripada Qwen3.8-Max?
Tidak secara universal. Qwen3.8-Flash adalah pilihan lebih baik saat latensi, komputasi aktif, dan harga penting. Qwen3.8-Max adalah pilihan flagship untuk tugas paling sulit, horizon panjang, dan bernilai tinggi. Sistem perouting dapat menggunakan keduanya.
Berapa biaya Qwen3.8-Flash?
Alibaba mengumumkan US$0.16/M token input dan US$0.47/M token output untuk QwenCloud saat peluncuran. CometAPI saat ini mencantumkan sekitar US$0.12/M input dan US$0.376/M output. Periksa harga live karena tarif penyedia dan agregator dapat berubah.
Kesimpulan
Qwen3.8-Flash adalah salah satu contoh paling jelas dari pergeseran saat ini dari “model lebih besar” ke “ekonomi sistem yang lebih baik.” Backbone utama 125B terlihat besar di atas kertas, tetapi model ini hanya mengaktifkan 6B parameter per token dan menambah kapasitas melalui embedding N-gram gaya lookup. QSA, Gated Residual, perutean MoE ultra-jarang, dan desain penyajian berorientasi konteks panjang semuanya mendorong ke arah yang sama: menghadirkan kapabilitas pengodean agen dan multimodal tanpa biaya inferensi level-flagship.
Hasil rilis sangat menarik untuk rekayasa perangkat lunak, agen perkantoran, penggunaan alat, dan alur kerja visual. Pada saat yang sama, model ini tidak unggul secara seragam: DeepSeek V4 Flash menang setidaknya satu benchmark pembuatan repositori di tabel Qwen sendiri, Claude Opus 4.6 tetap lebih kuat pada HLE, dan Qwen3.8-Max masih merupakan tier Qwen dengan kapabilitas lebih tinggi.
Bagi pengembang, langkah praktis paling masuk akal adalah mengevaluasi Qwen3.8-Flash pada tugas nyata dan membandingkan biaya per hasil diterima terhadap Gemini 3.7 Flash, DeepSeek V4 Flash, dan model premium dalam tumpukan perouting Anda. CometAPI menyediakan satu antarmuka yang kompatibel dengan OpenAI untuk pengujian multi-model dan penerapan semacam itu.
