GPT-6 Astra is now live on CometAPI →
technology/Riset CometAPI

Apa itu Qwen3.8-Flash? Spesifikasi, Benchmark, Arsitektur, Harga, dan Panduan API

Pelajari apa itu Qwen3.8-Flash, termasuk arsitektur MoE 6B-active, konteks 1M, benchmark, harga, perbandingan, dan penggunaan CometAPI.

CometAPI
Mia MarenTim riset model AI dan API
Diperbarui Sep 6, 2026 17 menit baca
Apa itu Qwen3.8-Flash? Spesifikasi, Benchmark, Arsitektur, Harga, dan Panduan API
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Qwen3.8-Flash dijelaskan: konteks 1M, desain MoE aktif 6B, benchmark pengodean dan multimodal, harga-kinerja, perbandingan, dan akses CometAPI.

TL;DR Alibaba's Qwen3.8-Flash adalah model produksi untuk pengodean volume tinggi, agen, pekerjaan konteks panjang, dan tugas multimodal. Model ini mendukung konteks ter-host 1M token dan menggabungkan hasil benchmark kuat dengan harga API rendah. Mitra open-weight, Qwen3.8-Flash-Next, tersedia untuk evaluasi dan penerapan lokal.

Poin Utama

Apa itu Qwen3.8-Flash? Spesifikasi, Benchmark, Arsitektur, Harga, dan Panduan API

Gambar peluncuran resmi Qwen3.8-Flash — sumber Alibaba/Qwen

Apa Itu Qwen3.8-Flash?

Qwen3.8-Flash adalah model produksi berorientasi efisiensi dari Alibaba Qwen untuk pengodean, agen, pekerjaan pengetahuan ber-konteks panjang, dan tugas multimodal. Model ini diumumkan bersama mitra open-weight bernama Qwen3.8-Flash-Next. Alibaba menggambarkannya sebagai model MoE multimodal open-weight yang dioptimalkan untuk kapabilitas, latensi, dan biaya, serta menyatakan arsitektur ini adalah pratinjau awal ide-ide untuk Qwen4.

Label “Flash” penting. Qwen3.8-Max adalah tier flagship yang lebih besar untuk kapabilitas maksimum, sementara Qwen3.8-Flash dibangun untuk menghadirkan sebagian besar performa pengodean dan agen yang berguna dengan komputasi aktif yang jauh lebih rendah. Rilis ini mengaktifkan 6B parameter per token, dibandingkan jejak aktif yang jauh lebih besar pada sistem MoE flagship.

Model produksi disajikan dengan ID model qwen3.8-flash. QwenCloud mendukung Chat Completions dan Responses API yang kompatibel dengan OpenAI plus antarmuka yang kompatibel dengan Anthropic, sehingga memudahkan integrasi ke tumpukan agen dan pengodean yang ada.

Qwen3.8-Flash vs. Qwen3.8-Flash-Next: Apa Bedanya?

Qwen3.8-Flash-Next adalah rilis model open-weight. Ini mengekspose arsitektur, bobot model, panduan penerapan, dan rangkaian benchmark. Bobot tersedia di Hugging Face dan ModelScope. Model open mendukung konteks native 262.144 token dan dapat diperluas hingga 1M dengan YaRN.

Qwen3.8-Flash adalah versi API produksi. Dalam rilis resmi, Alibaba mengatakan versi produksi menggunakan konteks 1M secara default dan mencakup alat bawaan resmi. Dalam praktiknya, pengembang yang mengevaluasi model ter-host sebaiknya menggunakan perilaku dan harga API Qwen3.8-Flash, sementara rilis Flash-Next adalah sumber publik terbaik untuk detail arsitektur dan benchmark.

Spesifikasi Qwen3.8-Flash

SpesifikasiQwen3.8-Flash / Flash-Next
PenyediaAlibaba Qwen
ID model produksiqwen3.8-flash
Model open-weightQwen3.8-Flash-Next
ArsitekturMultimodal Mixture-of-Experts; atensi hibrida GDN + QSA
Parameter utama125B
Parameter diaktifkan6B per token
Parameter embedding N-gram51B
Konteks model open native262.144 token
Konteks diperluas/ter-hostHingga 1.000.000 token
Modalitas input produksiTeks + gambar didokumentasikan dalam contoh integrasi resmi
Modalitas open-weightTeks + visi; dirilis sebagai multimodal
Kontrol penalaranlow / medium / xhigh dalam contoh QwenCloud
Panggilan alat paralelDidukung dalam konfigurasi model Codex resmi
Bobot terbukaYa, untuk Qwen3.8-Flash-Next
Tanggal peluncuranRentang rilis 26–27 Agustus 2026

Angka efisiensi kunci adalah 6B parameter diaktifkan per token. Tambahan 51B parameter embedding N-gram adalah kapasitas berbasis lookup; Qwen mencatat bahwa ini tidak masuk ke anggaran perkalian-matriks per token dengan cara yang sama seperti bobot transformer.

Apa yang Baru di Arsitektur Qwen3.8-Flash?

Apa itu Qwen3.8-Flash? Spesifikasi, Benchmark, Arsitektur, Harga, dan Panduan API

Diagram arsitektur resmi Qwen — Qwen3.8-Flash-Next

1. GDN + Qwen Sparse Attention (QSA)

Model ini mencampur dua mekanisme. Tiga dari setiap empat layer menggunakan Gated DeltaNet (GDN) untuk mengompresi informasi historis menjadi state berukuran tetap, sementara layer yang tersisa menggunakan atensi global untuk pengambilan yang presisi. Layer atensi global kemudian menggunakan Qwen Sparse Attention untuk mengurangi jumlah konteks yang harus diproses langsung.

Tujuan praktisnya sederhana: GDN menangani memori hemat, sementara QSA mengalokasikan atensi penuh hanya di tempat pengambilan informasi penting. Ini sangat berharga untuk aplikasi konteks panjang di mana atensi penuh biasa menjadi mahal baik dalam komputasi maupun lalu lintas KV-cache.

2. Gated Residual dengan Empat Jalur Informasi

Gated Residual memperlebar aliran residual menjadi empat cabang paralel. Sebuah gerbang per-elemen dinamis mengontrol seberapa banyak informasi yang dibaca dari dan ditulis ke setiap cabang. Ini memberi informasi awal lebih banyak cara untuk bertahan di jaringan yang dalam alih-alih terus-menerus bercampur dalam satu aliran. Qwen juga mengatakan state residual dapat disimpan dalam FP8 untuk mengurangi lalu lintas memori.

3. Embedding N-gram Menambah Kapasitas Tanpa Komputasi Proporsional

Qwen menambahkan 51B parameter embedding N-gram yang diakses menggunakan konteks token lokal. Tidak seperti bobot transformer normal, parameter ini diambil melalui operasi lookup dan dapat di-offload ke memori host dengan prefetch asinkron. Desain ini memperluas kapasitas model sambil menjaga aritmetika per token tetap rendah.

4. Optimizer Muon dan Ko-desain Pelatihan

Qwen melatih model dengan optimizer Muon untuk bobot peta linear 2D inti sambil mempertahankan AdamW untuk embedding, router, dan parameter low-rank tertentu. Tim juga menyesuaikan ulang hukum skala untuk arsitektur baru dan melaporkan bahwa warmup ukuran batch tidak diperlukan, menghindari 18.8% langkah optimizer tambahan dalam eksperimennya.

5. MoE Ultra-jarang dan Prediksi Multi-token

Model mempertahankan kumpulan expert besar tetapi hanya merutekan sejumlah kecil expert per token. Model ini juga menggunakan prediksi multi-token, yang membantu decoding spekulatif dengan meningkatkan tingkat penerimaan sekaligus memperbaiki backbone selama pelatihan. Bersama-sama, pilihan ini memperkuat tujuan desain yang sama: lebih banyak kapasitas dan throughput tanpa membayar komputasi level-flagship pada setiap token.

Performa Benchmark Qwen3.8-Flash

Benchmark Pengodean

Alibaba memublikasikan rangkaian benchmark di bawah Qwen3.8-Flash-Next, mitra open-weight dari Qwen3.8-Flash produksi. Tabel berikut menggunakan skor rilis yang dilaporkan Qwen dan berfokus pada rekan yang juga tersedia melalui CometAPI.

Apa itu Qwen3.8-Flash? Spesifikasi, Benchmark, Arsitektur, Harga, dan Panduan API

Bagan benchmark bahasa resmi Qwen

BenchmarkQwen3.8-FlashDeepSeek V4 FlashClaude Opus 4.6
DeepSWE 1.158.754.4
SWE-bench Pro62.556.053.4
SWE-bench Multilingual81.077.5
NL2Repo-Bench48.154.247.6
CoWorkBench73.945.168.2
JobBench55.741.336.6
Toolathlon Verified73.570.3
IFBench81.379.262.5
GPQA Diamond91.790.891.3
HLE35.933.840.0
LiveCodeBench v691.990.688.8

Hasil pengodean: Qwen3.8-Flash memimpin rekan terpilih pada SWE-bench Pro (62.5), SWE-bench Multilingual (81.0), dan LiveCodeBench v6 (91.9). Pengecualian utama adalah NL2Repo-Bench, di mana DeepSeek V4 Flash mencetak 54.2 versus 48.1.

Hasil agen: Qwen3.8-Flash mencatat 73.9 pada CoWorkBench dan 55.7 pada JobBench, secara material di atas rekan terpilih dalam tabel rilis Qwen. Model ini juga sedikit unggul atas DeepSeek V4 Flash pada Toolathlon Verified, 73.5 versus 70.3.

Hasil penalaran: Bidang ini lebih ketat. Qwen3.8-Flash mencetak 91.7 pada GPQA Diamond, dekat dengan Claude Opus 4.6 di 91.3 dan DeepSeek V4 Flash di 90.8. Pada HLE, Claude Opus 4.6 memimpin dengan 40.0 dibanding 35.9 milik Qwen.

Benchmark Multimodal

Apa itu Qwen3.8-Flash? Spesifikasi, Benchmark, Arsitektur, Harga, dan Panduan API

Bagan benchmark visi-bahasa resmi Qwen

BenchmarkQwen3.8-FlashClaude Opus 4.6
ClawEval-MM (Pass@3 / Rata-rata)64.4 / 60.452.5 / 54.7
AndroidWorld84.562.0
ERQA72.340.8
LVBench76.663.0
RealWorldQA88.573.9
MathVision (tanpa CI / dengan CI)90.6 / 95.765.5 / —
CharXiv RQ (tanpa CI / dengan CI)84.6 / 90.666.0 / —

Hasil rilis multimodal adalah salah satu argumen terkuat untuk Qwen3.8-Flash. Qwen melaporkan 84.5 pada AndroidWorld, 88.5 pada RealWorldQA, dan 90.6 pada MathVision tanpa code interpreter. Skor ini menunjukkan model ditujukan untuk agen yang harus membaca layar, memahami status visual, dan terus bertindak alih-alih hanya menjawab pertanyaan gambar.

Catatan benchmark: Ini adalah hasil rilis yang dilaporkan vendor, bukan uji lab head-to-head netral. Beberapa benchmark menggunakan harness atau konfigurasi alat berbeda, dan sebagian bersifat in-house. Perlakukan angka sebagai bukti indikatif, lalu validasi model pada prompt, alat, target latensi, dan kriteria penerimaan Anda sendiri.

Mengapa Qwen3.8-Flash Cepat dan Hemat Biaya

Apa itu Qwen3.8-Flash? Spesifikasi, Benchmark, Arsitektur, Harga, dan Panduan API

Bagan efisiensi konteks panjang resmi Qwen

Pada konteks 1M token, Qwen melaporkan hingga 7.6x lebih cepat prefill dan 4.9x lebih cepat decode untuk kernel atensi QSA. Dalam eksperimen penyajian dengan tingkat hit cache prefiks 90%, Qwen3.8-Flash-Next mencapai 8.6x throughput prefill Qwen3.7-Plus.

Kisah tingkat sistem yang lebih besar adalah komputasi aktif. Model utama 125B biasanya terdengar besar, tetapi hanya 6B parameter yang diaktifkan per token. Jejak aktif itu kurang dari setengah 13B parameter aktif yang dilaporkan untuk DeepSeek V4 Flash dan jauh di bawah sekitar 95B parameter aktif yang dilaporkan untuk Qwen3.8-Max. Jumlah parameter tidak bertranslasi linear ke kecepatan, tetapi desain ini memberi Qwen3.8-Flash target efisiensi yang jelas.

Alibaba juga melaporkan bahwa pelatihan membutuhkan sekitar sepersembilan sumber daya Qwen3.7-Plus sambil meningkatkan kinerja pengodean dan tugas perkantoran. Terpisah, mode QwenWork Standard yang didukung oleh model ini dilaporkan memangkas konsumsi token per tugas sebesar 75% dan kira-kira menggandakan kecepatan generasi dibanding mode sebelumnya. Angka tingkat produk tersebut tidak boleh dianggap sebagai jaminan latensi API universal, tetapi menunjukkan bagaimana Alibaba mengharapkan model digunakan.

Harga Qwen3.8-Flash

Pengumuman peluncuran Alibaba mencantumkan harga QwenCloud sebesar $0.16 per satu juta token input dan $0.47 per satu juta token output. Harga dapat bervariasi menurut wilayah, permukaan produk, caching, atau pembaruan berikutnya, jadi tim produksi harus selalu memeriksa halaman penyedia live sebelum memperkirakan beban kerja besar.

Pada saat artikel ini disiapkan, CometAPI mencantumkan Qwen3.8-Flash pada $0.12 per satu juta token input dan sekitar $0.376 per satu juta token output. Halaman model CometAPI menandai ini sebagai diskon 20% relatif terhadap harga referensi yang tercantum.

RuteInput / 1M tokenOutput / 1M tokenContoh: 10M input + 2M output
Tarif peluncuran QwenCloud$0.16$0.47$2.54
Tarif terdaftar CometAPI$0.12~$0.376~$1.95

Untuk beban kerja dengan 10 juta token input dan 2 juta token output, aritmetika tarif peluncuran sekitar $2.54 di QwenCloud versus sekitar $1.95 pada tarif CometAPI yang saat ini terdaftar. Tagihan agen nyata bisa lebih tinggi karena panggilan alat, retry, penalaran panjang, konteks yang berulang, dan layanan eksternal menambah biaya. Bandingkan biaya per hasil yang diterima alih-alih hanya harga token.

Qwen3.8-Flash vs. Qwen3.8-Max vs DeepSeek V4 Flash

DimensiQwen3.8-FlashQwen3.8-MaxGemini 3.7 FlashDeepSeek V4 Flash
PemosisianModel produksi Qwen berfokus efisiensiModel flagship QwenModel Flash andalan GoogleMoE teks berfokus efisiensi
Total / parameter aktif125B + 51B lookup / 6B2.4T / ~95BTidak diungkap284B / 13B
Konteks1M ter-host1M1,048,5761M
MultimodalTeks + visi didokumentasikanTeks + gambar + videoTeks + gambar + video + audio + PDFBerfokus teks
Kontrol penalaranlow / medium / xhighPenalaran lanjutan / mode cepatlow / medium / highNon-think / Think / Think Max
Harga input CometAPIUS$0.12/MUS$1.60/MUS$0.60/MUS$0.176/M
Harga penyedia resmi (input / output)US$0.15 / US$0.47 (Alibaba Cloud internasional)US$2 / US$6 (Alibaba Cloud internasional)US$0.75 / US$3.75 hingga 31 Des 2026Puncak: US$0.44 / US$1.32; non-puncak: US$0.22 / US$0.66
Kecocokan terbaikPengodean volume tinggi, agen, kerja bersamaTugas Qwen tersulit, otonomi horizon panjangEkosistem alat Google, agen multimodal luasPenalaran teks dan pengodean ber-throughput tinggi

Di Mana Qwen3.8-Flash Unggul

  • Efisiensi komputasi aktif: 6B parameter aktif sangat kecil untuk model yang mencatat skor pengodean agen dan multimodal kuat.
  • Nilai ekosistem Qwen: Qwen3.8-Flash jauh lebih murah daripada Qwen3.8-Max untuk beban kerja yang tidak membutuhkan tier flagship.
  • Keseimbangan agen + perkantoran: Rilis ini luar biasa kuat pada CoWorkBench, JobBench, Toolathlon, SWE-bench Pro, dan tugas agen multimodal, bukan hanya QA akademis.
  • Jalur open-weight: Qwen3.8-Flash-Next menyediakan bobot bagi tim yang memerlukan penerapan lokal, evaluasi independen, atau fine-tuning.

Kapan Model Lain Lebih Baik

  • Gunakan Qwen3.8-Max untuk kapabilitas puncak Qwen. Tier Max memiliki anggaran komputasi aktif yang jauh lebih besar dan dirancang untuk pekerjaan horizon panjang yang paling sulit.
  • Gunakan Gemini 3.7 Flash saat dukungan modalitas input yang luas penting. Model Flash Google secara eksplisit mencakup audio, video, PDF, dan integrasi alat Google yang mendalam.
  • Gunakan DeepSeek V4 Flash saat prioritasnya adalah efisiensi berfokus teks. Model ini menang pada NL2Repo-Bench dalam perbandingan Qwen dan tetap menjadi alternatif pengodean berbiaya rendah yang kuat.
  • Gunakan Claude Opus 4.6 saat penalaran premium dan kematangan alur kerja enterprise membenarkan harganya. Dalam tabel rilis Qwen, model ini masih memimpin HLE dan tetap sangat kompetitif pada GPQA.

Use Case Terbaik untuk Qwen3.8-Flash

Agen Pengodean dan Pekerjaan Repositori

Qwen3.8-Flash sangat cocok untuk penyelesaian isu, refaktoring, tinjauan kode, navigasi repositori, pembuatan pengujian, debugging, dan loop pengodean berbasis alat. Hasil LiveCodeBench dan SWE-bench Pro yang tinggi menunjukkan bahwa ini bukan sekadar model chat ber-latensi rendah; model ini dirancang untuk melakukan pekerjaan perangkat lunak multi-langkah.

Pekerjaan Pengetahuan Enterprise Ber-konteks Panjang

Konteks produksi 1M token dapat menampung koleksi dokumen besar, basis kode, log, transkrip rapat, atau riwayat agen jangka panjang. Hasil CoWorkBench dan JobBench membuat model ini menarik untuk sintesis dokumen, alur kerja spreadsheet/slide, dukungan riset, tinjauan kepatuhan, dan analisis operasional.

Agen Multimodal

Skor AndroidWorld, RealWorldQA, ERQA, dan MathVision mengarah pada agen yang harus memahami tangkapan layar, dokumen visual, antarmuka, diagram, dan gambar dunia nyata sebagai bagian dari alur kerja. Ini membuat model relevan untuk agen peramban, pengujian UI, QA visual, agen dokumen, dan otomasi yang peka terhadap layar.

Perouting Volume Tinggi

Karena Qwen3.8-Flash jauh lebih murah daripada model flagship, arsitektur praktisnya adalah merutekan sebagian besar traffic produksi ke Flash dan mengeskalasi hanya permintaan yang ambigu, berisiko tinggi, atau sangat sulit ke Qwen3.8-Max atau model premium lainnya. Gateway terpadu seperti CometAPI memudahkan pola perouting ini karena aplikasi dapat beralih penyedia di balik satu kontrak API.

Keterbatasan dan Peringatan

  • Benchmark dilaporkan oleh vendor. Beberapa menggunakan harness pilihan Qwen, tugas in-house, atau pengaturan dengan alat. Verifikasi independen tetap penting.
  • Tidak setiap benchmark adalah kemenangan. DeepSeek V4 Flash memimpin NL2Repo-Bench dalam perbandingan resmi, dan Claude Opus 4.6 memimpin HLE.
  • Penggunaan komputer tetap sulit secara absolut. Rilis melaporkan skor biner OSWorld 2.0 sebesar 19.4 meskipun kinerja kredit parsial jauh lebih tinggi.
  • Perilaku ter-host dan open-weight bisa berbeda. Prompt sistem, alat, manajemen konteks, kuantisasi, tumpukan penyajian, dan pembaruan penyedia dapat menggeser hasil dunia nyata dari setup benchmark Flash-Next yang dipublikasikan.
  • Harga bersifat dinamis. Pengumuman peluncuran dan halaman agregator saat ini dapat menampilkan harga referensi yang sedikit berbeda. Gunakan harga endpoint live saat membuat anggaran.

Cara Menggunakan API Qwen3.8-Flash dengan CometAPI

CometAPI mengekspos Qwen3.8-Flash melalui endpoint yang kompatibel dengan OpenAI, sehingga integrasi SDK OpenAI yang ada biasanya dapat beralih dengan mengubah kunci API, base URL, dan ID model.

Mengapa Menggunakan CometAPI untuk Qwen3.8-Flash?

CometAPI memberi pengembang endpoint API terpadu untuk menguji Qwen3.8-Flash bersama model lain tanpa memelihara integrasi penyedia terpisah. Ini sangat berguna untuk perbandingan benchmark, perouting fallback, dan pemilihan model berbasis biaya.

  1. Buat kunci API CometAPI. Hasilkan kunci di dasbor CometAPI dan simpan di variabel lingkungan, bukan dalam kode sumber.
  2. Gunakan base URL terpadu. Setel base URL SDK ke https://api.cometapi.com/v1.
  3. Pilih model. Gunakan qwen3.8-flash sebagai ID model.

Python

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-flash",
    messages=[
        {"role": "system", "content": "Anda adalah asisten pengodean yang presisi."},
        {"role": "user", "content": "Tinjau desain API ini dan identifikasi risiko keandalannya."},
    ],
)

print(response.choices[0].message.content)

cURL

curl "https://api.cometapi.com/v1/chat/completions" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash",
    "messages": [
      {"role": "user", "content": "Ringkas risiko utama dalam rencana migrasi ini."}
    ]
  }' 
For production, add timeout handling, retry policy, token limits, structured output validation, and model-routing telemetry. If your workflow is agentic, track tool-call failures and accepted-task rate in addition to raw model latency.

FAQ

Apakah Qwen3.8-Flash open source?

Rute produksi Qwen3.8-Flash adalah API ter-host. Mitra open-weight-nya, Qwen3.8-Flash-Next, memiliki bobot yang dirilis di Hugging Face dan ModelScope. “Open-weight” adalah istilah yang lebih tepat karena hak penggunaan bergantung pada lisensi model.

Berapa konteks jendela Qwen3.8-Flash?

Model open mendukung 262.144 token secara native dan dapat diperluas hingga 1.000.000 token dengan YaRN. Alibaba mengatakan layanan Qwen3.8-Flash produksi menggunakan konteks 1M token secara default.

Berapa banyak parameter yang dimiliki Qwen3.8-Flash?

Rilisnya memiliki model utama 125B parameter, 51B parameter embedding N-gram, dan 6B parameter diaktifkan per token. Jumlah aktif yang rendah adalah inti dari desain efisiensinya.

Apakah Qwen3.8-Flash mendukung gambar?

Ya. Rilisnya bersifat multimodal, tumpukan penerapan open-weight mendukung teks dan visi, dan contoh integrasi resmi mencantumkan input teks dan gambar untuk model ter-host. Permukaan khusus penyedia dapat mengekspose kombinasi modalitas berbeda, jadi periksa halaman kapabilitas API saat ini sebelum penerapan.

Apakah Qwen3.8-Flash lebih baik daripada Qwen3.8-Max?

Tidak secara universal. Qwen3.8-Flash adalah pilihan lebih baik saat latensi, komputasi aktif, dan harga penting. Qwen3.8-Max adalah pilihan flagship untuk tugas paling sulit, horizon panjang, dan bernilai tinggi. Sistem perouting dapat menggunakan keduanya.

Berapa biaya Qwen3.8-Flash?

Alibaba mengumumkan US$0.16/M token input dan US$0.47/M token output untuk QwenCloud saat peluncuran. CometAPI saat ini mencantumkan sekitar US$0.12/M input dan US$0.376/M output. Periksa harga live karena tarif penyedia dan agregator dapat berubah.

Kesimpulan

Qwen3.8-Flash adalah salah satu contoh paling jelas dari pergeseran saat ini dari “model lebih besar” ke “ekonomi sistem yang lebih baik.” Backbone utama 125B terlihat besar di atas kertas, tetapi model ini hanya mengaktifkan 6B parameter per token dan menambah kapasitas melalui embedding N-gram gaya lookup. QSA, Gated Residual, perutean MoE ultra-jarang, dan desain penyajian berorientasi konteks panjang semuanya mendorong ke arah yang sama: menghadirkan kapabilitas pengodean agen dan multimodal tanpa biaya inferensi level-flagship.

Hasil rilis sangat menarik untuk rekayasa perangkat lunak, agen perkantoran, penggunaan alat, dan alur kerja visual. Pada saat yang sama, model ini tidak unggul secara seragam: DeepSeek V4 Flash menang setidaknya satu benchmark pembuatan repositori di tabel Qwen sendiri, Claude Opus 4.6 tetap lebih kuat pada HLE, dan Qwen3.8-Max masih merupakan tier Qwen dengan kapabilitas lebih tinggi.

Bagi pengembang, langkah praktis paling masuk akal adalah mengevaluasi Qwen3.8-Flash pada tugas nyata dan membandingkan biaya per hasil diterima terhadap Gemini 3.7 Flash, DeepSeek V4 Flash, dan model premium dalam tumpukan perouting Anda. CometAPI menyediakan satu antarmuka yang kompatibel dengan OpenAI untuk pengujian multi-model dan penerapan semacam itu.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Sep 4, 2026
Terakhir diperbarui Sep 6, 2026
0 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya