TLDR Tim Qwen milik Alibaba resmi meluncurkan Qwen3.8-Max pada 3 Agustus 2026 โ sebuah model Mixture-of-Experts (MoE) sparse dengan total 2,4 triliun parameter (95 miliar aktif), jendela konteks 1 juta token, dan dukungan multimodal bawaan (teks + gambar + video).
Ini adalah model Qwen kelas Max pertama yang dijadwalkan untuk bobot terbuka (diperkirakan pekan berikutnya). Dipatok agresif pada $2 per 1 juta token input dan $6 per 1 juta token output, model ini memberikan hasil kuat pada tugas agen berjangka panjang, rekayasa perangkat lunak otonom (termasuk proyek pengodean self-evolving selama 16 hari yang didokumentasikan), reproduksi riset, dan tolok ukur multimodal. Model ini bersaing ketat dengan model seperti Kimi K3 dan berada di atas opsi yang lebih ringan seperti DeepSeek V4 Flash dalam kapabilitas, sekaligus tetap jauh lebih hemat biaya daripada model frontier Barat teratas pada beban kerja yang berat di output. Pengembang dapat mengaksesnya hari ini via QwenCloud / Alibaba Cloud Model Studio dan melalui platform terpadu seperti CometAPI.
Poin Utama
- Skala dan efisiensi: arsitektur MoE total 2,4T / 95B aktif yang dibangun di atas fondasi Qwen 3.5 memungkinkan kinerja setara frontier dengan biaya inferensi yang praktis.
- Kekuatan jangka panjang: Menunjukkan pengodean otonom multi-hari (265 commit, 127 PR selama ~16 hari tanpa intervensi manusia), reproduksi + peningkatan makalah riset, dan operasi e-commerce simulasi selama setahun.
- Sorotan benchmark: PaperBench 93.0 (terdepan), Terminal Bench 2.1 86.6, skor multimodal dan dokumen yang kuat; kompetitif namun tidak dominan di setiap leaderboard agen pengodean murni dibandingkan Claude Fable 5 atau GPT-5.6 Sol.
- Keunggulan harga: Flat $2 / $6 per 1M token di seluruh 1M konteks (input cache ~$0.25), lebih murah daripada Kimi K3 pada output dan banyak model Barat.
- Ketersediaan: Live di QwenCloud dan Alibaba Cloud Model Studio (API kompatibel OpenAI dan Anthropic); bobot terbuka direncanakan; sudah terdaftar di CometAPI sebagai
qwen3.8-maxuntuk akses terpadu bersama 500+ model lainnya. Bobot terbuka segera hadir; varian Qwen3.8-27B yang lebih kecil juga direncanakan untuk deployment lokal/edge yang praktis. - Keunggulan praktis: Unggul dalam produksi deliverable end-to-end daripada jawaban satu putaran โ ideal untuk agen pengodean, pipeline riset, alur kerja kantor, dan loop agen berkelanjutan.
Apa itu Qwen3.8-Max?
Qwen3.8-Max adalah model flagship terbaru dan paling kapabel dari seri Qwen milik Alibaba, resmi dirilis pada 3 Agustus 2026 (setelah pratinjau pertengahan Juli di World AI Conference di Shanghai). Ini mewakili pergeseran yang disengaja menuju model yang dapat menyelesaikan tugas kompleks multi-hari secara end-to-end dengan supervisi minimal dan menghasilkan deliverable siap kirim.
Secara arsitektur, ini adalah model Mixture-of-Experts (MoE) sparse yang diskalakan hingga 2,4 triliun parameter total, dengan hanya sekitar 95 miliar yang diaktifkan per token. Desain ini, dibangun di atas fondasi Qwen 3.5, menyeimbangkan kapasitas masif dengan efisiensi inferensi. Model ini mendukung jendela konteks 1 juta token (input maksimum terdokumentasi sekitar 991K token dan output maksimum sekitar 131K token), input multimodal bawaan (teks, gambar, dan video), serta output teks. Model ini mencakup kontrol upaya penalaran (xhigh / medium / low) dan mendukung protokol yang kompatibel dengan OpenAI Chat Completions dan Anthropic, sehingga kompatibel drop-in dengan kerangka agen populer seperti Claude Code, Codex, Qoder CLI, Qwen Code, dan OpenClaw.
Berbeda dari model kelas Max sebelumnya yang tetap tertutup, Alibaba berkomitmen untuk merilis bobot Qwen3.8-Max (dan varian Qwen3.8-27B yang lebih kecil) pada pekan setelah peluncuran melalui Hugging Face dan ModelScope โ untuk pertama kalinya model Qwen kelas Max akan tersedia secara terbuka.
Model ini diposisikan untuk agen pengodean, pekerjaan profesional dunia nyata (โcoworkโ), riset, perencanaan jangka panjang, dan loop agen multimodal. Demo resmi menekankan perilaku yang berevolusi sendiri: model membuat issue, menugaskannya ke dirinya sendiri, menulis dan menguji kode, melakukan iterasi berdasarkan umpan balik, dan meningkatkan tool-nya sendiri dalam periode yang panjang.
Sumber: Blog resmi Qwen dan pengumuman Alibaba Cloud (Agustus 2026); kartu model Artificial Analysis; ulasan independen yang merangkum rilis GA.
Apa yang Baru di Qwen3.8-Max?
Dibandingkan pendahulunya Qwen3.7-Max, generasi 3.8 menghadirkan peningkatan substansial dalam pengodean agen, reliabilitas jangka panjang, penalaran multimodal, dan performa dokumen/kantor. Inovasi kunci meliputi:
Otonomi jangka panjang yang sesungguhnya:
Model dapat mempertahankan pembelajaran adaptif loop tertutup selama ratusan giliran atau beberapa hari. Contoh terdokumentasi mencakup proyek rekayasa perangkat lunak otonom selama 16 hari yang menghasilkan tool CLI self-evolving (oh-my-cli) dengan 265 commit, 127 pull request, dan 151 issue sepenuhnya tanpa intervensi manusia; reproduksi dan peningkatan metodologi sebuah makalah riset (termasuk loop pelatihan GPU dan peningkatan tolok ukur terukur); serta simulasi operasi e-commerce selama setahun penuh yang secara signifikan melampaui baseline.
Multimodal sebagai loop umpan balik kontinu:
Kemampuan visual bukan sekadar modalitas masukan. Model menggunakan pemahaman visual untuk perencanaan, pemantauan eksekusi, dan koreksi diri โ memungkinkan tugas seperti rekreasi screenshot-ke-kode, pembuatan game/animasi interaktif, dan visualisasi 2D-ke-3D.
Model ini berperingkat tinggi di Text Arena (dilaporkan kelima) dan Vision Arena (dilaporkan kedua) dalam data awal pascarilis.


Fokus pada deliverable end-to-end:
Penekanan pada menghasilkan output berkualitas produksi di ratusan profesi alih-alih jawaban terisolasi.
Mode Thinking dan Inferensi Cepat
Dua mode: thinking mode dan fast inference mode. Thinking mode untuk penalaran lebih dalam dan perencanaan kompleks. Fast mode untuk respons latensi rendah ketika tugasnya sederhana. Dokumentasi OpenCode milik Alibaba Cloud menunjukkan thinking diaktifkan untuk rute Qwen3.8 dan mencantumkan kontrol penalaran untuk rute pratinjau, termasuk xhigh, medium, dan low.
Pemisahan ini bernilai bagi desain produk. Tim tidak boleh memakai mode penalaran terberat untuk setiap permintaan. Bot dukungan dapat mengklasifikasikan tiket sederhana dengan murah, merangkum dengan model yang lebih cepat, dan mengekeskalasi ke thinking mode Qwen3.8-Max hanya ketika pengguna meminta keputusan kebijakan yang rumit, analisis akar masalah, telaah kontrak, atau rencana migrasi kode.
Kemampuan ini divalidasi melalui eksperimen internal jangka panjang dan rangkaian benchmark komprehensif yang mencakup agen pengodean, agen umum, penalaran multimodal, pemahaman dokumen, serta tugas persepsi/grounding.
Benchmarking: kinerja kuantisasi data
Alibaba menerbitkan rangkaian benchmark internal yang ekstensif saat GA. Verifikasi independen (Artificial Analysis Intelligence Index, LMArena, dll.) masih menyusul pada hari-hari segera setelah rilis; data awal Artificial Analysis menempatkan Qwen3.8-Max pada Intelligence Index 53 (peringkat ~16/186 dalam set yang dilacak), dengan catatan verbositas tinggi dan kecepatan relatif lebih rendah.
Skor resmi/dilaporkan terpilih (Qwen3.8-Max vs rekan pembanding terpilih):
| Benchmark | Qwen3.8-Max | Claude Fable 5 / Opus 4.8 | GPT-5.6 Sol (max) | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| PaperBench | 93.0 | 88.8 / 80.3 | 90.5 | 64.8 |
| SWE-bench Pro | 67.7 | 80.0 / 69.2 | 64.6 | 60.6 |
| FrontierSWE | 73.5 | 88.8 | โ | 40.7 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| IFBench | 82.8 | ~63.5 | โ | 79.1 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.4 |
| OmniDocBench 1.5 | 92.1 | โ | โ | โ |
| OSWorld-Verified | 86.1 | โ | โ | โ |
Qwen3.8-Max sering memimpin atau berada di dekat puncak pada penalaran multimodal, tugas dokumen/kantor, dan metrik agen pengodean/riset tertentu, sementara tertinggal dari model tertutup terkuat pada beberapa suite agen rekayasa perangkat lunak murni. Lompatan generasional pada FrontierSWE dan DeepSWE sangat mencolok. Perlakukan angka vendor sebagai indikatif; menjalankan evaluasi independen dan spesifik beban kerja tetap esensial.
Harga API Qwen3.8-Max
Harga resmi Alibaba Cloud Model Studio / QwenCloud untuk Qwen3.8-Max (tarif GA awal Agustus 2026):
- Input: $2.00 per 1 juta token
- Output: $6.00 per 1 juta token (termasuk token thinking/penalaran)
- Input cache: sekitar $0.25 per 1 juta token (penghematan signifikan untuk konteks panjang berulang)
Harga flat di seluruh jendela konteks 1M token โ keunggulan penting dibanding banyak pesaing yang menerapkan biaya tambahan untuk konteks panjang. Diskon batch dan lainnya dapat berlaku tergantung wilayah dan paket deployment.
Konteks perbandingan (harga daftar perkiraan pada periode yang sama):
- Kimi K3: ~$3 / $15
- Model frontier Claude / GPT kelas atas: sering $5+ / $15โ25+
- Varian DeepSeek V4 Flash: jauh lebih rendah (sering di bawah $0.50 gabungan untuk banyak use case)
Bagi tim yang sudah memakai beberapa penyedia, gateway teragregasi seperti CometAPI biasanya menawarkan diskon ~20% dibanding tarif resmi, endpoint tunggal yang kompatibel OpenAI, penagihan terpadu, dan kemudahan switching atau failover model. Ini membuat eksperimen dengan Qwen3.8-Max (dan perbandingan simultan dengan DeepSeek V4 Flash, Kimi model, atau lainnya) menjadi lebih sederhana secara operasional dan sering kali lebih murah. Periksa halaman harga CometAPI dan penawaran kredit gratis untuk tarif efektif terbaru.
Bagaimana Qwen3.8-Max Membandingkan dengan Kimi K3 dan DeepSeek V4 Flash
| Dimensi | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Flash |
|---|---|---|---|
| Parameter Total / Aktif | 2.4T / ~95B | ~2.8T / ~104B | 284B / 13B |
| Konteks | 1M | 1M | 1M |
| Multimodal | Teks + Gambar + Video | Teks + Gambar + Video | Hanya teks |
| Harga (masuk/keluar) | $2 / $6 | $3 / $15 | ~$0.14 / $0.28 (jauh lebih murah) |
| Bobot terbuka | Direncanakan (pekan depan) | Sudah dirilis | MIT, tersedia |
| Kekuatan | Otonomi jangka panjang, multimodal, PaperBench, harga output | Skor independen kuat, kepemimpinan Arena pengodean frontend | Efisiensi biaya ekstrem, agen pengodean solid untuk ukuran |
| Posisi relatif | Kompetitif / unggul pada beberapa benchmark agen & multimodal | Sedikit unggul pada beberapa indeks kecerdasan yang diaudit | Nilai sangat baik; kapabilitas absolut lebih rendah |
Qwen3.8-Max umumnya menyamai atau melampaui Kimi K3 dalam efisiensi biaya untuk pekerjaan ber-output besar dan tugas multimodal, sementara DeepSeek V4 Flash tetap menjadi raja anggaran untuk beban teks volume tinggi di mana kapabilitas puncak bukan prioritas utama. Banyak tim akan menggunakan ketiganya melalui gateway terpadu, merutekan trafik sederhana ke model kelas Flash dan sesi agen kompleks ke Qwen3.8-Max atau Kimi K3.
Apakah Qwen3.8-Max setara dengan Kimi K3?
Dalam beberapa hal, ya. Ia menyamai tier 1M konteks, memiliki posisi multimodal yang kuat, dan lebih murah pada harga input/output resmi standar. Ia tidak menyamai jumlah parameter total 2.8T milik Kimi K3, dan dokumentasi publik Kimi saat ini menyediakan panduan tool, caching konteks, output terstruktur, dan visi yang sangat terperinci.
Apakah Qwen3.8-Max setara dengan DeepSeek V4 Flash?
Ia bersaing pada 1M konteks dan arsitektur MoE, namun produknya ditujukan untuk pekerjaan yang berbeda. DeepSeek V4 Flash adalah rute ekonomis yang cepat. Qwen3.8-Max adalah rute berkapabilitas tinggi yang lebih besar untuk pekerjaan di mana pemahaman multimodal, penalaran lanjutan, dan produktivitas enterprise lebih penting daripada harga token serendah mungkin.
Apa yang dapat dilakukan Qwen3.8-Max?
Pemrograman dan Rekayasa Perangkat Lunak
Qwen3.8-Max adalah kandidat kuat untuk pengembangan full-stack, review kode, pemahaman repositori, perencanaan migrasi, desain API, debugging, penalaran pengujian, dan arsitektur perangkat lunak. Konteks panjangnya membantu ketika model perlu menjaga banyak file, log, dan kebutuhan tetap dalam pandangan. Gunakan untuk tugas pengodean sulit, bukan untuk setiap pelengkapan otomatis atau penjelasan lint sederhana.
Pekerjaan Perkantoran dan Pengetahuan
Positioning "Cowork" model ini penting. Karyawan enterprise tidak hanya mengajukan pertanyaan chat. Mereka membandingkan PDF, merangkum rapat, meninjau slide, menafsirkan spreadsheet, memeriksa kontrak, menulis laporan, dan menyiapkan keputusan dari bukti yang acak. Desain multimodal dan konteks panjang Qwen3.8-Max membuatnya cocok untuk alur kerja kantor di mana teks, dokumen, screenshot, dan data terstruktur harus dianalisis bersama.
Alur Kerja Agen
Qwen3.8-Max bermanfaat untuk perencanaan agen: memecah tujuan menjadi langkah, memutuskan tool mana yang akan dipanggil, mengevaluasi hasil, dan merevisi rencana. Di CometAPI, ini menjadi lebih praktis karena aplikasi yang sama dapat merutekan langkah sederhana ke model yang lebih murah dan menyisihkan Qwen3.8-Max untuk perencanaan atau verifikasi.
Cara Memulai dan Tips Integrasi CometAPI
- Akses langsung: Gunakan QwenCloud atau Alibaba Cloud Model Studio dengan ID model
qwen3.8-max. Endpoint yang kompatibel OpenAI dan Anthropic keduanya didukung. - Akses terpadu via CometAPI: Daftar di CometAPI.com, dapatkan kunci API, set
base_urlkehttps://api.cometapi.com/v1, dan panggilmodel="qwen3.8-max". Kunci yang sama berfungsi untuk DeepSeek V4 Flash, Kimi K3, Claude, GPT, dan ratusan model lain โ ideal untuk eksperimen, kontrol biaya, dan routing produksi. CometAPI menekankan harga kompetitif, latensi rendah, dan penambahan model cepat (Qwen3.8-Max terdaftar segera setelah peluncuran). - Kerangka agen: Colokkan langsung ke Claude Code, OpenClaw, atau kerangka kustom. Aktifkan upaya penalaran lebih tinggi untuk pekerjaan jangka panjang yang kompleks.
- Bobot terbuka: Pantau Hugging Face / ModelScope untuk rilis yang akan datang jika Anda memerlukan deployment on-premise atau fine-tuning.
