GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI โ†’
ai-model/Riset CometAPI

Apa itu Qwen3.8-Omni-Flash dan cara mengaksesnya

Please provide the source text you want translated into Bahasa Indonesia.

CometAPI
Mia MarenTim riset model AI dan API
Diperbarui Sep 21, 2026 11 menit baca
Apa itu Qwen3.8-Omni-Flash dan cara mengaksesnya
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Qwen3.8-Omni-Flash adalah model omni-modal native dari Alibaba Qwen untuk pemahaman teks, gambar, audio, dan video, dengan teks sebagai modalitas keluarannya. Diumumkan pada September 18, 2026, model ini menggabungkan jendela konteks 1M token, penalaran audio-video native, penalaran yang dapat disesuaikan, pemanggilan fungsi, penelusuran web, pemahaman audio spasial, dan penggunaan alat.

Perubahan terpenting bukan sekadar pemahaman video yang lebih baik. Qwen menggambarkan model ini sebagai model omni-modal pertamanya yang dibangun di sekitar kapabilitas agen: model ini dapat memahami apa yang dilihat dan didengar, merencanakan langkah selanjutnya, memanggil alat, dan menyelesaikan tugas yang lebih panjang seperti pengeditan vlog, penerjemahan video, produksi ringkasan film, analisis rapat, dan riset multimedia.

Saat peluncuran, Qwen melaporkan peningkatan rata-rata lebih dari 25% di 29 evaluasi dibandingkan Qwen3.5-Omni-Plus. Ini adalah hasil yang dilaporkan vendor pada saat peluncuran, bukan evaluasi independen.

Key Takeaways

  • Masukan omni-modal native: Qwen3.8-Omni-Flash menerima teks, gambar, audio, dan video, sementara saat ini mengembalikan teks.
  • Alur kerja media berkapabilitas agen: Dapat menggabungkan pemahaman media dengan perencanaan, pemanggilan fungsi, dan penelusuran web.
  • Konteks panjang dan kedalaman audio: Model hosted menyediakan jendela konteks 1M token dan mendukung audio multibahasa, stereo, dan ambisonik orde pertama.
  • Peningkatan tolok ukur yang dilaporkan vendor: Peningkatan terbesar muncul pada agen multimodal, pemahaman audio panjang, diarisasi pembicara, dan grounding audio.
  • Ketersediaan hosted: Model tersedia melalui API hosted; Qwen-MM-Plugins dirilis terpisah sebagai open source untuk alur kerja agen multimodal.

Pengembang dapat mengakses Qwen3.8-Omni-Flash API di CometAPI melalui alur kerja API terpadu.

What Is Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash adalah model omni-modal native generasi berikutnya dari Qwen. Alih-alih memperlakukan audio atau video hanya sebagai artefak prapemrosesan, model ini melakukan penalaran atas teks, bingkai visual, ucapan, suara lingkungan, dan relasi temporal dalam satu alur. Masukan yang didukung adalah teks, gambar, audio, dan video; keluarannya saat ini adalah teks.

Pembedaan modalitas keluaran itu penting. Dokumentasi resmi Alibaba Cloud memposisikan Qwen3.8-Omni-Flash untuk pemahaman multimodal dan eksekusi agen, sementara kasus penggunaan keluaran suara tetap lebih cocok untuk varian Qwen Omni yang secara eksplisit mendukung audio yang dihasilkan.

Pemosisian peluncurannya bergeser dari โ€œmengenali mediaโ€ menuju โ€œmemahami, merencanakan, mengeksekusi, dan menyampaikan.โ€ Hal ini membuat model relevan untuk pengeditan video, riset multimedia, analisis rapat, pemrosesan video instruksional, dan alur kerja lain di mana model harus melakukan sesuatu terhadap media, bukan sekadar meringkasnya.

Qwen3.8-Omni-Flash specifications

Tabel spesifikasi di bawah ini didasarkan pada laman model resmi Alibaba Cloud dan QwenCloud; batasan dan harga dapat bervariasi menurut wilayah dan harus diperiksa ulang sebelum publikasi atau penerapan.

SpecificationQwen3.8-Omni-Flash โ€” laman model resmi
DeveloperAlibaba Qwen
ReleaseSeptember 18, 2026
Model typeModel omni-modal native
Input / outputTeks, gambar, audio, video / teks
Context window1,000,000 token
Maximum input991,808 token normal; 983,616 token dalam mode thinking
Maximum output131,072 token
Maximum reasoning allowanceHingga 262K token di QwenCloud
ThinkingDiaktifkan secara default; upaya penalaran dapat dikonfigurasi
Tools and cachingPemanggilan fungsi, penelusuran web, cache implisit, dan cache sesi
Audio113 bahasa dan dialek; stereo dan FOA empat kanal
API stylesChat Completions dan Responses
QwenCloud price$0.15 input, $0.47 output, dan $0.016 implicit-cache input per 1M token
Open weightsTidak diumumkan untuk model ini saat peluncuran

How Does Qwen3.8-Omni-Flash Work?

QwenCloud menyatakan bahwa Qwen3.8-Omni-Flash dibangun di atas arsitektur Qwen3.8-Flash-Next. Itu memberi konteks arsitektural, tetapi jumlah parameter yang dipublikasikan untuk Flash-Next tidak boleh secara otomatis dipresentasikan sebagai spesifikasi parameter persis dari model Omni kecuali Qwen mengonfirmasi pemetaannya.

Gated DeltaNet + Qwen Sparse Attention

Fondasi Flash-Next menggabungkan Gated DeltaNet dengan Qwen Sparse Attention. Secara sederhana, komponen rekuren mengompresi informasi historis ke dalam state yang ringkas, sementara sparse attention mengambil konteks jarak jauh terpilih alih-alih menerapkan attention penuh padat ke setiap pasangan token. Ini sangat relevan untuk aliran audio dan video panjang, di mana panjang urutan dapat mendominasi biaya komputasi.

Agentic perception instead of static perception

Perubahan yang lebih besar berada pada tingkat sistem. Qwen mengatakan model dapat secara aktif menjelajahi video panjang dan fokus pada momen yang relevan alih-alih menghabiskan compute secara setara pada setiap segmen. Secara konseptual, agen mengidentifikasi lokasi bukti yang paling mungkin, memeriksa momen tersebut lebih dalam, melakukan penalaran, lalu memutuskan alat atau operasi apa yang harus dilakukan berikutnya.

What Are the Main Qwen3.8-Omni-Flash Features?

Native audio-video reasoning

Qwen3.8-Omni-Flash melakukan penalaran secara bersama atas aliran visual dan audio dari sebuah video. Ini penting ketika jawaban bergantung pada kedua modalitas: mengidentifikasi siapa yang mengatakan sesuatu, menentukan apakah suatu suara terjadi sebelum atau sesudah sebuah aksi, menafsirkan musik atau audio ambient, atau menghubungkan instruksi lisan dengan apa yang muncul di layar.

Multi-speaker dan pemahaman audio spasial

API mendukung audio multikanal, termasuk stereo dua kanal dan ambisonik orde pertama empat kanal. Pelestarian informasi arah dapat membantu analisis rapat, agen embodied, acara yang direkam, lingkungan multi-pembicara, dan grounding audio.

Upaya penalaran yang dapat disesuaikan

Thinking diaktifkan secara default. Pengembang dapat mengonfigurasi upaya penalaran untuk menukar latensi dan konsumsi token dengan penalaran yang lebih dalam untuk tugas multimedia kompleks.

Pemanggilan fungsi dan penelusuran web

Pemanggilan fungsi dan penelusuran web adalah pusat dari pemosisian agen. Setelah memahami video, gambar, atau file audio, model dapat meneruskan argumen terstruktur ke alat eksternal, mengambil informasi tambahan, atau melanjutkan alur kerja di luar model.

Qwen-MM-Plugins

Qwen juga merilis Qwen-MM-Plugins, sebuah toolkit Apache-2.0 untuk harness agen yang native multimodal. Alur kerjanya mencakup produksi video, konversi video menjadi catatan, mempelajari keterampilan yang dapat digunakan ulang dari video demonstrasi, dan memori audiovisual.

How Good Is Qwen3.8-Omni-Flash on Benchmarks?

Is Qwen3.8-Omni-Flash Still Good at Text and Coding?

Hasil peluncuran Qwen menunjukkan bahwa model Omni tetap mendekati model teks Flash terkait pada beberapa evaluasi pengodean dan penalaran. Qwen melaporkan 92.6 pada LiveCodeBench v6, 63.3 pada SWE-bench Pro, dan 91.0 pada GPQA Diamond. Ini adalah hasil yang dilaporkan vendor dalam setup peluncuran Qwen dan harus divalidasi terhadap tugas pengodean dan kerangka agen yang digunakan dalam produksi.

Qwen melaporkan lebih dari 25% peningkatan rata-rata di 29 evaluasi dibandingkan Qwen3.5-Omni-Plus. Tabel berikut merangkum hasil tolok ukur peluncuran resmi. Ini adalah hasil pihak pertama dan belum direplikasi secara independen saat publikasi.

Kondisi evaluasi: Baris statis mengukur satu kali run model dalam setup peluncuran Qwen. Baris berlabel โ€œ+ agentโ€ menyertakan kerangka agen sekeliling, retrieval atau inspeksi media iteratif. Materi peluncuran resmi harus dirujuk untuk template prompt, pengaturan sampling, prapemrosesan media, dan versi kerangka; bila detail tersebut tidak diungkap, hasil harus diperlakukan sebagai laporan vendor, bukan reproduksi independen.

Makna yang lebih besar adalah pergeseran dari pemahaman multimodal ke eksekusi multimodal. Pipeline sebelumnya sering mentranskripsi audio, mengambil sampel bingkai video, mengirim artefak tersebut ke LLM, menghasilkan jawaban, lalu mengandalkan logika aplikasi terpisah untuk tugas sebenarnya. Qwen3.8-Omni-Flash dirancang untuk memadatkan lebih banyak loop itu ke dalam satu sistem agen.

Seorang agen produksi media dapat memeriksa rekaman video dan audio sebelum merencanakan edit. Agen rapat dapat menggabungkan identitas pembicara dengan konten ujaran dan visual presentasi. Agen riset dapat menemukan momen relevan dalam jam-jam materi audiovisual lalu mencari konteks eksternal. Dalam pemosisian ini, audio dan video menjadi konteks kerja bagi agen, bukan lampiran pasif.

Audio-video agents

Benchmark โ€” sumber peluncuran resmiQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71.034.558.9
UniClawBench69.667.169.0
AgenticVBench36.814.545.0
OmniGAIA74.0โ€”78.6
StreamingBench80.857.179.9

Lompatan generasional terbesar adalah WildClawBench-MM, di mana Qwen melaporkan kenaikan dari 34.5 ke 71.0. AgenticVBench juga meningkat tajam, sementara Gemini 3.8 Flash tetap unggul pada tolok ukur tersebut. Polanya karenanya bukan hasil universal โ€œsatu model menang semuanya.โ€

Audio-video understanding and reasoning

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
OmniVideoBench63.453.865.2
OmniVideoBench + Qwen Code agent67.8โ€”65.2
Video-MME-v265.0โ€”71.0
Video-MME-v2 + agent71.3โ€”71.0
LVOmniBench63.3โ€”70.7
LVOmniBench + agent73.6โ€”70.7
JointAVBench75.9โ€”70.4

Baris statisnya beragam. Gemini unggul pada beberapa tes penalaran video konvensional, tetapi hasil Qwen sering meningkat di dalam loop agen. Pembedaan ini penting hanya ketika aplikasi produksi menggunakan retrieval, alat, atau inspeksi iteratif yang sebanding.

Audio and multi-speaker understanding

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
LongAudioSpan82.774.479.3
AliMeeting DER โ†“3.488.172.6
AliMeeting cpWER โ†“17.289.653.1
FLEURS-ASR WER โ†“9.37.27.9
VoiceBench91.692.992.3

Baris rapat merupakan sorotan, sementara FLEURS-ASR dan VoiceBench tidak mengalami peningkatan atas pendahulunya. Hasil peluncuran karenanya menunjukkan pemahaman audio multi-pembicara, spasial, dan konteks panjang yang lebih kaya, bukan kemenangan uniform dalam pengenalan ucapan.

Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash

Tabel ini menggabungkan informasi produk resmi Qwen dengan spesifikasi resmi Gemini 3.8 Flash dari Google. Perbandingan tolok ukur tetap dijalankan oleh Qwen dan tidak boleh diperlakukan sebagai peringkat pihak ketiga yang netral.

DimensionQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
ArchitectureFondasi Qwen3.8-Flash-Next; pemetaan parameter Omni yang tepat tidak diungkapGenerasi Qwen Omni sebelumnyaArsitektur proprietary Gemini dari Google
Context window1M tokenBatas penerapan lebih kecil1,048,576 input token
ReasoningUpaya penalaran yang dapat disesuaikan; thinking diaktifkan secara defaultTidak ada mode penalaran default-on yang ekuivalen dalam penerapan yang dikutipTingkat penalaran rendah, sedang, dan tinggi
Multimodal inputTeks, gambar, audio, videoTeks, gambar, audio, videoTeks, gambar, video, audio, dan PDF
OutputTeksTeks dan alur kerja keluaran suara yang didukungTeks
CodingSkor pengodean yang kuat (laporan vendor); bukan pembedaan utamanyaBukan pemosisian utamaDirancang untuk rekayasa perangkat lunak horizon panjang dan agen
API availabilityChat Completions dan Responses; API hostedQwen API hostedGemini API; tersedia umum
ToolsPemanggilan fungsi dan penelusuran webPemanggilan fungsi dan penelusuran webPemanggilan fungsi, search grounding, eksekusi kode, dan alat bawaan lainnya
Published API pricingQwenCloud: $0.15 input / $0.47 output per 1M tokenBergantung wilayah dan endpointHarga perkenalan Google: $0.75 input / $3.75 output per 1M token hingga December 31, 2026
Best fitAgen dan analisis mediaPercakapan Omni dan keluaran suaraAlur kerja multimodal, pengodean, dan agen otonom yang luas

Qwen3.5-Omni-Plus tetap relevan ketika keluaran suara diperlukan. Qwen3.8-Omni-Flash lebih jelas dioptimalkan untuk pemahaman audio-video yang efisien plus eksekusi berorientasi alat.

Dibandingkan Gemini 3.8 Flash, evaluasi Qwen adalah campuran: Qwen3.8-Omni-Flash kompetitif dalam audio, pemrosesan multi-pembicara, grounding, dan beberapa alur kerja agen, sementara Gemini unggul pada beberapa tes penalaran video statis. Perbandingan yang masuk akal harus spesifik terhadap beban kerja.

Pengembang yang mengevaluasi akses terpadu dapat membandingkan Gemini 3.8 Flash API di CometAPI, Qwen3.8-Flash API di CometAPI, dan Qwen3.8-Flash-Next API di CometAPI di luar tabel agar tautan sumber teknis dan tautan akses produk tetap berbeda.

Limitations of Qwen3.8-Omni-Flash

  • Keluaran hanya teks: Memahami audio dan video tetapi tidak menghasilkan suara sebagai modalitas respons.
  • Penerapan hosted: Open weights tidak diumumkan untuk Qwen3.8-Omni-Flash saat peluncuran.
  • Tolok ukur baru: Perbandingan utama terutama hasil pihak pertama dan memerlukan replikasi independen.
  • Efek kerangka agen: Beberapa skor menyertakan retrieval, lingkungan alat, atau inspeksi iteratif dan tidak boleh disamakan dengan hasil model mentah saja.
  • Biaya yang bergantung alur kerja: Video panjang masih dapat menjadi mahal jika aplikasi berulang kali memproses ulang segmen besar alih-alih menggunakan retrieval, caching, atau inspeksi terarah.

Who Should Use Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash paling menarik ketika audio atau video merupakan bagian dari tugas itu sendiri, bukan lampiran yang hanya perlu diringkas. Kasus penggunaan yang sesuai mencakup kecerdasan rapat, penelusuran media panjang, pipeline penerjemahan video, alur kerja tutorial-ke-catatan, agen produksi media, dan arsip audiovisual.

Untuk chat teks konvensional, model teks Flash khusus mungkin tetap lebih sederhana. Untuk aplikasi keluaran suara, model Omni dengan generasi audio eksplisit mungkin lebih cocok. Untuk alur kerja yang menggabungkan melihat, mendengar, bernalar, dan bertindak, Qwen3.8-Omni-Flash adalah opsi yang lebih khas dalam jajaran Qwen.

Conclusion

Qwen3.8-Omni-Flash paling tepat dipahami sebagai model audio-video berkapabilitas agen, bukan sekadar rilis Flash multimodal lainnya. Konteks 1M token, penalaran audio-video native, kemampuan multi-pembicara dan audio spasial, penalaran yang dapat disesuaikan, pemanggilan fungsi, penelusuran, dan ekosistem Qwen-MM-Plugins semuanya diarahkan pada transisi yang sama: memungkinkan sistem AI bergerak dari memahami multimedia ke melakukan pekerjaan dengan multimedia.

Data peluncuran menunjukkan peningkatan generasional yang substansial dibandingkan Qwen3.5-Omni-Plus, terutama dalam alur kerja agen dan skenario audio kompleks. Dibandingkan Gemini 3.8 Flash, angka Qwen sendiri lebih berimbang. Pertanyaan penting karenanya bukan model mana yang menang dalam satu tabel, melainkan kombinasi model-dan-kerangka mana yang menyelesaikan alur kerja sasaran secara akurat dan ekonomis.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Sep 21, 2026
Terakhir diperbarui Sep 21, 2026
3 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya