Spesifikasi Teknis GLM-4.6V-Flash
| Item | |
|---|---|
| Model family | Keluarga model multimodal GLM-4.6V |
| Positioning | Model multimodal gratis dan ringan |
| Model | GLM-4.6V-Flash |
| CometAPI listing name | glm-4.6v-flash-free |
| Input types | Video, gambar, teks, file |
| Output type | Teks |
| Context window | 128K token |
| Thinking | Dapat diaktifkan atau dinonaktifkan |
| Function calling | Dukungan pemanggilan fungsi native |
| Languages | Tionghoa dan Inggris |
| Open-source model | zai-org/GLM-4.6V-Flash di Hugging Face; lisensi MIT |
Apa itu GLM-4.6V-Flash (Free)?
GLM-4.6V-Flash adalah versi gratis dari GLM-4.6V milik Z.ai. CometAPI juga menyediakan penggunaan gratis; ID-nya adalah glm-4.6v-flash-free. Ini adalah model multimodal ringan yang dirancang untuk menggabungkan pemahaman visual dengan penalaran dan penggunaan alat. Model ini menerima video, gambar, teks, dan file, menghasilkan teks, mendukung jendela konteks 128K token, dan dapat mengaktifkan atau menonaktifkan mode pemikiran mendalam. Z.ai juga menjelaskan dukungan Function Call native sebagai fitur arsitektural kunci untuk menghubungkan persepsi visual dengan tindakan yang dapat dieksekusi.
Fitur utama GLM-4.6V Flash(Free)
- 128K multimodal context: Model ini dilatih untuk jendela konteks 128K token dan dapat memproses input panjang multimodal seperti dokumen dan video bersama teks.
- Image, video, file and text understanding: Input tidak terbatas pada teks biasa; GLM-4.6V-Flash dirancang untuk memahami informasi visual dan tekstual secara bersama.
- Native function calling: Pemanggilan fungsi terintegrasi ke dalam model visi, memungkinkan input visual berpartisipasi dalam alur kerja berorientasi alat alih-alih hanya diperlakukan sebagai konten deskriptif.
- Configurable thinking: Mode pemikiran mendalam dapat diaktifkan atau dinonaktifkan, memberikan kompromi praktis antara kedalaman penalaran dan perilaku respons.
- Multimodal document understanding: Model dapat menafsirkan halaman yang kaya format, termasuk teks, tata letak, bagan, tabel, dan gambar, dalam alur kerja konteks panjang.
- Visual coding and agent workflows: Keluarga GLM-4.6V mendukung rekonstruksi/penyuntingan frontend berbasis tangkapan layar dan skenario agen multimodal; varian Flash diposisikan sebagai anggota yang ringan.
Kinerja benchmark GLM-4.6V-Flash (Free)
Kartu model yang dipublikasikan melaporkan hasil evaluasi berikut: MMBench V1.1 86.9, MMStar 74.7, MMMU (Val) 71.1, MMMU-Pro 60.6, VideoMMU 70.1, MathVista 82.7, AI2D 89.2, OCRBench 84.7, Design2Code 69.8, dan MMLongBench-128K 63.4. Angka-angka ini dilaporkan oleh penerbit/model card dan harus ditafsirkan bersama versi benchmark spesifik serta pengaturan evaluasinya.
Z.ai menyatakan bahwa GLM-4.6V-Flash 9B melampaui Qwen3-VL-8B secara keseluruhan dalam perbandingan evaluasi multimodal yang dilaporkan. Dokumentasi yang sama memposisikan model GLM-4.6V penuh sebagai model 106B yang lebih besar, sementara GLM-4.6V-Flash adalah varian ringan/gratis.
GLM-4.6V-Flash vs GLM-4.6V vs GLM-4.6V-FlashX
| Model | Positioning | Context | Paling cocok |
|---|---|---|---|
| GLM-4.6V-Flash | Gratis, ringan | 128K | Aplikasi multimodal hemat biaya, pembuatan prototipe, alur kerja model lokal/terbuka |
| GLM-4.6V-FlashX | Ringan, kecepatan tinggi | 128K | Beban kerja produksi multimodal berkecepatan lebih tinggi |
| GLM-4.6V | Flagship performa tinggi | 128K | Beban kerja penalaran multimodal dan agen yang lebih menuntut |
Kasus penggunaan GLM-4.6V-Flash
GLM-4.6V-Flash sangat relevan untuk aplikasi yang membutuhkan pemahaman visual tanpa bergantung pada model berbasis teks saja: analisis dokumen dan bagan, alur kerja berorientasi OCR, pemahaman tangkapan layar, tanya jawab video, grounding visual, bantuan coding multimodal, dan agen dengan dukungan alat.
Batasan dan pertimbangan GLM-4.6V-Flash
Model ini adalah anggota 9B yang ringan dari keluarga GLM-4.6V, sehingga tidak boleh otomatis diperlakukan setara dengan GLM-4.6V flagship yang lebih besar. Skor benchmark juga bervariasi menurut tugas dan protokol evaluasi. Untuk keputusan produksi, uji input yang persis, alur pemanggilan alat, latensi, dan batasan output dari aplikasi yang dimaksud alih-alih hanya bergantung pada peringkat benchmark agregat.
Cara menggunakan API GLM-4.6V-Flash di CometAPI
Karena CometAPI menggunakan antarmuka yang kompatibel dengan OpenAI, Anda dapat memanggil glm-4.6v-flash-free dengan pola dasar yang sama seperti OpenAI SDK. Base URL terdokumentasi CometAPI adalah https://api.cometapi.com/v1, dan endpoint REST-nya adalah /v1/chat/completions.
Langkah 1: Dapatkan Kunci API CometAPI
Pertama, masuk ke akun CometAPI Anda. Jika Anda belum memiliki akun, daftarkan akun di CometAPI. Setelah masuk, buka halaman manajemen token API dan buat kunci API baru. Salin kunci yang dihasilkan dan simpan dengan aman, karena akan digunakan untuk mengautentikasi permintaan API Anda.
Langkah 2: Pilih Model GLM-4.6V-Flash
Saat membuat permintaan API, tentukan ID model CometAPI glm-4.6v-flash-free. Ini adalah pengenal khusus CometAPI untuk versi gratis GLM-4.6V-Flash.
Model ini mendukung permintaan multimodal, sehingga Anda dapat menggunakannya untuk tugas yang melibatkan teks, gambar, dan input visual lain yang didukung.
Langkah 3: Konfigurasikan Permintaan API
Kirim permintaan Anda ke endpoint chat completions CometAPI. Otentikasikan permintaan dengan kunci API CometAPI Anda dan setel field model ke glm-4.6v-flash-free.
Dalam konten permintaan, berikan instruksi yang ingin diproses GLM-4.6V-Flash. Untuk permintaan hanya teks, berikan prompt teks biasa. Untuk analisis visual, sertakan gambar bersama instruksi teks agar model dapat memahami informasi visual dan pertanyaannya.
Langkah 4: Kirim Permintaan
Kirim permintaan yang telah dikonfigurasi ke CometAPI. CometAPI meneruskan permintaan ke GLM-4.6V-Flash dan mengembalikan respons model melalui API.
Respons berisi konten yang dihasilkan dan informasi respons terkait. Aplikasi Anda kemudian dapat mengekstrak jawaban model dan menampilkannya kepada pengguna atau memprosesnya lebih lanjut secara terprogram.
Langkah 5: Proses dan Verifikasi Respons
Setelah menerima respons, uraikan konten yang dikembalikan dan gunakan dalam aplikasi Anda. Untuk aplikasi multimodal, verifikasi bahwa interpretasi model terhadap gambar atau konten visual lain yang disuplai sesuai dengan kebutuhan alur kerja Anda.
Untuk aplikasi produksi, tangani juga kesalahan API, batas waktu permintaan (timeout), dan respons tidak valid sehingga aplikasi Anda dapat pulih dengan baik saat permintaan tidak dapat diselesaikan.
Untuk permintaan CometAPI, gunakan:
glm-4.6v-flash-free
ID model ini berbeda dari nama model dasar milik penyedia. Pastikan permintaan Anda menggunakan ID model CometAPI persis seperti yang diberikan.