Spesifikasi Teknis Grok Imagine Image 2.0
| Item | Grok Imagine Image 2.0 |
|---|---|
| Model ID | grok-imagine-image-2.0 |
| Provider | xAI |
| Model family | Grok Imagine |
| Model type | Pembuatan dan pengeditan gambar |
| Input modalities | Teks, Gambar |
| Output modality | Gambar |
| Generation endpoint | POST /v1/images/generations |
| Editing endpoint | POST /v1/images/edits |
| Output resolutions | 1K, 2K |
| Quality modes | Low, Medium |
| Default quality | Medium |
| Aspect ratios | 1:1, 3:4, 4:3, 9:16, 16:9, 2:3, 3:2, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1, auto |
| Images per request | Hingga 10 |
| Reference images | Didukung untuk pengeditan gambar |
| Response formats | URL, Base64 JSON |
| API compatibility | API gambar kompatibel dengan OpenAI |
| Release date | August 7, 2026 |
| API status | Tersedia secara umum |
Dokumentasi resmi xAI mengonfirmasi bahwa grok-imagine-image-2.0 mendukung pembuatan dan pengeditan gambar, dengan resolusi 1K/2K serta rasio aspek dan kualitas yang dapat dikonfigurasi.
Apa itu Grok Imagine Image 2.0?
Grok Imagine Image 2.0 adalah model pembuatan dan pengeditan gambar terbaru dari keluarga Grok Imagine milik xAI, yang dirancang untuk mengikuti instruksi secara presisi, menangani tipografi, kontrol tata letak, dan pelestarian karakteristik gambar referensi.
xAI menggambarkan Image 2.0 sebagai dirancang untuk "pekerjaan kreatif nyata." Peningkatan utamanya bukan sekadar kualitas gambar yang lebih tinggi; model ini secara khusus dioptimalkan untuk mengikuti prompt terperinci, mempertahankan elemen visual selama pengeditan iteratif, dan menangani komposisi yang memuat tipografi dan beberapa elemen terstruktur.
Model ini tersedia secara umum mulai August 7, 2026, awalnya sebagai Mode Kualitas baru pada Grok Imagine dan selanjutnya melalui API.
Fitur Utama Grok Imagine Image 2.0
Kepatuhan Prompt yang Presisi
Grok Imagine Image 2.0 dirancang untuk mempertahankan instruksi terperinci dalam prompt pembuatan gambar yang kompleks. Ini sangat berguna saat sebuah prompt menentukan banyak objek, hubungan spasial, gaya visual, atau batasan komposisi.
Tipografi dan Pembuatan Tata Letak yang Kuat
Salah satu tujuan desain eksplisit model ini adalah penanganan tipografi dan tata letak terstruktur yang lebih baik. xAI menyoroti kemampuannya merencanakan tipografi dan tata letak untuk visual padat multi-bagian sekaligus menjaga keterbacaan teks kecil.
Ini membuat model ini sangat relevan untuk:
- Poster
- Iklan
- Infografik
- Kemasan produk
- Grafis media sosial
- Karya presentasi
- Banner pemasaran
Pengeditan Gambar (Image-to-Image)
Model ini mendukung pengeditan gambar melalui endpoint /v1/images/edits. Pengembang dapat menyediakan gambar yang ada dan instruksi pengeditan, seperti mengubah gaya artistik atau menambah/menghapus elemen visual.
Pelestarian Gambar Referensi
Image 2.0 dirancang untuk mempertahankan elemen penting dari gambar referensi pada pembuatan dan pengeditan. Ini berguna untuk menjaga tampilan karakter, identitas produk, komposisi, atau gaya visual selama alur kerja iteratif.
Keluaran 1K dan 2K
API mendukung resolusi keluaran 1K dan 2K. Pengembang dapat memilih resolusi sesuai kebutuhan, apakah untuk draf yang lebih cepat atau aset produksi dengan detail lebih tinggi.
Rasio Aspek Fleksibel
Grok Imagine Image 2.0 mendukung beragam rasio aspek, termasuk kotak, potret, lanskap, sinematik, dan format berorientasi seluler. Ini memungkinkan API pembuatan yang sama melayani berbagai kanal publikasi tanpa memaksa setiap output ke kanvas 1:1.
Pembuatan Gambar Batch
API dapat menghasilkan beberapa gambar dalam satu permintaan, dengan dokumentasi Imagine resmi mendukung hingga 10 gambar per permintaan. Ini berguna untuk menghasilkan variasi kreatif untuk iklan, fotografi produk, thumbnail, dan eksplorasi konsep.
Performa Benchmark Grok Imagine Image 2.0
xAI melaporkan bahwa Imagine Image 2.0 menempati peringkat kedua pada papan peringkat Text-to-Image dan Image Edit Arena, berdasarkan data papan peringkat per August 7, 2026. Ini adalah evaluasi arena eksternal yang dikutip oleh xAI, bukan skor benchmark internal.

Karena peringkat ini dapat berubah dari waktu ke waktu, peringkat tersebut sebaiknya disajikan dengan tanggal terlampir dan bukan sebagai peringkat permanen.
Grok Imagine Image 2.0 vs Grok Imagine Image
| Feature | Grok Imagine Image 2.0 | Grok Imagine Image |
|---|---|---|
| Model ID | grok-imagine-image-2.0 | grok-imagine-image |
| Input | Teks + Gambar | Teks + Gambar |
| Output | Gambar | Gambar |
| 1K | Ya | Ya |
| 2K | Ya | Ya |
| Quality control | Low / Medium | Tidak didokumentasikan sama seperti kontrol kualitas 2.0 |
| Typography | Ditingkatkan | Generasi sebelumnya |
| Layout following | Ditingkatkan | Generasi sebelumnya |
| Image editing | Ya | Ya |
| Price | $0.04–$0.08/gambar keluaran tergantung pada kualitas/resolusi | $0.02/gambar |
| Positioning | Model kreatif generasi baru | Generasi Grok Imagine sebelumnya |
grok-imagine-image yang lebih lama saat ini memiliki harga tertera $0.02 per gambar yang dihasilkan, sementara Image 2.0 menggunakan harga yang bergantung pada resolusi/kualitas.
Grok Imagine Image 2.0 vs GPT Image 2.0
| Aspect | Grok Imagine Image 2.0 | GPT Image 2 / ChatGPT Images 2.0 |
|---|---|---|
| Release | Aug 7, 2026 | Apr 21, 2026 |
| Core Focus | Pengeditan presisi + output yang berguna di dunia nyata (infografik, foto produk, mockup UI, aset gim, storyboard) | Generasi high-fidelity + penalaran + konsistensi multi-gambar yang kompleks |
| Arena Ranking (Aug 2026) | #2 dunia untuk text-to-image dan pengeditan gambar | #1 dunia untuk text-to-image dan pengeditan gambar |
| Text Rendering | Peningkatan kuat (tajam, tipografi sadar-tata letak) | Terbaik di kelasnya (terutama teks kecil, skrip non-Latin seperti Jepang/Korea/Cina/Hindi/Bengali) |
| Multi-image / Consistency | Hingga 5 gambar referensi; templat untuk produk/headshot/dll. | Hingga 8 gambar konsisten dari satu prompt (dengan mode “Thinking”); kontinuitas karakter/objek kuat |
| Special Features | Smart resize/outpainting, komposit multi-referensi bawaan, perencanaan berorientasi desain | Mode “Thinking” (bernalar sebelum menghasilkan, bisa menelusuri web, membuat penjelasan visual dari file) |
| Resolution / Ratios | 1K/2K umum; rasio fleksibel via Smart Resize | Hingga 2K (API menawarkan opsi lebih tinggi pada beberapa kasus); rentang lebar (mis. 3:1 hingga 1:3) |
| Strengths | Edit lokal presisi, pekerjaan produk/referensi, alur kerja kreatif praktis | Kepatuhan prompt, desain kaya teks, konsistensi multi-adegan, penalaran + pengetahuan web |
Kedua model menargetkan kategori yang serupa namun menekankan kekuatan yang agak berbeda.
Grok Imagine Image 2.0 sangat menarik ketika alur kerja bergantung pada kepatuhan prompt yang presisi, tata letak gaya poster, tipografi, pelestarian gambar referensi, dan pengeditan gambar iteratif.
GPT Image lebih tepat dipertimbangkan ketika aplikasi sudah dibangun di atas ekosistem multimodal OpenAI yang lebih luas dan membutuhkan pembuatan gambar sebagai bagian dari alur kerja GPT yang lebih besar.
Untuk API gambar kreatif yang berdedikasi, kombinasi pembuatan + pengeditan + keluaran 2K + kualitas yang dapat dikonfigurasi + dukungan rasio aspek yang luas pada Grok Imagine Image 2.0 menjadikannya opsi kuat untuk pipeline kreatif produksi.
Grok Imagine Image 2.0 vs Google Imagen
| Capability | Grok Imagine Image 2.0 | Google Imagen |
|---|---|---|
| Text-to-image | Ya | Ya |
| Image editing | Ya | Ya, tergantung model/API |
| 2K output | Ya | Tergantung model |
| Typography/layout focus | Kuat | Kuat |
| Reference-image workflows | Ya | Tergantung model |
| OpenAI-compatible API | Ya | Tidak |
| Aspect-ratio control | Ekstensif | Tergantung model |
| Multi-image generation | Hingga 10/per permintaan | Tergantung model |
Grok Imagine Image 2.0 memiliki keunggulan integrasi praktis bagi pengembang yang sudah menggunakan SDK kompatibel OpenAI karena xAI mengekspos endpoint pembuatan gambar menggunakan antarmuka yang kompatibel dengan OpenAI.
Use Case untuk Grok Imagine Image 2.0
1. Kreatif Pemasaran dan Periklanan
Hasilkan karya kampanye, banner promosi, iklan produk, dan grafis media sosial sambil menentukan hierarki visual dan penempatan teks secara tepat.
2. Pembuatan Poster dan Infografik
Penekanan model pada tipografi dan tata letak membuatnya cocok untuk poster, bagan, grafis acara, dan aset visual padat informasi.
3. Visualisasi Produk
Pengembang dapat menggabungkan gambar referensi produk dengan instruksi untuk membuat lingkungan, komposisi, atau adegan pemasaran baru sambil mempertahankan karakteristik visual penting dari produk.
4. Penggantian Gaya Gambar
API pengeditan dapat mengubah gambar yang ada menjadi gaya artistik berbeda tanpa perlu menghasilkan ulang seluruh gambar dari awal.
5. Konten Media Sosial
Dukungan rasio aspek yang luas berguna saat menghasilkan aset untuk feed seluler, stories, posting lanskap, thumbnail, dan format khusus platform lainnya.
6. Iterasi Kreatif
Karena pengeditan gambar dapat beroperasi pada hasil yang ada, tim dapat menggunakan alur kerja buat → tinjau → edit → sempurnakan alih-alih berulang kali memulai dari prompt kosong.
Cara Menggunakan API Grok Imagine Image 2.0 di CometAPI
Bagi pengembang yang sudah menggunakan banyak model gambar AI, CometAPI dapat menyediakan lapisan akses terpadu sehingga Grok Imagine Image 2.0 dapat diintegrasikan ke dalam aplikasi yang ada tanpa membuat alur kerja manajemen model yang sepenuhnya terpisah.
Alur integrasi dasar:
- Buat atau masuk ke akun CometAPI Anda.
- Dapatkan kunci API CometAPI.
- Pilih
grok-imagine-image-2.0. - Kirim prompt teks atau permintaan pengeditan gambar melalui endpoint gambar CometAPI yang didukung.
- Simpan URL gambar atau data gambar yang dikembalikan.
- Bandingkan hasilnya dengan model gambar lain yang tersedia melalui platform yang sama.