Spesifikasi Teknikal Grok Imagine Image 2.0
| Item | Grok Imagine Image 2.0 |
|---|---|
| ID Model | grok-imagine-image-2.0 |
| Penyedia | xAI |
| Keluarga model | Grok Imagine |
| Jenis model | Penjanaan dan penyuntingan imej |
| Mod input | Teks, Imej |
| Mod output | Imej |
| Endpoint penjanaan | POST /v1/images/generations |
| Endpoint penyuntingan | POST /v1/images/edits |
| Resolusi output | 1K, 2K |
| Mod kualiti | Rendah, Sederhana |
| Kualiti lalai | Sederhana |
| Nisbah bidang | 1:1, 3:4, 4:3, 9:16, 16:9, 2:3, 3:2, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1, auto |
| Imej setiap permintaan | Sehingga 10 |
| Imej rujukan | Disokong untuk penyuntingan imej |
| Format respons | URL, Base64 JSON |
| Keserasian API | API imej serasi OpenAI |
| Tarikh keluaran | 7 Ogos 2026 |
| Status API | Tersedia umum |
Dokumentasi rasmi xAI mengesahkan bahawa grok-imagine-image-2.0 menyokong penjanaan dan penyuntingan imej, dengan resolusi 1K/2K serta nisbah bidang dan kualiti yang boleh dikonfigurasi.
Apakah Grok Imagine Image 2.0?
Grok Imagine Image 2.0 ialah model penjanaan dan penyuntingan imej terbaharu xAI dalam keluarga Grok Imagine, direka berasaskan pematuhan arahan yang tepat, tipografi, kawalan tata letak, dan pemeliharaan ciri-ciri imej rujukan.
xAI menerangkan Image 2.0 sebagai direka untuk “kerja kreatif sebenar.” Peningkatan utamanya bukan sekadar kualiti imej yang lebih tinggi; model ini dioptimumkan khusus untuk mengikuti prompt terperinci, mengekalkan elemen visual semasa suntingan berulang, dan mengendalikan komposisi yang mengandungi tipografi serta pelbagai elemen berstruktur.
Model ini tersedia umum pada 7 Ogos 2026, pada mulanya sebagai Mod Kualiti baharu pada Grok Imagine dan seterusnya melalui API.
Ciri Utama Grok Imagine Image 2.0
Pematuhan Prompt yang Tepat
Grok Imagine Image 2.0 direka untuk mengekalkan arahan terperinci merentasi prompt penjanaan imej yang kompleks. Ini amat berguna apabila prompt menentukan berbilang objek, hubungan spatial, gaya visual, atau kekangan komposisi.
Tipografi dan Penjanaan Tata Letak yang Kukuh
Salah satu matlamat reka bentuk yang dinyatakan ialah pengendalian tipografi dan tata letak berstruktur yang dipertingkat. xAI menonjolkan keupayaannya untuk merancang tipografi dan tata letak bagi visual berbilang bahagian yang padat sambil mengekalkan kebolehbacaan teks kecil.
Ini menjadikan model ini sangat relevan untuk:
- Poster
- Iklan
- Infografik
- Pembungkusan produk
- Grafik media sosial
- Grafik pembentangan
- Sepanduk pemasaran
Penyuntingan Imej ke Imej
Model ini menyokong penyuntingan imej melalui endpoint /v1/images/edits. Pembangun boleh menyediakan imej sedia ada dan arahan penyuntingan, seperti menukar gaya artistik atau menambah/membuang elemen visual.
Pemeliharaan Imej Rujukan
Image 2.0 direka untuk mengekalkan elemen penting daripada imej rujukan merentasi penjanaan dan suntingan. Ini berguna untuk mengekalkan rupa watak, identiti produk, komposisi, atau gaya visual semasa aliran kerja iteratif.
Output 1K dan 2K
API menyokong resolusi output 1K dan 2K. Pembangun boleh memilih resolusi mengikut keperluan sama ada draf yang lebih pantas atau aset pengeluaran berperincian tinggi.
Nisbah Bidang yang Fleksibel
Grok Imagine Image 2.0 menyokong pelbagai nisbah bidang, termasuk segi empat sama, potret, landskap, sinematik, dan format berorientasi mudah alih. Ini membolehkan API penjanaan yang sama menyokong pelbagai saluran penerbitan tanpa memaksa setiap output ke kanvas 1:1.
Penjanaan Imej secara Kelompok
API boleh menjana berbilang imej dalam satu permintaan, dengan dokumentasi Imagine rasmi menyokong sehingga 10 imej setiap permintaan. Ini berguna untuk menghasilkan variasi kreatif bagi pengiklanan, fotografi produk, imej kenit, dan penerokaan konsep.
Prestasi Penanda Aras Grok Imagine Image 2.0
xAI melaporkan bahawa Imagine Image 2.0 berada di kedudukan kedua pada papan pendahulu Text-to-Image dan Image Edit Arena, berdasarkan data papan pendahulu setakat 7 Ogos 2026. Ini ialah penilaian arena luaran yang dipetik oleh xAI, bukan skor penanda aras dalaman.

Memandangkan kedudukan ini boleh berubah dari semasa ke semasa, ia harus dibentangkan dengan tarikh dilampirkan dan bukan sebagai kedudukan model kekal.
Grok Imagine Image 2.0 vs Grok Imagine Image
| Ciri | Grok Imagine Image 2.0 | Grok Imagine Image |
|---|---|---|
| ID Model | grok-imagine-image-2.0 | grok-imagine-image |
| Input | Teks + Imej | Teks + Imej |
| Output | Imej | Imej |
| 1K | Ya | Ya |
| 2K | Ya | Ya |
| Kawalan kualiti | Rendah / Sederhana | Tidak didokumentasikan sebagai kawalan kualiti 2.0 yang sama |
| Tipografi | Dipertingkat | Generasi terdahulu |
| Pematuhan tata letak | Dipertingkat | Generasi terdahulu |
| Penyuntingan imej | Ya | Ya |
| Harga | $0.04–$0.08/imej output bergantung pada kualiti/resolusi | $0.02/imej |
| Posisi | Model kreatif generasi baharu | Generasi Grok Imagine sebelumnya |
Model grok-imagine-image yang lebih lama kini disenaraikan pada harga $0.02 bagi setiap imej yang dijana, manakala Image 2.0 menggunakan harga bergantung pada resolusi/kualiti.
Grok Imagine Image 2.0 vs GPT Image 2.0
| Aspek | Grok Imagine Image 2.0 | GPT Image 2 / ChatGPT Images 2.0 |
|---|---|---|
| Keluaran | 7 Ogos 2026 | 21 April 2026 |
| Fokus Teras | Penyuntingan tepat + output berguna dunia nyata (infografik, foto produk, mockup UI, aset permainan, papan cerita) | Penjanaan fideliti tinggi + penaakulan + konsistensi berbilang imej yang kompleks |
| Kedudukan Arena (Ogos 2026) | No. 2 dunia dalam text-to-image dan penyuntingan imej | No. 1 dunia dalam text-to-image dan penyuntingan imej |
| Pemaparan Teks | Peningkatan ketara (tipografi tajam, peka tata letak) | Terbaik dalam kelas (terutamanya teks kecil, tulisan bukan Latin seperti Jepun/Korea/Cina/Hindi/Bengali) |
| Berbilang imej / Konsistensi | Sehingga 5 imej rujukan; templat untuk produk/headshot/dll. | Sehingga 8 imej konsisten daripada satu prompt (dengan mod “Thinking”); kesinambungan watak/objek kukuh |
| Ciri Khas | Smart resize/outpainting, komposit multi-rujukan asli, perancangan berorientasikan reka bentuk | “Thinking” mode (berfikir sebelum menjana, boleh mencari web, mencipta penerang visual daripada fail) |
| Resolusi / Nisbah | 1K/2K lazim; nisbah fleksibel melalui Smart Resize | Sehingga 2K (API menawarkan pilihan lebih tinggi dalam sesetengah kes); julat luas (cth., 3:1 hingga 1:3) |
| Kekuatan | Suntingan setempat yang tepat, kerja rujukan/produk, aliran kerja kreatif yang praktikal | Pematuhan prompt, reka bentuk sarat teks, konsistensi berbilang babak, penaakulan + pengetahuan web |
Kedua-dua model menyasar kategori serupa tetapi menekankan kekuatan yang agak berbeza.
Grok Imagine Image 2.0 amat menarik apabila aliran kerja bergantung pada pematuhan prompt yang tepat, tata letak gaya poster, tipografi, pemeliharaan imej rujukan, dan penyuntingan imej iteratif.
GPT Image lebih sesuai dipertimbangkan apabila aplikasi sudah dibina di sekitar ekosistem multimodal OpenAI yang lebih luas dan memerlukan penjanaan imej sebagai sebahagian daripada aliran kerja GPT yang lebih besar.
Bagi API imej kreatif khusus, gabungan penjanaan + penyuntingan + output 2K + kualiti boleh dikonfigurasi + sokongan nisbah bidang yang luas pada Grok Imagine Image 2.0 menjadikannya pilihan kukuh untuk talian pengeluaran kreatif.
Grok Imagine Image 2.0 vs Google Imagen
| Keupayaan | Grok Imagine Image 2.0 | Google Imagen |
|---|---|---|
| Teks ke imej | Ya | Ya |
| Penyuntingan imej | Ya | Ya, bergantung pada model/API |
| Output 2K | Ya | Bergantung pada model |
| Fokus tipografi/tata letak | Kuat | Kuat |
| Aliran kerja imej rujukan | Ya | Bergantung pada model |
| API serasi OpenAI | Ya | Tidak |
| Kawalan nisbah bidang | Meluas | Bergantung pada model |
| Penjanaan berbilang imej | Sehingga 10/permintaan | Bergantung pada model |
Grok Imagine Image 2.0 mempunyai kelebihan integrasi praktikal untuk pembangun yang sudah menggunakan SDK serasi OpenAI kerana xAI mendedahkan endpoint penjanaan imej menggunakan antara muka serasi OpenAI.
Kes Penggunaan untuk Grok Imagine Image 2.0
1. Kreatif Pemasaran dan Pengiklanan
Menjana karya kempen, sepanduk promosi, iklan produk, dan grafik media sosial sambil menentukan hierarki visual dan penempatan teks yang tepat.
2. Penjanaan Poster dan Infografik
Penekanan model terhadap tipografi dan tata letak menjadikannya sesuai untuk poster, carta, grafik acara, dan aset visual yang padat maklumat.
3. Visualisasi Produk
Pembangun boleh menggabungkan imej rujukan produk dengan arahan untuk mencipta persekitaran, komposisi, atau adegan pemasaran baharu sambil mengekalkan ciri visual penting produk.
4. Penggayaan Semula Imej
API penyuntingan boleh mengubah imej sedia ada kepada gaya artistik yang berbeza tanpa memerlukan keseluruhan imej dijana semula dari awal.
5. Kandungan Media Sosial
Sokongan nisbah bidang yang luas berguna apabila menjana aset untuk suapan mudah alih, cerita, hantaran landskap, imej kenit, dan format khusus platform lain.
6. Iterasi Kreatif
Memandangkan penyuntingan imej boleh beroperasi pada hasil sedia ada, pasukan boleh menggunakan aliran kerja jana → semak → sunting → perhalus dan bukannya berulang kali bermula daripada prompt kosong.
Cara Menggunakan API Grok Imagine Image 2.0 pada CometAPI
Untuk pembangun yang sudah menggunakan pelbagai model imej AI, CometAPI boleh menyediakan lapisan akses bersepadu supaya Grok Imagine Image 2.0 boleh diintegrasikan ke dalam aplikasi sedia ada tanpa mewujudkan aliran kerja pengurusan model yang benar-benar berasingan.
Aliran integrasi asas ialah:
- Cipta atau log masuk ke akaun CometAPI anda.
- Dapatkan kunci API CometAPI.
- Pilih
grok-imagine-image-2.0. - Hantar prompt teks atau permintaan penyuntingan imej melalui endpoint imej CometAPI yang disokong.
- Simpan URL imej atau data imej yang dipulangkan.
- Bandingkan hasilnya dengan model imej lain yang tersedia melalui platform yang sama.