Apa Itu Qwen-Image-3.0?
Qwen-Image-3.0 adalah model generatif gambar generasi ketiga dari Alibaba Qwen, dirancang agar gambar yang dihasilkan AI lebih berguna bagi alur kerja kreatif dan desain di dunia nyata, bukan hanya berfokus pada estetika visual. Model ini mendukung teks-ke-gambar (T2I) dan pengeditan gambar-ke-gambar (I2I), dengan penekanan khusus pada tata letak kompleks, informasi visual yang padat, perenderan teks yang akurat, tipografi multibahasa, dan komposisi gambar yang terperinci.
Alibaba memosisikan Qwen-Image-3.0 di sekitar tiga kapabilitas inti: Konten Kaya, Detail Otentik, dan Pengetahuan Mendalam. Model ini menerima prompt hingga sekitar 4.5K tokens, memungkinkan pengguna mendeskripsikan komposisi rumit seperti koran, storyboard, lembar ujian, infografik multi-panel, dan mockup antarmuka dalam satu permintaan. Model ini juga dapat merender teks sekecil 10 pixels, mendukung 12 bahasa dan lebih dari 20 font, serta dirancang untuk mereproduksi detail visual halus seperti helaian rambut, pori-pori, dan mikro-ekspresi wajah.
Apa saja fitur utama Qwen-Image-3.0?
Pembuatan tata letak yang kompleks: Qwen-Image-3.0 dirancang untuk komposisi visual dengan informasi padat. Alibaba memperlihatkan tata letak seperti grid visual 3×3, slide matematika, koran, storyboard, menu, lembar ujian, dan desain terstruktur lainnya yang dihasilkan dalam satu gambar alih-alih memerlukan penggabungan beberapa gambar.
Instruksi pembuatan gambar yang lebih panjang: Model ini mendukung prompt hingga sekitar 4.5K tokens, memberi pengguna ruang yang jauh lebih besar untuk merinci objek, relasi, tipografi, tata letak, hierarki visual, dan gaya dalam satu permintaan generasi.
Perenderan teks yang sangat detail: Qwen-Image-3.0 secara khusus dirancang untuk merender teks kecil, dengan Alibaba menonjolkan teks sekecil 10px. Hal ini membuat model ini sangat relevan untuk poster, infografik, diagram, konsep UI, materi edukasi, dan desain lain di mana teks yang terbaca merupakan bagian dari gambar, bukan sekadar tambahan.
Tipografi multibahasa: Model ini mendukung perenderan native di 12 bahasa dan lebih dari 20 font, memperluas kegunaannya untuk materi pemasaran multibahasa, grafis terlokalisasi, antarmuka produk, dan pembuatan konten internasional.
Pengeditan gambar: Qwen-Image-3.0 mendukung generasi gambar-ke-gambar dan pengeditan menggunakan gambar referensi bersama instruksi pengeditan. Dokumentasi API Alibaba saat ini mendukung 1–3 gambar referensi untuk alur kerja I2I.
Keluaran berganda: API mendukung hingga 6 gambar keluaran per permintaan, memungkinkan pengguna menghasilkan beberapa variasi dari prompt yang sama.
Spesifikasi Teknis Qwen-Image-3.0
Alibaba menerbitkan informasi akses dan kapabilitas konkret untuk model Standard. Tabel ini memisahkan batas terdokumentasi dari klaim pemasaran agar pengembang tidak keliru menganggap demo sebagai jaminan API.
| Specification | Qwen-Image-3.0 |
|---|---|
| Developer | Alibaba Qwen Team |
| Model type | Pembuatan gambar dan pengeditan gambar |
| Primary positioning | Keseimbangan kualitas, kecepatan, dan biaya |
| Model ID | qwen-image-3.0 |
| Input modalities | Teks dan gambar |
| Output modality | Gambar |
| Generation modes | Teks-ke-gambar; gambar-ke-gambar; pengeditan terinstruksi |
| Maximum prompt | Approximately 4.5K tokens |
| Reference images | 1-3 |
| Output pixel range | Total piksel dari 512 x 512 hingga 2048 x 2048 |
| Output format | PNG |
| Claimed small-text rendering | Approximately 10 px |
| Native visual-text languages | 12 |
| Standard rate limit | 20 RPM di wilayah yang didokumentasikan |
| Function calling | Tidak didukung |
| Batch inference | Tidak didukung |
| Fine-tuning | Tidak didukung |
| CometAPI endpoints | /v1/images/generations; /v1/images/edits |
Performa Benchmark Qwen-Image-3.0
| Model | T2I Elo | T2I Rank | Edit Elo | Edit Rank | API Price / 1K |
|---|---|---|---|---|---|
| GPT Image 2 (high) | 1,367 | #1 | 1,257 | #4 | $211 |
| Nano Banana 2 | 1,319 | #3 | 1,250 | #7 | $67 |
| Qwen-Image-3.0-Pro | 1,284 | #9 | 1,250 | #5 | $43 |
| Seedream 5.0 Pro | 1,279 | #10 | 1,247 | #8 | $90 |
| Qwen-Image-3.0 | 1,275 | #11 | 1,218 | #15 | $30 |
Apa Arti Hasilnya
- Standard versus Pro: selisih teks-ke-gambar hanya 9 Elo, tetapi Pro unggul 32 Elo dalam pengeditan. Alasan terkuat untuk membayar Pro mungkin adalah kualitas pengeditan, bukan generasi putaran pertama.
- Melawan Seedream 5.0 Pro: Standard hanya tertinggal 4 Elo untuk teks-ke-gambar, sementara Pro unggul 5 Elo. Perbedaan kecil ini berada dalam rentang ketidakpastian yang dipublikasikan dan harus diperlakukan sebagai klaster kompetitif, bukan urutan yang definitif.
- Melawan Nano Banana 2: Standard tertinggal 44 Elo dalam teks-ke-gambar dan 32 Elo dalam pengeditan. Pro memperkecil selisih pengeditan hingga seri di 1,250 Elo.
- Melawan GPT Image 2: GPT unggul atas Standard sebesar 92 Elo dalam teks-ke-gambar dan 39 Elo dalam pengeditan. Kasus Qwen karenanya adalah harga-performa dan spesialisasi tata letak, bukan kepemimpinan kualitas universal.
- Dibandingkan dengan Qwen Image 2.0 Pro sebelumnya, model Standard 3.0 memperoleh 39 Elo teks-ke-gambar pada papan peringkat yang sama sementara harga representatif turun dari $75 menjadi $30 per 1,000 gambar.
Qwen-Image-3.0 vs GPT Image 2 vs Nano Banana 2
Tidak ada model gambar yang memimpin di setiap dimensi produksi. Preferensi umum, fidelitas pengeditan, perenderan teks, kapasitas referensi, resolusi keluaran, grounding, latensi, dan biaya dapat menunjuk pemenang yang berbeda. Perbandingan di bawah berfokus pada kapabilitas yang terdokumentasi dan hasil Arena independen.
| Dimension | Qwen 3 Standard | Qwen 3 Pro | GPT Image 2 | Nano Banana 2 | Seedream 5 Pro |
|---|---|---|---|---|---|
| Positioning | Keseimbangan kualitas / kecepatan / biaya | Fidelitas Qwen tertinggi | Model gambar umum premium | Model gambar Gemini cepat dan ber-volume tinggi | Desain dan pengeditan profesional |
| T2I / Edit Elo | 1,275 / 1,218 | 1,284 / 1,250 | 1,367 / 1,257 | 1,319 / 1,250 | 1,279 / 1,247 |
| Cited output | Sekitar 2K | Sekitar 2K | Ukuran fleksibel | Hingga 4K | Sekitar 2K di CometAPI |
| Reference inputs | 1-3 | 1-3 | Didukung | Multi-referensi | Hingga 10 di CometAPI |
| Typography angle | Brief 4.5K; klaim 10px; 12 bahasa | Fokus inti yang sama dengan fidelitas lebih tinggi | Teks multibahasa yang kuat | Teks plus grounding pencarian | Infografik padat dan kontrol spasial |
| Web grounding | Tidak | Tidak | Bukan fitur API yang menentukan | Google Search and Image Search | Bergantung pada jalur akses |
| Best fit | Tata letak padat dengan biaya terkontrol | Pengeditan Qwen berkualitas tinggi | Preferensi umum maksimum | Alur kerja 4K cepat dan informasi terbaru | Pengeditan presisi dan desain multi-referensi |