Apakah Qwen-Image-3.0?
Qwen-Image-3.0 ialah model penjanaan imej generasi ketiga oleh Alibaba Qwen, direka untuk menjadikan imej dijana AI lebih berguna bagi aliran kerja kreatif dan reka bentuk dunia sebenar, bukan hanya menumpukan pada estetika visual. Ia menyokong teks-ke-imej (T2I) dan pengeditan imej-ke-imej (I2I), dengan penekanan khusus pada susun atur kompleks, maklumat visual yang padat, pemaparan teks yang tepat, tipografi berbilang bahasa, dan komposisi imej terperinci.
Alibaba memposisikan Qwen-Image-3.0 di sekitar tiga keupayaan teras: Kandungan Kaya, Butiran Asli, dan Pengetahuan Mendalam. Model ini menerima prompt sehingga kira-kira 4.5K token, membolehkan pengguna menghuraikan komposisi rumit seperti akhbar, papan cerita, kertas peperiksaan, infografik berbilang panel, dan lakaran antaramuka dalam satu permintaan. Ia juga boleh memaparkan teks sekecil 10 piksel, menyokong 12 bahasa dan lebih 20 fon, serta direka untuk menghasilkan semula perincian visual halus seperti helai rambut, liang pori, dan mikroekspresi wajah.
Apakah ciri utama Qwen-Image-3.0?
Penjanaan susun atur kompleks: Qwen-Image-3.0 direka untuk komposisi visual yang berinformasi padat. Alibaba menunjukkan susun atur termasuk grid visual 3×3, slaid matematik, akhbar, papan cerita, menu, kertas peperiksaan, dan reka bentuk berstruktur lain yang dijana dalam satu imej berbanding perlu mencantumkan berbilang imej.
Arahan penjanaan imej yang lebih panjang: Model ini menyokong prompt sehingga kira-kira 4.5K token, memberikan pengguna ruang yang jauh lebih luas untuk menetapkan objek, hubungan, tipografi, susun atur, hierarki visual, dan penggayaan dalam satu permintaan penjanaan.
Pemaparan teks terperinci: Qwen-Image-3.0 direka khusus untuk memaparkan teks kecil, dengan Alibaba menonjolkan teks sekecil 10px. Ini menjadikan model ini sangat relevan untuk poster, infografik, diagram, konsep UI, bahan pendidikan, dan reka bentuk lain di mana teks yang boleh dibaca merupakan sebahagian daripada imej, bukan sekadar selepas fikir.
Tipografi berbilang bahasa: Model ini menyokong pemaparan asli merentasi 12 bahasa dan lebih 20 fon, memperluas kegunaannya untuk bahan pemasaran berbilang bahasa, grafik setempat, antaramuka produk, dan penciptaan kandungan antarabangsa.
Pengeditan imej: Qwen-Image-3.0 menyokong penjanaan dan pengeditan imej-ke-imej menggunakan imej rujukan bersama arahan pengeditan. Dokumentasi API semasa Alibaba menyokong 1–3 imej rujukan untuk aliran kerja I2I.
Output berbilang: API menyokong sehingga 6 imej output bagi setiap permintaan, membolehkan pengguna menjana beberapa variasi daripada prompt yang sama.
Spesifikasi Teknikal Qwen-Image-3.0
Alibaba menerbitkan maklumat capaian dan keupayaan konkrit untuk model Standard. Jadual ini memisahkan had yang didokumenkan daripada dakwaan peringkat pemasaran supaya pembangun tidak tersalah anggap paparan contoh sebagai jaminan API.
| Spesifikasi | Qwen-Image-3.0 |
|---|---|
| Pembangun | Alibaba Qwen Team |
| Jenis model | Penjanaan imej dan pengeditan imej |
| Pemposisian utama | Kualiti, kelajuan dan kos yang seimbang |
| ID model | qwen-image-3.0 |
| Modaliti input | Teks dan imej |
| Modaliti output | Imej |
| Mod penjanaan | Teks-ke-imej; imej-ke-imej; pengeditan berarahan |
| Prompt maksimum | Kira-kira 4.5K token |
| Imej rujukan | 1-3 |
| Julat piksel output | Jumlah piksel dari 512 x 512 hingga 2048 x 2048 |
| Format output | PNG |
| Pemaparan teks kecil yang didakwa | Kira-kira 10 px |
| Bahasa teks visual asli | 12 |
| Had kadar standard | 20 RPM di wilayah yang didokumenkan |
| Pemanggilan fungsi | Tidak disokong |
| Inferens kelompok | Tidak disokong |
| Penalaan halus | Tidak disokong |
| Titik akhir CometAPI | /v1/images/generations; /v1/images/edits |
Prestasi Penanda Aras Qwen-Image-3.0
| Model | T2I Elo | Kedudukan T2I | Edit Elo | Kedudukan Edit | Harga API / 1K |
|---|---|---|---|---|---|
| GPT Image 2 (high) | 1,367 | #1 | 1,257 | #4 | $211 |
| Nano Banana 2 | 1,319 | #3 | 1,250 | #7 | $67 |
| Qwen-Image-3.0-Pro | 1,284 | #9 | 1,250 | #5 | $43 |
| Seedream 5.0 Pro | 1,279 | #10 | 1,247 | #8 | $90 |
| Qwen-Image-3.0 | 1,275 | #11 | 1,218 | #15 | $30 |
Apakah Maksud Keputusan Ini
- Standard lwn Pro: jurang teks-ke-imej hanya 9 Elo, tetapi Pro mendahului 32 Elo dalam pengeditan. Alasan terkuat untuk membayar Pro oleh itu mungkin kualiti pengeditan, bukannya penjanaan awal.
- Berbanding Seedream 5.0 Pro: Standard hanya ketinggalan 4 Elo untuk teks-ke-imej, manakala Pro mendahului 5 Elo. Perbezaan kecil ini berada dalam julat ketidakpastian yang diterbitkan dan harus dianggap sebagai kelompok bersaing, bukan susunan muktamad.
- Berbanding Nano Banana 2: Standard ketinggalan 44 Elo dalam teks-ke-imej dan 32 Elo dalam pengeditan. Pro mengecilkan jurang pengeditan kepada seri pada 1,250 Elo.
- Berbanding GPT Image 2: GPT mendahului Standard sebanyak 92 Elo dalam teks-ke-imej dan 39 Elo dalam pengeditan. Oleh itu, kes Qwen ialah harga-prestasi dan pengkhususan susun atur, bukan kepimpinan kualiti sejagat.
- Berbanding Qwen Image 2.0 Pro yang lebih awal, model Standard 3.0 memperoleh 39 Elo teks-ke-imej dalam papan kedudukan yang sama manakala harga representatif turun daripada $75 kepada $30 bagi setiap 1,000 imej.
Qwen-Image-3.0 vs GPT Image 2 vs Nano Banana 2
Tiada model imej menerajui setiap dimensi pengeluaran. Keutamaan umum, ketepatan pengeditan, pemaparan teks, kapasiti rujukan, resolusi output, grounding, kependaman, dan kos boleh menunjuk kepada pemenang yang berbeza. Perbandingan di bawah menumpukan pada keupayaan yang didokumenkan dan keputusan Arena bebas.
| Dimensi | Qwen 3 Standard | Qwen 3 Pro | GPT Image 2 | Nano Banana 2 | Seedream 5 Pro |
|---|---|---|---|---|---|
| Pemposisian | Keseimbangan kualiti / kelajuan / kos | Fideliti Qwen tertinggi | Model imej umum premium | Model imej Gemini pantas, volum tinggi | Reka bentuk dan pengeditan profesional |
| T2I / Edit Elo | 1,275 / 1,218 | 1,284 / 1,250 | 1,367 / 1,257 | 1,319 / 1,250 | 1,279 / 1,247 |
| Output yang disebut | Kira-kira 2K | Kira-kira 2K | Saiz fleksibel | Sehingga 4K | Kira-kira 2K pada CometAPI |
| Input rujukan | 1-3 | 1-3 | Disokong | Berbilang rujukan | Sehingga 10 pada CometAPI |
| Fokus tipografi | 4.5K ringkas; dakwaan 10px; 12 bahasa | Fokus teras yang sama dengan fideliti lebih tinggi | Teks berbilang bahasa yang kuat | Teks serta grounding carian | Infografik padat dan kawalan spatial |
| Grounding web | Tidak | Tidak | Bukan ciri API yang penentu | Google Search dan Image Search | Bergantung pada laluan capaian |
| Kesesuaian terbaik | Susun atur padat pada kos terkawal | Pengeditan Qwen berkualiti tinggi | Keutamaan umum maksimum | 4K pantas dan aliran kerja maklumat semasa | Suntingan tepat dan reka bentuk berbilang rujukan |