GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/Riset CometAPI

Apa itu Qwen Image 3.0

Jelajahi spesifikasi, fitur, performa benchmark, harga, kemampuan pengeditan gambar, perbandingan, dan akses API Qwen-Image-3.0.

CometAPI
Mia MarenTim riset model AI dan API
Diperbarui Sep 12, 2026 16 menit baca
Apa itu Qwen Image 3.0
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Jawaban terlebih dahulu: Qwen-Image-3.0 adalah model terpadu untuk pembuatan dan penyuntingan gambar yang dibuat untuk visual yang kaya informasi. Kemampuan khasnya mencakup prompt hingga sekitar 4,5K token, demonstrasi resmi teks sekitar 10 piksel, teks visual native dalam 12 bahasa, dan penyuntingan dengan satu hingga tiga gambar referensi. Tier Standard menekankan kualitas, kecepatan, dan biaya, sementara Pro menargetkan fidelitas maksimum. Data preferensi independen menempatkan model Standard dekat dengan Seedream 5.0 Pro dalam kualitas teks-ke-gambar, meskipun skor penyuntingannya tertinggal dari tier Pro. Terakhir diperbarui: 7 September 2026

TL;DR

Qwen-Image-3.0 adalah model pembuatan gambar generasi ketiga dari Alibaba Qwen. Model ini menggabungkan pembuatan teks-ke-gambar dengan penyuntingan gambar berbasis referensi dan dirancang untuk dokumen visual yang bermanfaat, bukan sekadar gambar dekoratif. Model ini dapat menafsirkan brief kreatif panjang, mengoordinasikan tata letak padat, merender tipografi multibahasa, dan mempertahankan struktur visual selama penyuntingan.

Perbedaan praktis utamanya adalah antara Standard dan Pro. Standard menyeimbangkan kualitas dan kecepatan serta menggunakan ID model qwen-image-3.0. Pro menargetkan detail terkuat dan fidelitas penyuntingan. Dalam Artificial Analysis Image Arena, Standard mencatat 1.275 Elo untuk teks-ke-gambar dan 1.218 untuk penyuntingan, sementara Pro mencatat 1.284 dan 1.250. GPT Image 2 tetap unggul jelas dalam preferensi teks-ke-gambar umum, namun harga API representatif Qwen yang lebih rendah membuat Standard menarik untuk tata letak padat dan produksi volume tinggi.

Alibaba Cloud saat ini mencantumkan harga pembuatan yang sama ¥0,18 untuk penempatan Beijing dan Tokyo, meskipun ketersediaan regional dan ketentuan penagihan harus diperiksa sebelum penggunaan produksi

Pokok-Pokok Penting

  • Qwen-Image-3.0 adalah model terpadu teks-ke-gambar dan penyuntingan gambar, bukan LLM Qwen berbasis teks.
  • Kapasitas prompt sekitar 4,5K token dimaksudkan untuk koran, storyboard, menu, kertas ujian, infografik, dan antarmuka bertingkat.
  • Materi resmi menunjukkan teks tajam sekitar 10 piksel, notasi matematika, 12 bahasa teks visual, banyak font, dan fotorealisme detail.
  • API menerima teks saja atau teks dengan satu hingga tiga gambar referensi dan mengembalikan gambar PNG dalam rentang total piksel terdokumentasi dari 512 x 512 hingga 2048 x 2048.
  • Model Standard menawarkan posisi kualitas-harga teks-ke-gambar yang kuat, sementara Pro menunjukkan keunggulan jauh lebih besar dalam penyuntingan.
  • Rilis ini tidak menyertakan bobot publik, jumlah parameter, pengungkapan komputasi pelatihan, atau laporan teknis lengkap.
  • Salinan, angka, rumus, tanggal, dan aset merek yang dihasilkan masih memerlukan penjaminan kualitas manusia sebelum publikasi.

Apa Itu Qwen-Image-3.0?

Qwen-Image-3.0 adalah model gambar fondasional generasi ketiga dalam keluarga Qwen-Image dari Alibaba. Tujuan desain utamanya adalah kegunaan: membuat gambar yang dapat membawa informasi terstruktur, label yang dapat dibaca, hubungan logis, dan detail realistis dalam satu kanvas yang koheren.

Posisi tersebut mengubah target evaluasi. Generator konvensional bisa berhasil dengan menghasilkan satu gambar menarik dari prompt pendek. Model berorientasi produksi harus melakukan lebih. Ia harus mengikuti brief panjang, menempatkan teks dan objek di area yang bermakna, mempertahankan hierarki visual, menggabungkan referensi, dan mendukung revisi tanpa mengubah bagian lain gambar secara tidak perlu.

Referensi API resmi mengekspos alur kerja teks-ke-gambar dan gambar-ke-gambar. Pengguna dapat membuat dari teks saja atau menggabungkan instruksi penyuntingan dengan satu hingga tiga gambar masukan. Baik Qwen-Image-3.0 maupun Qwen-Image-3.0-Pro menggunakan antarmuka pembuatan-dan-penyuntingan terpadu ini, tetapi model Standard secara eksplisit diposisikan sebagai keseimbangan kualitas dan kecepatan.

Catatan penamaan: Qwen-Image-3.0 adalah model gambar. Jangan bingungkan dengan seri model bahasa Qwen3, Qwen3-VL, atau rilis Qwen-Image dan Qwen-Image-Edit sebelumnya.

Spesifikasi Teknis Qwen-Image-3.0

Alibaba memublikasikan informasi akses dan kapabilitas konkret untuk model Standard. Tabel berikut memisahkan batas terdokumentasi dari klaim tingkat pemasaran agar pengembang tidak menyalahartikan materi pameran sebagai jaminan API.

SpesifikasiQwen-Image-3.0
PengembangAlibaba Qwen Team
Jenis modelPembuatan gambar dan penyuntingan gambar
Posisi utamaKeseimbangan kualitas, kecepatan, dan biaya
ID modelqwen-image-3.0
Masukan/KeluaranTeks dan gambar / gambar PNG
Mode pembuatanteks-ke-gambar; gambar-ke-gambar; penyuntingan berbasis instruksi
Prompt maksimumSekitar 4,5K token
Gambar referensi1-3
Rentang resolusi512 × 512 hingga 2048 × 2048
Kapabilitas teks visualTeks sekitar 10px; 12 bahasa
Endpoint CometAPI/v1/images/generations; /v1/images/edits

Sumber: Informasi model Alibaba Cloud dan Referensi API Qwen Image 3.0.

gambar

Dokumentasi kapabilitas snapshot untuk model Standard.

Sumber: Alibaba Cloud Model Studio.

Apa yang Baru di Qwen-Image-3.0?

Prompt 4,5K Token untuk Konten Visual Padat

Peningkatan paling terlihat adalah dukungan untuk masukan sekitar 4,5K token. Prompt panjang dapat menentukan zona tata letak, judul, label tepat, warna, tipografi, gaya visual, hubungan objek, dan peran referensi tanpa memampatkan seluruh brief ke dalam beberapa kalimat.

Ini sangat berguna untuk dokumen visual. Halaman koran mungkin membutuhkan beberapa kolom, banyak foto, keterangan, label bagian, dan hierarki tipografis yang konsisten. Infografik sembilan panel mungkin memerlukan konsep terpisah, ikon, judul, dan penjelasan di setiap panel. Storyboard mungkin memerlukan kesinambungan antar adegan sambil tetap memvariasikan sudut kamera dan aksi. Instruksi lebih panjang memberi model lebih banyak ruang untuk merepresentasikan batasan tersebut dalam satu permintaan.

Namun, kapasitas prompt tidak boleh disamakan dengan kapasitas teks yang dirender. Model dapat menerima brief desain 4,5K token, tetapi tidak dijamin mereproduksi 4,5K token teks dengan sempurna di dalam gambar keluaran. Anggaran tambahan juga mendeskripsikan gaya, penempatan, dan hubungan yang mungkin tidak pernah muncul sebagai teks literal.

Teks Kecil, Rumus, dan Tipografi Terstruktur

Qwen menyoroti teks yang dirender sekitar 10 piksel, bersama dengan rumus, subskrip, superskrip, huruf Yunani, keterangan, dan salinan editorial padat. Kapabilitas ini memperluas potensi model melampaui poster dengan satu slogan pendek. Model ini dapat mencoba lembar kerja, halaman akademik, diagram teknis, menu, dasbor, dan grafik perbandingan produk.

Implikasi produksinya menjanjikan namun bersyarat. Teks kecil adalah area di mana keandalan visual dan ketepatan faktual paling mudah menyimpang. Satu baris mungkin tampak meyakinkan secara tipografis sementara berisi nama salah eja, satuan yang berubah, tanda minus hilang, atau rumus tidak valid. Salinan penting harus dibaca ulang pada ukuran tampilan final, bukan hanya dalam pratinjau yang dizoom.

Rendering Native dalam 12 Bahasa

Model ini mendukung rendering native dalam 12 bahasa dan banyak font. Contoh peluncuran menunjukkan tata letak multibahasa, termasuk kombinasi Tionghoa-Inggris dan contoh dalam bahasa Jepang, Korea, dan Spanyol. Ini menjadikan Qwen-Image-3.0 relevan untuk aset kampanye terlokalisasi, materi pendidikan, menu, antarmuka, dan dokumentasi produk internasional.

Dukungan bahasa tetap memerlukan pengujian spesifik skrip. Tanda baca, pemutusan baris, teks vertikal, diakritik, jarak karakter, dan substitusi font dapat berperilaku berbeda di berbagai bahasa. Tim harus memelihara uji penerimaan untuk setiap bahasa yang digunakan dalam produksi alih-alih mengasumsikan bahwa satu sampel bahasa Inggris yang sukses membuktikan kualitas tipografi universal.

Detail Fotografi dan Material yang Autentik

Qwen juga menekankan mikro-ekspresi wajah, pori-pori, helaian rambut, kain, kertas, ukiran batu, pencahayaan, dan detail visual halus lainnya. Manfaat praktisnya lebih luas daripada sekadar pembuatan potret fotorealistik. Fotografi produk membutuhkan konsistensi material; tugas restorasi membutuhkan kesinambungan tekstur; aset niaga-el membutuhkan warna dan detail tepi yang stabil; dan gambar editorial membutuhkan subjek yang tetap kredibel saat ditempatkan di sebelah teks padat.

Pembuatan Terpadu dan Penyuntingan Berbasis Referensi

API 3.0 menerima satu hingga tiga gambar referensi bersama instruksi penyuntingan. Referensi tersebut dapat mendefinisikan subjek, produk, gaya, lingkungan, atau komposisi. Pengguna dapat mengganti gaya foto produk, menggabungkan subjek terpisah ke satu adegan, memperbaiki gambar rusak, mengubah pakaian atau latar, atau menghasilkan variasi baru sambil mempertahankan elemen penting.

Antarmuka terpadu ini mengurangi perbedaan antara pembuatan dan penyuntingan pada lapisan aplikasi. Pengembang dapat mempertahankan satu keluarga model dan hanya mengubah keberadaan gambar referensi dan endpoint-nya. Komprominya adalah tiga referensi mungkin terlalu membatasi untuk alur kerja katalog atau kampanye yang kompleks, di mana model seperti Seedream 5.0 Pro dapat menerima lebih banyak masukan melalui beberapa jalur akses.

Kinerja Benchmark Qwen-Image-3.0

Apa yang Tidak Ditampilkan Rilis Resmi

Perbandingan kuantitatif di bawah menggunakan data preferensi buta independen. Skor Arena bersifat dinamis dan bergantung pada distribusi prompt, suara, pengaturan model, dan interval kepercayaan. Skor tersebut sebaiknya memandu pemilihan model, bukan menggantikan pengujian khusus beban kerja.

Hasil Teks-ke-Gambar dan Penyuntingan Independen

ModelT2I EloPeringkat T2IEdit EloPeringkat EditHarga API / 1K
GPT Image 2 (high)1,367#11,257#4$211
Nano Banana 21,319#31,250#7$67
Qwen-Image-3.0-Pro1,284#91,249#5$43
Seedream 5.0 Pro1,279#101,247#8$90
Qwen-Image-3.01,270#121,218#15$30

Sumber: Papan peringkat teks-ke-gambar Artificial Analysis dan papan peringkat penyuntingan. Harga representatif adalah estimasi API kreator yang dinormalisasi oleh sumber pada setelan default 1024 x 1024.

Apa Arti Hasil Ini

  • Standard versus Pro: jarak teks-ke-gambar hanya 9 Elo, tetapi Pro unggul 32 Elo dalam penyuntingan. Alasan terkuat untuk membayar Pro mungkin kualitas penyuntingan, bukan pembuatan awal.
  • Melawan Seedream 5.0 Pro: Standard hanya tertinggal 4 Elo untuk teks-ke-gambar, sementara Pro unggul 5 Elo. Perbedaan kecil ini berada dalam rentang ketidakpastian yang dipublikasikan dan harus diperlakukan sebagai klaster kompetitif, bukan urutan definitif.
  • Melawan Nano Banana 2: Standard tertinggal 44 Elo dalam teks-ke-gambar dan 32 Elo dalam penyuntingan. Pro memperkecil jarak penyuntingan menjadi seri pada 1.250 Elo.
  • Melawan GPT Image 2: GPT unggul atas Standard sebesar 92 Elo dalam teks-ke-gambar dan 39 Elo dalam penyuntingan. Kasus Qwen adalah harga-kinerja dan spesialisasi tata letak, bukan kepemimpinan kualitas universal.
  • Dibandingkan Qwen Image 2.0 Pro sebelumnya, model Standard 3.0 memperoleh 39 Elo teks-ke-gambar pada papan peringkat yang sama sementara harga representatif turun dari $75 menjadi $30 per 1.000 gambar.

gambar

Gambar 3. Qwen-Image-3.0 menempati posisi kualitas-harga yang kuat, meskipun harga per aset yang diterima masih bergantung pada percobaan ulang dan keandalan penyuntingan. Data: Perbandingan model Artificial Analysis.

Harga Qwen-Image-3.0

Harga Resmi Alibaba Cloud

Alibaba Cloud menagih keluarga 3.0 berdasarkan jumlah gambar masukan dan gambar keluaran yang berhasil dihasilkan. Jadwal harga Beijing resmi mencantumkan model Standard pada ¥0,02 per gambar referensi masukan dan ¥0,18 per gambar keluaran pada 1K maupun 2K. Pro menggunakan harga masukan yang sama tetapi mengenakan biaya ¥0,25 untuk keluaran 1K dan ¥0,50 untuk keluaran 2K.

ModelGambar MasukanKeluaran 1KKeluaran 2K
Qwen-Image-3.0¥0,02 / gambar¥0,18 / gambar¥0,18 / gambar
Qwen-Image-3.0-Pro¥0,02 / gambar¥0,25 / gambar¥0,50 / gambar

Sumber: Harga Alibaba Cloud Model Studio. Harga regional dan ketentuan promosi dapat berbeda.

Skenario Biaya Contoh

Beban KerjaPerhitunganEstimasi Biaya
Satu keluaran Standard teks-ke-gambar1 x ¥0,18¥0,18
Satu referensi penyuntingan Standard¥0,02 + ¥0,18¥0,20
Tiga referensi penyuntingan Standard3 x ¥0,02 + ¥0,18¥0,24
1.000 keluaran Standard teks-ke-gambar1.000 x ¥0,18¥180
1.000 keluaran Pro 1K1.000 x ¥0,25¥250
1.000 keluaran Pro 2K1.000 x ¥0,50¥500

Contoh-contoh ini hanya mencakup keluaran yang berhasil dan tidak termasuk pajak, konversi regional, kredit promosi, penyimpanan, tinjauan konten, alur kerja hilir yang gagal, serta biaya pembuatan tambahan yang diperlukan untuk mencapai aset yang diterima.

Siapa yang Sebaiknya Menggunakan Qwen-Image-3.0?

Pilih Qwen-Image-3.0 Standard ketika:

  • Anda membuat banyak gambar;
  • tata letak berisi banyak teks;
  • prompt sangat terperinci;
  • tipografi multibahasa penting;
  • penyuntingan gambar diperlukan tetapi fidelitas maksimum tidak esensial;
  • biaya per pembuatan penting.

Pilih Qwen-Image-3.0-Pro ketika:

  • fidelitas penyuntingan lebih penting daripada biaya pembuatan mentah;
  • mempertahankan subjek/material/tata letak melalui penyuntingan sangat kritis;
  • jumlah pembuatan relatif kecil.

Pilih model lain ketika:

  • keluaran 4K native wajib;
  • Anda memerlukan alur kerja gambar referensi yang ekstensif;
  • grounding pencarian adalah persyaratan inti;
  • Anda membutuhkan skor preferensi gambar serbaguna tertinggi.

Perbandingan Qwen-Image-3.0 dengan Model Gambar Terdepan

Tidak ada model gambar yang unggul di setiap dimensi produksi. Preferensi umum, fidelitas penyuntingan, perenderan teks, kapasitas referensi, resolusi keluaran, grounding, latensi, dan biaya dapat menunjuk pada pemenang yang berbeda. Perbandingan di bawah berfokus pada kapabilitas terdokumentasi dan hasil Arena independen.

DimensiQwen 3 StandardQwen 3 ProGPT Image 2Nano Banana 2Seedream 5 Pro
PosisiKeseimbangan kualitas/kecepatan/biayaFidelitas tertinggi QwenModel gambar umum premiumModel gambar Gemini cepat, volume tinggiDesain profesional dan penyuntingan
T2I / Edit Elo1,275 / 1,2181,284 / 1,2501,367 / 1,2571,319 / 1,2501,279 / 1,247
Output yang disebutSekitar 2KSekitar 2KUkuran fleksibelHingga 4KSekitar 2K di CometAPI
Masukan referensi1-31-3DidukungMulti-referensiHingga 10 di CometAPI
Fokus tipografiBrief 4,5K; klaim 10px; 12 bahasaFokus inti sama dengan fidelitas lebih tinggiTeks multibahasa kuatTeks plus grounding pencarianInfografik padat dan kontrol spasial
Grounding webTidakTidakBukan fitur API penentuGoogle Search dan Image SearchBergantung jalur akses
Kesesuaian terbaikTata letak padat dengan biaya terkendaliPenyuntingan Qwen berkualitas tinggiPreferensi umum maksimum4K cepat dan alur kerja informasi terbaruPenyuntingan presisi dan desain multi-referensi

Data benchmark: Artificial Analysis. Sumber kapabilitas model tertaut di header tabel; jalur akses individual dapat mengekspos batas berbeda.

Qwen-Image-3.0 vs Qwen-Image-3.0-Pro

Model Standard bukan sekadar edisi beresolusi rendah. Kedua tier berbagi API pembuatan-dan-penyuntingan 3.0 dan rentang total piksel terdokumentasi yang sama. Perbedaannya adalah posisi produk dan kualitas yang diamati. Standard dimaksudkan untuk produksi harian yang berkelanjutan, sementara Pro menekankan detail, realisme, dan fidelitas penyuntingan terkuat.

Untuk generasi awal, jaraknya kecil. Untuk penyuntingan, jaraknya secara material lebih besar. Pilih Standard ketika volume, latensi, dan biaya penting dan alur kerja dapat mentolerir pembuatan ulang atau penyelesaian eksternal. Pilih Pro ketika mempertahankan subjek, tipografi, komposisi, atau detail material melalui beberapa penyuntingan layak dengan harga keluaran yang lebih tinggi.

Qwen-Image-3.0 vs GPT Image 2

GPT Image 2 adalah titik awal yang lebih aman ketika preferensi gambar umum maksimum adalah tujuan utama. OpenAI memposisikannya pada perenderan teks yang lebih baik, dukungan multibahasa, penyuntingan lanjutan, dan pembuatan gambar profesional, dan ia memegang keunggulan substansial di Arena teks-ke-gambar independen.

Qwen menjadi lebih menarik ketika beban kerja menghargai brief kreatif panjang, tata letak padat informasi, dokumen visual multibahasa, dan biaya API representatif yang lebih rendah. Sistem produksi yang masuk akal dapat menggunakan GPT Image 2 untuk aset hero bernilai tertinggi dan Qwen-Image-3.0 untuk grafik editorial, pendidikan, atau katalog berskala.

Qwen-Image-3.0 vs Nano Banana 2

Nano Banana 2 mendukung keluaran dari 0,5K hingga 4K, termasuk rasio aspek ekstrem 1:4, 4:1, 1:8, dan 8:1. Model ini juga dapat menggunakan grounding Google Search dan Image Search, yang berguna untuk visual berbasis produk, lokasi, atau konteks faktual terkini.

Gunakan Nano Banana 2 ketika keluaran 4K, format memanjang, grounding pencarian, atau pembuatan iteratif cepat menjadi pusat. Uji Qwen terlebih dahulu ketika prompt menyerupai dokumen desain dan keluaran harus mengoordinasikan teks padat, rumus, panel, antarmuka, atau bagian multibahasa dalam satu kanvas.

Qwen-Image-3.0 vs Seedream 5.0 Pro

Seedream 5.0 Pro berfokus pada pemahaman desain profesional dan penyuntingan presisi. ByteDance menyoroti panduan titik, laso, kotak, dan sketsa, penggantian warna dan material, pemisahan layer, dan fusi multi gambar. CometAPI mendokumentasikan hingga sepuluh referensi untuk rute Seedream saat ini.

Model-model ini berdekatan dalam preferensi teks-ke-gambar, tetapi Seedream memimpin Qwen Standard dalam penyuntingan. Karena itu Seedream lebih kuat untuk koreksi lokal, kontrol area bertanda, dan kampanye yang dibangun dari banyak aset referensi. Qwen lebih khas ketika prompt panjang, tata letak editorial padat, salinan multibahasa, dan biaya tier Standard diberi bobot lebih.

Keterbatasan Qwen-Image-3.0

  • Tidak ada jumlah parameter publik, deskripsi arsitektur, pengungkapan komputasi pelatihan, atau laporan teknis lengkap yang tersedia.
  • Rilis 3.0 tidak disajikan dengan bobot terbuka yang dapat diunduh, jadi tidak boleh disebut sebagai model sumber terbuka.
  • Hasil teks 10 piksel adalah klaim kapabilitas resmi, bukan jaminan keandalan universal di setiap font, bahasa, dan tata letak.
  • Prompt 4,5K token tidak berarti 4,5K token teks dapat dirender tanpa kesalahan dalam satu gambar.
  • Skor penyuntingan independen model Standard tertinggal dari Pro dan beberapa pesaing terkemuka.
  • Rentang keluaran yang didokumentasikan kira-kira skala 2K, di bawah pesaing yang mengekspos keluaran 4K native.
  • API hanya menerima satu hingga tiga referensi, yang dapat membatasi alur kerja katalog atau konsistensi karakter yang kompleks.
  • Inferensi batch, fine-tuning, function calling, keluaran terstruktur, dan context caching tidak didukung pada rute Standard yang didokumentasikan.
  • Fakta, rumus, diagram, tanda merek, dan salinan publikasi yang dihasilkan memerlukan QA manusia dan mungkin perlu koreksi di perangkat lunak desain konvensional.

Cara Mengakses Qwen-Image-3.0

Akses Melalui Qwen dan Alibaba Cloud

Pengguna dapat mencoba pembuatan gambar Qwen melalui produk konsumen Qwen, sementara pengembang dapat menggunakan Alibaba Cloud Model Studio. Model, URL endpoint, workspace, dan kunci API harus berada pada wilayah penempatan yang sama. Kombinasi lintas wilayah akan gagal, jadi tim produksi harus memilih wilayah sebelum membuat kredensial dan mengeraskan endpoint.

Akses Melalui CometAPI

Qwen-Image-3.0 di CometAPI tercantum sebagai segera hadir, jadi jangan perlakukan qwen-image-3.0 sebagai rute siap produksi untuk saat ini. Hingga diaktifkan, pertimbangkan GPT Image 2, Nano Banana 2, atau Seedream 5.0 Pro sesuai kebutuhan kualitas, penyuntingan, resolusi, dan biaya Anda.

Sebelum penerapan, periksa ulang halaman model dan dokumentasi CometAPI untuk ID model aktif, endpoint, jumlah masukan yang didukung, ukuran keluaran, dan skema respons.

Endpoint teks-ke-gambar: POST https://api.cometapi.com/v1/images/generations

Endpoint penyuntingan gambar: POST https://api.cometapi.com/v1/images/edits

Buat kunci di konsol CometAPI, simpan sebagai variabel lingkungan, dan hindari hard-code kredensial dalam kontrol sumber.

Untuk penyuntingan, panggil /v1/images/edits dan sertakan satu hingga tiga URL gambar masukan dalam konten pesan sebelum instruksi teks. Tinjau dokumentasi CometAPI untuk skema respons saat ini, ukuran yang didukung, dan parameter khusus rute.

Struktur Prompt yang Direkomendasikan untuk Qwen-Image-3.0

Qwen-Image-3.0 diuntungkan oleh prompt yang dibaca seperti brief desain ringkas. Struktur yang berguna adalah:

Subject + information hierarchy + exact copy + layout regions + visual style + typography + color system + reference roles + elements to preserve + output ratio

Untuk pekerjaan kaya informasi, definisikan hierarki halaman sebelum menggambarkan estetika. Nyatakan bagian mana yang utama, berapa banyak panel yang diperlukan, teks mana yang harus persis, apa yang dapat diringkas secara visual, dan elemen mana yang harus tetap tidak tersentuh selama penyuntingan. Ini mengurangi ambiguitas lebih efektif daripada menambahkan daftar panjang kata sifat gaya.

Production tip: Build set penerimaan dengan tipografi, teks multibahasa, wajah, produk, rumus, penyuntingan lokal, dan komposisi multi-referensi. Bandingkan kualitas generasi awal, tingkat percobaan ulang, drift penyuntingan, latensi, dan total biaya per aset yang diterima - bukan hanya harga satu pembuatan mentah.

Rekomendasi Akhir

Qwen-Image-3.0 bukan pemimpin kualitas gambar universal. GPT Image 2 tetap lebih kuat dalam preferensi teks-ke-gambar keseluruhan, Nano Banana 2 menawarkan 4K native dan alur kerja ber-grounding pencarian, dan Seedream 5.0 Pro menyediakan kontrol penyuntingan yang lebih khusus dan anggaran referensi lebih besar di CometAPI.

Nilainya lebih spesifik dan lebih praktis. Standard menggabungkan kualitas pembuatan yang kompetitif, kapasitas prompt panjang, tata letak multibahasa padat, ambisi teks kecil, penyuntingan terpadu, dan harga API representatif yang rendah. Ini adalah salah satu pilihan paling menarik untuk infografik, konten pendidikan, halaman editorial, menu, mockup UI, storyboard, penjelas produk, dan aset lain yang harus membawa informasi, bukan sekadar terlihat menarik.

Mulailah dengan Standard untuk pembuatan volume tinggi dan tugas berat tata letak. Beralih ke Pro ketika fidelitas penyuntingan atau detail halus secara material mengurangi percobaan ulang. Pertahankan GPT Image 2, Nano Banana 2, atau Seedream 5.0 Pro sebagai rute perbandingan, dan buat keputusan akhir menggunakan prompt produksi yang sama dan rubrik tinjauan manusia tetap.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Sep 12, 2026
Terakhir diperbarui Sep 12, 2026
0 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya