Spesifikasi Teknikal Hy-Image 3.5 Preview
| Butiran | Hy-Image 3.5 Preview |
|---|---|
| ID Model | hy-image-v3.5-preview |
| Penyedia | Tencent Hunyuan |
| Jenis model | Model penjanaan dan penyuntingan imej profesional |
| Input | Teks + imej rujukan |
| Output | Imej |
| Had input | Sehingga 100K token |
| Mod penjanaan | Teks-ke-imej, imej-ke-imej, penyuntingan berbilang pusingan |
| Imej rujukan | Sehingga 20 imej setiap permintaan |
| Saiz imej rujukan | Sehingga 20MB setiap imej |
| Resolusi output | Sehingga 4096 × 4096 (4K) |
| Protokol | Chat / Messages |
| Penjanaan | Segerak |
| Carian luaran | Disokong |
| Seed | Disokong |
| Saiz tersuai | Disokong |
Apakah Hy-Image 3.5 Preview?
Hy-Image 3.5 Preview ialah model penjanaan imej profesional daripada Tencent Hunyuan yang direka untuk penjanaan teks-ke-imej, penjanaan imej-ke-imej, dan penyuntingan imej berbilang pusingan.
Tidak seperti API penjanaan imej berasaskan satu arahan yang konvensional, Hy-Image 3.5 Preview menggunakan protokol gaya Chat/Messages, membolehkan arahan teks, imej rujukan dan konteks penjanaan imej sebelumnya digabungkan dalam aliran kerja berbualan. Justeru, model ini bukan sahaja boleh mencipta imej dari awal, tetapi juga mengubah suai hasil sedia ada secara berulang merentas berbilang pusingan.
Ciri Utama Hy-Image 3.5 Preview
- Penjanaan teks-ke-imej: Menjana imej daripada arahan bahasa semula jadi dan membolehkan model mentafsir komposisi, gaya, subjek, dan butiran visual yang diminta.
- Penjanaan imej-ke-imej: Gabungkan arahan teks dengan imej rujukan untuk memandu hasil yang dijana.
- Penyuntingan berbilang pusingan: Mengekalkan perbualan dan konteks imej terdahulu agar pengguna boleh memperhalusi imej secara progresif tanpa perlu bermula dari kosong.
- Input multimodal: Sesuatu permintaan boleh menggabungkan arahan teks dengan imej rujukan, sesuai untuk pemindahan gaya, pengeditan imej produk, pelarasan watak, dan iterasi visual.
- Output 4K: Dokumentasi API rasmi menyokong output sehingga 4096 × 4096 piksel, tertakluk pada kekangan keluasan imej yang didokumenkan.
- Penambahbaikan carian luaran: Dokumentasi API menyenaraikan penambahbaikan carian luaran sebagai keupayaan yang disokong, membolehkan aliran kerja penjanaan imej memasukkan maklumat tambahan apabila diperlukan.
- Saiz imej yang fleksibel: Pembangun boleh menentukan
sizeyang tepat, atau membenarkan model menentukan saiz output yang sesuai berdasarkan arahan dan bajet piksel yang ditetapkan. - Kawalan seed: Seed boleh dibekalkan apabila diperlukan penjanaan yang boleh dihasilkan semula.
Keupayaan Penjanaan dan Penyuntingan Imej
Teks-ke-Imej
Hy-Image 3.5 Preview boleh menjana imej terus daripada arahan teks. Model menerima permintaan gaya Messages, dengan teks pengguna berfungsi sebagai arahan penjanaan imej.
Ini sesuai untuk tugasan kreatif seperti ilustrasi, seni konsep, visual pengiklanan, grafik pembentangan, imej produk, dan aliran kerja kandungan visual lain.
Imej-ke-Imej
Model ini boleh menggabungkan arahan teks dengan imej rujukan. Imej rujukan boleh dibekalkan melalui URL imej awam atau data imej yang dikodkan Base64.
Dokumentasi API rasmi membenarkan sehingga 20 imej rujukan, dengan saiz maksimum 20MB setiap imej.
Penyuntingan Imej Berbilang Pusingan
Salah satu keupayaan tersendiri Hy-Image 3.5 Preview ialah penyuntingan berbilang pusingan. Daripada menjana setiap semakan sebagai permintaan berasingan, pembangun boleh mengekalkan perbualan dan konteks imej yang dijana sebelum ini dan kemudian menghantar arahan penyuntingan baharu.
Ini membolehkan aliran kerja seperti:
- Jana imej awal.
- Minta model menukar elemen tertentu.
- Kekalkan selebihnya komposisi.
- Terus memperhalusi imej merentas berbilang pusingan.
API memulangkan struktur assembled_history yang boleh diguna semula sebagai konteks untuk pusingan penyuntingan seterusnya.
Resolusi dan Saiz Imej
Hy-Image 3.5 Preview menyokong dimensi output yang fleksibel.
Apabila size diberikan dengan jelas, dimensi yang diminta boleh dikawal secara langsung, dengan dokumentasi API rasmi menyatakan dimensi dari 256 hingga 8192 piksel setiap sisi dan keluasan imej maksimum 16,777,216 piksel, bersamaan output kelas 4K 4096 × 4096.
Untuk penjanaan 4K, dokumentasi API mengesyorkan agar saiz yang dikehendaki dinyatakan dengan jelas. Jika tiada saiz tepat dibekalkan, model boleh menentukan dimensi output berdasarkan arahan dan bajet piksel yang dikonfigurasi.
Prestasi Penanda Aras Hy-Image 3.5 Preview
Bahan pelancaran awam Tencent menerangkan Hy-Image 3.5 Preview sebagai model penjanaan imej bertaraf profesional. Tencent juga melaporkan penilaian buta dalaman yang melibatkan ratusan pereka profesional, mendakwa peningkatan 30% berbanding Hy-Image 3.0 dan hasil yang setanding dengan Seedream 5.0 Pro. Ini ialah keputusan penilaian dalaman yang dilaporkan oleh vendor, bukannya penanda aras awam yang dihasilkan semula secara bebas.
Oleh kerana dokumentasi API rasmi tidak menyediakan jadual penanda aras awam yang piawai, keputusan yang dilaporkan ini tidak seharusnya dibentangkan sebagai skor papan pendahulu yang boleh dibandingkan secara langsung.
Hy-Image 3.5 Preview vs. Hy-Image 3.0
| Keupayaan | Hy-Image 3.5 Preview | Hy-Image 3.0 |
|---|---|---|
| Teks-ke-imej | Ya | Ya |
| Penjanaan imej berasaskan rujukan | Ya | Ya |
| Penyuntingan berbilang pusingan | Ya | Tidak |
| Protokol Chat / Messages | Ya | Tidak |
| Input multimodal | Ya | Ya |
| Output didokumen maksimum | Sehingga 4K | Sehingga 2048 × 2048 |
| Had input | 100K token | 8192 aksara |
| Imej rujukan | Sehingga 20 | 0–3 |
| Penambahbaikan carian luaran | Ya | — |
| Seed | Ya | Ya |
Oleh itu, Hy-Image 3.5 Preview diposisikan sebagai sistem penjanaan yang lebih berorientasikan perbualan dan penyuntingan, manakala Hy-Image 3.0 menggunakan antara muka penjanaan yang lebih ringkas berpusatkan arahan dan imej rujukan pilihan.
Hy-Image 3.5 Preview vs. Model Imej Lain
Hy-Image 3.5 Preview terutamanya dibezakan oleh gabungan penjanaan imej, input rujukan multimodal, penyuntingan berbualan, dan aliran kerja imej dengan konteks yang besar.
Untuk aplikasi yang memfokuskan pada penciptaan visual beriterasi, seni bina Chat/Messages boleh menjadi sangat berguna kerana model boleh mengekalkan konteks pusingan penyuntingan sebelumnya, bukan menganggap setiap penjanaan sebagai permintaan berasingan.
Berbanding model yang terutamanya mendedahkan satu arahan penjanaan imej, Hy-Image 3.5 Preview menyediakan aliran kerja yang lebih hampir kepada penyunting imej berbualan.
Kes Penggunaan Representatif
1. Pengiklanan Komersial
Hasilkan visual kempen, karya promosi, grafik pemasaran, dan konsep pengiklanan daripada penerangan bahasa semula jadi yang terperinci.
2. Penciptaan Imej Produk
Gunakan imej rujukan dan arahan teks untuk mencipta atau mengubah suai visual produk sambil mengekalkan ciri visual penting.
3. Reka Bentuk UI dan Produk
Jana konsep antara muka, mockup visual, penerokaan reka bentuk, dan aset visual siap pembentangan.
4. Penyuntingan Watak dan Potret
Gunakan imej rujukan dan arahan beriterasi untuk memperhalusi watak, potret, gaya, pakaian, latar belakang, dan elemen visual lain.
5. Ilustrasi Kreatif
Cipta ilustrasi, seni konsep, visual penceritaan, dan aset kreatif lain daripada arahan terperinci.
6. Penghasilan Visual Berbilang Pusingan
Gunakan keupayaan penyuntingan berbualan untuk memperhalusi imej secara progresif merentas pelbagai arahan, menjadikan model sesuai untuk aliran kerja di mana visual akhir dibangunkan melalui beberapa iterasi.
Had dan Pertimbangan
Hy-Image 3.5 Preview kini merupakan model Preview, jadi tingkah laku API dan versi model asas mungkin berubah apabila Tencent terus mengemas kini perkhidmatan.
URL imej yang dijana dan dipulangkan oleh API adalah sementara. Dokumentasi rasmi menyatakan bahawa URL imej yang dijana sah selama 12 jam, jadi aplikasi yang memerlukan aset berterusan hendaklah memuat turun dan menyimpan imej yang dijana dan tidak bergantung pada URL yang dipulangkan untuk tempoh yang tidak terhad.
Pembangun yang menggunakan penyuntingan berbilang pusingan juga perlu mengekalkan assembled_history yang dipulangkan apabila meneruskan sesi penyuntingan, kerana struktur ini mengandungi konteks yang diperlukan untuk pusingan seterusnya.
Cara Mengakses API Hy-Image 3.5 Preview melalui CometAPI
CometAPI boleh menyediakan lapisan integrasi bersatu untuk aplikasi yang ingin mengakses model AI yang disokong melalui aliran kerja API yang konsisten.
Langkah 1: Daftar atau Log Masuk ke CometAPI
Cipta akaun CometAPI atau log masuk ke akaun sedia ada. Selepas memasuki konsol CometAPI, akses kawasan pengurusan kunci API.
Langkah 2: Cipta Kunci API CometAPI
Jana kunci API daripada konsol CometAPI. Pastikan kunci disimpan dengan selamat kerana ia digunakan untuk mengesahkan permintaan API.
Langkah 3: Cari Hy-Image 3.5 Preview
Buka katalog model CometAPI dan cari Hy-Image 3.5 Preview. Sahkan bahawa model tersebut tersedia melalui akaun CometAPI anda sebelum mengintegrasikannya ke dalam aplikasi produksi.
Gunakan pengecam model:
hy-image-v3.5-preview
Langkah 4: Konfigurasi Aplikasi Anda
Konfigurasikan aplikasi anda untuk menggunakan antara muka API bersatu CometAPI dan sahkan permintaan dengan kunci API CometAPI anda.
Untuk aliran kerja penjanaan imej, hantarkan arahan teks yang sesuai, maklumat imej rujukan, dan parameter penjanaan yang disokong oleh model.
Langkah 5: Hantar Permintaan Penjanaan Imej Anda
Hantar permintaan melalui CometAPI dengan menggunakan hy-image-v3.5-preview sebagai model yang dipilih.
Bergantung pada aplikasi anda, anda boleh menggunakan model untuk penjanaan teks-ke-imej, penjanaan berasaskan imej rujukan, atau penyuntingan berbilang pusingan.
Langkah 6: Proses dan Simpan Imej yang Dijana
Dapatkan imej yang dijana daripada respons API dan simpannya dalam storan aplikasi anda sendiri jika imej perlu kekal tersedia melebihi tempoh sah URL sementara.