Spesifikasi Teknikal bagi kling-image-recognize
| Spesifikasi | Butiran |
|---|---|
| ID Model | kling-image-recognize |
| Kategori | Pengecaman imej / analisis multimodal |
| Keupayaan Utama | Mengenal pasti elemen imej untuk aliran kerja kreatif hiliran, termasuk penjanaan video rujukan berbilang imej dan penyuntingan video multimodal |
| Jenis Input | Input imej |
| Jenis Output | Keputusan pengecaman berstruktur |
| Skop Pengecaman | Subjek, wajah, pakaian, dan elemen visual lain |
| Jumlah Keputusan | Boleh mengembalikan sehingga 4 set keputusan bagi setiap permintaan, jika tersedia |
| Kes Penggunaan | Analisis aset visual, penyediaan rujukan untuk penjanaan video, pemahaman kandungan untuk saluran paip penyuntingan, pengenalan subjek dan pakaian |
Apakah kling-image-recognize?
kling-image-recognize ialah API pengecaman elemen imej Keling yang direka untuk menganalisis kandungan visual dan mengenal pasti elemen penting dalam sesuatu imej. Ia amat berguna dalam aliran kerja yang memerlukan penjanaan video rujukan berbilang imej atau penyuntingan video multimodal, di mana memahami kandungan imej sumber merupakan langkah prapemprosesan yang penting.
Model ini boleh mengenal pasti pelbagai atribut visual seperti subjek, wajah, pakaian, dan komponen imej berkaitan. Bergantung pada input, ia boleh memberikan sehingga 4 set keputusan pengecaman dalam satu permintaan, membantu pembangun menangkap pelbagai pengesanan atau tafsiran yang berpotensi apabila tersedia.
Ciri utama kling-image-recognize
- Pengecaman elemen imej: Mengesan dan mengenal pasti elemen visual penting yang terdapat dalam imej input.
- Analisis subjek: Mengenal pasti subjek utama yang boleh digunakan dalam aliran kerja penjanaan atau penyuntingan media hiliran.
- Sokongan pengenalan wajah: Mengekstrak keputusan pengecaman berkaitan wajah apabila terdapat wajah dalam imej.
- Pengenalpastian pakaian: Mengesan pakaian dan elemen berkaitan pakaian untuk menyokong pemahaman visual yang lebih terperinci.
- Sokongan aliran kerja rujukan berbilang imej: Berguna untuk menyediakan dan menganalisis rujukan imej yang digunakan dalam saluran paip penjanaan video.
- Keserasian penyuntingan video multimodal: Membantu menyokong senario penyuntingan di mana kandungan imej perlu difahami sebelum transformasi atau komposisi.
- Berbilang set keputusan bagi setiap permintaan: Boleh memperoleh sehingga 4 set keputusan bagi setiap permintaan, jika tersedia, membolehkan output pengecaman yang lebih kaya.
- Penggunaan API mesra integrasi: Sesuai untuk pembangun yang membina saluran paip analisis media automatik dan aplikasi kreatif.
Cara mengakses dan mengintegrasikan kling-image-recognize
Langkah 1: Daftar untuk Kunci API
Untuk bermula, daftar di platform CometAPI dan jana kunci API anda daripada papan pemuka. Selepas memperoleh kunci anda, simpan dengan selamat dan gunakannya untuk mengesahkan setiap permintaan ke API kling-image-recognize.
Langkah 2: Hantar permintaan ke API kling-image-recognize
Sebaik sahaja anda mempunyai kunci API, hantar permintaan ke titik akhir CometAPI menggunakan kling-image-recognize sebagai ID model. Sertakan pengepala pengesahan anda dan sediakan muatan input imej yang diperlukan berdasarkan aliran kerja aplikasi anda.
curl --request POST \
--url https://api.cometapi.com/v1/responses \
--header "Authorization: Bearer YOUR_COMETAPI_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kling-image-recognize",
"input": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Recognize the main visual elements in this image."
},
{
"type": "input_image",
"image_url": "YOUR_IMAGE_URL"
}
]
}
]
}'
Langkah 3: Dapatkan dan Sahkan Keputusan
Selepas penyerahan, API mengembalikan keputusan pengecaman yang dijana oleh kling-image-recognize. Huraikan respons dalam aplikasi anda, sahkan subjek atau atribut yang dikesan, dan simpan data yang dikembalikan untuk digunakan dalam penjanaan video, penyuntingan, atau tugas automasi hiliran yang lain.