Specifiche tecniche di kling-image-recognize
| Specifiche | Dettagli |
|---|---|
| ID modello | kling-image-recognize |
| Categoria | Riconoscimento di immagini / analisi multimodale |
| Capacità principale | Riconosce gli elementi dell'immagine per flussi creativi downstream, inclusa la generazione di video con riferimenti multi-immagine e il montaggio video multimodale |
| Tipo di input | Input immagine |
| Tipo di output | Risultati di riconoscimento strutturati |
| Ambito di riconoscimento | Soggetti, volti, abbigliamento e altri elementi visivi |
| Volume dei risultati | Può restituire fino a 4 set di risultati per richiesta, se disponibili |
| Casi d'uso | Analisi di asset visivi, preparazione di riferimenti per la generazione di video, comprensione dei contenuti per pipeline di editing, riconoscimento di soggetti e abbigliamento |
Che cos'è kling-image-recognize?
kling-image-recognize è un'API di Keling per il riconoscimento degli elementi dell'immagine, progettata per analizzare i contenuti visivi e identificare elementi importanti all'interno di un'immagine. È particolarmente utile nei workflow che richiedono la generazione di video basata su più immagini di riferimento o il montaggio video multimodale, in cui comprendere i contenuti delle immagini sorgente è un'importante fase di pre-elaborazione.
Il modello può riconoscere una gamma di attributi visivi come soggetti, volti, abbigliamento e componenti correlati dell'immagine. A seconda dell'input, può fornire fino a 4 set di risultati di riconoscimento in un'unica richiesta, aiutando gli sviluppatori a cogliere più rilevamenti o interpretazioni possibili quando disponibili.
Funzionalità principali di kling-image-recognize
- Riconoscimento degli elementi dell'immagine: rileva e identifica gli elementi visivi importanti contenuti in un'immagine di input.
- Analisi dei soggetti: riconosce i soggetti principali utilizzabili in flussi di generazione o montaggio di contenuti downstream.
- Supporto al riconoscimento dei volti: estrae risultati relativi ai volti quando presenti nell'immagine.
- Identificazione dell'abbigliamento: rileva elementi di abbigliamento per supportare una comprensione visiva più dettagliata.
- Supporto ai workflow con riferimenti multi-immagine: utile per preparare e analizzare riferimenti d'immagine usati in pipeline di generazione video.
- Compatibilità con il montaggio video multimodale: abilita scenari di editing in cui è necessario comprendere il contenuto prima della trasformazione o composizione.
- Più set di risultati per richiesta: può ottenere fino a 4 set di risultati per richiesta, se disponibili, per un output di riconoscimento più ricco.
- Utilizzo dell'API facile da integrare: adatta agli sviluppatori che costruiscono pipeline di analisi dei media e applicazioni creative automatizzate.
Come accedere e integrare kling-image-recognize
Passaggio 1: registrati per ottenere una chiave API
Per iniziare, registrati sulla piattaforma CometAPI e genera la tua chiave API dalla dashboard. Dopo aver ottenuto la chiave, conservala in modo sicuro e usala per autenticare ogni richiesta all'API kling-image-recognize.
Passaggio 2: invia richieste all'API kling-image-recognize
Una volta ottenuta la chiave API, invia richieste all'endpoint di CometAPI usando kling-image-recognize come ID del modello. Includi le intestazioni di autenticazione e fornisci il payload di input dell'immagine richiesto in base al flusso di lavoro della tua applicazione.
curl --request POST \
--url https://api.cometapi.com/v1/responses \
--header "Authorization: Bearer YOUR_COMETAPI_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kling-image-recognize",
"input": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Recognize the main visual elements in this image."
},
{
"type": "input_image",
"image_url": "YOUR_IMAGE_URL"
}
]
}
]
}'
Passaggio 3: recupera e verifica i risultati
Dopo l'invio, l'API restituisce i risultati di riconoscimento generati da kling-image-recognize. Analizza la risposta nella tua applicazione, verifica i soggetti o gli attributi rilevati e archivia i dati restituiti per l'uso nella generazione di video, nel montaggio o in altre attività di automazione a valle.