Tekniske specifikationer for kling-image-recognize
| Specifikation | Detaljer |
|---|---|
| Model-ID | kling-image-recognize |
| Kategori | Billedgenkendelse / multimodal analyse |
| Primær funktion | Genkender billedelementer til nedstrøms kreative arbejdsprocesser, herunder videogenerering med referencer fra flere billeder og multimodal videoredigering |
| Inputtype | Billedinput |
| Outputtype | Strukturerede genkendelsesresultater |
| Genkendelsesområde | Motiver, ansigter, beklædning og andre visuelle elementer |
| Resultatmængde | Kan returnere op til 4 sæt resultater pr. anmodning, hvis tilgængeligt |
| Anvendelsesområder | Analyse af visuelle aktiver, forberedelse af referencer til videogenerering, indholdsforståelse til redigeringspipelines, motiv- og beklædningsgenkendelse |
Hvad er kling-image-recognize?
kling-image-recognize er en Keling API til genkendelse af billedelementer, der er designet til at analysere visuelt indhold og identificere vigtige elementer i et billede. Den er især nyttig i arbejdsgange, der kræver videogenerering med referencer fra flere billeder eller multimodal videoredigering, hvor forståelsen af kildebilledernes indhold er et vigtigt forbehandlingsskridt.
Modellen kan genkende en række visuelle attributter såsom motiver, ansigter, beklædning og relaterede billedkomponenter. Afhængigt af inputtet kan den levere op til 4 sæt genkendelsesresultater i en enkelt anmodning, hvilket hjælper udviklere med at indfange flere mulige detektioner eller fortolkninger, når de er tilgængelige.
Hovedfunktioner i kling-image-recognize
- Genkendelse af billedelementer: Detekterer og identificerer vigtige visuelle elementer i et inputbillede.
- Motivanalyse: Genkender primære motiver, der kan bruges i nedstrøms arbejdsgange til mediegenerering eller redigering.
- Understøttelse af ansigtsgenkendelse: Udtrækker ansigtsrelaterede genkendelsesresultater, når der er ansigter i billedet.
- Identifikation af beklædning: Detekterer beklædnings- og tøjrelaterede elementer for at understøtte en mere detaljeret visuel forståelse.
- Understøttelse af arbejdsgange med flere billedreferencer: Nyttig til at forberede og analysere billedreferencer, der bruges i videogenereringspipelines.
- Kompatibilitet med multimodal videoredigering: Hjælper i redigeringsscenarier, hvor billedindhold skal forstås før transformation eller komposition.
- Flere resultatsæt pr. anmodning: Kan opnå op til 4 sæt resultater pr. anmodning, hvis tilgængeligt, hvilket muliggør mere fyldige genkendelsesoutput.
- Integrationsvenlig API-brug: Velegnet til udviklere, der bygger automatiserede medieanalyse- og kreative applikationspipelines.
Sådan får du adgang til og integrerer kling-image-recognize
Trin 1: Tilmeld dig for at få en API-nøgle
Kom i gang ved at tilmelde dig på CometAPI-platformen og generér din API-nøgle fra dashboardet. Når du har fået din nøgle, skal du opbevare den sikkert og bruge den til at godkende hver anmodning til kling-image-recognize-API'en.
Trin 2: Send anmodninger til kling-image-recognize-API'en
Når du har din API-nøgle, skal du sende anmodninger til CometAPI-endepunktet med kling-image-recognize som model-ID. Inkludér dine autentificeringsheaders og angiv den krævede billedinput-nyttelast baseret på din applikations arbejdsgang.
curl --request POST \
--url https://api.cometapi.com/v1/responses \
--header "Authorization: Bearer YOUR_COMETAPI_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kling-image-recognize",
"input": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Recognize the main visual elements in this image."
},
{
"type": "input_image",
"image_url": "YOUR_IMAGE_URL"
}
]
}
]
}'
Trin 3: Hent og verificer resultater
Efter afsendelse returnerer API'en genkendelsesresultater genereret af kling-image-recognize. Pars svaret i din applikation, verificer de detekterede motiver eller attributter, og gem de returnerede data til brug i videogenerering, redigering eller andre nedstrøms automatiseringsopgaver.