Technische Spezifikationen von kling-image-recognize
| Spezifikation | Details |
|---|---|
| Modell-ID | kling-image-recognize |
| Kategorie | Bilderkennung / multimodale Analyse |
| Primärfunktion | Erkennt Bildelemente für nachgelagerte kreative Workflows, einschließlich der Videoerzeugung auf Basis mehrerer Bildreferenzen und multimodaler Videobearbeitung |
| Eingabetyp | Bildeingabe |
| Ausgabetyp | Strukturierte Erkennungsergebnisse |
| Erkennungsumfang | Motive, Gesichter, Kleidung und andere visuelle Elemente |
| Ergebnisumfang | Kann pro Anfrage bis zu 4 Ergebnissätze zurückgeben, sofern verfügbar |
| Anwendungsfälle | Analyse visueller Assets, Referenzaufbereitung für die Videoerzeugung, Inhaltsverständnis für Bearbeitungspipelines, Motiv- und Bekleidungserkennung |
Was ist kling-image-recognize?
kling-image-recognize ist eine Keling-API zur Erkennung von Bildelementen, die visuelle Inhalte analysiert und wichtige Elemente innerhalb eines Bildes identifiziert. Sie ist besonders nützlich in Workflows, die eine Videoerzeugung auf Basis mehrerer Bildreferenzen oder eine multimodale Videobearbeitung erfordern, bei denen das Verständnis der Inhalte der Quellbilder ein wichtiger Vorverarbeitungsschritt ist.
Das Modell kann eine Reihe visueller Merkmale erkennen, etwa Motive, Gesichter, Kleidung und verwandte Bildkomponenten. Abhängig von der Eingabe kann es in einer einzigen Anfrage bis zu 4 Ergebnissätze liefern und Entwicklern so helfen, mehrere mögliche Erkennungen oder Interpretationen zu erfassen, sofern verfügbar.
Hauptfunktionen von kling-image-recognize
- Erkennung von Bildelementen: Erkennt und identifiziert wichtige visuelle Elemente in einem Eingabebild.
- Motivanalyse: Erkennt Hauptmotive, die in nachgelagerten Medienerzeugungs- oder Bearbeitungs-Workflows verwendet werden können.
- Unterstützung der Gesichtserkennung: Extrahiert gesichtsbezogene Erkennungsergebnisse, wenn im Bild Gesichter vorhanden sind.
- Kleidungserkennung: Erkennt Bekleidung und damit zusammenhängende Elemente, um ein detaillierteres visuelles Verständnis zu unterstützen.
- Unterstützung von Workflows mit mehreren Bildreferenzen: Nützlich für die Vorbereitung und Analyse von Bildreferenzen in Videoerzeugungs-Pipelines.
- Kompatibilität mit multimodaler Videobearbeitung: Unterstützt Bearbeitungsszenarien, in denen der Bildinhalt vor der Transformation oder Komposition verstanden werden muss.
- Mehrere Ergebnissätze pro Anfrage: Kann bis zu 4 Ergebnissätze pro Anfrage erhalten, sofern verfügbar, und ermöglicht so umfangreichere Erkennungsausgaben.
- Integrationsfreundliche API-Nutzung: Geeignet für Entwickler, die automatisierte Medienanalyse- und kreative Anwendungspipelines aufbauen.
Zugriff auf und Integration von kling-image-recognize
Schritt 1: Für einen API-Schlüssel registrieren
Um zu beginnen, registrieren Sie sich auf der CometAPI-Plattform und generieren Sie Ihren API-Schlüssel im Dashboard. Bewahren Sie den Schlüssel sicher auf und verwenden Sie ihn zur Authentifizierung jeder Anfrage an die kling-image-recognize-API.
Schritt 2: Anfragen an die kling-image-recognize-API senden
Sobald Sie Ihren API-Schlüssel haben, senden Sie Anfragen an den CometAPI-Endpunkt und verwenden kling-image-recognize als Modell-ID. Fügen Sie Ihre Authentifizierungsheader hinzu und stellen Sie die erforderliche Bildeingabe entsprechend Ihrem Anwendungs-Workflow bereit.
curl --request POST \
--url https://api.cometapi.com/v1/responses \
--header "Authorization: Bearer YOUR_COMETAPI_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kling-image-recognize",
"input": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Recognize the main visual elements in this image."
},
{
"type": "input_image",
"image_url": "YOUR_IMAGE_URL"
}
]
}
]
}'
Schritt 3: Ergebnisse abrufen und verifizieren
Nach der Übermittlung gibt die API von kling-image-recognize erzeugte Erkennungsergebnisse zurück. Parsen Sie die Antwort in Ihrer Anwendung, verifizieren Sie die erkannten Motive oder Attribute und speichern Sie die zurückgegebenen Daten für die Videoerzeugung, Bearbeitung oder andere nachgelagerte Automatisierungsaufgaben.