Specyfikacje techniczne kling-image-recognize
| Specyfikacja | Szczegóły |
|---|---|
| Identyfikator modelu | kling-image-recognize |
| Kategoria | Rozpoznawanie obrazów / analiza multimodalna |
| Główna funkcja | Rozpoznaje elementy obrazu na potrzeby dalszych kreatywnych przepływów pracy, w tym generowania wideo z wieloma obrazami referencyjnymi i multimodalnej edycji wideo |
| Typ wejścia | Obraz |
| Typ wyjścia | Strukturyzowane wyniki rozpoznawania |
| Zakres rozpoznawania | Obiekty, twarze, odzież oraz inne elementy wizualne |
| Liczba wyników | Może zwrócić do 4 zestawów wyników na żądanie, jeśli dostępne |
| Zastosowania | Analiza zasobów wizualnych, przygotowanie referencji do generowania wideo, zrozumienie treści dla potoków edycyjnych, rozpoznawanie obiektów i odzieży |
Czym jest kling-image-recognize?
kling-image-recognize to interfejs API Keling do rozpoznawania elementów obrazu, zaprojektowany do analizy treści wizualnych i identyfikacji ważnych elementów w obrębie obrazu. Jest szczególnie przydatny w przepływach pracy wymagających generowania wideo z wieloma obrazami referencyjnymi lub multimodalnej edycji wideo, gdzie zrozumienie zawartości obrazów źródłowych stanowi ważny etap wstępnego przetwarzania.
Model potrafi rozpoznawać różne atrybuty wizualne, takie jak obiekty, twarze, odzież i powiązane komponenty obrazu. W zależności od danych wejściowych może zwrócić do 4 zestawów wyników rozpoznawania w jednym żądaniu, co pomaga deweloperom uchwycić wiele możliwych detekcji lub interpretacji, gdy są dostępne.
Główne funkcje kling-image-recognize
- Rozpoznawanie elementów obrazu: Wykrywa i identyfikuje ważne elementy wizualne zawarte w obrazie wejściowym.
- Analiza obiektów: Rozpoznaje główne obiekty, które można wykorzystać w dalszym generowaniu mediów lub przepływach edycyjnych.
- Obsługa rozpoznawania twarzy: Wyodrębnia wyniki związane z twarzami, gdy są obecne na obrazie.
- Identyfikacja odzieży: Wykrywa elementy odzieży i powiązane atrybuty, wspierając bardziej szczegółowe zrozumienie wizualne.
- Obsługa przepływów z wieloma obrazami referencyjnymi: Przydatny do przygotowania i analizy referencji obrazów używanych w potokach generowania wideo.
- Zgodność z multimodalną edycją wideo: Wspiera scenariusze edycyjne, w których przed transformacją lub kompozycją konieczne jest zrozumienie treści obrazu.
- Wiele zestawów wyników na żądanie: Może uzyskać do 4 zestawów wyników na żądanie, jeśli są dostępne, zapewniając bogatsze wyjście.
- Przyjazne integracji korzystanie z API: Odpowiedni dla deweloperów budujących zautomatyzowane analizy mediów i kreatywne potoki aplikacyjne.
Jak uzyskać dostęp i zintegrować kling-image-recognize
Krok 1: Zarejestruj się, aby uzyskać klucz API
Aby rozpocząć, zarejestruj się na platformie CometAPI i wygeneruj swój klucz API z poziomu panelu. Po uzyskaniu klucza przechowuj go bezpiecznie i używaj do uwierzytelniania każdego żądania kierowanego do interfejsu API kling-image-recognize.
Krok 2: Wysyłaj żądania do interfejsu API kling-image-recognize
Gdy masz już klucz API, wysyłaj żądania do punktu końcowego CometAPI, używając kling-image-recognize jako identyfikatora modelu. Dołącz nagłówki uwierzytelniające i przekaż wymagane dane wejściowe obrazu w treści żądania zgodnie z przepływem pracy aplikacji.
curl --request POST \
--url https://api.cometapi.com/v1/responses \
--header "Authorization: Bearer YOUR_COMETAPI_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kling-image-recognize",
"input": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Recognize the main visual elements in this image."
},
{
"type": "input_image",
"image_url": "YOUR_IMAGE_URL"
}
]
}
]
}'
Krok 3: Odbierz i zweryfikuj wyniki
Po wysłaniu żądania interfejs API zwróci wyniki rozpoznawania wygenerowane przez kling-image-recognize. Przetwórz odpowiedź w swojej aplikacji, zweryfikuj wykryte obiekty lub atrybuty i zapisz zwrócone dane do wykorzystania w generowaniu wideo, edycji lub innych dalszych zadaniach automatyzacji.