kling-image-recognize의 기술 사양
| 사양 | 상세 |
|---|---|
| 모델 ID | kling-image-recognize |
| 카테고리 | 이미지 인식 / 멀티모달 분석 |
| 주요 기능 | 다중 이미지 레퍼런스 비디오 생성 및 멀티모달 비디오 편집을 포함한 후속 크리에이티브 워크플로우를 위해 이미지 요소 인식 |
| 입력 유형 | 이미지 입력 |
| 출력 유형 | 구조화된 인식 결과 |
| 인식 범위 | 피사체, 얼굴, 의상 및 기타 시각 요소 |
| 결과 세트 수 | 요청당 최대 4개의 결과 세트를 반환할 수 있습니다(가능한 경우) |
| 사용 사례 | 시각 자산 분석, 비디오 생성용 레퍼런스 준비, 편집 파이프라인을 위한 콘텐츠 이해, 피사체 및 의상 인식 |
kling-image-recognize란?
kling-image-recognize는 시각 콘텐츠를 분석하고 이미지 내 주요 요소를 식별하도록 설계된 Keling 이미지 요소 인식 API입니다. 소스 이미지의 콘텐츠 이해가 중요한 전처리 단계가 되는 다중 이미지 레퍼런스 비디오 생성 또는 멀티모달 비디오 편집이 필요한 워크플로우에서 특히 유용합니다.
이 모델은 피사체, 얼굴, 의상 등 다양한 시각적 속성과 관련 이미지 구성 요소를 인식할 수 있습니다. 입력에 따라 단일 요청에서 최대 4개의 인식 결과 세트를 제공할 수 있어, 가능한 경우 여러 탐지나 해석을 포착하는 데 도움이 됩니다.
kling-image-recognize의 주요 기능
- 이미지 요소 인식: 입력 이미지에 포함된 중요한 시각 요소를 감지하고 식별합니다.
- 피사체 분석: 후속 미디어 생성 또는 편집 워크플로우에 사용할 수 있는 주요 피사체를 인식합니다.
- 얼굴 인식 지원: 이미지에 얼굴이 있을 때 얼굴 관련 인식 결과를 추출합니다.
- 의상 식별: 보다 세부적인 시각적 이해를 지원하기 위해 의류 및 의상 관련 요소를 감지합니다.
- 다중 이미지 레퍼런스 워크플로우 지원: 비디오 생성 파이프라인에서使用되는 이미지 레퍼런스의 준비 및 분석에 유용합니다.
- 멀티모달 비디오 편집 호환성: 변환 또는 합성 전에 이미지 콘텐츠를 이해해야 하는 편집 시나리오를 지원합니다.
- 요청당 다중 결과 세트: 가능한 경우 요청당 최대 4개의 결과 세트를 얻어 더 풍부한 인식 출력을 제공합니다.
- 통합 친화적 API 사용성: 자동화된 미디어 분석 및 크리에이티브 애플리케이션 파이프라인을 구축하는 개발자에게 적합합니다.
kling-image-recognize에 접근하고 통합하는 방법
1단계: API 키 발급을 위한 가입
시작하려면 CometAPI 플랫폼에 가입한 뒤 대시보드에서 API 키를 생성하세요. 키를 발급받은 후에는 안전하게 보관하고, kling-image-recognize API에 대한 모든 요청 인증에 사용하십시오.
2단계: kling-image-recognize API로 요청 보내기
API 키를 받았다면, 모델 ID로 kling-image-recognize를 사용하여 CometAPI 엔드포인트에 요청을 보내세요. 인증 헤더를 포함하고, 애플리케이션 워크플로우에 따라 필요한 이미지 입력 페이로드를 제공하십시오.
curl --request POST \
--url https://api.cometapi.com/v1/responses \
--header "Authorization: Bearer YOUR_COMETAPI_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kling-image-recognize",
"input": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Recognize the main visual elements in this image."
},
{
"type": "input_image",
"image_url": "YOUR_IMAGE_URL"
}
]
}
]
}'
3단계: 결과 조회 및 검증
요청이 완료되면 API는 kling-image-recognize가 생성한 인식 결과를 반환합니다. 애플리케이션에서 응답을 파싱하고 탐지된 피사체나 속성을 검증한 뒤, 비디오 생성, 편집 또는 기타 후속 자동화 작업에 활용할 수 있도록 데이터를 저장하십시오.