kling-image-recognize の技術仕様
| 仕様 | 詳細 |
|---|---|
| モデル ID | kling-image-recognize |
| カテゴリ | 画像認識 / マルチモーダル解析 |
| 主な機能 | マルチ画像リファレンスを用いた動画生成やマルチモーダル動画編集を含む下流のクリエイティブワークフロー向けに、画像要素を認識 |
| 入力タイプ | 画像入力 |
| 出力タイプ | 構造化された認識結果 |
| 認識範囲 | 被写体、顔、衣服などの視覚要素 |
| 結果件数 | 利用可能な場合、1 回のリクエストで最大 4 セットの結果を返す |
| ユースケース | ビジュアルアセット分析、動画生成のリファレンス準備、編集パイプラインにおけるコンテンツ理解、被写体および衣服の認識 |
kling-image-recognize とは?
kling-image-recognize は、視覚コンテンツを解析し、画像内の重要な要素を特定するために設計された Keling の画像要素認識 API です。複数画像リファレンスを要する動画生成やマルチモーダル動画編集など、ソース画像の内容理解が重要な前処理となるワークフローで特に有用です。
このモデルは、被写体、顔、衣服などの視覚属性および関連する画像コンポーネントを認識できます。入力に応じて、1 回のリクエストで最大 4 セットの認識結果を返すことができ、利用可能な場合に複数の検出や解釈の可能性を開発者が取得するのに役立ちます。
kling-image-recognize の主な機能
- 画像要素の認識: 入力画像に含まれる重要な視覚要素を検出・特定します。
- 被写体解析: 下流のメディア生成や編集ワークフローで利用可能な主要被写体を認識します。
- 顔認識サポート: 画像内に顔が存在する場合、顔に関連する認識結果を抽出します。
- 衣服の識別: アパレルや衣服関連の要素を検出し、より詳細な視覚理解を支援します。
- マルチ画像リファレンスのワークフロー支援: 動画生成パイプラインで使用される画像リファレンスの準備・分析に有用です。
- マルチモーダル動画編集への適合: 変換や合成の前に画像内容の理解が必要な編集シナリオを支援します。
- リクエストごとの複数結果セット: 利用可能な場合、1 回のリクエストで最大 4 セットの結果を取得でき、より豊富な認識出力を実現します。
- 統合しやすい API 利用: 自動化されたメディア解析やクリエイティブアプリケーションのパイプラインを構築する開発者に適しています。
kling-image-recognize へのアクセスと統合方法
ステップ 1: API キーに登録
まず、CometAPI プラットフォームにサインアップし、ダッシュボードから API キーを生成します。キーを取得したら安全に保管し、kling-image-recognize API へのすべてのリクエストの認証に使用してください。
ステップ 2: kling-image-recognize API にリクエストを送信する
API キーを取得したら、モデル ID として kling-image-recognize を指定し、CometAPI のエンドポイントにリクエストを送信します。認証ヘッダーを含め、アプリケーションのワークフローに基づいて必要な画像入力のペイロードを提供してください。
curl --request POST \
--url https://api.cometapi.com/v1/responses \
--header "Authorization: Bearer YOUR_COMETAPI_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kling-image-recognize",
"input": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Recognize the main visual elements in this image."
},
{
"type": "input_image",
"image_url": "YOUR_IMAGE_URL"
}
]
}
]
}'
ステップ 3: 結果の取得と検証
送信後、API は kling-image-recognize によって生成された認識結果を返します。アプリケーションでレスポンスを解析し、検出された被写体や属性を確認したうえで、動画生成、編集、その他の下流の自動化タスクに使用するために返却データを保存してください。