Especificações técnicas do kling-image-recognize
| Especificação | Detalhes |
|---|---|
| ID do modelo | kling-image-recognize |
| Categoria | Reconhecimento de imagem / análise multimodal |
| Capacidade principal | Reconhece elementos de imagem para fluxos de trabalho criativos subsequentes, incluindo geração de vídeo com referência de múltiplas imagens e edição de vídeo multimodal |
| Tipo de entrada | Entrada de imagem |
| Tipo de saída | Resultados de reconhecimento estruturados |
| Escopo de reconhecimento | Sujeitos, rostos, vestuário e outros elementos visuais |
| Volume de resultados | Pode retornar até 4 conjuntos de resultados por solicitação, quando disponíveis |
| Casos de uso | Análise de ativos visuais, preparação de referências para geração de vídeo, compreensão de conteúdo para pipelines de edição, reconhecimento de sujeitos e vestuário |
O que é o kling-image-recognize?
kling-image-recognize é uma API de reconhecimento de elementos de imagem da Keling, projetada para analisar conteúdos visuais e identificar elementos importantes em uma imagem. É especialmente útil em fluxos de trabalho que exigem geração de vídeo com referência de múltiplas imagens ou edição de vídeo multimodal, em que compreender o conteúdo das imagens de origem é uma etapa importante de pré-processamento.
O modelo pode reconhecer uma variedade de atributos visuais, como sujeitos, rostos, vestuário e componentes de imagem relacionados. Dependendo da entrada, ele pode fornecer até 4 conjuntos de resultados de reconhecimento em uma única solicitação, ajudando os desenvolvedores a capturar múltiplas detecções ou interpretações possíveis quando disponíveis.
Principais recursos do kling-image-recognize
- Reconhecimento de elementos de imagem: Detecta e identifica elementos visuais importantes contidos em uma imagem de entrada.
- Análise de sujeitos: Reconhece os sujeitos principais que podem ser usados em fluxos de geração ou edição de mídia subsequentes.
- Suporte a reconhecimento facial: Extrai resultados de reconhecimento relacionados a rostos quando eles estão presentes na imagem.
- Identificação de vestuário: Detecta itens de vestuário e elementos relacionados para dar suporte a uma compreensão visual mais detalhada.
- Suporte a fluxos com referência de múltiplas imagens: Útil para preparar e analisar referências de imagem usadas em pipelines de geração de vídeo.
- Compatibilidade com edição de vídeo multimodal: Ajuda a viabilizar cenários de edição em que o conteúdo da imagem precisa ser compreendido antes da transformação ou composição.
- Múltiplos conjuntos de resultados por solicitação: Pode obter até 4 conjuntos de resultados por solicitação, quando disponíveis, possibilitando saídas de reconhecimento mais ricas.
- Uso de API amigável à integração: Adequado para desenvolvedores que constroem pipelines automatizados de análise de mídia e aplicações criativas.
Como acessar e integrar o kling-image-recognize
Etapa 1: Cadastre-se para obter a chave de API
Para começar, cadastre-se na plataforma CometAPI e gere sua chave de API no painel. Após obter sua chave, armazene-a com segurança e use-a para autenticar todas as solicitações à API kling-image-recognize.
Etapa 2: Envie solicitações para a API kling-image-recognize
Quando tiver sua chave de API, envie solicitações ao endpoint da CometAPI usando kling-image-recognize como o ID do modelo. Inclua seus cabeçalhos de autenticação e forneça a carga de entrada de imagem necessária conforme o fluxo de trabalho da sua aplicação.
curl --request POST \
--url https://api.cometapi.com/v1/responses \
--header "Authorization: Bearer YOUR_COMETAPI_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kling-image-recognize",
"input": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Recognize the main visual elements in this image."
},
{
"type": "input_image",
"image_url": "YOUR_IMAGE_URL"
}
]
}
]
}'
Etapa 3: Recupere e verifique os resultados
Após o envio, a API retorna os resultados de reconhecimento gerados por kling-image-recognize. Analise a resposta na sua aplicação, verifique os sujeitos ou atributos detectados e armazene os dados retornados para uso em geração de vídeo, edição ou outras tarefas de automação subsequentes.