Spécifications techniques de hunyuan-vision
| Spécification | Détails |
|---|---|
| ID du modèle | hunyuan-vision |
| Fournisseur | Tencent Hunyuan |
| Type de modèle | Modèle de conversation multimodale vision-langage pour la compréhension d’images et le questions-réponses visuels |
| Fonction principale | Accepte une entrée image + texte et renvoie des réponses en langue naturelle sur le contenu de l’image |
| Style d’API | API Chat Completions compatible OpenAI |
| URL de base | https://api.hunyuan.cloud.tencent.com/v1 |
| Point de terminaison | POST /chat/completions |
| Format d’entrée | Tableau messages avec des parties de contenu mixtes text et image_url ; les exemples prennent en charge une URL d’image ou une URL de données base64 |
| Authentification | Clé d’API Bearer (HUNYUAN_API_KEY) |
| Compatibilité SDK | Peut être appelé avec les SDK OpenAI en modifiant base_url et api_key |
| Note de facturation | Pour les entrées image, Tencent indique que le nombre de jetons d’image de hunyuan-vision varie selon la taille de l’image, d’environ 256–1280 jetons par image, l’utilisation réelle étant calculée côté modèle |
Qu’est-ce que hunyuan-vision ?
hunyuan-vision est le modèle multimodal de compréhension d’images de Tencent Hunyuan, exposé via une API compatible OpenAI. Dans les exemples officiels de Tencent, il est utilisé pour des tâches de type « image-vers-texte », où l’utilisateur envoie une invite accompagnée d’une image et le modèle répond à des questions telles que ce qui est montré sur l’image.
Concrètement, cela rend hunyuan-vision adapté aux applications qui nécessitent du raisonnement visuel dans un flux de conversation, telles que la génération de légendes d’images, la description de scènes, l’interprétation d’interfaces utilisateur ou de captures d’écran, l’analyse d’images produit et le questions-réponses visuel général. Son mode d’intégration est particulièrement pratique pour les équipes utilisant déjà des clients de type OpenAI, car Tencent indique que les développeurs peuvent basculer en ne remplaçant que le point de terminaison et la configuration de la clé API.
Principales fonctionnalités de hunyuan-vision
- Compréhension d’images multimodale :
hunyuan-visionaccepte à la fois du texte et des images dans la même requête, permettant des conversations tenant compte du visuel et des questions-réponses sur les images téléchargées. - Interface compatible OpenAI : Tencent propose
hunyuan-visionvia la même structure de requête générale que Chat Completions, ce qui réduit l’effort de migration pour les applications d’IA existantes. - Méthodes d’entrée d’images flexibles : Les exemples officiels montrent la prise en charge d’URL d’images distantes standard ainsi que d’URL de données encodées en base64, ce qui aide aussi bien avec des ressources publiques que des fichiers traités localement.
- Intégration favorable aux SDK : Tencent documente explicitement l’utilisation avec les SDK OpenAI en Python, Node.js, Go et des requêtes HTTP de type cURL, ce qui facilite l’intégration dans des services backend existants.
- Flux de travail basé sur le chat : Étant exposé comme un modèle de complétion de chat,
hunyuan-visions’intègre naturellement aux applications conversationnelles, assistants et chaînes d’outils qui structurent déjà les requêtes autour demessages. - Comptabilisation des jetons d’image basée sur l’usage : Tencent note que le coût dépend de la taille de l’image, avec une consommation de jetons par image documentée sous forme d’intervalle plutôt qu’un montant fixe.
Comment accéder à hunyuan-vision et l’intégrer
Étape 1 : S’inscrire pour obtenir une clé API
Pour accéder à hunyuan-vision, commencez par créer et sécuriser votre clé API via la console du fournisseur. Tencent documente un accès basé sur clé API pour son API Hunyuan compatible OpenAI, et la clé est transmise comme un jeton Bearer dans les requêtes. Conservez la clé dans une variable d’environnement telle que HUNYUAN_API_KEY, et évitez de l’exposer dans du code côté client ou des dépôts publics.
Étape 2 : Envoyer des requêtes à l’API hunyuan-vision
Utilisez le point de terminaison compatible OpenAI et indiquez hunyuan-vision comme nom de modèle.
curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $HUNYUAN_API_KEY" \
--data '{
"model": "hunyuan-vision",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}'
Vous pouvez également utiliser des SDK compatibles OpenAI en pointant le client vers l’URL de base Hunyuan :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("HUNYUAN_API_KEY"),
base_url="https://api.hunyuan.cloud.tencent.com/v1",
)
response = client.chat.completions.create(
model="hunyuan-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
},
},
],
}
],
)
print(response.choices[0].message.content)
Cette structure de requête suit les exemples officiels de Tencent compatibles OpenAI pour hunyuan-vision.
Étape 3 : Récupérer et vérifier les résultats
Lisez la réponse générée à partir du premier choix de complétion, généralement response.choices[0].message.content lors de l’utilisation d’un SDK compatible OpenAI. En production, vérifiez que l’URL de l’image est accessible ou que votre charge utile base64 est valide, puis comparez la description renvoyée aux exigences de votre application en matière de précision, de sécurité et de cohérence de formatage. Les exemples de Tencent montrent un traitement standard des réponses de chat-completions, de sorte que les pipelines de validation et de journalisation existants peuvent généralement être réutilisés avec un minimum de modifications.