Technische Spezifikationen von hunyuan-vision
| Spezifikation | Details |
|---|---|
| Model ID | hunyuan-vision |
| Provider | Tencent Hunyuan |
| Model type | Vision‑Language-/multimodales Chatmodell für Bildverständnis und visuelle Fragebeantwortung |
| Primary capability | Akzeptiert Bild‑plus‑Text‑Eingaben und gibt natürlichsprachliche Antworten zum Bildinhalt zurück |
| API style | OpenAI‑kompatible Chat‑Completions‑API |
| Base URL | https://api.hunyuan.cloud.tencent.com/v1 |
| Endpoint | POST /chat/completions |
| Input format | messages‑Array mit gemischten text‑ und image_url‑Inhaltsbausteinen; in den Beispielen werden Bild‑URLs oder Base64‑Data‑URLs unterstützt |
| Authentication | Bearer‑API‑Schlüssel (HUNYUAN_API_KEY) |
| SDK compatibility | Kann mit OpenAI‑SDKs aufgerufen werden, indem base_url und api_key geändert werden |
| Billing note | Für Bildeingaben dokumentiert Tencent, dass die Bild‑Tokens von hunyuan-vision je nach Bildgröße variieren, etwa 256–1280 Tokens pro Bild; die tatsächliche Nutzung basiert auf einer modellseitigen Berechnung |
Was ist hunyuan-vision?
hunyuan-vision ist das multimodale Bildverständnis‑Modell von Tencent Hunyuan, das über eine OpenAI‑kompatible API bereitgestellt wird. In den offiziellen Beispielen von Tencent wird es für Aufgaben im Stil „Image‑to‑Text“ verwendet, bei denen ein Benutzer eine Eingabeaufforderung zusammen mit einem Bild sendet und das Modell Fragen beantwortet, etwa was auf dem Bild zu sehen ist.
Praktisch macht dies hunyuan-vision geeignet für Anwendungen, die visuelles Schlussfolgern in einem Chat‑Workflow benötigen, wie etwa Bildunterschriften, Szenenbeschreibungen, Interpretation von UIs oder Screenshots, Produktbild‑Analysen und allgemeine visuelle Fragebeantwortung. Die Integrationsweise ist besonders bequem für Teams, die bereits OpenAI‑ähnliche Clients einsetzen, da Tencent angibt, dass Entwickler durch Austauschen von Endpunkt und API‑Schlüssel konfigurativ wechseln können.
Hauptfunktionen von hunyuan-vision
- Multimodales Bildverständnis:
hunyuan-visionakzeptiert sowohl Text‑ als auch Bildinhalte in derselben Anfrage und ermöglicht bildbezogene Gespräche sowie Fragebeantwortung zu hochgeladenen Visuals. - OpenAI‑kompatible Schnittstelle: Tencent stellt
hunyuan-visionüber dieselbe allgemeine Request‑Struktur wie Chat Completions bereit, was den Migrationsaufwand für bestehende KI‑Anwendungen reduziert. - Flexible Methoden für Bildeingaben: Offizielle Beispiele zeigen Unterstützung sowohl für Standard‑Bild‑URLs als auch für Base64‑kodierte Data‑URLs – hilfreich für öffentliche Assets ebenso wie lokal verarbeitete Dateien.
- SDK‑freundliche Integration: Tencent dokumentiert explizit die Nutzung mit OpenAI‑SDKs in Python, Node.js, Go und cURL‑basierten HTTP‑Anfragen, wodurch sich das Modell leicht in bestehende Backend‑Dienste einbetten lässt.
- Chat‑basierter Workflow: Da es als Chat‑Completion‑Modell angeboten wird, passt es sich natürlich in konversationelle Apps, Assistenten und Toolchains ein, die Anfragen bereits um
messagesherum strukturieren. - Nutzungsbasierte Abrechnung der Bild‑Tokens: Tencent weist darauf hin, dass die Kosten für Bilder von der Bildgröße abhängen; der Verbrauch pro Bild wird als Bereich dokumentiert statt als fester Wert.
Zugriff auf und Integration von hunyuan-vision
Schritt 1: API‑Schlüssel beantragen
Um auf hunyuan-vision zuzugreifen, erstellen und sichern Sie zunächst Ihren API‑Schlüssel über die Konsole des Anbieters. Tencent dokumentiert den Zugriff auf die OpenAI‑kompatible Hunyuan‑API per API‑Schlüssel, der als Bearer‑Token in Anfragen übermittelt wird. Bewahren Sie den Schlüssel in einer Umgebungsvariablen wie HUNYUAN_API_KEY auf und vermeiden Sie eine Offenlegung in Client‑seitigem Code oder öffentlichen Repositories.
Schritt 2: Anfragen an die hunyuan-vision‑API senden
Verwenden Sie den OpenAI‑kompatiblen Endpunkt und geben Sie hunyuan-vision als Modellnamen an.
curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $HUNYUAN_API_KEY" \
--data '{
"model": "hunyuan-vision",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}'
Sie können auch OpenAI‑kompatible SDKs verwenden, indem Sie den Client auf die Hunyuan‑Basis‑URL zeigen lassen:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("HUNYUAN_API_KEY"),
base_url="https://api.hunyuan.cloud.tencent.com/v1",
)
response = client.chat.completions.create(
model="hunyuan-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
},
},
],
}
],
)
print(response.choices[0].message.content)
Diese Request‑Struktur folgt den offiziellen, OpenAI‑kompatiblen Beispielen von Tencent für hunyuan-vision.
Schritt 3: Ergebnisse abrufen und verifizieren
Lesen Sie die generierte Antwort aus der ersten Completion‑Choice aus, typischerweise response.choices[0].message.content, wenn Sie ein OpenAI‑kompatibles SDK verwenden. Überprüfen Sie in der Produktionsumgebung, ob die Bild‑URL erreichbar ist oder ob Ihre Base64‑Nutzlast gültig ist, und gleichen Sie die zurückgegebene Beschreibung mit den Anforderungen Ihrer Anwendung hinsichtlich Genauigkeit, Sicherheit und Formatierungskonsistenz ab. Die Beispiele von Tencent zeigen eine standardmäßige Handhabung von Chat‑Completions‑Antworten, sodass bestehende Validierungs‑ und Logging‑Pipelines in der Regel mit minimalen Änderungen wiederverwendet werden können.