Tekniske specifikationer for hunyuan-vision
| Specifikation | Detaljer |
|---|---|
| Model-ID | hunyuan-vision |
| Udbyder | Tencent Hunyuan |
| Modeltype | Vision-sprog / multimodal chatmodel til billedforståelse og visuel spørgsmålsbesvarelse |
| Primær funktion | Accepterer input med billede plus tekst og returnerer svar i naturligt sprog om billedindhold |
| API-stil | OpenAI-kompatibel Chat Completions API |
| Base-URL | https://api.hunyuan.cloud.tencent.com/v1 |
| Endpoint | POST /chat/completions |
| Inputformat | messages-array med blandede text- og image_url-indholdsdele; billed-URL eller base64 data-URL understøttes i eksemplerne |
| Autentificering | Bearer-API-nøgle (HUNYUAN_API_KEY) |
| SDK-kompatibilitet | Kan kaldes med OpenAI-SDK'er ved at ændre base_url og api_key |
| Bemærkning om fakturering | For billedinput dokumenterer Tencent, at hunyuan-vision-billedtokens varierer efter billedstørrelse, cirka 256–1280 tokens pr. billede, hvor det faktiske forbrug er baseret på beregning på modellsiden |
Hvad er hunyuan-vision?
hunyuan-vision er Tencent Hunyuan’s multimodale model til billedforståelse, eksponeret via en OpenAI-kompatibel API. I Tencents officielle eksempler bruges den til opgaver i “billede-til-tekst”-stil, hvor en bruger sender en prompt sammen med et billede, og modellen besvarer spørgsmål som f.eks. hvad der vises på billedet.
I praksis gør dette hunyuan-vision velegnet til applikationer, der har brug for visuel ræsonnering i et chat-workflow, såsom billedtekstgenerering, scenebeskrivelser, UI- eller skærmbilledefortolkning, produktbilledanalyse og generel visuel spørgsmålsbesvarelse. Dens integrationsmønster er særligt bekvemt for teams, der allerede bruger OpenAI-lignende klienter, fordi Tencent angiver, at udviklere kan skifte ved kun at udskifte endpoint og API-nøglekonfiguration.
Hovedfunktioner i hunyuan-vision
- Multimodal billedforståelse:
hunyuan-visionaccepterer både tekst- og billedindhold i samme anmodning, hvilket muliggør billedbevidste samtaler og spørgsmål/svar om uploadede visuelle input. - OpenAI-kompatibel grænseflade: Tencent leverer
hunyuan-visiongennem den samme generelle anmodningsstruktur som Chat Completions, hvilket reducerer migreringsindsatsen for eksisterende AI-applikationer. - Fleksible metoder til billedinput: Officielle eksempler viser støtte for standard eksterne billed-URL'er såvel som base64-kodede data-URL'er, hvilket hjælper ved arbejde med både offentlige aktiver og lokalt forarbejdede filer.
- SDK-venlig integration: Tencent dokumenterer eksplicit brug med OpenAI-SDK'er i Python, Node.js, Go og cURL-lignende HTTP-anmodninger, hvilket gør det let at indlejre i eksisterende backend-tjenester.
- Chat-baseret arbejdsgang: Fordi den eksponeres som en chat completion-model, passer
hunyuan-visionnaturligt ind i konversationelle apps, assistenter og toolchains, der allerede strukturerer anmodninger omkringmessages. - Forbrugsbaseret afregning af billedtokens: Tencent bemærker, at omkostningen for billeder afhænger af billedstørrelse, med et angivet interval for forbrug pr. billede i stedet for et fast beløb.
Sådan får du adgang til og integrerer hunyuan-vision
Trin 1: Opret og sikr en API-nøgle
For at få adgang til hunyuan-vision skal du først oprette og sikre din API-nøgle via udbyderens konsol. Tencent dokumenterer adgang baseret på API-nøgle for deres OpenAI-kompatible Hunyuan-API, og nøglen sendes som en Bearer-token i anmodninger. Opbevar nøglen i en miljøvariabel som HUNYUAN_API_KEY, og undgå at eksponere den i klientkode eller offentlige repositories.
Trin 2: Send forespørgsler til hunyuan-vision-API'en
Brug det OpenAI-kompatible endpoint og angiv hunyuan-vision som modelnavn.
curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $HUNYUAN_API_KEY" \
--data '{
"model": "hunyuan-vision",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}'
Du kan også bruge OpenAI-kompatible SDK'er ved at pege klienten mod Hunyuan-base-URL'en:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("HUNYUAN_API_KEY"),
base_url="https://api.hunyuan.cloud.tencent.com/v1",
)
response = client.chat.completions.create(
model="hunyuan-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
},
},
],
}
],
)
print(response.choices[0].message.content)
Denne forespørgselsstruktur følger Tencents officielle OpenAI-kompatible eksempler for hunyuan-vision.
Trin 3: Hent og verificer resultater
Læs det genererede svar fra det første completion-valg, typisk response.choices[0].message.content, når du bruger et OpenAI-kompatibelt SDK. Til produktion bør du verificere, at billed-URL'en er tilgængelig, eller at din base64-payload er gyldig, og derefter tjekke den returnerede beskrivelse op imod dine applikationskrav for nøjagtighed, sikkerhed og konsistent formatering. Tencents eksempler viser standardhåndtering af chat-completions-svar, så eksisterende validerings- og logningspipelines kan normalt genbruges med minimale ændringer.