Tekniske spesifikasjoner for hunyuan-vision
| Spesifikasjon | Detaljer |
|---|---|
| Modell-ID | hunyuan-vision |
| Tilbyder | Tencent Hunyuan |
| Modelltype | Visjons‑språk / multimodal samtalemodell for bildeforståelse og visuelle spørsmål‑svar |
| Primær kapasitet | Aksepterer bilde‑pluss‑tekst‑inndata og returnerer svar i naturlig språk om bildeinnhold |
| API‑stil | OpenAI‑kompatibel Chat Completions API |
| Base URL | https://api.hunyuan.cloud.tencent.com/v1 |
| Endepunkt | POST /chat/completions |
| Inndataformat | messages‑array med blandede text‑ og image_url‑innholds deler; bilde‑URL eller base64‑data‑URL støttes i eksemplene |
| Autentisering | Bearer API‑nøkkel (HUNYUAN_API_KEY) |
| SDK‑kompatibilitet | Kan kalles med OpenAI‑SDK‑er ved å endre base_url og api_key |
| Faktureringsmerknad | For bildeinndata dokumenterer Tencent at hunyuan-vision‑bildetokens varierer etter bildestørrelse, omtrent 256–1280 tokens per bilde, med faktisk forbruk basert på modellens interne beregning |
Hva er hunyuan-vision?
hunyuan-vision er Tencent Hunyuan sin multimodale bildeforståelsesmodell eksponert gjennom et OpenAI‑kompatibelt API. I Tencents offisielle eksempler brukes den til “image‑to‑text”‑oppgaver der en bruker sender en prompt sammen med et bilde, og modellen svarer på spørsmål som hva som vises i bildet.
Praktisk gjør dette hunyuan-vision egnet for applikasjoner som trenger visuell resonnering i en chat‑arbeidsflyt, som bildebeskrivelse, sceneskildring, tolkning av UI eller skjermbilder, analyse av produktbilder og generell visuell spørsmål‑svar. Integrasjonsmønsteret er spesielt praktisk for team som allerede bruker OpenAI‑stil klienter, fordi Tencent opplyser at utviklere kan bytte ved kun å erstatte endepunkt og API‑nøkkelkonfigurasjon.
Hovedfunksjoner ved hunyuan-vision
- Multimodal bildeforståelse:
hunyuan-visionaksepterer både tekst og bilder i samme forespørsel, som muliggjør bildebevisste samtaler og spørsmål‑svar om opplastede visuelle innhold. - OpenAI‑kompatibelt grensesnitt: Tencent leverer
hunyuan-visiongjennom samme generelle forespørselsstruktur som Chat Completions, noe som reduserer migrasjonsarbeidet for eksisterende KI‑applikasjoner. - Fleksible bildeinndata‑metoder: Offisielle eksempler viser støtte for standard eksterne bilde‑URL‑er samt base64‑kodede data‑URL‑er, noe som hjelper både med offentlige ressurser og lokalt prosesserte filer.
- SDK‑vennlig integrasjon: Tencent dokumenterer eksplisitt bruk med OpenAI‑SDK‑er i Python, Node.js, Go og cURL‑stil HTTP‑forespørsler, noe som gjør det enkelt å bygge inn i eksisterende backend‑tjenester.
- Chat‑basert arbeidsflyt: Fordi den eksponeres som en chat completion‑modell, passer
hunyuan-visionnaturlig inn i samtaleapper, assistenter og verktøykjeder som allerede strukturerer forespørsler rundtmessages. - Forbruksbasert token‑regnskap for bilder: Tencent påpeker at bildekostnaden avhenger av bildestørrelse, med tokenforbruk per bilde dokumentert som et intervall snarere enn et fast beløp.
Hvordan få tilgang til og integrere hunyuan-vision
Trinn 1: Registrer deg for API‑nøkkel
For å få tilgang til hunyuan-vision, opprett og sikr API‑nøkkelen din gjennom tilbyderens konsoll. Tencent dokumenterer tilgang via API‑nøkkel for sitt OpenAI‑kompatible Hunyuan‑API, og nøkkelen sendes som en Bearer‑token i forespørsler. Oppbevar nøkkelen i en miljøvariabel som HUNYUAN_API_KEY, og unngå å eksponere den i klientkode eller offentlige repoer.
Trinn 2: Send forespørsler til hunyuan-vision‑API‑et
Bruk det OpenAI‑kompatible endepunktet og angi hunyuan-vision som modellnavn.
curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $HUNYUAN_API_KEY" \
--data '{
"model": "hunyuan-vision",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}'
Du kan også bruke OpenAI‑kompatible SDK‑er ved å peke klienten til Hunyuan‑base‑URL‑en:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("HUNYUAN_API_KEY"),
base_url="https://api.hunyuan.cloud.tencent.com/v1",
)
response = client.chat.completions.create(
model="hunyuan-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
},
},
],
}
],
)
print(response.choices[0].message.content)
Denne forespørselsstrukturen følger Tencents offisielle OpenAI‑kompatible eksempler for hunyuan-vision.
Trinn 3: Hent og verifiser resultater
Les det genererte svaret fra det første fullføringsvalget, typisk response.choices[0].message.content når du bruker en OpenAI‑kompatibel SDK. For produksjonsbruk, verifiser at bilde‑URL‑en er tilgjengelig eller at base64‑lasten er gyldig, og kontroller deretter den returnerte beskrivelsen opp mot kravene i applikasjonen din for nøyaktighet, sikkerhet og formateringskonsistens. Tencents eksempler viser standard håndtering av chat‑completions‑responser, så eksisterende validerings‑ og loggrutiner kan som regel gjenbrukes med minimale endringer.