Specyfikacje techniczne hunyuan-vision
| Specyfikacja | Szczegóły |
|---|---|
| ID modelu | hunyuan-vision |
| Dostawca | Tencent Hunyuan |
| Typ modelu | Model vision-language / multimodalny model czatowy do rozumienia obrazów i wizualnego odpowiadania na pytania |
| Podstawowa funkcjonalność | Przyjmuje wejście łączące obraz i tekst i zwraca odpowiedzi w języku naturalnym dotyczące treści obrazu |
| Styl API | Interfejs Chat Completions kompatybilny z OpenAI |
| Base URL | https://api.hunyuan.cloud.tencent.com/v1 |
| Endpoint | POST /chat/completions |
| Format wejścia | tablica messages z mieszanymi częściami treści text i image_url; w przykładach obsługiwane są adresy URL obrazów lub dane URL w formacie base64 |
| Uwierzytelnianie | Klucz API w schemacie Bearer (HUNYUAN_API_KEY) |
| Zgodność z SDK | Można wywoływać za pomocą SDK OpenAI, zmieniając base_url i api_key |
| Uwaga dotycząca rozliczeń | Dla wejścia obrazu Tencent dokumentuje, że liczba tokenów obrazu w hunyuan-vision zależy od rozmiaru obrazu, w przybliżeniu 256–1280 tokenów na obraz; faktyczne zużycie jest obliczane po stronie modelu |
Czym jest hunyuan-vision?
hunyuan-vision to multimodalny model rozumienia obrazów od Tencent Hunyuan, udostępniany poprzez interfejs kompatybilny z OpenAI. W oficjalnych przykładach Tencent służy do zadań typu „image-to-text”, gdzie użytkownik wysyła prompt wraz z obrazem, a model odpowiada na pytania o to, co znajduje się na obrazie.
Praktycznie czyni to hunyuan-vision odpowiednim do aplikacji wymagających rozumowania wizualnego w przepływie czatowym, takich jak tworzenie podpisów do obrazów, opisy scen, interpretacja interfejsów lub zrzutów ekranu, analiza obrazów produktów oraz ogólne wizualne odpowiadanie na pytania. Wzorzec integracji jest szczególnie wygodny dla zespołów już używających klientów w stylu OpenAI, ponieważ Tencent podaje, że deweloperzy mogą się przełączyć, zastępując jedynie punkt końcowy i konfigurację klucza API.
Główne funkcje hunyuan-vision
- Multimodalne rozumienie obrazów:
hunyuan-visionprzyjmuje w jednym żądaniu zarówno treść tekstową, jak i obraz, umożliwiając rozmowy i odpowiadanie na pytania z uwzględnieniem przesłanych materiałów wizualnych. - Interfejs kompatybilny z OpenAI: Tencent udostępnia
hunyuan-visionw tej samej ogólnej strukturze żądań co Chat Completions, co zmniejsza wysiłek migracyjny w istniejących aplikacjach AI. - Elastyczne metody wprowadzania obrazów: Oficjalne przykłady pokazują obsługę standardowych zdalnych adresów URL obrazów oraz danych URL zakodowanych w base64, co pomaga zarówno przy zasobach publicznych, jak i lokalnie przetwarzanych plikach.
- Przyjazna integracja z SDK: Tencent wprost dokumentuje użycie z SDK OpenAI w Pythonie, Node.js, Go i żądaniach HTTP w stylu cURL, co ułatwia osadzenie w istniejących usługach backendowych.
- Przepływ pracy oparty na czacie: Ponieważ jest udostępniany jako model chat completion,
hunyuan-visionnaturalnie pasuje do aplikacji konwersacyjnych, asystentów i narzędzi opierających żądania namessages. - Rozliczanie tokenów obrazów w zależności od użycia: Tencent wskazuje, że koszt dla obrazów zależy od rozmiaru obrazu, a zużycie tokenów jest podawane jako zakres, a nie stała wartość.
Jak uzyskać dostęp i zintegrować hunyuan-vision
Krok 1: Uzyskaj klucz API
Aby uzyskać dostęp do hunyuan-vision, najpierw utwórz i zabezpiecz klucz API poprzez konsolę dostawcy. Tencent dokumentuje dostęp oparty na kluczu API dla zgodnego z OpenAI interfejsu Hunyuan, a klucz jest przekazywany jako token Bearer w żądaniach. Przechowuj klucz w zmiennej środowiskowej, takiej jak HUNYUAN_API_KEY, i unikaj ujawniania go w kodzie po stronie klienta lub publicznych repozytoriach.
Krok 2: Wysyłaj żądania do interfejsu API hunyuan-vision
Użyj zgodnego z OpenAI punktu końcowego i podaj hunyuan-vision jako nazwę modelu.
curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $HUNYUAN_API_KEY" \
--data '{
"model": "hunyuan-vision",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}'
Możesz też użyć zgodnych z OpenAI zestawów SDK, kierując klienta na bazowy adres URL Hunyuan:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("HUNYUAN_API_KEY"),
base_url="https://api.hunyuan.cloud.tencent.com/v1",
)
response = client.chat.completions.create(
model="hunyuan-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
},
},
],
}
],
)
print(response.choices[0].message.content)
Ta struktura żądania odpowiada oficjalnym przykładom Tencent zgodnym z OpenAI dla hunyuan-vision.
Krok 3: Pobieraj i weryfikuj wyniki
Odczytaj wygenerowaną odpowiedź z pierwszej opcji wyniku, zazwyczaj z response.choices[0].message.content podczas używania zgodnego z OpenAI SDK. W środowisku produkcyjnym zweryfikuj, czy adres URL obrazu jest osiągalny lub czy ładunek w formacie base64 jest poprawny, a następnie sprawdź zwrócony opis względem wymagań aplikacji pod kątem dokładności, bezpieczeństwa i spójności formatowania. Przykłady Tencent pokazują standardową obsługę odpowiedzi chat-completions, więc istniejące potoki walidacji i logowania zwykle można ponownie wykorzystać przy minimalnych zmianach.