Claude Opus 5 is now live on CometAPI →
H

hunyuan-vision

Wejście:$2.00592/M
Wyjście:$2.00592/M
Wydano:Oct 1, 2025
Użycie komercyjne

Specyfikacje techniczne hunyuan-vision

SpecyfikacjaSzczegóły
ID modeluhunyuan-vision
DostawcaTencent Hunyuan
Typ modeluModel vision-language / multimodalny model czatowy do rozumienia obrazów i wizualnego odpowiadania na pytania
Podstawowa funkcjonalnośćPrzyjmuje wejście łączące obraz i tekst i zwraca odpowiedzi w języku naturalnym dotyczące treści obrazu
Styl APIInterfejs Chat Completions kompatybilny z OpenAI
Base URLhttps://api.hunyuan.cloud.tencent.com/v1
EndpointPOST /chat/completions
Format wejściatablica messages z mieszanymi częściami treści text i image_url; w przykładach obsługiwane są adresy URL obrazów lub dane URL w formacie base64
UwierzytelnianieKlucz API w schemacie Bearer (HUNYUAN_API_KEY)
Zgodność z SDKMożna wywoływać za pomocą SDK OpenAI, zmieniając base_url i api_key
Uwaga dotycząca rozliczeńDla wejścia obrazu Tencent dokumentuje, że liczba tokenów obrazu w hunyuan-vision zależy od rozmiaru obrazu, w przybliżeniu 256–1280 tokenów na obraz; faktyczne zużycie jest obliczane po stronie modelu

Czym jest hunyuan-vision?

hunyuan-vision to multimodalny model rozumienia obrazów od Tencent Hunyuan, udostępniany poprzez interfejs kompatybilny z OpenAI. W oficjalnych przykładach Tencent służy do zadań typu „image-to-text”, gdzie użytkownik wysyła prompt wraz z obrazem, a model odpowiada na pytania o to, co znajduje się na obrazie.

Praktycznie czyni to hunyuan-vision odpowiednim do aplikacji wymagających rozumowania wizualnego w przepływie czatowym, takich jak tworzenie podpisów do obrazów, opisy scen, interpretacja interfejsów lub zrzutów ekranu, analiza obrazów produktów oraz ogólne wizualne odpowiadanie na pytania. Wzorzec integracji jest szczególnie wygodny dla zespołów już używających klientów w stylu OpenAI, ponieważ Tencent podaje, że deweloperzy mogą się przełączyć, zastępując jedynie punkt końcowy i konfigurację klucza API.

Główne funkcje hunyuan-vision

  • Multimodalne rozumienie obrazów: hunyuan-vision przyjmuje w jednym żądaniu zarówno treść tekstową, jak i obraz, umożliwiając rozmowy i odpowiadanie na pytania z uwzględnieniem przesłanych materiałów wizualnych.
  • Interfejs kompatybilny z OpenAI: Tencent udostępnia hunyuan-vision w tej samej ogólnej strukturze żądań co Chat Completions, co zmniejsza wysiłek migracyjny w istniejących aplikacjach AI.
  • Elastyczne metody wprowadzania obrazów: Oficjalne przykłady pokazują obsługę standardowych zdalnych adresów URL obrazów oraz danych URL zakodowanych w base64, co pomaga zarówno przy zasobach publicznych, jak i lokalnie przetwarzanych plikach.
  • Przyjazna integracja z SDK: Tencent wprost dokumentuje użycie z SDK OpenAI w Pythonie, Node.js, Go i żądaniach HTTP w stylu cURL, co ułatwia osadzenie w istniejących usługach backendowych.
  • Przepływ pracy oparty na czacie: Ponieważ jest udostępniany jako model chat completion, hunyuan-vision naturalnie pasuje do aplikacji konwersacyjnych, asystentów i narzędzi opierających żądania na messages.
  • Rozliczanie tokenów obrazów w zależności od użycia: Tencent wskazuje, że koszt dla obrazów zależy od rozmiaru obrazu, a zużycie tokenów jest podawane jako zakres, a nie stała wartość.

Jak uzyskać dostęp i zintegrować hunyuan-vision

Krok 1: Uzyskaj klucz API

Aby uzyskać dostęp do hunyuan-vision, najpierw utwórz i zabezpiecz klucz API poprzez konsolę dostawcy. Tencent dokumentuje dostęp oparty na kluczu API dla zgodnego z OpenAI interfejsu Hunyuan, a klucz jest przekazywany jako token Bearer w żądaniach. Przechowuj klucz w zmiennej środowiskowej, takiej jak HUNYUAN_API_KEY, i unikaj ujawniania go w kodzie po stronie klienta lub publicznych repozytoriach.

Krok 2: Wysyłaj żądania do interfejsu API hunyuan-vision

Użyj zgodnego z OpenAI punktu końcowego i podaj hunyuan-vision jako nazwę modelu.

curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $HUNYUAN_API_KEY" \
  --data '{
    "model": "hunyuan-vision",
    "messages": [
      {
        "role": "user",
        "content": [
          {
            "type": "text",
            "text": "What is in this image?"
          },
          {
            "type": "image_url",
            "image_url": {
              "url": "https://example.com/image.jpg"
            }
          }
        ]
      }
    ]
  }'

Możesz też użyć zgodnych z OpenAI zestawów SDK, kierując klienta na bazowy adres URL Hunyuan:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("HUNYUAN_API_KEY"),
    base_url="https://api.hunyuan.cloud.tencent.com/v1",
)

response = client.chat.completions.create(
    model="hunyuan-vision",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Describe this image."},
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/image.jpg"
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

Ta struktura żądania odpowiada oficjalnym przykładom Tencent zgodnym z OpenAI dla hunyuan-vision.

Krok 3: Pobieraj i weryfikuj wyniki

Odczytaj wygenerowaną odpowiedź z pierwszej opcji wyniku, zazwyczaj z response.choices[0].message.content podczas używania zgodnego z OpenAI SDK. W środowisku produkcyjnym zweryfikuj, czy adres URL obrazu jest osiągalny lub czy ładunek w formacie base64 jest poprawny, a następnie sprawdź zwrócony opis względem wymagań aplikacji pod kątem dokładności, bezpieczeństwa i spójności formatowania. Przykłady Tencent pokazują standardową obsługę odpowiedzi chat-completions, więc istniejące potoki walidacji i logowania zwykle można ponownie wykorzystać przy minimalnych zmianach.

Cennik dla hunyuan-vision

Poznaj konkurencyjne ceny dla hunyuan-vision, zaprojektowane tak, aby pasowały do różnych budżetów i potrzeb użytkowania. Nasze elastyczne plany zapewniają, że płacisz tylko za to, czego używasz, co ułatwia skalowanie w miarę wzrostu Twoich wymagań. Odkryj, jak hunyuan-vision może ulepszyć Twoje projekty przy jednoczesnym utrzymaniu kosztów na rozsądnym poziomie.

Comet Price (USD / M Tokens)Official Price (USD / M Tokens)Discount
Wejście:$2.00592/M
Wyjście:$2.00592/M
Wejście:$2.5074/M
Wyjście:$2.5074/M
-20%

Przykładowy kod i API dla hunyuan-vision

Uzyskaj dostęp do kompleksowego przykładowego kodu i zasobów API dla hunyuan-vision, aby usprawnić proces integracji. Nasza szczegółowa dokumentacja zapewnia wskazówki krok po kroku, pomagając wykorzystać pełny potencjał hunyuan-vision w Twoich projektach.