hunyuan-vision Teknik Özellikleri
| Özellik | Ayrıntılar |
|---|---|
| Model Kimliği | hunyuan-vision |
| Sağlayıcı | Tencent Hunyuan |
| Model türü | Görsel anlama ve görsel soru-cevap için görsel-dil / çok modlu sohbet modeli |
| Birincil yetenek | Görüntü+metin girdisini kabul eder ve görüntü içeriğine ilişkin doğal dilde yanıtlar döndürür |
| API stili | OpenAI ile uyumlu Chat Completions API |
| Temel URL | https://api.hunyuan.cloud.tencent.com/v1 |
| Uç nokta | POST /chat/completions |
| Girdi biçimi | Karışık text ve image_url içerik parçaları içeren messages dizisi; örneklerde görüntü URL'si veya base64 veri URL'si desteklenir |
| Kimlik doğrulama | Bearer API anahtarı (HUNYUAN_API_KEY) |
| SDK uyumluluğu | OpenAI SDK’larında base_url ve api_key değiştirilerek çağrılabilir |
| Faturalandırma notu | Görüntü girişi için Tencent, hunyuan-vision görsel tokenlarının görüntü boyutuna göre değiştiğini, yaklaşık görüntü başına 256–1280 token olduğunu ve gerçek kullanımın model taraflı hesaplamaya dayandığını belirtir |
hunyuan-vision nedir?
hunyuan-vision, Tencent Hunyuan’ın OpenAI uyumlu bir API üzerinden sunulan çok modlu görsel anlama modelidir. Tencent’in resmi örneklerinde, kullanıcının bir görselle birlikte bir istem gönderdiği ve modelin görselde ne olduğuna dair soruları yanıtladığı “görüntüden metne” tarzı görevlerde kullanılır.
Pratikte bu, hunyuan-vision’ı sohbet iş akışı içinde görsel akıl yürütmeye ihtiyaç duyan uygulamalar için uygun kılar; örneğin görüntü açıklama, sahne betimleme, UI veya ekran görüntüsü yorumlama, ürün görseli analizi ve genel görsel soru-cevap. Entegrasyon biçimi, halihazırda OpenAI tarzı istemciler kullanan ekipler için özellikle uygundur; zira Tencent, yalnızca uç nokta ve API anahtarı yapılandırmasını değiştirerek geçiş yapılabileceğini belirtir.
hunyuan-vision'ın başlıca özellikleri
- Çok modlu görsel anlama:
hunyuan-vision, aynı istekte hem metin hem de görsel içeriği kabul eder; bu da yüklenen görseller hakkında farkındalıklı sohbetler ve soru-cevap imkanı sağlar. - OpenAI ile uyumlu arayüz: Tencent,
Chat Completionsile aynı genel istek yapısını sağlar; bu da mevcut yapay zeka uygulamalarının taşınma çabasını azaltır. - Esnek görsel girdi yöntemleri: Resmi örnekler, standart uzak görsel URL’lerinin yanı sıra base64 ile kodlanmış veri URL’lerinin de desteklendiğini gösterir; bu da hem herkese açık varlıklarla hem de yerelde işlenen dosyalarla çalışmayı kolaylaştırır.
- SDK dostu entegrasyon: Tencent, Python, Node.js, Go ve cURL tarzı HTTP istekleri için OpenAI SDK’larıyla kullanımını açıkça belgelendirir; bu da mevcut arka uç servislerine gömmeyi kolaylaştırır.
- Sohbet tabanlı iş akışı: Bir sohbet tamamlama modeli olarak sunulduğu için
hunyuan-vision, isteklerinimessagesetrafında yapılandıran konuşma uygulamaları, asistanlar ve araç zincirlerine doğal biçimde uyar. - Kullanıma dayalı görsel token hesaplaması: Tencent, görsel maliyetinin görüntü boyutuna bağlı olduğunu ve görsel başına token tüketiminin sabit değil, belgelenmiş bir aralık olduğunu (yaklaşık 256–1280) belirtir.
hunyuan-vision'a nasıl erişilir ve entegre edilir
Adım 1: API Anahtarı edinin
hunyuan-vision’a erişmek için önce sağlayıcı konsolu üzerinden API anahtarınızı oluşturup güvenceye alın. Tencent, OpenAI uyumlu Hunyuan API’si için anahtar tabanlı erişimi belgelendirir ve anahtar isteklerde Bearer belirteci olarak iletilir. Anahtarı HUNYUAN_API_KEY gibi bir ortam değişkeninde saklayın ve istemci tarafı kodda veya herkese açık depolarda ifşa etmekten kaçının.
Adım 2: hunyuan-vision API’sine istek gönderin
OpenAI uyumlu uç noktayı kullanın ve model adı olarak hunyuan-vision belirtin.
curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $HUNYUAN_API_KEY" \
--data '{
"model": "hunyuan-vision",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}'
İstemciyi Hunyuan temel URL’sine yönlendirerek OpenAI uyumlu SDK’ları da kullanabilirsiniz:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("HUNYUAN_API_KEY"),
base_url="https://api.hunyuan.cloud.tencent.com/v1",
)
response = client.chat.completions.create(
model="hunyuan-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
},
},
],
}
],
)
print(response.choices[0].message.content)
Bu istek yapısı, hunyuan-vision için Tencent’in resmi OpenAI uyumlu örneklerini takip eder.
Adım 3: Sonuçları alın ve doğrulayın
OpenAI uyumlu bir SDK kullanırken tipik olarak response.choices[0].message.content’ten ilk tamamlama seçeneğinin yanıtını okuyun. Üretim ortamında, görsel URL’sinin erişilebilir olduğunu veya base64 yükünüzün geçerli olduğunu doğrulayın; ardından dönen açıklamayı uygulama gereksinimlerinize göre doğruluk, güvenlik ve biçim tutarlılığı açısından kontrol edin. Tencent’in örnekleri, standart chat-completions yanıt işleme akışını gösterir; bu nedenle mevcut doğrulama ve günlükleme hatları genellikle çok az değişiklikle yeniden kullanılabilir.