Spesifikasi Teknikal hunyuan-vision
| Spesifikasi | Butiran |
|---|---|
| ID Model | hunyuan-vision |
| Penyedia | Tencent Hunyuan |
| Jenis model | Model sembang multimodal berasaskan penglihatan-bahasa untuk pemahaman imej dan soal jawab visual |
| Keupayaan utama | Menerima input imej bersama teks dan mengembalikan respons bahasa semula jadi tentang kandungan imej |
| Gaya API | API Chat Completions serasi OpenAI |
| URL Asas | https://api.hunyuan.cloud.tencent.com/v1 |
| Endpoint | POST /chat/completions |
| Format input | Tatasusunan messages dengan bahagian kandungan bercampur text dan image_url; contoh menyokong URL imej atau URL data base64 |
| Autentikasi | Kunci API Bearer (HUNYUAN_API_KEY) |
| Keserasian SDK | Boleh dipanggil dengan SDK OpenAI dengan menukar base_url dan api_key |
| Nota pengebilan | Untuk input imej, Tencent mendokumenkan bahawa token imej hunyuan-vision berbeza mengikut saiz imej, kira-kira 256โ1280 token setiap imej, dengan penggunaan sebenar berdasarkan pengiraan pada sisi model |
Apakah hunyuan-vision?
hunyuan-vision ialah model pemahaman imej multimodal milik Tencent Hunyuan yang didedahkan melalui API serasi OpenAI. Dalam contoh rasmi Tencent, ia digunakan untuk tugasan gaya โimej-ke-teksโ di mana pengguna menghantar prompt bersama imej dan model menjawab soalan seperti apa yang ditunjukkan dalam imej.
Secara praktikal, ini menjadikan hunyuan-vision sesuai untuk aplikasi yang memerlukan penaakulan visual dalam aliran kerja sembang, seperti kapsyen imej, penerangan adegan, tafsiran UI atau tangkapan skrin, analisis imej produk, dan soal jawab visual umum. Corak integrasinya amat memudahkan pasukan yang sudah menggunakan klien gaya OpenAI, kerana Tencent menyatakan bahawa pembangun boleh bertukar hanya dengan menggantikan endpoint dan konfigurasi kunci API.
Ciri utama hunyuan-vision
- Pemahaman imej multimodal:
hunyuan-visionmenerima kandungan teks dan imej dalam permintaan yang sama, membolehkan perbualan sedar-imej dan soal jawab tentang visual yang dimuat naik. - Antara muka serasi OpenAI: Tencent menyediakan
hunyuan-visionmelalui struktur permintaan yang sama seperti Chat Completions, yang mengurangkan usaha migrasi untuk aplikasi AI sedia ada. - Kaedah input imej yang fleksibel: Contoh rasmi menunjukkan sokongan untuk URL imej jauh standard serta URL data yang disandikan base64, yang membantu sama ada bekerja dengan aset awam atau fail yang diproses secara setempat.
- Integrasi mesra SDK: Tencent secara jelas mendokumenkan penggunaan dengan SDK OpenAI dalam Python, Node.js, Go, dan permintaan HTTP gaya cURL, menjadikannya mudah untuk disepadukan ke dalam perkhidmatan belakang sedia ada.
- Aliran kerja berasaskan sembang: Memandangkan ia didedahkan sebagai model chat completion,
hunyuan-visionsesuai secara semula jadi untuk aplikasi perbualan, pembantu, dan rantaian alat yang sudah menyusun permintaan berdasarkanmessages. - Pengiraan token imej berasaskan penggunaan: Tencent menyatakan bahawa kos imej bergantung pada saiz imej, dengan penggunaan token per imej didokumenkan sebagai julat dan bukannya jumlah tetap.
Cara mengakses dan mengintegrasikan hunyuan-vision
Langkah 1: Daftar untuk Kunci API
Untuk mengakses hunyuan-vision, mula-mula cipta dan lindungi kunci API anda melalui konsol penyedia. Tencent mendokumenkan akses berasaskan kunci API untuk API Hunyuan yang serasi OpenAI, dan kunci dihantar sebagai token Bearer dalam permintaan. Simpan kunci dalam pemboleh ubah persekitaran seperti HUNYUAN_API_KEY, dan elakkan mendedahkannya dalam kod sisi klien atau repositori awam.
Langkah 2: Hantar Permintaan ke API hunyuan-vision
Gunakan endpoint serasi OpenAI dan tetapkan hunyuan-vision sebagai nama model.
curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $HUNYUAN_API_KEY" \
--data '{
"model": "hunyuan-vision",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}'
Anda juga boleh menggunakan SDK serasi OpenAI dengan menetapkan klien ke URL asas Hunyuan:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("HUNYUAN_API_KEY"),
base_url="https://api.hunyuan.cloud.tencent.com/v1",
)
response = client.chat.completions.create(
model="hunyuan-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
},
},
],
}
],
)
print(response.choices[0].message.content)
Struktur permintaan ini mengikuti contoh rasmi Tencent yang serasi OpenAI untuk hunyuan-vision.
Langkah 3: Dapatkan dan Sahkan Keputusan
Baca jawapan yang dijana daripada pilihan penyempurnaan pertama, lazimnya response.choices[0].message.content apabila menggunakan SDK serasi OpenAI. Untuk penggunaan produksi, sahkan bahawa URL imej boleh dicapai atau payload base64 anda sah, kemudian semak penerangan yang dikembalikan berbanding keperluan aplikasi anda dari segi ketepatan, keselamatan dan konsistensi pemformatan. Contoh Tencent menunjukkan pengendalian respons chat-completions yang piawai, jadi saluran pengesahan dan pembalakan sedia ada biasanya boleh digunakan semula dengan perubahan minimum.