Spesifikasi Teknis hunyuan-turbos-vision
hunyuan-turbos-vision adalah ID model CometAPI untuk model Tencent Hunyuan yang berkemampuan visi dalam keluarga multimodal Tencent HY yang lebih luas. Tencent menggambarkan Hunyuan/Tencent HY sebagai keluarga model serbaguna dan multimodal yang dikembangkan sendiri, mencakup gambar dan modalitas lain, dengan akses berbasis API untuk kasus penggunaan perusahaan.
| Spesifikasi | Rincian |
|---|---|
| ID model | hunyuan-turbos-vision |
| Penyedia / keluarga | Tencent Hunyuan / keluarga model multimodal Tencent HY. |
| Modalitas | Model pemahaman multimodal berkemampuan visi untuk interaksi gambar-dan-teks. Lini Hunyuan dari Tencent mencakup model pemahaman visual dan layanan multimodal. |
| Penggunaan utama | Pemahaman gambar, tanya jawab visual, pengenalan objek/adegan, interpretasi bagan dan dokumen, serta penalaran multimodal. Karakterisasi ini didasarkan pada pemosisian model visi dan deskripsi produk multimodal yang dipublikasikan oleh Tencent. |
| Pola akses | Akses API melalui antarmuka Tencent HY / Hunyuan; dokumentasi Tencent merujuk pemanggilan Hunyuan melalui API seperti ChatCompletions dan alur kerja API Explorer. |
| Orientasi penerapan | Layanan cloud tingkat enterprise dengan dukungan pemanggilan API. |
| Kekuatan yang dinyatakan vendor | Respons cepat, peningkatan akurasi persepsi/pengenalan visual, serta penalaran/pemahaman bagan yang lebih kuat dalam katalog model visi Tencent saat ini. |
Apa itu hunyuan-turbos-vision?
hunyuan-turbos-vision adalah model multimodal berkemampuan visi yang diekspos di CometAPI dengan pengenal khusus platform, dipetakan ke ekosistem pemahaman visual Tencent Hunyuan. Dalam materi publik Tencent, Hunyuan/Tencent HY diposisikan sebagai keluarga model multimodal yang dikembangkan sendiri, mencakup teks, gambar, 3D, dan skenario AI perusahaan terkait.
Berdasarkan daftar model resmi Tencent untuk pemahaman visual, keluarga ini menekankan respons gambar yang cepat, pengenalan visual yang lebih akurat, dan penalaran yang lebih kuat atas konten gambar, diagram, dan bagan. Hal ini menjadikan hunyuan-turbos-vision pilihan yang praktis untuk aplikasi yang perlu menganalisis gambar yang diunggah bersama prompt berbahasa alami, seperti asisten visual, pembaca dokumen, otomatisasi dukungan, pipeline moderasi konten, atau sistem tanya jawab berbasis gambar.
Karena CometAPI menggunakan pengenal model stabilnya sendiri, string persis hunyuan-turbos-vision harus diperlakukan sebagai target integrasi dalam permintaan API, meskipun penamaan yang menghadap publik dari Tencent dapat berbeda di halaman produk atau katalog model. Ini adalah pemetaan pada lapisan integrasi, bukan kontradiksi. Kapabilitas dasarnya tetap terkait dengan tumpukan visi multimodal Tencent Hunyuan.
Fitur utama hunyuan-turbos-vision
- Pemahaman gambar multimodal: Mendukung alur kerja di mana pengguna mengirimkan gambar beserta instruksi teks, lalu menerima jawaban yang didasari konten visual. Ini selaras dengan pemosisian multimodal dan pemahaman visual Tencent Hunyuan.
- Perilaku respons cepat: Katalog model pemahaman visual Tencent saat ini menyoroti respons yang cepat terhadap input gambar, yang sangat berguna bagi asisten interaktif dan UX real-time.
- Akurasi pengenalan visual yang ditingkatkan: Tencent menggambarkan persepsi dan pengenalan objek/konten yang lebih kuat dalam lini visi, sehingga cocok untuk pemahaman adegan dan tanya jawab berbasis gambar.
- Penalaran atas bagan dan visual kompleks: Tencent secara khusus menyoroti penalaran logis dan pemahaman bagan yang lebih kuat, bermanfaat untuk dasbor analitik, laporan, dan alat pendidikan.
- Kegunaan terkait dokumen dan OCR: Meskipun Tencent juga menawarkan model OCR khusus, tumpukan visi yang lebih luas menunjukkan dukungan untuk mengekstrak dan menafsirkan informasi terstruktur dari dokumen berbasis gambar, tabel, dan rumus.
- Aksesibilitas API tingkat enterprise: Tencent HY ditawarkan sebagai layanan cloud berorientasi API, sehingga cocok untuk integrasi ke sistem produksi, alat internal, dan pipeline otomatis.
- Bagian dari ekosistem multimodal yang lebih besar:
hunyuan-turbos-visionmendapatkan manfaat sebagai bagian dari keluarga Hunyuan/Tencent HY, yang mencakup berbagai modalitas dan kasus penggunaan AI perusahaan, bukan model niche yang berdiri sendiri.
Cara mengakses dan mengintegrasikan hunyuan-turbos-vision
Langkah 1: Daftar Kunci API
Daftar di CometAPI dan buat kunci API dari dasbor. Setelah dibuat, simpan kunci Anda dengan aman dan muat melalui variabel lingkungan seperti COMETAPI_API_KEY. Kunci ini akan digunakan untuk mengautentikasi setiap permintaan yang Anda kirim ke API hunyuan-turbos-vision.
Langkah 2: Kirim Permintaan ke API hunyuan-turbos-vision
Gunakan endpoint CometAPI yang kompatibel dengan OpenAI dan setel field model ke hunyuan-turbos-vision.
curl https://api.cometapi.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_API_KEY" \
-d '{
"model": "hunyuan-turbos-vision",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Describe this image in detail." },
{ "type": "image_url", "image_url": { "url": "https://example.com/sample.jpg" } }
]
}
]
}'
Anda juga dapat memanggil model yang sama dari Python menggunakan format SDK OpenAI:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_COMETAPI_KEY",
base_url="https://api.cometapi.com/v1"
)
response = client.chat.completions.create(
model="hunyuan-turbos-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "What objects are visible in this image?"},
{"type": "image_url", "image_url": {"url": "https://example.com/sample.jpg"}}
]
}
]
)
print(response)
Langkah 3: Mengambil dan Memverifikasi Hasil
Setelah mengirim permintaan, uraikan JSON respons dan baca keluaran model dari pilihan pertama. Untuk penggunaan produksi, Anda juga harus memverifikasi bahwa konten yang dikembalikan sesuai dengan gambar yang diberikan, menerapkan pemeriksaan keamanan atau aturan bisnis yang diperlukan, serta mencatat metadata respons untuk pemantauan dan debugging.