ข้อกำหนดทาง技术ของ hunyuan-vision
| ข้อกำหนด | รายละเอียด |
|---|---|
| รหัสรุ่น | hunyuan-vision |
| ผู้ให้บริการ | Tencent Hunyuan |
| ประเภทรุ่น | โมเดลสนทนาหลายโมดัลด้านภาพและภาษา สำหรับทำความเข้าใจภาพและตอบคำถามเชิงภาพ |
| ความสามารถหลัก | รองรับอินพุตเป็นภาพพร้อมข้อความ และส่งคืนคำตอบภาษาธรรมชาติเกี่ยวกับเนื้อหาของภาพ |
| รูปแบบ API | Chat Completions API ที่เข้ากันได้กับ OpenAI |
| Base URL | https://api.hunyuan.cloud.tencent.com/v1 |
| Endpoint | POST /chat/completions |
| รูปแบบอินพุต | อาร์เรย์ messages ที่ประกอบด้วยส่วนเนื้อหาแบบ text และ image_url ผสมกัน; ในตัวอย่างรองรับทั้ง URL ของภาพหรือ data URL แบบ base64 |
| การยืนยันตัวตน | คีย์ API แบบ Bearer (HUNYUAN_API_KEY) |
| ความเข้ากันได้กับ SDK | สามารถเรียกใช้ผ่าน OpenAI SDK ได้โดยเปลี่ยน base_url และ api_key |
| หมายเหตุการคิดค่าบริการ | สำหรับอินพุตภาพ Tencent ระบุว่าโทเค็นภาพของ hunyuan-vision แตกต่างกันตามขนาดภาพ โดยประมาณ 256–1280 โทเค็นต่อภาพ โดยการใช้งานจริงคำนวณจากฝั่งโมเดล |
hunyuan-vision คืออะไร?
hunyuan-vision เป็นโมเดลทำความเข้าใจภาพแบบหลายโมดัลของ Tencent Hunyuan ที่ให้บริการผ่าน API ที่เข้ากันได้กับ OpenAI ในตัวอย่างอย่างเป็นทางการของ Tencent โมเดลนี้ถูกใช้สำหรับงานสไตล์ “image-to-text” ที่ผู้ใช้ส่งพรอมป์พร้อมภาพ และโมเดลจะตอบคำถามเกี่ยวกับสิ่งที่ปรากฏในภาพ
ในทางปฏิบัติ สิ่งนี้ทำให้ hunyuan-vision เหมาะสำหรับแอปพลิเคชันที่ต้องการการให้เหตุผลเชิงภาพในกรอบงานสนทนา เช่น การสร้างคำบรรยายภาพ การอธิบายฉาก การตีความ UI หรือภาพหน้าจอ การวิเคราะห์ภาพสินค้า และการตอบคำถามเชิงภาพทั่วไป รูปแบบการผสานใช้งานยังสะดวกเป็นพิเศษสำหรับทีมที่ใช้ไคลเอนต์สไตล์ OpenAI อยู่แล้ว เพราะ Tencent ระบุว่านักพัฒนาสามารถสลับมาใช้ได้โดยเปลี่ยนเพียงปลายทาง (endpoint) และการตั้งค่า API key
คุณสมบัติหลักของ hunyuan-vision
- ความเข้าใจภาพแบบหลายโมดัล:
hunyuan-visionรองรับทั้งเนื้อหาข้อความและภาพในคำขอเดียวกัน ทำให้สนทนาที่ตระหนักถึงภาพและการตอบคำถามเกี่ยวกับภาพที่อัปโหลดเป็นไปได้ - อินเทอร์เฟซที่เข้ากันได้กับ OpenAI: Tencent ให้บริการ
hunyuan-visionด้วยโครงสร้างคำขอแบบเดียวกับ Chat Completions ช่วยลดความยุ่งยากในการย้ายสำหรับแอปพลิเคชัน AI ที่มีอยู่ - วิธีการป้อนภาพที่ยืดหยุ่น: ตัวอย่างอย่างเป็นทางการแสดงการรองรับทั้ง URL ของภาพแบบรีโมตมาตรฐานและ data URL ที่เข้ารหัสแบบ base64 ซึ่งช่วยเมื่อต้องทำงานกับทรัพยากรสาธารณะหรือไฟล์ที่ประมวลผลภายในเครื่อง
- การผสานที่เป็นมิตรกับ SDK: Tencent มีเอกสารการใช้งานร่วมกับ OpenAI SDK ใน Python, Node.js, Go และคำขอ HTTP แบบ cURL อย่างชัดเจน ทำให้ง่ายต่อการฝังลงในบริการแบ็กเอนด์ที่มีอยู่
- เวิร์กโฟลว์แบบสนทนา: เนื่องจากเปิดให้ใช้ในรูปแบบโมเดล chat completion
hunyuan-visionจึงเข้ากันได้อย่างเป็นธรรมชาติกับแอปสนทนา ผู้ช่วย และชุดเครื่องมือที่ออกแบบคำขอโดยอ้างอิงmessages - การคำนวณโทเค็นภาพแบบอิงการใช้งาน: Tencent ระบุว่าต้นทุนของภาพขึ้นอยู่กับขนาดภาพ โดยจำนวนโทเค็นต่อภาพถูกระบุเป็นช่วง ไม่ใช่จำนวนคงที่
วิธีเข้าถึงและผสาน hunyuan-vision
ขั้นตอนที่ 1: ลงทะเบียนรับ API Key
เพื่อเข้าถึง hunyuan-vision ให้สร้างและเก็บรักษา API key ของคุณผ่านคอนโซลของผู้ให้บริการ Tencent ระบุการเข้าถึงผ่าน API key สำหรับ Hunyuan API ที่เข้ากันได้กับ OpenAI และส่งคีย์เป็นโทเค็นแบบ Bearer ในคำขอ เก็บคีย์ไว้ในตัวแปรสภาพแวดล้อม เช่น HUNYUAN_API_KEY และหลีกเลี่ยงการเปิดเผยในโค้ดฝั่งไคลเอนต์หรือที่เก็บแบบสาธารณะ
ขั้นตอนที่ 2: ส่งคำขอไปยัง API ของ hunyuan-vision
ใช้ปลายทางที่เข้ากันได้กับ OpenAI และระบุ hunyuan-vision เป็นชื่อรุ่น
curl --location 'https://api.hunyuan.cloud.tencent.com/v1/chat/completions' \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $HUNYUAN_API_KEY" \
--data '{
"model": "hunyuan-vision",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What is in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}'
คุณยังสามารถใช้ SDK ที่เข้ากันได้กับ OpenAI โดยการตั้งค่า client ให้ชี้ไปที่ Hunyuan base URL:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("HUNYUAN_API_KEY"),
base_url="https://api.hunyuan.cloud.tencent.com/v1",
)
response = client.chat.completions.create(
model="hunyuan-vision",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
},
},
],
}
],
)
print(response.choices[0].message.content)
โครงสร้างคำขอนี้สอดคล้องกับตัวอย่างอย่างเป็นทางการของ Tencent ที่เข้ากันได้กับ OpenAI สำหรับ hunyuan-vision.
ขั้นตอนที่ 3: ดึงผลลัพธ์และตรวจสอบความถูกต้อง
อ่านคำตอบที่สร้างขึ้นจากตัวเลือกการเติมเต็มลำดับแรก โดยทั่วไปคือ response.choices[0].message.content เมื่อใช้ SDK ที่เข้ากันได้กับ OpenAI สำหรับการใช้งานจริง ให้ตรวจสอบว่า URL ของภาพเข้าถึงได้หรือว่าเพย์โหลด base64 ถูกต้อง จากนั้นตรวจสอบคำอธิบายที่ส่งกลับให้สอดคล้องกับข้อกำหนดของแอปพลิเคชันในด้านความถูกต้อง ความปลอดภัย และความสม่ำเสมอของรูปแบบ ตัวอย่างของ Tencent แสดงการจัดการการตอบกลับของ chat-completions มาตรฐาน ดังนั้นไปป์ไลน์การตรวจสอบและการบันทึกที่มีอยู่มักสามารถนำกลับมาใช้ได้โดยปรับเปลี่ยนเพียงเล็กน้อย