ข้อกำหนดทาง技术ของ GPT-Realtime-2.1
| ข้อกำหนด | รายละเอียด |
|---|---|
| ชื่อรุ่น | GPT-Realtime-2.1 |
| ผู้ให้บริการ | OpenAI |
| ซีรีส์โมเดล | GPT-Realtime series |
| ประเภทโมเดล | โมเดลการให้เหตุผลด้วยเสียงแบบมัลติโหมดแบบเรียลไทม์ |
| ความสามารถหลัก | เอเจนต์ AI แบบเสียงต่อเสียง |
| รูปแบบอินพุต | ข้อความ, เสียง, รูปภาพ |
| รูปแบบเอาต์พุต | ข้อความ, เสียง |
| หน้าต่างบริบท | 128,000 โทเค็น |
| โทเค็นผลลัพธ์สูงสุด | 32,000 โทเค็น |
| รองรับการให้เหตุผล | ปรับระดับความพยายามในการให้เหตุผลได้ |
| การเรียกใช้ฟังก์ชัน | รองรับ |
| ผลลัพธ์แบบมีโครงสร้าง | ไม่รองรับ |
| การปรับแต่งเฉพาะงาน (fine-tuning) | ไม่รองรับ |
| อินพุตวิดีโอ | ไม่รองรับ |
| จุดปลาย API หลัก | Realtime API |
| ขอบเขตความรู้ | September 30, 2024 |
แหล่งที่มา: เอกสารของโมเดล OpenAI GPT-Realtime-2.1
GPT-Realtime-2.1 คืออะไร?
GPT-Realtime-2.1 คือโมเดลเสียงแบบเรียลไทม์ขั้นสูงของ OpenAI ที่ออกแบบมาเพื่อสร้างเอเจนต์สนทนา AI ที่สามารถฟัง คิด และตอบกลับด้วยเสียงได้อย่างเป็นธรรมชาติ
เมื่อเทียบกับผู้ช่วยเสียงแบบดั้งเดิมที่ต้องพึ่งพาสายพานประมวลผลแยกส่วนสำหรับการรู้จำเสียง ความเข้าใจภาษา และสังเคราะห์เสียง GPT-Realtime-2.1 มอบปฏิสัมพันธ์แบบเสียงต่อเสียงโดยกำเนิด ช่วยให้การสนทนามีความหน่วงต่ำขึ้น พร้อมการจัดการการขัดจังหวะและความเข้าใจบริบทที่ดีขึ้น
โมเดลนี้ได้รับการปรับแต่งสำหรับการใช้งานเสียงในโปรดักชัน เช่น เอเจนต์บริการลูกค้า ผู้ช่วย AI ระบบอัตโนมัติด้านการขาย แพลตฟอร์มการศึกษา และประสบการณ์เสียงเชิงโต้ตอบ
ประสิทธิภาพตามเกณฑ์ชี้วัดของ GPT-Realtime-2.1
การปรับปรุงของ GPT-Realtime-2.1 มุ่งที่เมตริกปฏิสัมพันธ์แบบเรียลไทม์ที่ใช้งานได้จริง:
| ความสามารถ | การปรับปรุง |
|---|---|
| การจัดการการขัดจังหวะด้วยเสียง | ดีขึ้น |
| ความทนทานต่อสัญญาณรบกวน | ดีขึ้น |
| การรู้จำอักขระผสม (ตัวอักษร-ตัวเลข) | ดีขึ้น |
| เวิร์กโฟลว์ด้วยเสียงที่ใช้เครื่องมือ | รองรับ |
| ปฏิสัมพันธ์เสียงต่อเสียง | รองรับ |
คุณสมบัติหลักของ GPT-Realtime-2.1
1. ปฏิสัมพันธ์แบบเสียงต่อเสียงแบบเนทีฟ
GPT-Realtime-2.1 ตัดความจำเป็นต้องมีสายพานแยกสำหรับรู้จำเสียงและสังเคราะห์เสียง
สถาปัตยกรรมเสียงแบบดั้งเดิม:
User Voice
↓
Speech-to-Text
↓
LLM Processing
↓
Text-to-Speech
↓
Voice Response
GPT-Realtime-2.1:
User Voice
↓
GPT-Realtime-2.1
↓
Voice Response
สิ่งนี้ช่วยลดความหน่วงและปรับปรุงความลื่นไหลของบทสนทนา
2. คุณภาพบทสนทนาด้วยเสียงที่ดีขึ้น
GPT-Realtime-2.1 ปรับปรุงความท้าทายหลายประการของเสียงในโลกจริง:
การจัดการการขัดจังหวะที่ดีขึ้น
ผู้ใช้สามารถขัดจังหวะ AI ได้ตามธรรมชาติระหว่างที่ AI กำลังพูด
ตัวอย่าง:
ผู้ใช้:
"จองตั๋วเครื่องบินให้ฉันไป—เอาเป็นว่า เปลี่ยนเป็นไปโตเกียวแทน"
โมเดลสามารถฟื้นตัวจากการเปลี่ยนแปลงระหว่างสนทนาได้โดยไม่ต้องเริ่มต้นใหม่
การจัดการช่วงเงียบและสัญญาณรบกวนที่ดีขึ้น
โมเดลได้รับการปรับแต่งสำหรับสภาพแวดล้อมที่คุณภาพเสียงไม่สมบูรณ์แบบ:
- คอลเซ็นเตอร์
- อุปกรณ์พกพา
- พื้นที่สาธารณะ
- อุปกรณ์อัจฉริยะ
3. การใช้เครื่องมือของเอเจนต์เสียงขั้นสูง
GPT-Realtime-2.1 รองรับการเรียกใช้เครื่องมือ ทำให้เอเจนต์เสียงสามารถลงมือทำงานได้
ตัวอย่าง:
ฝ่ายบริการลูกค้า:
User:
"Where is my order?"
AI:
→ Calls order database API
→ Retrieves status
→ Responds by voice
เวิร์กโฟลว์ระดับองค์กร:
Voice command
↓
Reasoning
↓
API execution
↓
Voice confirmation
สิ่งนี้ทำให้ GPT-Realtime-2.1 เหมาะสำหรับเอเจนต์เสียงแบบอัตโนมัติ
4. ความสามารถในการให้เหตุผลที่ปรับตั้งได้
ต่างจากโมเดลเสียงแบบเรียลไทม์รุ่นก่อนที่เน้นความเร็วเป็นหลัก GPT-Realtime-2.1 เพิ่มความสามารถในการปรับระดับความพยายามในการให้เหตุผล
นักพัฒนาสามารถปรับสมดุลระหว่าง:
- ระยะเวลาหน่วงของการตอบกลับ
- ความถูกต้อง
- ความซับซ้อนของงาน
ระดับการให้เหตุผลต่ำ:
- การสนทนาง่ายๆ
- ผู้ช่วยตอบคำถามที่พบบ่อย (FAQ)
ระดับการให้เหตุผลสูง:
- คำขอลูกค้าที่ซับซ้อน
- เวิร์กโฟลว์หลายขั้นตอน
- ปฏิบัติการทางธุรกิจ
5. การจดจำตัวเลขและข้อมูลเชิงเทคนิคที่ดีขึ้น
เอเจนต์เสียงมักเจอความท้าทายกับ:
- หมายเลขบัญชี
- หมายเลขซีเรียล
- ที่อยู่
- รหัสสินค้า
- ข้อมูลทางการเงิน
GPT-Realtime-2.1 ปรับปรุงการรู้จำอักขระผสม ทำให้เหมาะกับระบบเสียงในองค์กรยิ่งขึ้น
6. รองรับอินพุตหลายรูปแบบ
GPT-Realtime-2.1 รองรับ:
| อินพุต | การรองรับ |
|---|---|
| ข้อความ | ✅ |
| เสียง | ✅ |
| รูปภาพ | ✅ |
| วิดีโอ | ❌ |
อินพุตรูปภาพช่วยให้ทำกรณีใช้งานได้ เช่น:
- การสนับสนุนลูกค้าเชิงภาพ
- การตีความเอกสาร
- ผู้ช่วยที่ใช้กล้อง
เปรียบเทียบ GPT-Realtime-2.1 กับ GPT-Realtime-2 และ GPT-4o Realtime
| โมเดล | จุดเด่น | การใช้งานที่เหมาะสมที่สุด |
|---|---|---|
| GPT-Realtime-2.1 | การให้เหตุผลแบบเรียลไทม์ที่ยอดเยี่ยม + ความสามารถเอเจนต์เสียง | เอเจนต์เสียงระดับโปรดักชัน |
| GPT-Realtime-2 | การให้เหตุผลด้วยเสียงแบบเรียลไทม์ที่แข็งแกร่ง | แอปสนทนาขั้นสูง |
| GPT-4o Realtime | การโต้ตอบแบบมัลติโหมดที่รวดเร็ว | ผู้ช่วยเสียงทั่วไป |
เปรียบเทียบ GPT-Realtime-2.1 กับ GPT-Realtime-2
GPT-Realtime-2.1 ปรับปรุง:
- การฟื้นตัวจากการขัดจังหวะด้วยเสียง
- การจัดการสัญญาณรบกวน
- ความแม่นยำในการรู้จำ
- ความทนทานของการสนทนา
ทั้งสองโมเดลมีร่วมกัน:
- สถาปัตยกรรมเสียงต่อเสียง
- การเรียกใช้เครื่องมือ
- รองรับการให้เหตุผล
- การเข้าถึงผ่าน Realtime API
เปรียบเทียบ GPT-Realtime-2.1 กับ GPT-4o Realtime
GPT-Realtime-2.1 ถูกวางตำแหน่งเพื่อเวิร์กโฟลว์เอเจนต์ขั้นสูงมากกว่า
เมื่อเทียบกับ GPT-4o Realtime:
| ความสามารถ | GPT-Realtime-2.1 | GPT-4o Realtime |
|---|---|---|
| การให้เหตุผล | แข็งแกร่งกว่า | ทั่วไป |
| บริบท | 128K | 32K |
| การใช้เครื่องมือ | รองรับ | รองรับ |
| เอเจนต์เสียง | ขั้นสูง | ทั่วไป |
| เวิร์กโฟลว์ที่ซับซ้อน | เหมาะสมกว่า | เหมาะสม |
วิธีใช้ GPT-Realtime-2.1 API กับ CometAPI
GPT-Realtime-2.1 ถูกออกแบบมาสำหรับแอปเอเจนต์เสียงหน่วงต่ำ รองรับปฏิสัมพันธ์เสียงต่อเสียงแบบเรียลไทม์ อินพุตเสียง/เอาต์พุตเสียง อินพุตรูปภาพ การปรับระดับการให้เหตุผล และการเรียกใช้ฟังก์ชันสำหรับเวิร์กโฟลว์เสียงที่ใช้เครื่องมือ OpenAI เปิดให้ใช้งานผ่าน Realtime API รวมถึง WebRTC, WebSocket และวิธีสื่อสารแบบเรียลไทม์ผ่าน SIP
CometAPI มอบเลเยอร์ API รวมศูนย์สำหรับผสานรวมโมเดล AI ขั้นสูง ทำให้นักพัฒนาสามารถเข้าถึงเวิร์กโฟลว์สไตล์ GPT-Realtime-2.1 ได้โดยไม่ต้องดูแลการยืนยันตัวตนผู้ให้บริการ แยก SDK หรือโครงสร้างพื้นฐานเอง
ขั้นตอนที่ 1: ขอรับคีย์ API ของ CometAPI
สร้างบัญชี CometAPI และสร้างโทเค็น API จากคอนโซลนักพัฒนา
คำขอ API ของคุณควรรวม:
Authorization: Bearer YOUR_COMETAPI_API_KEY
Content-Type: application/json
คีย์ API ใช้ยืนยันคำขอของคุณและอนุญาตให้แอปของคุณเรียกใช้โมเดล AI ที่มีอยู่ผ่าน CometAPI
ขั้นตอนที่ 2: สร้างเซสชัน GPT-Realtime-2.1
GPT-Realtime-2.1 ทำงานผ่านเซสชันแบบเรียลไทม์ถาวร แทนวิธีโต้ตอบแบบคำขอ-คำตอบของแชตทั่วไป
เซสชันแบบเรียลไทม์จะคงไว้ซึ่ง:
- สตรีมอินพุตเสียง
- การตอบสนองของโมเดล
- สถานะการสนทนา
- การเรียกใช้เครื่องมือ
- การขัดจังหวะ
Realtime API ของ OpenAI รองรับการสื่อสารแบบเรียลไทม์ผ่าน WebRTC, WebSocket และ SIP
ตัวอย่าง:
curl https://api.cometapi.com/v1/realtime/sessions \
-H "Authorization: Bearer YOUR_COMETAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '
{
"model": "gpt-realtime-2.1",
"modalities": [
"audio",
"text"
],
"voice": "alloy",
"instructions": "You are a helpful customer support voice assistant."
}
'
ตัวอย่างการตอบกลับ:
{
"id": "sess_xxxxx",
"model": "gpt-realtime-2.1",
"status": "active"
}
ขั้นตอนที่ 3: ส่งอินพุตเสียงไปยัง GPT-Realtime-2.1
หลังจากสร้างเซสชันแล้ว ให้สตรีมเสียงของผู้ใช้
เวิร์กโฟลว์ตัวอย่าง:
User microphone
|
↓
Audio stream
|
↓
GPT-Realtime-2.1
|
↓
Generated voice response
อินพุตเสียงอาจรวมถึง:
- การสนทนาทางโทรศัพท์
- คำสั่งเสียง
- สายบริการลูกค้า
- ผู้ช่วยแบบโต้ตอบ
เมื่อเทียบกับโมเดลเรียลไทม์ก่อนหน้า GPT-Realtime-2.1 ปรับปรุงการโต้ตอบด้วยเสียงด้วยการตรวจจับความเงียบ การจัดการสัญญาณรบกวน และพฤติกรรมระหว่างการขัดจังหวะที่ดีขึ้น
ขั้นตอนที่ 4: รับการตอบกลับเสียงแบบเรียลไทม์
โมเดลจะส่งเสียงตอบกลับที่สร้างขึ้นผ่านการเชื่อมต่อแบบเรียลไทม์
อีเวนต์ตัวอย่าง:
{
"type": "response.audio.delta",
"delta": "base64_audio_chunk"
}
แอปของคุณสามารถเล่นชิ้นส่วนเสียงที่ได้รับได้ทันที
การใช้งานที่พบทั่วไป:
- แอปเสียงผ่าน WebRTC
- ผู้ช่วยบนเบราว์เซอร์
- แอปเสียงบนมือถือ
- เอเจนต์โทรศัพท์อัจฉริยะ
ขั้นตอนที่ 5: เพิ่มการเรียกใช้ฟังก์ชันสำหรับเอเจนต์เสียง
GPT-Realtime-2.1 รองรับการเรียกใช้ฟังก์ชัน ทำให้เอเจนต์เสียงสามารถดำเนินการภายนอกได้
ตัวอย่าง:
{
"tools": [
{
"type": "function",
"name": "check_order_status",
"description": "Retrieve customer order information",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
}
}
}
]
}
เวิร์กโฟลว์เอเจนต์เสียงที่เป็นไปได้:
- "พัสดุของฉันอยู่ที่ไหน?"
- "จองประชุมให้ฉันพรุ่งนี้"
- "ยกเลิกการสมัครสมาชิกของฉัน"
- "ตรวจสอบยอดเงินในบัญชีของฉัน"
โมเดลสามารถเข้าใจคำขอ เรียกใช้เครื่องมือที่เหมาะสม และสนทนาต่อไปอย่างเป็นธรรมชาติ
ขั้นตอนที่ 6: กำหนดค่าระดับการให้เหตุผลและคำแนะนำ
GPT-Realtime-2.1 รองรับการปรับระดับความพยายามในการให้เหตุผล
ตัวอย่าง:
{
"model": "gpt-realtime-2.1",
"reasoning": {
"effort": "medium"
},
"instructions": "Act as a professional travel assistant."
}
การตั้งค่าที่แนะนำ:
| แอปพลิเคชัน | ระดับการให้เหตุผล |
|---|---|
| คำสั่งเสียงแบบง่าย | ต่ำ |
| การสนับสนุนลูกค้า | ปานกลาง |
| เอเจนต์เวิร์กโฟลว์ที่ซับซ้อน | สูง |