ข้อกำหนดทาง技术ของ gpt-realtime-1.5
| รายการ | gpt-realtime-1.5 (การวางตำแหน่งสาธารณะ) |
|---|---|
| ตระกูลโมเดล | GPT Realtime 1.5 (รุ่นที่ปรับแต่งสำหรับเสียง) |
| โหมดหลัก | เสียงต่อเสียง (S2S) |
| ประเภทอินพุต | เสียง (สตรีมมิ่ง), ข้อความ |
| ประเภทเอาต์พุต | เสียง (สตรีมมิ่ง), ข้อความ, การเรียกใช้เครื่องมือแบบมีโครงสร้าง |
| API | Realtime API (WebRTC / เซสชันสตรีมมิ่งแบบต่อเนื่อง) |
| โปรไฟล์เวลาแฝง | ปรับแต่งเพื่อเวลาแฝงต่ำ สำหรับการโต้ตอบแบบสนทนาสด |
| รูปแบบเซสชัน | เซสชันสตรีมมิ่งแบบมีสถานะ |
| การใช้เครื่องมือ | รองรับการเรียกฟังก์ชันและการผสานรวมเครื่องมือ |
| กรณีใช้งานเป้าหมาย | เอเจนต์เสียงสด ผู้ช่วย ระบบเชิงโต้ตอบ |
หมายเหตุ: ขีดจำกัดโทเค็นและขนาดหน้าต่างบริบทที่แน่ชัดไม่ได้มีการบันทึกไว้อย่างเด่นชัดในสรุปสาธารณะ; โมเดลนี้ถูกวางตำแหน่งเพื่อการตอบสนองแบบเรียลไทม์มากกว่าการรองรับเซสชันบริบทที่ยาวเป็นพิเศษ
gpt-realtime-1.5 คืออะไร?
gpt-realtime-1.5 เป็นโมเดลที่มีเวลาแฝงต่ำ ปรับแต่งสำหรับการโต้ตอบแบบเสียงต่อเสียง ออกแบบมาสำหรับระบบสนทนาสด ต่างจากโมเดลแบบคำขอ-คำตอบทั่วไป มันทำงานผ่านเซสชันสตรีมมิ่งแบบต่อเนื่อง ช่วยให้ผลัดกันพูดตามธรรมชาติ จัดการการแทรกกลาง และปฏิสัมพันธ์ด้วยเสียงแบบไดนามิก
มันถูกสร้างขึ้นโดยเฉพาะสำหรับแอปพลิเคชันที่ความเร็วของกระแสการสนทนามีความสำคัญมากกว่าความยาวบริบทสูงสุด
คุณสมบัติหลัก
- ปฏิสัมพันธ์เสียงต่อเสียงอย่างแท้จริง — รับอินพุตเสียงสดและสตรีมคำตอบแบบเสียงแบบเรียลไทม์
- สถาปัตยกรรมเวลาแฝงต่ำ — ออกแบบเพื่อการตอบสนองในการสนทนาที่ต่ำกว่าหนึ่งวินาทีสำหรับเอเจนต์เสียง
- การออกแบบแบบเน้นสตรีมมิ่ง — ทำงานผ่านเซสชันต่อเนื่อง (WebRTC หรือโปรโตคอลสตรีมมิ่ง)
- การผลัดกันพูดอย่างเป็นธรรมชาติ — รองรับการจัดการการขัดจังหวะและกระแสการสนทนาแบบไดนามิก
- รองรับการเรียกใช้เครื่องมือ — สามารถทริกเกอร์การเรียกฟังก์ชันแบบมีโครงสร้างระหว่างเซสชันแบบเรียลไทม์
- พื้นฐานเอเจนต์เสียงพร้อมใช้งานจริง — สร้างขึ้นเฉพาะสำหรับผู้ช่วยเชิงโต้ตอบ คีออสก์ และอุปกรณ์ฝังตัว
การวัดผลและการวางตำแหน่งด้านประสิทธิภาพ
OpenAI วางตำแหน่ง gpt-realtime-1.5 ว่าเป็นวิวัฒนาการจากโมเดลเรียลไทม์รุ่นก่อน โดยมีการปฏิบัติตามคำสั่งที่ดีขึ้น ความเสถียรระหว่างเซสชันเสียงที่ยาวขึ้น และน้ำเสียงที่เป็นธรรมชาติมากขึ้นเมื่อเทียบกับรุ่นก่อน
ต่างจากโมเดลที่เน้นการเขียนโค้ด (เช่น Codex variants) ประสิทธิภาพถูกวัดด้วยเวลาแฝงในการสนทนา ความเป็นธรรมชาติของเสียง และความเสถียรของเซสชัน มากกว่าการทดสอบแบบตารางจัดอันดับ
gpt-realtime-1.5 เทียบกับโมเดลที่เกี่ยวข้อง
| คุณลักษณะ | gpt-realtime-1.5 | gpt-audio-1.5 |
|---|---|---|
| เป้าหมายหลัก | ปฏิสัมพันธ์เสียงสด | เวิร์กโฟลว์แชทที่รองรับเสียง |
| เวลาแฝง | ปรับแต่งให้หน่วงต่ำสุด | สมดุลคุณภาพ/ความเร็ว |
| ประเภทเซสชัน | เซสชันสตรีมมิ่งแบบต่อเนื่อง | โฟลว์ Chat Completions มาตรฐาน |
| ขนาดบริบท | ปรับแต่งเพื่อการตอบสนอง | รองรับบริบทที่ใหญ่กว่า |
| กรณีใช้งานที่เหมาะที่สุด | เอเจนต์เสียงแบบเรียลไทม์ | ผู้ช่วยสนทนาที่มีเสียง |
ควรเลือกแต่ละโมเดลเมื่อใด
- เลือก gpt-realtime-1.5 สำหรับคอลเซ็นเตอร์ คีออสก์ พนักงานต้อนรับ AI หรือผู้ช่วยฝังตัวแบบสด
- เลือก gpt-audio-1.5 สำหรับแอปแชทที่รองรับเสียงซึ่งต้องการความทรงจำการสนทนาที่ยาวขึ้นหรือเวิร์กโฟลว์แบบมัลติโหมด
กรณีใช้งานตัวอย่าง
- เอเจนต์คอลเซ็นเตอร์ AI
- ผู้ช่วยอุปกรณ์อัจฉริยะ
- คีออสก์เชิงโต้ตอบ
- ระบบติวสด
- เครื่องมือฝึกภาษาแบบเรียลไทม์
- แอปพลิเคชันที่ควบคุมด้วยเสียง
- วิธีเข้าถึง GPT realtime 1.5 API
ขั้นตอนที่ 1: สมัครเพื่อรับ API Key
เข้าสู่ระบบที่ cometapi.com หากคุณยังไม่เป็นผู้ใช้ของเรา โปรดลงทะเบียนก่อน เข้าสู่ CometAPI console รับ API key สำหรับการเข้าถึงอินเทอร์เฟซ คลิก “Add Token” ที่ API token ในศูนย์ส่วนบุคคล รับ token key: sk-xxxxx แล้วส่ง

ขั้นตอนที่ 2: ส่งคำขอไปยัง GPT realtime 1.5 API
เลือกปลายทาง “gpt-realtime-1.5” เพื่อส่งคำขอ API และกำหนด request body วิธีและรูปแบบของคำขอสามารถดูได้จากเอกสาร API บนเว็บไซต์ของเรา เว็บไซต์ของเรายังมีการทดสอบผ่าน Apifox เพื่อความสะดวกของคุณ แทนที่ <YOUR_API_KEY> ด้วย CometAPI key จริงจากบัญชีของคุณ base url คือ Chat Completions
ใส่คำถามหรือคำขอของคุณลงในช่อง content—นี่คือสิ่งที่โมเดลจะตอบกลับ ประมวลผลการตอบกลับของ API เพื่อรับคำตอบที่สร้างขึ้น
ขั้นตอนที่ 3: ดึงและยืนยันผลลัพธ์
ประมวลผลการตอบกลับของ API เพื่อรับคำตอบที่สร้างขึ้น หลังจากประมวลผลแล้ว API จะตอบกลับด้วยสถานะงานและข้อมูลผลลัพธ์