Thông số kỹ thuật của GPT-Realtime-2.1
| Thông số | Chi tiết |
|---|---|
| Tên mô hình | GPT-Realtime-2.1 |
| Nhà cung cấp | OpenAI |
| Dòng mô hình | GPT-Realtime series |
| Loại mô hình | Mô hình suy luận giọng nói đa phương thức thời gian thực |
| Năng lực chính | Tác nhân AI thoại-sang-thoại |
| Phương thức đầu vào | Text, Audio, Image |
| Phương thức đầu ra | Text, Audio |
| Cửa sổ ngữ cảnh | 128,000 tokens |
| Số token đầu ra tối đa | 32,000 tokens |
| Hỗ trợ lập luận | Nỗ lực lập luận có thể cấu hình |
| Gọi hàm | Được hỗ trợ |
| Đầu ra có cấu trúc | Không được hỗ trợ |
| Tinh chỉnh | Không được hỗ trợ |
| Đầu vào video | Không được hỗ trợ |
| Điểm cuối API chính | Realtime API |
| Thời điểm cắt kiến thức | 30 tháng 9, 2024 |
Nguồn: tài liệu mô hình OpenAI GPT-Realtime-2.1.
GPT-Realtime-2.1 là gì?
GPT-Realtime-2.1 là mô hình giọng nói thời gian thực tiên tiến của OpenAI, được thiết kế để xây dựng các tác nhân AI hội thoại có thể lắng nghe, suy luận và phản hồi tự nhiên qua âm thanh.
So với các trợ lý giọng nói truyền thống dựa vào các chuỗi xử lý riêng biệt gồm nhận dạng giọng nói, hiểu ngôn ngữ và chuyển văn bản thành giọng nói, GPT-Realtime-2.1 cung cấp tương tác thoại-sang-thoại nguyên bản, cho phép hội thoại độ trễ thấp hơn với khả năng xử lý ngắt lời và hiểu ngữ cảnh tốt hơn.
Mô hình được tối ưu cho các ứng dụng giọng nói trong sản xuất, bao gồm tác nhân chăm sóc khách hàng, trợ lý AI, tự động hóa bán hàng, nền tảng giáo dục và trải nghiệm giọng nói tương tác.
Hiệu năng đo chuẩn của GPT-Realtime-2.1
GPT-Realtime-2.1 tập trung cải thiện các chỉ số tương tác thời gian thực trong thực tế:
| Khả năng | Cải thiện |
|---|---|
| Xử lý ngắt lời trong giọng nói | Improved |
| Khả năng chống nhiễu | Improved |
| Nhận dạng chữ-số | Improved |
| Luồng công việc thoại dựa trên công cụ | Supported |
| Tương tác thoại-sang-thoại | Supported |
Tính năng chính của GPT-Realtime-2.1
1. Tương tác thoại-sang-thoại nguyên bản
GPT-Realtime-2.1 loại bỏ nhu cầu về các chuỗi xử lý riêng cho nhận dạng giọng nói và chuyển văn bản thành giọng nói.
Kiến trúc giọng nói truyền thống:
User Voice
↓
Speech-to-Text
↓
LLM Processing
↓
Text-to-Speech
↓
Voice Response
GPT-Realtime-2.1:
User Voice
↓
GPT-Realtime-2.1
↓
Voice Response
Điều này giảm độ trễ và cải thiện dòng hội thoại.
2. Cải thiện chất lượng hội thoại giọng nói
GPT-Realtime-2.1 cải thiện nhiều thách thức giọng nói trong thực tế:
Khả năng xử lý ngắt lời tốt hơn
Người dùng có thể tự nhiên ngắt lời AI khi AI đang nói.
Ví dụ:
Người dùng:
"Đặt cho tôi một chuyến bay đến—thực ra đổi thành Tokyo."
Mô hình có thể phục hồi trước các thay đổi trong hội thoại mà không cần khởi động lại tương tác.
Xử lý khoảng lặng và nhiễu tốt hơn
Mô hình được tối ưu cho các môi trường có chất lượng âm thanh không hoàn hảo:
- Tổng đài
- Thiết bị di động
- Không gian công cộng
- Thiết bị thông minh
3. Sử dụng công cụ nâng cao cho tác nhân giọng nói
GPT-Realtime-2.1 hỗ trợ gọi công cụ, cho phép tác nhân giọng nói thực hiện hành động.
Ví dụ:
Chăm sóc khách hàng:
User:
"Where is my order?"
AI:
→ Calls order database API
→ Retrieves status
→ Responds by voice
Luồng công việc doanh nghiệp:
Voice command
↓
Reasoning
↓
API execution
↓
Voice confirmation
Điều này giúp GPT-Realtime-2.1 phù hợp cho các tác nhân giọng nói tự động.
4. Khả năng lập luận có thể cấu hình
Khác với các mô hình giọng nói thời gian thực trước đây vốn được tối ưu chủ yếu cho tốc độ, GPT-Realtime-2.1 giới thiệu nỗ lực lập luận có thể cấu hình.
Nhà phát triển có thể cân bằng giữa:
- Độ trễ phản hồi
- Độ chính xác
- Độ phức tạp nhiệm vụ
Mức lập luận thấp:
- Hội thoại đơn giản
- Trợ lý FAQ
Mức lập luận cao hơn:
- Yêu cầu khách hàng phức tạp
- Luồng công việc nhiều bước
- Vận hành doanh nghiệp
5. Nhận dạng tốt hơn các số và thông tin kỹ thuật
Các tác nhân giọng nói thường gặp khó với:
- Số tài khoản
- Số seri
- Địa chỉ
- Mã sản phẩm
- Thông tin tài chính
GPT-Realtime-2.1 cải thiện nhận dạng chữ-số, giúp phù hợp hơn với hệ thống giọng nói cho doanh nghiệp.
6. Hỗ trợ đầu vào đa phương thức
GPT-Realtime-2.1 hỗ trợ:
| Đầu vào | Hỗ trợ |
|---|---|
| Text | ✅ |
| Audio | ✅ |
| Image | ✅ |
| Video | ❌ |
Đầu vào hình ảnh cho phép các tình huống như:
- Hỗ trợ khách hàng bằng hình ảnh
- Diễn giải tài liệu
- Trợ lý dựa trên camera
GPT-Realtime-2.1 so với GPT-Realtime-2 và GPT-4o Realtime
| Mô hình | Thế mạnh | Mục đích tốt nhất |
|---|---|---|
| GPT-Realtime-2.1 | Lập luận thời gian thực tốt nhất + khả năng tác nhân giọng nói | Tác nhân giọng nói cho môi trường sản xuất |
| GPT-Realtime-2 | Lập luận giọng nói thời gian thực mạnh | Ứng dụng hội thoại nâng cao |
| GPT-4o Realtime | Tương tác đa phương thức nhanh | Trợ lý giọng nói chung |
GPT-Realtime-2.1 so với GPT-Realtime-2
GPT-Realtime-2.1 cải thiện:
- Khả năng phục hồi khi bị ngắt lời
- Xử lý nhiễu
- Độ chính xác nhận dạng
- Độ vững chắc trong hội thoại
Cả hai mô hình đều có:
- Kiến trúc thoại-sang-thoại
- Gọi công cụ
- Hỗ trợ lập luận
- Truy cập Realtime API
GPT-Realtime-2.1 so với GPT-4o Realtime
GPT-Realtime-2.1 được định vị cho các luồng tác nhân nâng cao hơn.
So với GPT-4o Realtime:
| Khả năng | GPT-Realtime-2.1 | GPT-4o Realtime |
|---|---|---|
| Lập luận | Mạnh hơn | Tổng quát |
| Ngữ cảnh | 128K | 32K |
| Sử dụng công cụ | Được hỗ trợ | Được hỗ trợ |
| Tác nhân giọng nói | Nâng cao | Tổng quát |
| Luồng công việc phức tạp | Phù hợp hơn | Phù hợp |
Cách sử dụng API GPT-Realtime-2.1 với CometAPI
GPT-Realtime-2.1 được thiết kế cho các ứng dụng tác nhân giọng nói độ trễ thấp. Mô hình hỗ trợ tương tác thoại-sang-thoại thời gian thực, đầu vào/đầu ra âm thanh, đầu vào hình ảnh, nỗ lực lập luận có thể cấu hình và gọi hàm cho các luồng công việc giọng nói có công cụ. OpenAI cung cấp qua Realtime API, bao gồm các phương thức giao tiếp thời gian thực dựa trên WebRTC, WebSocket và SIP.
CometAPI cung cấp một lớp API hợp nhất để tích hợp các mô hình AI tiên tiến, cho phép nhà phát triển truy cập các luồng công việc kiểu GPT-Realtime-2.1 mà không cần duy trì xác thực nhà cung cấp riêng, logic SDK và hạ tầng.
Bước 1: Lấy khóa API CometAPI
Tạo tài khoản CometAPI và tạo mã thông báo API từ bảng điều khiển nhà phát triển.
Yêu cầu API của bạn cần bao gồm:
Authorization: Bearer YOUR_COMETAPI_API_KEY
Content-Type: application/json
Khóa API xác thực yêu cầu của bạn và cho phép ứng dụng gọi các mô hình AI khả dụng qua CometAPI.
Bước 2: Tạo phiên GPT-Realtime-2.1
GPT-Realtime-2.1 hoạt động thông qua phiên thời gian thực liên tục thay vì hoàn thành chat theo kiểu yêu cầu-phản hồi truyền thống.
Một phiên thời gian thực duy trì:
- Luồng đầu vào âm thanh
- Phản hồi của mô hình
- Trạng thái hội thoại
- Gọi công cụ
- Ngắt lời
Realtime API của OpenAI hỗ trợ giao tiếp thời gian thực qua các giao diện WebRTC, WebSocket và SIP.
Ví dụ:
curl https://api.cometapi.com/v1/realtime/sessions \
-H "Authorization: Bearer YOUR_COMETAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '
{
"model": "gpt-realtime-2.1",
"modalities": [
"audio",
"text"
],
"voice": "alloy",
"instructions": "You are a helpful customer support voice assistant."
}
'
Phản hồi ví dụ:
{
"id": "sess_xxxxx",
"model": "gpt-realtime-2.1",
"status": "active"
}
Bước 3: Gửi đầu vào âm thanh đến GPT-Realtime-2.1
Sau khi tạo phiên, hãy truyền âm thanh của người dùng.
Luồng công việc ví dụ:
User microphone
|
↓
Audio stream
|
↓
GPT-Realtime-2.1
|
↓
Generated voice response
Đầu vào âm thanh có thể bao gồm:
- Cuộc gọi điện thoại
- Lệnh giọng nói
- Cuộc gọi hỗ trợ khách hàng
- Trợ lý tương tác
GPT-Realtime-2.1 cải thiện tương tác giọng nói với khả năng phát hiện khoảng lặng, xử lý nhiễu và hành vi ngắt lời tốt hơn so với các mô hình thời gian thực trước đó.
Bước 4: Nhận phản hồi âm thanh thời gian thực
Mô hình trả về phản hồi âm thanh được tạo qua kết nối thời gian thực.
Sự kiện ví dụ:
{
"type": "response.audio.delta",
"delta": "base64_audio_chunk"
}
Ứng dụng của bạn có thể phát ngay các đoạn âm thanh nhận được.
Triển khai điển hình:
- Ứng dụng giọng nói WebRTC
- Trợ lý dựa trên trình duyệt
- Ứng dụng giọng nói trên di động
- Tác nhân AI qua điện thoại
Bước 5: Thêm gọi hàm cho tác nhân giọng nói
GPT-Realtime-2.1 hỗ trợ gọi hàm, cho phép tác nhân giọng nói thực thi các hành động bên ngoài.
Ví dụ:
{
"tools": [
{
"type": "function",
"name": "check_order_status",
"description": "Retrieve customer order information",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
}
}
}
]
}
Các luồng tác nhân giọng nói có thể có:
- "Gói hàng của tôi ở đâu?"
- "Đặt cho tôi một cuộc họp vào ngày mai."
- "Hủy đăng ký của tôi."
- "Kiểm tra số dư tài khoản của tôi."
Mô hình có thể nhận diện yêu cầu, gọi công cụ phù hợp và tiếp tục hội thoại một cách tự nhiên.
Bước 6: Cấu hình lập luận và hướng dẫn
GPT-Realtime-2.1 hỗ trợ nỗ lực lập luận có thể cấu hình.
Ví dụ:
{
"model": "gpt-realtime-2.1",
"reasoning": {
"effort": "medium"
},
"instructions": "Act as a professional travel assistant."
}
Thiết lập khuyến nghị:
| Ứng dụng | Mức lập luận |
|---|---|
| Lệnh giọng nói đơn giản | Thấp |
| Hỗ trợ khách hàng | Trung bình |
| Tác nhân luồng công việc phức tạp | Cao |