Thông số kỹ thuật của GPT-Realtime-2
| Thông số | Chi tiết |
|---|---|
| Phát hành | 7 tháng 5, 2026 |
| API | Realtime API (GA) |
| Đầu vào | Âm thanh, Văn bản, Hình ảnh |
| Đầu ra | Âm thanh, Văn bản |
| Khả năng suy luận | Đẳng cấp GPT-5 |
| Truyền phát | Có |
| Song công đầy đủ | Có |
| Gọi hàm | Có |
| Đa phương thức | Có |
| Ngắt lời | Được hỗ trợ |
| Độ trễ thấp | Có |
| SLA doanh nghiệp | Có |
| Sẵn sàng sản xuất | Có |
GPT-Realtime-2 là gì
GPT-Realtime-2 đánh dấu một bước tiến lớn trong AI hội thoại bằng cách vượt qua các chuỗi xử lý giọng nói truyền thống để hướng tới kiến trúc thuần âm thanh với khả năng suy luận đẳng cấp GPT-5. Việc hỗ trợ truyền phát giọng nói, đầu vào đa phương thức, gọi hàm/công cụ và triển khai cấp doanh nghiệp khiến nó phù hợp cho các tác nhân giọng nói thế hệ mới, hỗ trợ khách hàng, chăm sóc sức khỏe, giáo dục và trợ lý thông minh.
Tính năng và điểm nổi bật của GPT-Realtime-2
1. Khả năng suy luận đẳng cấp GPT-5
Khác với các mô hình realtime trước đây, GPT-Realtime-2 có thể giải quyết:
- nhiệm vụ nhiều bước
- truy vấn đòi hỏi suy luận chuyên sâu
- lập kế hoạch
- lập lịch
- cuộc hội thoại phức tạp
thay vì chỉ đơn thuần tạo ra lời nói trôi chảy.
2. Độ trễ cực thấp
Thiết kế cho:
- tác nhân điện thoại
- trợ lý giọng nói
- dịch vụ khách hàng
- bạn đồng hành AI
Bản cập nhật tháng 7 năm 2026 giảm độ trễ p95 ít nhất 25%.
3. Gọi công cụ
Trong cuộc hội thoại trực tiếp, mô hình có thể:
- tìm kiếm cơ sở dữ liệu
- kiểm tra tồn kho
- truy vấn CRM
- truy xuất tài liệu
- thực thi API
- gọi các hàm tùy chỉnh
mà không cần kết thúc cuộc hội thoại.
4. Ngôn ngữ nói tự nhiên
Mô hình hỗ trợ:
- ngắt lời
- ngắt nghỉ tự nhiên
- nhịp điệu hội thoại
- từ đệm
- điều chỉnh thời gian theo cảm xúc
- tốc độ nói linh hoạt
khiến cuộc trò chuyện trở nên gần gũi hơn với đối thoại của con người.
5. Hiểu biết đa phương thức
Đầu vào có thể bao gồm:
- giọng nói
- văn bản
- hình ảnh
cho phép các tình huống như:
"Hãy xem hình ảnh này trong khi tôi đang giải thích vấn đề."
6. Độ tin cậy cho môi trường sản xuất
GA Realtime API bổ sung:
- hỗ trợ SLA
- SDK ổn định
- điểm cuối cho môi trường sản xuất
- triển khai cấp doanh nghiệp
vượt ra ngoài dịch vụ beta trước đây.
Hiệu năng đo chuẩn của GPT-Realtime-2
OpenAI nhấn mạnh các cải thiện định tính thay vì công bố một bộ đo chuẩn toàn diện cho GPT-Realtime-2. Các chỉ số được tiết lộ công khai bao gồm:
| Chỉ số | GPT-Realtime-2 |
|---|---|
| Nói-sang-nói | Bản địa |
| Khả năng suy luận đẳng cấp GPT-5 | Có |
| Gọi công cụ | Có |
| Hiểu hình ảnh | Có |
| Truyền phát | Có |
| SLA cho sản xuất | Có |
| Ngắt lời | Bản địa |
| Cải thiện độ trễ p95 (v2.1) | ≥25% |
GPT-Realtime-2 so với các mô hình thoại khác
| Tính năng | GPT-Realtime-2 | GPT-4o Realtime | Gemini Live | ElevenLabs Conversational AI |
|---|---|---|---|---|
| Âm thanh bản địa | ✅ | Một phần | Có | Không |
| Khả năng suy luận đẳng cấp GPT-5 | ✅ | Không | Không | Không |
| Gọi hàm | ✅ | Giới hạn | Giới hạn | Không |
| Đầu vào hình ảnh | ✅ | Có | Có | Không |
| API cấp doanh nghiệp | ✅ | Beta | Có | Có |
| Truyền phát | ✅ | Có | Có | Có |
| Song công đầy đủ | ✅ | Một phần | Có | Không |
| SLA cho sản xuất | ✅ | Không | Có | Không áp dụng |
GPT-Realtime-2 nổi bật nhờ kết hợp khả năng suy luận tiên tiến với tương tác giọng nói độ trễ thấp trong một API sẵn sàng cho sản xuất.
Hạn chế
- Chi phí token âm thanh cao hơn suy luận chỉ với văn bản.
- Các phiên thoại kéo dài cần quản lý băng thông và độ trễ cẩn trọng.
- Mặc dù các tín hiệu giọng nói được nhận diện, nghiên cứu độc lập cho thấy bối cảnh cảm xúc không phải lúc nào cũng được phản ánh nhất quán trong các quyết định tiếp theo, vì vậy sự giám sát của con người vẫn quan trọng trong các ứng dụng nhạy cảm.
Cách sử dụng API GPT-Realtime-2 trên CometAPI
CometAPI cung cấp cổng API hợp nhất cho phép nhà phát triển truy cập nhiều mô hình AI—bao gồm các mô hình realtime tương thích OpenAI—thông qua một giao diện nhất quán (tùy theo danh mục do nhà cung cấp hỗ trợ).
Quy trình điển hình:
Bước 1: Tạo tài khoản
Đăng ký trên nền tảng CometAPI và lấy khóa API.
Bước 2: Cấu hình xác thực
Đưa khóa API của bạn vào header của yêu cầu:
Authorization: Bearer YOUR_API_KEY
Bước 3: Chọn mô hình
Chỉ định định danh mô hình realtime (ví dụ, tên mô hình GPT-Realtime-2 được hỗ trợ bởi tài khoản CometAPI của bạn).
Bước 4: Thiết lập phiên realtime
Mở WebSocket hoặc kết nối realtime do API hỗ trợ để truyền phát âm thanh hai chiều.
Bước 5: Truyền phát âm thanh
Gửi âm thanh từ micro liên tục và nhận phản hồi giọng nói dạng stream, cho phép hội thoại độ trễ thấp.
Bước 6: Bật các tính năng nâng cao
Tùy theo triển khai của CometAPI, bạn có thể cấu hình:
- gọi hàm/công cụ
- bộ nhớ hội thoại
- đầu vào hình ảnh
- phát hiện hoạt động giọng nói
- xử lý ngắt lời
- mức độ suy luận (nếu được hỗ trợ)
Trước khi triển khai, hãy tham khảo tài liệu hiện tại của CometAPI để xác minh tên mô hình được hỗ trợ, điểm cuối, xác thực và chi tiết giao thức realtime, vì các yếu tố này có thể phát triển độc lập với API chính thức của OpenAI.