Thông số kỹ thuật của gpt-realtime-1.5
| Mục | gpt-realtime-1.5 (định vị công khai) |
|---|---|
| Họ mô hình | GPT Realtime 1.5 (biến thể tối ưu cho giọng nói) |
| Phương thức chính | Giọng nói sang giọng nói (S2S) |
| Loại đầu vào | Âm thanh (truyền phát), văn bản |
| Loại đầu ra | Âm thanh (truyền phát), văn bản, lời gọi công cụ có cấu trúc |
| API | Realtime API (WebRTC / phiên truyền phát liên tục) |
| Đặc tính độ trễ | Tối ưu cho độ trễ thấp, tương tác hội thoại trực tiếp |
| Mô hình phiên | Phiên truyền phát có trạng thái |
| Sử dụng công cụ | Hỗ trợ gọi hàm và tích hợp công cụ |
| Trường hợp sử dụng mục tiêu | Tác nhân giọng nói trực tiếp, trợ lý, hệ thống tương tác |
Lưu ý: Giới hạn token và kích thước cửa sổ ngữ cảnh chính xác không được ghi rõ ràng trong các bản tóm tắt công khai; mô hình được định vị cho khả năng phản hồi thời gian thực hơn là các phiên ngữ cảnh cực dài.
gpt-realtime-1.5 là gì?
gpt-realtime-1.5 là một mô hình tối ưu cho độ trễ thấp, giọng nói-đến-giọng nói, được thiết kế cho các hệ thống hội thoại trực tiếp. Khác với các mô hình yêu cầu-đáp ứng truyền thống, nó vận hành thông qua các phiên truyền phát liên tục, cho phép luân phiên lượt nói tự nhiên, xử lý ngắt lời và tương tác giọng nói linh hoạt.
Mô hình được xây dựng chuyên biệt cho các ứng dụng trong đó tốc độ luồng hội thoại quan trọng hơn độ dài ngữ cảnh tối đa.
Các tính năng chính
- Tương tác giọng nói-đến-giọng nói thực sự — Nhận đầu vào âm thanh trực tiếp và phát luồng phản hồi bằng giọng nói theo thời gian thực.
- Kiến trúc độ trễ thấp — Được thiết kế để đạt khả năng phản hồi dưới một giây cho tác nhân giọng nói.
- Thiết kế ưu tiên truyền phát — Hoạt động qua các phiên liên tục (WebRTC hoặc giao thức truyền phát).
- Luân phiên lượt nói tự nhiên — Hỗ trợ xử lý ngắt lời và luồng hội thoại linh hoạt.
- Hỗ trợ gọi công cụ — Có thể kích hoạt các lời gọi hàm có cấu trúc trong phiên thời gian thực.
- Nền tảng tác nhân giọng nói sẵn sàng cho sản xuất — Xây dựng riêng cho trợ lý tương tác, ki-ốt và thiết bị nhúng.
Chuẩn đánh giá & định vị hiệu năng
OpenAI định vị gpt-realtime-1.5 là bản nâng cấp của các mô hình thời gian thực trước đó với khả năng tuân thủ chỉ dẫn tốt hơn, ổn định hơn trong các phiên thoại kéo dài và ngữ điệu tự nhiên hơn so với các phát hành trước.
Khác với các mô hình tập trung vào lập trình (ví dụ, biến thể Codex), hiệu năng được đo lường chủ yếu bằng độ trễ hội thoại, độ tự nhiên của giọng nói và độ ổn định phiên hơn là các bảng xếp hạng kiểu leaderboard.
gpt-realtime-1.5 so với các mô hình liên quan
| Tính năng | gpt-realtime-1.5 | gpt-audio-1.5 |
|---|---|---|
| Mục tiêu chính | Tương tác giọng nói trực tiếp | Luồng trò chuyện hỗ trợ âm thanh |
| Độ trễ | Tối ưu cho độ trễ tối thiểu | Cân bằng giữa chất lượng/tốc độ |
| Loại phiên | Phiên truyền phát liên tục | Luồng Chat Completions tiêu chuẩn |
| Kích thước ngữ cảnh | Tối ưu cho khả năng phản hồi | Hỗ trợ ngữ cảnh lớn hơn |
| Trường hợp sử dụng phù hợp nhất | Tác nhân giọng nói thời gian thực | Trợ lý hội thoại có hỗ trợ âm thanh |
Khi nào chọn từng mô hình
- Chọn
gpt-realtime-1.5cho trung tâm cuộc gọi, ki-ốt, lễ tân AI hoặc trợ lý nhúng trực tiếp. - Chọn
gpt-audio-1.5cho ứng dụng trò chuyện hỗ trợ giọng nói cần bộ nhớ hội thoại dài hơn hoặc quy trình đa phương thức.
Trường hợp sử dụng tiêu biểu
- Tác nhân tổng đài AI
- Trợ lý cho thiết bị thông minh
- Ki-ốt tương tác
- Hệ thống gia sư trực tiếp
- Công cụ luyện ngôn ngữ thời gian thực
- Ứng dụng điều khiển bằng giọng nói
- Cách truy cập API GPT realtime 1.5
Bước 1: Đăng ký lấy khóa API
Đăng nhập vào cometapi.com. Nếu bạn chưa là người dùng của chúng tôi, vui lòng đăng ký trước. Đăng nhập vào Bảng điều khiển CometAPI. Lấy khóa API (thông tin xác thực truy cập) cho giao diện. Nhấp “Add Token” tại mục API token trong trung tâm cá nhân, lấy khóa token: sk-xxxxx và gửi.

Bước 2: Gửi yêu cầu tới API GPT realtime 1.5
Chọn endpoint “gpt-realtime-1.5” để gửi yêu cầu API và thiết lập phần thân yêu cầu. Phương thức yêu cầu và nội dung yêu cầu lấy từ tài liệu API trên trang web của chúng tôi. Trang web của chúng tôi cũng cung cấp Apifox test để bạn tiện thử nghiệm. Thay <YOUR_API_KEY> bằng khóa CometAPI thực của bạn từ tài khoản. URL cơ sở là Chat Completions
Chèn câu hỏi hoặc yêu cầu của bạn vào trường content — đây là nội dung mô hình sẽ phản hồi. Xử lý phản hồi API để lấy câu trả lời được tạo.
Bước 3: Truy xuất và xác minh kết quả
Xử lý phản hồi API để lấy câu trả lời được tạo. Sau khi xử lý, API phản hồi với trạng thái tác vụ và dữ liệu đầu ra.