GPT-Realtime-2.1 updates GPT-Realtime-2 with improved alphanumeric recognition, silence and noise handling, and interruption behavior. It supports speech-to-speech interactions with configurable reasoning effort, instruction following, and tool use for complex voice-agent workflows.
Sử dụng ước tính nhanh ở trên cho một lần chạy, sau đó xem so sánh đầy đủ giữa CometAPI và giá chính thức.
Khám phá mức giá cạnh tranh cho GPT-Realtime-2.1, được thiết kế để phù hợp với nhiều ngân sách và nhu cầu sử dụng khác nhau. Các gói linh hoạt của chúng tôi đảm bảo bạn chỉ trả tiền cho những gì bạn sử dụng, giúp dễ dàng mở rộng quy mô khi yêu cầu của bạn tăng lên. Khám phá cách GPT-Realtime-2.1 có thể nâng cao các dự án của bạn trong khi vẫn kiểm soát được chi phí.
| Model | Comet Price (USD / M Tokens) | Official Price (USD / M Tokens) | Discount |
|---|---|---|---|
| gpt-realtime-2.1 | Đầu vào:$3.2/M Đầu ra:$19.2/M | Đầu vào:$4/M Đầu ra:$24/M | -20% |
| gpt-realtime-2.1-mini | Đầu vào:$0.48/M Đầu ra:$2.88/M | Đầu vào:$0.6/M Đầu ra:$3.6/M | -20% |
Sao chép một endpoint và ví dụ mã hoạt động, sau đó mở tài liệu tham khảo API đầy đủ khi bạn cần mọi tham số.
Xác thực một lần, gọi endpoint mô hình và duy trì cùng một quy trình thanh toán và giám sát trên các nhà cung cấp.
Truy cập mã mẫu toàn diện và tài nguyên API cho GPT-Realtime-2.1 để tối ưu hóa quy trình tích hợp của bạn. Tài liệu chi tiết của chúng tôi cung cấp hướng dẫn từng bước, giúp bạn khai thác toàn bộ tiềm năng của GPT-Realtime-2.1 trong các dự án của mình.
Xem các thông tin quan trọng của mô hình trước khi chọn kiến trúc hoặc ước tính tải cho môi trường thực tế.
Sử dụng GPT-Realtime-2.1 cho các quy trình môi trường thực tế phù hợp với khả năng audio của nó, sau đó so sánh các lựa chọn khác trước khi cam kết tích hợp lâu dài.
Tạo giọng nói, âm nhạc và âm thanh
Trải nghiệm giọng nói và sản xuất truyền thông
Quy trình âm thanh tự động ở quy mô lớn
So sánh các mô hình khác có sẵn qua CometAPI theo chất lượng, độ trễ, khả năng và giá cả.
Mô hình giọng nói tốt nhất cho đầu vào âm thanh, đầu ra âm thanh với Chat Completions.
GPT-Realtime-2 là mô hình giọng nói thời gian thực mạnh nhất của chúng tôi. Nó hỗ trợ các tương tác giọng nói sang giọng nói với mức độ lập luận có thể cấu hình, khả năng tuân thủ hướng dẫn tốt hơn và khả năng sử dụng công cụ đáng tin cậy hơn cho các quy trình làm việc phức tạp của tác nhân giọng nói.
Mô hình giọng nói tốt nhất cho đầu vào âm thanh, đầu ra âm thanh.
OpenAI Text-to-Speech
[Tổng hợp giọng nói] Mới ra mắt: chuyển văn bản thành âm thanh phát sóng trực tuyến, có chức năng xem trước ● Có thể đồng thời tạo audio_id, dùng được với bất kỳ Keling API nào.
Kling chuyển đổi video sang âm thanh
Xem dữ liệu heartbeat trực tiếp, tính khả dụng của endpoint và thời gian phản hồi thực đo trước khi triển khai thực tế.
Xem các mã định danh mô hình khả dụng trước khi cố định một tích hợp môi trường thực tế.