Thông số kỹ thuật của gpt-audio-1.5
| Mục | gpt-audio-1.5 (thông số công khai) |
|---|---|
| Dòng mô hình | Họ GPT Audio (biến thể ưu tiên âm thanh) |
| Loại đầu vào | Văn bản, âm thanh (giọng nói vào) |
| Loại đầu ra | Văn bản, âm thanh (giọng nói ra), đầu ra có cấu trúc (hỗ trợ gọi hàm) |
| Cửa sổ ngữ cảnh | 128,000 token. |
| Số token đầu ra tối đa | 16,384 (được ghi trong danh sách gpt-audio liên quan). |
| Mức hiệu năng | Mức thông minh cao hơn; Tốc độ trung bình (cân bằng). |
| Hồ sơ độ trễ | Tối ưu cho tương tác giọng nói (độ trễ trung bình/thấp tùy endpoint). |
| Khả dụng | Chat Completions API (audio in/out) và playground của nền tảng; tích hợp trên các bề mặt realtime/giọng nói chính thức. |
| Ghi chú an toàn / sử dụng | Hàng rào bảo vệ cho nội dung giọng nói; xử lý đầu ra của mô hình theo tiêu chuẩn an toàn và xác minh thông thường cho agent giọng nói trong sản xuất. |
Lưu ý:
gpt-realtime-1.5là biến thể thời gian thực liên quan chặt chẽ, ưu tiên âm thanh/giọng nói, được tối ưu cho độ trễ thấp hơn và các phiên realtime; xem so sánh bên dưới.
gpt-audio-1.5 là gì?
gpt-audio-1.5 là một mô hình GPT hỗ trợ âm thanh, hỗ trợ cả đầu vào và đầu ra giọng nói thông qua Chat Completions và các API hỗ trợ âm thanh liên quan. Mô hình này được định vị là lựa chọn âm thanh sẵn dùng chủ đạo để xây dựng agent giọng nói và trải nghiệm ưu tiên giọng nói, cân bằng giữa chất lượng và tốc độ.
Các tính năng chính
- Hỗ trợ giọng nói vào/ra: Xử lý đầu vào dạng lời nói và trả về phản hồi dạng giọng nói hoặc văn bản cho luồng hội thoại tự nhiên.
- Ngữ cảnh lớn cho quy trình âm thanh: Hỗ trợ ngữ cảnh rất lớn (ghi nhận 128k token), cho phép nhiều lượt thoại, lịch sử hội thoại dài hoặc phiên đa phương thức lớn.
- Tương thích Streaming & Chat Completions: Hoạt động trong Chat Completions với phản hồi âm thanh dạng streaming và đầu ra có cấu trúc qua lời gọi hàm.
- Hiệu năng/độ trễ cân bằng: Điều chỉnh để cung cấp phản hồi âm thanh chất lượng cao ở thông lượng trung bình—phù hợp cho chatbot và trợ lý giọng nói nơi chất lượng quan trọng.
- Hệ sinh thái & tích hợp: Được hỗ trợ trong playground của nền tảng và khả dụng trên các endpoint realtime/giọng nói chính thức cùng tích hợp đối tác (ghi chú Azure/Microsoft Foundry tham chiếu các mô hình âm thanh tương tự).
gpt-audio-1.5 so với các mô hình âm thanh liên quan
| Thuộc tính | gpt-audio-1.5 | gpt-realtime-1.5 |
|---|---|---|
| Trọng tâm chính | Âm thanh vào/ra chất lượng cao cho Chat Completions và các luồng hội thoại. | S2S thời gian thực (speech-to-speech) với độ trễ thấp hơn cho agent giọng nói trực tiếp và các kịch bản streaming. |
| Cửa sổ ngữ cảnh | 128k tokens. | 32k tokens (biến thể realtime được ghi nhận). |
| Số token đầu ra tối đa | 16,384 (được ghi nhận). | Thường cấu hình cho phản hồi thời gian thực ngắn hơn (tài liệu liệt kê số token tối đa nhỏ hơn). |
| Phù hợp nhất | Chatbot, trợ lý hỗ trợ giọng nói nơi cần đầy đủ ngữ nghĩa chat + âm thanh. | Agent giọng nói trực tiếp, kiosk và giao diện hội thoại độ trễ thấp. |
Trường hợp sử dụng tiêu biểu
- Agent giọng nói hội thoại cho hỗ trợ khách hàng và bàn trợ giúp nội bộ.
- Trợ lý hỗ trợ giọng nói được nhúng trong ứng dụng, thiết bị và kiosk.
- Quy trình rảnh tay (nhập liệu bằng giọng nói, tìm kiếm bằng giọng nói, hỗ trợ tiếp cận).
- Trải nghiệm đa phương thức kết hợp âm thanh với văn bản/hình ảnh thông qua Chat Completions.
Giới hạn & lưu ý vận hành
- Không phải giải pháp thay thế trực tiếp cho kiểm thử chất lượng do con người: Luôn xác thực đầu ra giọng nói và các hành động hạ nguồn bằng rà soát của con người trong quy trình sản xuất.
- Lập kế hoạch tài nguyên: Ngữ cảnh lớn và I/O âm thanh có thể tăng tải tính toán và độ trễ—hãy thiết kế chiến lược streaming/chia đoạn cho các phiên dài.
- Ràng buộc an toàn & chính sách: Đầu ra giọng nói có thể mang tính thuyết phục; tuân thủ hướng dẫn an toàn của nền tảng và các hàng rào bảo vệ khi triển khai ở quy mô lớn.
- Cách truy cập API GPT Audio 1.5
Bước 1: Đăng ký để lấy API Key
Đăng nhập vào cometapi.com. Nếu bạn chưa là người dùng của chúng tôi, vui lòng đăng ký trước. Đăng nhập vào CometAPI console. Lấy API key thông tin xác thực truy cập của giao diện. Nhấp “Add Token” tại mục API token trong trung tâm cá nhân, lấy khóa token: sk-xxxxx và gửi.

Bước 2: Gửi yêu cầu đến API GPT Audio 1.5
Chọn endpoint “gpt-audio-1.5” để gửi yêu cầu API và thiết lập nội dung body yêu cầu. Phương thức yêu cầu và body được lấy từ tài liệu API trên trang web của chúng tôi. Trang web cũng cung cấp Apifox để bạn thử nghiệm. Thay thế <YOUR_API_KEY> bằng khóa CometAPI thực tế từ tài khoản của bạn. URL cơ sở là Chat Completions
Chèn câu hỏi hoặc yêu cầu của bạn vào trường content—đây là phần mà mô hình sẽ phản hồi. Xử lý phản hồi API để lấy câu trả lời được tạo ra.
Bước 3: Truy xuất và xác minh kết quả
Xử lý phản hồi API để lấy câu trả lời được tạo. Sau khi xử lý, API sẽ phản hồi trạng thái tác vụ và dữ liệu đầu ra.