Spesifikasi teknikal gpt-audio-1.5
| Item | gpt-audio-1.5 (spesifikasi awam) |
|---|---|
| Model family | Keluarga GPT Audio (varian mengutamakan audio) |
| Input types | Teks, audio (pertuturan masuk) |
| Output types | Teks, audio (pertuturan keluar), output berstruktur (menyokong panggilan fungsi) |
| Context window | 128,000 token. |
| Max output tokens | 16,384 (didokumenkan dalam penyenaraian gpt-audio yang berkaitan). |
| Performance tier | Kepintaran lebih tinggi; Kelajuan sederhana (seimbang). |
| Latency profile | Dioptimumkan untuk interaksi suara (latensi sederhana/rendah bergantung pada endpoint). |
| Availability | Chat Completions API (audio masuk/keluar) dan platform playgrounds; disepadukan merentas permukaan masa nyata/suara. |
| Safety / usage notes | Garis panduan keselamatan untuk kandungan suara; perlakukan output model dengan langkah keselamatan dan pengesahan lazim bagi ejen suara produksi. |
Nota:
gpt-realtime-1.5ialah varian berkait rapat yang mengutamakan audio/suara masa nyata dengan latensi lebih rendah dan sesi masa nyata; bandingkan di bawah.
Apakah gpt-audio-1.5?
gpt-audio-1.5 ialah model GPT berkeupayaan audio yang menyokong input pertuturan dan output pertuturan melalui Chat Completions dan API berkebolehan audio yang berkaitan. Ia diposisikan sebagai model audio utama yang tersedia umum untuk membina ejen suara dan pengalaman yang mengutamakan pertuturan sambil mengimbangi kualiti dan kelajuan.
Ciri utama
- Sokongan input pertuturan / output pertuturan: Menangani input pertuturan dan mengembalikan respons pertuturan atau teks bagi aliran suara yang semula jadi.
- Konteks besar untuk aliran kerja audio: Menyokong konteks yang sangat besar (didokumenkan 128k token) bagi sejarah perbualan berbilang pusingan yang panjang atau sesi multimodal yang besar.
- Keserasian penstriman & Chat Completions: Berfungsi dalam Chat Completions dengan respons audio penstriman dan output berstruktur panggilan fungsi.
- Prestasi/latensi seimbang: Ditala untuk menyediakan respons audio berkualiti tinggi pada kadar sederhana—sesuai untuk bot sembang dan pembantu suara di mana kualiti penting.
- Ekosistem & integrasi: Disokong dalam playgrounds platform dan tersedia merentas endpoint rasmi masa nyata/suara serta integrasi rakan kongsi (nota Azure/Microsoft Foundry merujuk kepada model audio serupa).
gpt-audio-1.5 vs model audio berkaitan
| Ciri | gpt-audio-1.5 | gpt-realtime-1.5 |
|---|---|---|
| Tumpuan utama | Audio masuk/keluar berkualiti tinggi untuk Chat Completions dan aliran perbualan. | S2S masa nyata (pertuturan-ke-pertuturan) dengan latensi lebih rendah untuk ejen suara langsung dan senario penstriman. |
| Tetingkap konteks | 128k token. | 32k token (varian masa nyata didokumenkan). |
| Token output maks | 16,384 (didokumenkan). | Lazimnya dikonfigurasi untuk respons masa nyata yang lebih pendek (dokumen menyenaraikan had token maksimum yang lebih kecil). |
| Penggunaan terbaik | Bot sembang, pembantu berkeupayaan suara yang memerlukan semantik chat penuh + audio. | Ejen suara langsung, kiosk, dan antara muka perbualan berlatensi rendah. |
Kes penggunaan representatif
- Ejen suara perbualan untuk sokongan pelanggan dan meja bantuan dalaman.
- Pembantu berkeupayaan suara yang disepadukan dalam aplikasi, peranti, dan kiosk.
- Aliran kerja bebas tangan (dikte, carian suara, kebolehaksesan).
- Pengalaman multimodal yang menggabungkan audio dengan teks / imej melalui Chat Completions.
Keterbatasan & pertimbangan operasi
- Bukan pengganti serta-merta untuk QA manusia: Sentiasa sahkan output pertuturan dan tindakan hiliran dengan semakan manusia dalam aliran produksi.
- Perancangan sumber: Konteks besar dan I/O audio boleh meningkatkan pengiraan dan latensi—rangka strategi penstriman/segmentasi untuk sesi panjang.
- Kekangan keselamatan & dasar: Output suara mempunyai kuasa mempengaruhi; patuhi garis panduan keselamatan platform dan pengadang apabila melaksanakan pada skala.
- Cara mengakses API GPT Audio 1.5
Langkah 1: Daftar untuk Kunci API
Log masuk ke cometapi.com. Jika anda belum menjadi pengguna kami, sila daftar terlebih dahulu. Log masuk ke CometAPI console. Dapatkan kunci API kelayakan akses bagi antara muka. Klik “Add Token” pada token API di pusat peribadi, dapatkan kunci token: sk-xxxxx dan hantar.

Langkah 2: Hantar Permintaan ke API GPT Audio 1.5
Pilih endpoint “gpt-audio-1.5” untuk menghantar permintaan API dan tetapkan badan permintaan. Kaedah permintaan dan badan permintaan diperoleh daripada dokumen API laman web kami. Laman web kami juga menyediakan ujian Apifox untuk kemudahan anda. Gantikan <YOUR_API_KEY> dengan kunci CometAPI sebenar anda daripada akaun anda. URL asas ialah Chat Completions
Masukkan soalan atau permintaan anda ke dalam medan content—ini yang akan direspons oleh model. Proses respons API untuk mendapatkan jawapan yang dijana.
Langkah 3: Dapatkan dan Sahkan Keputusan
Proses respons API untuk mendapatkan jawapan yang dijana. Selepas diproses, API mengembalikan status tugasan dan data output.