Spesifikasi Teknikal GPT-Realtime-2.1
| Spesifikasi | Butiran |
|---|---|
| Nama model | GPT-Realtime-2.1 |
| Penyedia | OpenAI |
| Keluarga model | Siri GPT-Realtime |
| Jenis model | Model penaakulan suara multimodal masa nyata |
| Keupayaan utama | Ejen AI pertuturan-ke-pertuturan |
| Mod input | Teks, Audio, Imej |
| Mod output | Teks, Audio |
| Tetingkap konteks | 128,000 token |
| Token output maksimum | 32,000 token |
| Sokongan penaakulan | Usaha penaakulan boleh dikonfigurasi |
| Panggilan fungsi | Disokong |
| Output berstruktur | Tidak disokong |
| Penalaan halus | Tidak disokong |
| Input video | Tidak disokong |
| Titik akhir API utama | Realtime API |
| Had pengetahuan | 30 September 2024 |
Sumber: dokumentasi model OpenAI GPT-Realtime-2.1.
Apakah GPT-Realtime-2.1?
GPT-Realtime-2.1 ialah model suara masa nyata lanjutan daripada OpenAI yang direka untuk membina ejen AI perbualan yang boleh mendengar, membuat penaakulan, dan bertindak balas secara semula jadi melalui audio.
Berbanding pembantu suara tradisional yang bergantung pada rantaian pemprosesan berasingan untuk pengecaman pertuturan, pemahaman bahasa dan teks-ke-pertuturan, GPT-Realtime-2.1 menyediakan interaksi pertuturan-ke-pertuturan asli, membolehkan perbualan dengan kependaman lebih rendah serta pengendalian gangguan dan pemahaman konteks yang lebih baik.
Model ini dioptimumkan untuk aplikasi suara peringkat produksi termasuk ejen khidmat pelanggan, pembantu AI, automasi jualan, platform pendidikan dan pengalaman suara interaktif.
Prestasi Penanda Aras GPT-Realtime-2.1
Penambahbaikan GPT-Realtime-2.1 memfokuskan pada metrik interaksi masa nyata yang praktikal:
| Keupayaan | Penambahbaikan |
|---|---|
| Pengendalian gangguan suara | Dipertingkat |
| Ketahanan terhadap hingar | Dipertingkat |
| Pengecaman abjad angka | Dipertingkat |
| Aliran kerja suara berasaskan alat | Disokong |
| Interaksi pertuturan-ke-pertuturan | Disokong |
Ciri Utama GPT-Realtime-2.1
1. Interaksi Pertuturan-ke-Pertuturan Asli
GPT-Realtime-2.1 menghapuskan keperluan rantaian pemprosesan berasingan bagi pengecaman pertuturan dan teks-ke-pertuturan.
Seni bina suara tradisional:
User Voice
↓
Speech-to-Text
↓
LLM Processing
↓
Text-to-Speech
↓
Voice Response
GPT-Realtime-2.1:
User Voice
↓
GPT-Realtime-2.1
↓
Voice Response
Ini mengurangkan kependaman dan memperbaiki aliran perbualan.
2. Kualiti Perbualan Suara yang Dipertingkat
GPT-Realtime-2.1 memperbaiki beberapa cabaran suara dunia sebenar:
Pengendalian gangguan yang lebih baik
Pengguna boleh mengganggu AI secara semula jadi ketika ia sedang bercakap.
Contoh:
Pengguna:
"Tempahkan saya penerbangan ke—sebenarnya tukar kepada Tokyo."
Model boleh pulih daripada perubahan perbualan tanpa memulakan semula interaksi.
Pengendalian kesenyapan dan hingar yang lebih baik
Model dioptimumkan untuk persekitaran di mana kualiti audio tidak sempurna:
- Pusat panggilan
- Peranti mudah alih
- Ruang awam
- Peranti pintar
3. Penggunaan Alat Ejen Suara Lanjutan
GPT-Realtime-2.1 menyokong pemanggilan alat, membolehkan ejen suara melaksanakan tindakan.
Contoh:
Khidmat pelanggan:
User:
"Where is my order?"
AI:
→ Calls order database API
→ Retrieves status
→ Responds by voice
Aliran kerja perusahaan:
Voice command
↓
Reasoning
↓
API execution
↓
Voice confirmation
Ini menjadikan GPT-Realtime-2.1 sesuai untuk ejen suara autonomi.
4. Keupayaan Penaakulan Boleh Dikonfigurasi
Berbeza dengan model suara masa nyata terdahulu yang dioptimumkan terutamanya untuk kelajuan, GPT-Realtime-2.1 memperkenalkan usaha penaakulan yang boleh dikonfigurasi.
Pembangun boleh mengimbangi:
- Kependaman respons
- Ketepatan
- Kerumitan tugas
Penaakulan rendah:
- Perbualan ringkas
- Pembantu Soalan Lazim
Penaakulan lebih tinggi:
- Permintaan pelanggan yang kompleks
- Aliran kerja berbilang langkah
- Operasi perniagaan
5. Pengecaman Nombor dan Maklumat Teknikal yang Lebih Baik
Ejen suara sering menghadapi kesukaran dengan:
- Nombor akaun
- Nombor siri
- Alamat
- Kod produk
- Maklumat kewangan
GPT-Realtime-2.1 meningkatkan pengecaman abjad angka, menjadikannya lebih sesuai untuk sistem suara perusahaan.
6. Sokongan Input Multimodal
GPT-Realtime-2.1 menyokong:
| Input | Sokongan |
|---|---|
| Teks | ✅ |
| Audio | ✅ |
| Imej | ✅ |
| Video | ❌ |
Input imej membolehkan senario seperti:
- Sokongan pelanggan visual
- Tafsiran dokumen
- Pembantu berasaskan kamera
GPT-Realtime-2.1 vs GPT-Realtime-2 vs GPT-4o Realtime
| Model | Kekuatan | Kegunaan Terbaik |
|---|---|---|
| GPT-Realtime-2.1 | Penaakulan masa nyata terbaik + keupayaan ejen suara | Ejen suara peringkat produksi |
| GPT-Realtime-2 | Penaakulan suara masa nyata yang kukuh | Aplikasi perbualan lanjutan |
| GPT-4o Realtime | Interaksi multimodal pantas | Pembantu suara umum |
GPT-Realtime-2.1 vs GPT-Realtime-2
GPT-Realtime-2.1 memperbaiki:
- Pemulihan selepas gangguan suara
- Pengendalian hingar
- Ketepatan pengecaman
- Keteguhan perbualan
Kedua-dua model berkongsi:
- Seni bina pertuturan-ke-pertuturan
- Pemanggilan alat
- Sokongan penaakulan
- Akses API Realtime
GPT-Realtime-2.1 vs GPT-4o Realtime
GPT-Realtime-2.1 diposisikan untuk aliran kerja ejen yang lebih maju.
Berbanding GPT-4o Realtime:
| Keupayaan | GPT-Realtime-2.1 | GPT-4o Realtime |
|---|---|---|
| Penaakulan | Lebih kuat | Umum |
| Konteks | 128K | 32K |
| Penggunaan alat | Disokong | Disokong |
| Ejen suara | Maju | Umum |
| Aliran kerja kompleks | Lebih sesuai | Sesuai |
Cara Menggunakan API GPT-Realtime-2.1 dengan CometAPI
GPT-Realtime-2.1 direka untuk aplikasi ejen suara berpendam masa rendah. Ia menyokong interaksi pertuturan-ke-pertuturan masa nyata, input/output audio, input imej, usaha penaakulan boleh dikonfigurasi, serta panggilan fungsi untuk aliran kerja suara berasaskan alat. OpenAI mendedahkannya melalui Realtime API, termasuk kaedah komunikasi masa nyata berasaskan WebRTC, WebSocket dan SIP.
CometAPI menyediakan lapisan API bersepadu untuk mengintegrasikan model AI termaju, membolehkan pembangun mengakses aliran kerja gaya GPT-Realtime-2.1 tanpa menyelenggara pengesahan penyedia, logik SDK dan infrastruktur yang berasingan.
Langkah 1: Dapatkan Kunci API CometAPI Anda
Cipta akaun CometAPI dan jana token API daripada konsol pembangun.
Permintaan API anda hendaklah merangkumi:
Authorization: Bearer YOUR_COMETAPI_API_KEY
Content-Type: application/json
Kunci API mengesahkan permintaan anda dan membolehkan aplikasi anda memanggil model AI yang tersedia melalui CometAPI.
Langkah 2: Cipta Sesi GPT-Realtime-2.1
GPT-Realtime-2.1 berfungsi melalui sesi masa nyata yang berterusan, bukannya penyempurnaan sembang permintaan-respons tradisional.
Sesi masa nyata mengekalkan:
- Aliran input audio
- Respons model
- Keadaan perbualan
- Panggilan alat
- Gangguan
Realtime API OpenAI menyokong komunikasi masa nyata melalui antaramuka WebRTC, WebSocket dan SIP.
Contoh:
curl https://api.cometapi.com/v1/realtime/sessions \
-H "Authorization: Bearer YOUR_COMETAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '
{
"model": "gpt-realtime-2.1",
"modalities": [
"audio",
"text"
],
"voice": "alloy",
"instructions": "You are a helpful customer support voice assistant."
}
'
Respons contoh:
{
"id": "sess_xxxxx",
"model": "gpt-realtime-2.1",
"status": "active"
}
Langkah 3: Hantar Input Audio ke GPT-Realtime-2.1
Selepas mencipta sesi, strim audio pengguna.
Aliran kerja contoh:
User microphone
|
↓
Audio stream
|
↓
GPT-Realtime-2.1
|
↓
Generated voice response
Input audio boleh merangkumi:
- Perbualan telefon
- Arahan suara
- Panggilan sokongan pelanggan
- Pembantu interaktif
GPT-Realtime-2.1 meningkatkan interaksi pertuturan dengan pengesanan senyap yang lebih baik, pengendalian hingar, dan tingkah laku gangguan berbanding model masa nyata terdahulu.
Langkah 4: Terima Respons Audio Masa Nyata
Model memulangkan respons audio yang dijana melalui sambungan masa nyata.
Peristiwa contoh:
{
"type": "response.audio.delta",
"delta": "base64_audio_chunk"
}
Aplikasi anda boleh serta-merta memainkan cebisan audio yang diterima.
Pelaksanaan tipikal:
- Aplikasi suara WebRTC
- Pembantu berasaskan pelayar
- Apl suara mudah alih
- Ejen telefon AI
Langkah 5: Tambah Panggilan Fungsi untuk Ejen Suara
GPT-Realtime-2.1 menyokong panggilan fungsi, membolehkan ejen suara melaksanakan tindakan luaran.
Contoh:
{
"tools": [
{
"type": "function",
"name": "check_order_status",
"description": "Retrieve customer order information",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
}
}
}
]
}
Aliran kerja ejen suara yang berpotensi:
- "Di mana bungkusan saya?"
- "Tempahkan mesyuarat untuk saya esok."
- "Batalkan langganan saya."
- "Semak baki akaun saya."
Model boleh mengenal pasti permintaan, memanggil alat yang sesuai, dan meneruskan perbualan secara semula jadi.
Langkah 6: Konfigurasikan Penaakulan dan Arahan
GPT-Realtime-2.1 menyokong usaha penaakulan yang boleh dikonfigurasi.
Contoh:
{
"model": "gpt-realtime-2.1",
"reasoning": {
"effort": "medium"
},
"instructions": "Act as a professional travel assistant."
}
Tetapan yang disyorkan:
| Aplikasi | Tahap penaakulan |
|---|---|
| Arahan suara ringkas | Rendah |
| Sokongan pelanggan | Sederhana |
| Ejen aliran kerja kompleks | Tinggi |