Spesifikasi Teknis GPT-Realtime-2.1
| Spesifikasi | Rincian |
|---|---|
| Nama model | GPT-Realtime-2.1 |
| Penyedia | OpenAI |
| Keluarga model | Seri GPT-Realtime |
| Jenis model | Model penalaran suara multimodal waktu nyata |
| Kemampuan utama | Agen AI suara-ke-suara |
| Modalitas input | Teks, Audio, Gambar |
| Modalitas output | Teks, Audio |
| Jendela konteks | 128,000 tokens |
| Token keluaran maksimum | 32,000 tokens |
| Dukungan penalaran | Upaya penalaran yang dapat dikonfigurasi |
| Panggilan fungsi | Didukung |
| Keluaran terstruktur | Tidak didukung |
| Fine-tuning | Tidak didukung |
| Input video | Tidak didukung |
| Endpoint API utama | Realtime API |
| Batas pengetahuan | September 30, 2024 |
Sumber: Dokumentasi model OpenAI GPT-Realtime-2.1.
Apa itu GPT-Realtime-2.1?
GPT-Realtime-2.1 adalah model suara real-time canggih dari OpenAI yang dirancang untuk membangun agen AI percakapan yang dapat mendengarkan, melakukan penalaran, dan merespons secara alami melalui audio.
Dibandingkan dengan asisten suara tradisional yang mengandalkan pipeline terpisah untuk pengenalan ucapan, pemahaman bahasa, dan text-to-speech, GPT-Realtime-2.1 menyediakan interaksi suara-ke-suara native, memungkinkan percakapan berlatensi lebih rendah dengan penanganan interupsi dan pemahaman konteks yang lebih baik.
Model ini dioptimalkan untuk aplikasi suara produksi termasuk agen layanan pelanggan, asisten AI, otomasi penjualan, platform edukasi, dan pengalaman suara interaktif.
Kinerja Benchmark GPT-Realtime-2.1
Peningkatan GPT-Realtime-2.1 berfokus pada metrik interaksi real-time yang praktis:
| Kemampuan | Peningkatan |
|---|---|
| Penanganan interupsi suara | Meningkat |
| Ketahanan terhadap kebisingan | Meningkat |
| Pengenalan alfanumerik | Meningkat |
| Alur kerja suara berbasis alat | Didukung |
| Interaksi suara-ke-suara | Didukung |
Fitur Utama GPT-Realtime-2.1
1. Interaksi Suara-ke-Suara Natif
GPT-Realtime-2.1 menghilangkan kebutuhan akan pipeline terpisah untuk pengenalan ucapan dan text-to-speech.
Arsitektur suara tradisional:
User Voice
↓
Speech-to-Text
↓
LLM Processing
↓
Text-to-Speech
↓
Voice Response
GPT-Realtime-2.1:
User Voice
↓
GPT-Realtime-2.1
↓
Voice Response
Ini mengurangi latensi dan meningkatkan kelancaran percakapan.
2. Kualitas Percakapan Suara yang Ditingkatkan
GPT-Realtime-2.1 meningkatkan beberapa tantangan suara di dunia nyata:
Penanganan interupsi yang lebih baik
Pengguna dapat menyela AI secara alami saat AI sedang berbicara.
Contoh:
Pengguna:
"Pesankan saya penerbangan ke—sebenarnya ganti ke Tokyo."
Model dapat pulih dari perubahan percakapan tanpa memulai ulang interaksi.
Penanganan jeda dan kebisingan yang lebih baik
Model dioptimalkan untuk lingkungan dengan kualitas audio yang tidak sempurna:
- Pusat panggilan
- Perangkat seluler
- Ruang publik
- Perangkat pintar
3. Penggunaan Alat Agen Suara Lanjutan
GPT-Realtime-2.1 mendukung pemanggilan alat, memungkinkan agen suara melakukan tindakan.
Contoh:
Layanan pelanggan:
User:
"Where is my order?"
AI:
→ Calls order database API
→ Retrieves status
→ Responds by voice
Alur kerja perusahaan:
Voice command
↓
Reasoning
↓
API execution
↓
Voice confirmation
Ini membuat GPT-Realtime-2.1 cocok untuk agen suara otonom.
4. Kemampuan Penalaran yang Dapat Dikonfigurasi
Tidak seperti model suara real-time sebelumnya yang terutama dioptimalkan untuk kecepatan, GPT-Realtime-2.1 memperkenalkan upaya penalaran yang dapat dikonfigurasi.
Pengembang dapat menyeimbangkan:
- Latensi respons
- Akurasi
- Kompleksitas tugas
Penalaran rendah:
- Percakapan sederhana
- Asisten FAQ
Penalaran lebih tinggi:
- Permintaan pelanggan yang kompleks
- Alur kerja multi-langkah
- Operasi bisnis
5. Pengenalan Angka dan Informasi Teknis yang Lebih Baik
Agen suara sering kesulitan dengan:
- Nomor akun
- Nomor seri
- Alamat
- Kode produk
- Informasi keuangan
GPT-Realtime-2.1 meningkatkan pengenalan alfanumerik, sehingga lebih cocok untuk sistem suara perusahaan.
6. Dukungan Input Multimodal
GPT-Realtime-2.1 mendukung:
| Input | Dukungan |
|---|---|
| Teks | ✅ |
| Audio | ✅ |
| Gambar | ✅ |
| Video | ❌ |
Input gambar memungkinkan skenario seperti:
- Dukungan pelanggan visual
- Interpretasi dokumen
- Asisten berbasis kamera
GPT-Realtime-2.1 vs GPT-Realtime-2 vs GPT-4o Realtime
| Model | Kekuatan | Penggunaan terbaik |
|---|---|---|
| GPT-Realtime-2.1 | Penalaran real-time terbaik + kemampuan agen suara | Agen suara produksi |
| GPT-Realtime-2 | Penalaran suara real-time yang kuat | Aplikasi percakapan tingkat lanjut |
| GPT-4o Realtime | Interaksi multimodal cepat | Asisten suara umum |
GPT-Realtime-2.1 vs GPT-Realtime-2
GPT-Realtime-2.1 meningkatkan:
- Pemulihan interupsi suara
- Penanganan kebisingan
- Akurasi pengenalan
- Ketangguhan percakapan
Kedua model memiliki kesamaan:
- Arsitektur suara-ke-suara
- Pemanggilan alat
- Dukungan penalaran
- Akses Realtime API
GPT-Realtime-2.1 vs GPT-4o Realtime
GPT-Realtime-2.1 diposisikan untuk alur kerja agen yang lebih maju.
Dibandingkan dengan GPT-4o Realtime:
| Kemampuan | GPT-Realtime-2.1 | GPT-4o Realtime |
|---|---|---|
| Penalaran | Lebih kuat | Umum |
| Konteks | 128K | 32K |
| Penggunaan alat | Didukung | Didukung |
| Agen suara | Lanjutan | Umum |
| Alur kerja kompleks | Lebih cocok | Cocok |
Cara Menggunakan API GPT-Realtime-2.1 dengan CometAPI
GPT-Realtime-2.1 dirancang untuk aplikasi agen suara berlatensi rendah. Model ini mendukung interaksi suara-ke-suara real-time, input/output audio, input gambar, upaya penalaran yang dapat dikonfigurasi, dan pemanggilan fungsi untuk alur kerja suara yang didukung alat. OpenAI menyediakannya melalui Realtime API, termasuk metode komunikasi real-time berbasis WebRTC, WebSocket, dan SIP.
CometAPI menyediakan lapisan API terpadu untuk mengintegrasikan model AI canggih, memungkinkan pengembang mengakses alur kerja bergaya GPT-Realtime-2.1 tanpa harus mengelola autentikasi penyedia terpisah, logika SDK, dan infrastruktur.
Langkah 1: Dapatkan Kunci API CometAPI Anda
Buat akun CometAPI dan hasilkan token API dari konsol pengembang.
Permintaan API Anda harus menyertakan:
Authorization: Bearer YOUR_COMETAPI_API_KEY
Content-Type: application/json
Kunci API mengautentikasi permintaan Anda dan memungkinkan aplikasi Anda memanggil model AI yang tersedia melalui CometAPI.
Langkah 2: Buat Sesi GPT-Realtime-2.1
GPT-Realtime-2.1 berfungsi melalui sesi real-time persisten alih-alih penyelesaian chat permintaan-respons tradisional.
Sesi real-time mempertahankan:
- Aliran input audio
- Respons model
- Status percakapan
- Panggilan alat
- Interupsi
Realtime API dari OpenAI mendukung komunikasi real-time melalui antarmuka WebRTC, WebSocket, dan SIP.
Contoh:
curl https://api.cometapi.com/v1/realtime/sessions \
-H "Authorization: Bearer YOUR_COMETAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '
{
"model": "gpt-realtime-2.1",
"modalities": [
"audio",
"text"
],
"voice": "alloy",
"instructions": "You are a helpful customer support voice assistant."
}
'
Contoh respons:
{
"id": "sess_xxxxx",
"model": "gpt-realtime-2.1",
"status": "active"
}
Langkah 3: Kirim Input Audio ke GPT-Realtime-2.1
Setelah membuat sesi, streaming audio pengguna.
Contoh alur kerja:
User microphone
|
↓
Audio stream
|
↓
GPT-Realtime-2.1
|
↓
Generated voice response
Input audio dapat mencakup:
- Percakapan telepon
- Perintah suara
- Panggilan dukungan pelanggan
- Asisten interaktif
GPT-Realtime-2.1 meningkatkan interaksi suara dengan deteksi jeda, penanganan kebisingan, dan perilaku interupsi yang lebih baik dibanding model real-time sebelumnya.
Langkah 4: Terima Respons Audio Real-time
Model mengembalikan respons audio yang dihasilkan melalui koneksi real-time.
Contoh event:
{
"type": "response.audio.delta",
"delta": "base64_audio_chunk"
}
Aplikasi Anda dapat segera memutar potongan audio yang diterima.
Implementasi yang umum:
- Aplikasi suara WebRTC
- Asisten berbasis browser
- Aplikasi suara seluler
- Agen telepon AI
Langkah 5: Tambahkan Panggilan Fungsi untuk Agen Suara
GPT-Realtime-2.1 mendukung pemanggilan fungsi, memungkinkan agen suara mengeksekusi tindakan eksternal.
Contoh:
{
"tools": [
{
"type": "function",
"name": "check_order_status",
"description": "Retrieve customer order information",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
}
}
}
]
}
Kemungkinan alur kerja agen suara:
- "Di mana paket saya?"
- "Jadwalkan pertemuan besok."
- "Batalkan langganan saya."
- "Periksa saldo akun saya."
Model dapat mengenali permintaan, memanggil alat yang sesuai, dan melanjutkan percakapan secara alami.
Langkah 6: Konfigurasikan Penalaran dan Instruksi
GPT-Realtime-2.1 mendukung upaya penalaran yang dapat dikonfigurasi.
Contoh:
{
"model": "gpt-realtime-2.1",
"reasoning": {
"effort": "medium"
},
"instructions": "Act as a professional travel assistant."
}
Pengaturan yang direkomendasikan:
| Aplikasi | Tingkat penalaran |
|---|---|
| Perintah suara sederhana | Rendah |
| Dukungan pelanggan | Sedang |
| Agen alur kerja kompleks | Tinggi |