GPT-Realtime-2.1'in Teknik Özellikleri
| Özellik | Ayrıntılar |
|---|---|
| Model adı | GPT-Realtime-2.1 |
| Sağlayıcı | OpenAI |
| Model ailesi | GPT-Realtime serisi |
| Model türü | Gerçek zamanlı çok modlu ses akıl yürütme modeli |
| Birincil yetenek | Konuşmadan konuşmaya yapay zekâ ajanları |
| Girdi türleri | Metin, Ses, Görüntü |
| Çıktı türleri | Metin, Ses |
| Bağlam penceresi | 128,000 token |
| Maksimum çıktı token | 32,000 token |
| Akıl yürütme desteği | Yapılandırılabilir akıl yürütme çabası |
| Fonksiyon çağırma | Destekleniyor |
| Yapılandırılmış çıktılar | Desteklenmiyor |
| İnce ayar | Desteklenmiyor |
| Video girişi | Desteklenmiyor |
| Ana API uç noktası | Realtime API |
| Bilgi kesim tarihi | 30 Eylül 2024 |
Kaynak: OpenAI GPT-Realtime-2.1 model dokümantasyonu.
GPT-Realtime-2.1 nedir?
GPT-Realtime-2.1, dinleyebilen, akıl yürütebilen ve sese doğal olarak yanıt verebilen konuşma tabanlı yapay zekâ ajanları oluşturmak için tasarlanmış, OpenAI'nin gelişmiş gerçek zamanlı ses modelidir.
Ayrı konuşma tanıma, dil anlama ve metinden konuşmaya hatlarına dayanan geleneksel sesli asistanlarla karşılaştırıldığında GPT-Realtime-2.1, yerel konuşmadan konuşmaya etkileşim sunar; bu da daha düşük gecikmeli konuşmalar ile daha iyi kesinti yönetimi ve bağlamsal anlayış sağlar.
Model, müşteri hizmetleri ajanları, yapay zekâ asistanları, satış otomasyonu, eğitim platformları ve etkileşimli ses deneyimleri dahil üretim düzeyindeki ses uygulamaları için optimize edilmiştir.
GPT-Realtime-2.1 Kıyaslama Performansı
GPT-Realtime-2.1 iyileştirmeleri, pratik gerçek zamanlı etkileşim ölçütlerine odaklanır:
| Yetenek | İyileştirme |
|---|---|
| Konuşma kesintisi yönetimi | İyileştirildi |
| Gürültü dayanıklılığı | İyileştirildi |
| Alfasayısal tanıma | İyileştirildi |
| Araç tabanlı ses iş akışları | Destekleniyor |
| Konuşmadan konuşmaya etkileşim | Destekleniyor |
GPT-Realtime-2.1’in Başlıca Özellikleri
1. Yerel Konuşmadan Konuşmaya Etkileşim
GPT-Realtime-2.1, ayrı konuşma tanıma ve metinden konuşmaya hatlarına duyulan ihtiyacı ortadan kaldırır.
Geleneksel ses mimarisi:
User Voice
↓
Speech-to-Text
↓
LLM Processing
↓
Text-to-Speech
↓
Voice Response
GPT-Realtime-2.1:
User Voice
↓
GPT-Realtime-2.1
↓
Voice Response
Bu, gecikmeyi azaltır ve konuşma akışını iyileştirir.
2. Geliştirilmiş Sesli Konuşma Kalitesi
GPT-Realtime-2.1, gerçek dünyadaki çeşitli sesli iletişim zorluklarını iyileştirir:
Daha iyi kesinti yönetimi
Kullanıcılar, yapay zekâ konuşurken onu doğal biçimde kesebilir.
Örnek:
Kullanıcı:
"Bana bir uçuş ayarla—aslında bunu Tokyo olarak değiştir."
Model, etkileşimi baştan başlatmadan konuşmadaki değişikliklerden toparlanabilir.
Daha iyi sessizlik ve gürültü yönetimi
Model, ses kalitesinin kusurlu olabildiği ortamlar için optimize edilmiştir:
- Çağrı merkezleri
- Mobil cihazlar
- Kamusal alanlar
- Akıllı cihazlar
3. Gelişmiş Sesli Ajan Araç Kullanımı
GPT-Realtime-2.1, sesli ajanların eylemler gerçekleştirmesine olanak tanıyan araç çağırmayı destekler.
Örnekler:
Müşteri hizmetleri:
User:
"Where is my order?"
AI:
→ Calls order database API
→ Retrieves status
→ Responds by voice
Kurumsal iş akışı:
Voice command
↓
Reasoning
↓
API execution
↓
Voice confirmation
Bu, GPT-Realtime-2.1’i otonom sesli ajanlar için uygun hâle getirir.
4. Yapılandırılabilir Akıl Yürütme Yeteneği
Hız odaklı önceki gerçek zamanlı ses modellerinden farklı olarak GPT-Realtime-2.1, yapılandırılabilir akıl yürütme çabası sunar.
Geliştiriciler şu unsurlar arasında denge kurabilir:
- Yanıt gecikmesi
- Doğruluk
- Görev karmaşıklığı
Düşük akıl yürütme:
- Basit konuşmalar
- SSS asistanları
Daha yüksek akıl yürütme:
- Karmaşık müşteri talepleri
- Çok adımlı iş akışları
- İş operasyonları
5. Sayılar ve Teknik Bilgilerin Daha İyi Tanınması
Sesli ajanlar sıklıkla şu konularda zorlanır:
- Hesap numaraları
- Seri numaraları
- Adresler
- Ürün kodları
- Finansal bilgiler
GPT-Realtime-2.1, alfasayısal tanımayı iyileştirir ve kurumsal ses sistemleri için daha uygun hâle getirir.
6. Çok Modlu Girdi Desteği
GPT-Realtime-2.1 şunları destekler:
| Girdi | Destek |
|---|---|
| Metin | ✅ |
| Ses | ✅ |
| Görüntü | ✅ |
| Video | ❌ |
Görüntü girdisi aşağıdaki senaryoları mümkün kılar:
- Görsel müşteri desteği
- Belge yorumlama
- Kamera tabanlı asistanlar
GPT-Realtime-2.1 vs GPT-Realtime-2 vs GPT-4o Realtime
| Model | Güçlü yön | En iyi kullanım |
|---|---|---|
| GPT-Realtime-2.1 | En iyi gerçek zamanlı akıl yürütme + sesli ajan yeteneği | Üretim ortamı sesli ajanları |
| GPT-Realtime-2 | Güçlü gerçek zamanlı ses akıl yürütmesi | Gelişmiş konuşma uygulamaları |
| GPT-4o Realtime | Hızlı çok modlu etkileşim | Genel amaçlı sesli asistanlar |
GPT-Realtime-2.1 vs GPT-Realtime-2
GPT-Realtime-2.1 şunları iyileştirir:
- Sesli kesintiden toparlanma
- Gürültüyle başa çıkma
- Tanıma doğruluğu
- Konuşma dayanıklılığı
Her iki modelde ortak olanlar:
- Konuşmadan konuşmaya mimari
- Araç çağırma
- Akıl yürütme desteği
- Gerçek zamanlı API erişimi
GPT-Realtime-2.1 vs GPT-4o Realtime
GPT-Realtime-2.1, daha gelişmiş ajan iş akışları için konumlandırılmıştır.
GPT-4o Realtime ile karşılaştırıldığında:
| Yetenek | GPT-Realtime-2.1 | GPT-4o Realtime |
|---|---|---|
| Akıl yürütme | Daha güçlü | Genel |
| Bağlam | 128K | 32K |
| Araç kullanımı | Destekleniyor | Destekleniyor |
| Sesli ajanlar | Gelişmiş | Genel |
| Karmaşık iş akışları | Daha uygun | Uygun |
CometAPI ile GPT-Realtime-2.1 API Nasıl Kullanılır
GPT-Realtime-2.1, düşük gecikmeli sesli ajan uygulamaları için tasarlanmıştır. Gerçek zamanlı konuşmadan konuşmaya etkileşim, ses girdi/çıktısı, görüntü girdisi, yapılandırılabilir akıl yürütme çabası ve araç etkin sesli iş akışları için fonksiyon çağırmayı destekler. OpenAI, WebRTC, WebSocket ve SIP tabanlı gerçek zamanlı iletişim yöntemlerini içeren Realtime API aracılığıyla bu modeli sunar.
CometAPI, gelişmiş yapay zekâ modellerinin entegrasyonu için birleşik bir API katmanı sağlayarak geliştiricilerin ayrı sağlayıcı kimlik doğrulaması, SDK mantığı ve altyapıyı yönetmeden GPT-Realtime-2.1 tarzı iş akışlarına erişmesine olanak tanır.
Adım 1: CometAPI API Anahtarınızı Alın
Bir CometAPI hesabı oluşturun ve geliştirici konsolundan bir API belirteci üretin.
API isteğiniz şunları içermelidir:
Authorization: Bearer YOUR_COMETAPI_API_KEY
Content-Type: application/json
API anahtarı, isteklerinizi kimliklendirir ve uygulamanızın CometAPI üzerinden kullanılabilir yapay zekâ modellerini çağırmasına olanak tanır.
Adım 2: Bir GPT-Realtime-2.1 Oturumu Oluşturun
GPT-Realtime-2.1, geleneksel istek-yanıt sohbet tamamlama yerine kalıcı bir gerçek zamanlı oturum aracılığıyla çalışır.
Gerçek zamanlı bir oturum şunları korur:
- Ses girdi akışı
- Model yanıtları
- Konuşma durumu
- Araç çağrıları
- Kesintiler
OpenAI’nin Realtime API’si, WebRTC, WebSocket ve SIP arayüzleri üzerinden gerçek zamanlı iletişimi destekler.
Örnek:
curl https://api.cometapi.com/v1/realtime/sessions \
-H "Authorization: Bearer YOUR_COMETAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '
{
"model": "gpt-realtime-2.1",
"modalities": [
"audio",
"text"
],
"voice": "alloy",
"instructions": "You are a helpful customer support voice assistant."
}
'
Örnek yanıt:
{
"id": "sess_xxxxx",
"model": "gpt-realtime-2.1",
"status": "active"
}
Adım 3: GPT-Realtime-2.1’e Ses Girdisi Gönderin
Bir oturum oluşturduktan sonra kullanıcı sesini akış olarak iletin.
Örnek iş akışı:
User microphone
|
↓
Audio stream
|
↓
GPT-Realtime-2.1
|
↓
Generated voice response
Ses girdisi şunları içerebilir:
- Telefon görüşmeleri
- Sesli komutlar
- Müşteri destek aramaları
- Etkileşimli asistanlar
GPT-Realtime-2.1, önceki gerçek zamanlı modellere kıyasla daha iyi sessizlik tespiti, gürültüyle başa çıkma ve kesinti davranışıyla konuşma etkileşimini iyileştirir.
Adım 4: Gerçek Zamanlı Sesli Yanıtlar Alın
Model, üretilen sesli yanıtları gerçek zamanlı bağlantı üzerinden döndürür.
Örnek olay:
{
"type": "response.audio.delta",
"delta": "base64_audio_chunk"
}
Uygulamanız, alınan ses parçalarını anında çalabilir.
Tipik uygulamalar:
- WebRTC tabanlı ses uygulamaları
- Tarayıcı tabanlı asistanlar
- Mobil ses uygulamaları
- Yapay zekâ telefon ajanları
Adım 5: Sesli Ajanlar için Fonksiyon Çağırma Ekleyin
GPT-Realtime-2.1, fonksiyon çağırmayı destekler ve sesli ajanların harici eylemler gerçekleştirmesine olanak tanır.
Örnek:
{
"tools": [
{
"type": "function",
"name": "check_order_status",
"description": "Retrieve customer order information",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
}
}
}
]
}
Olası sesli ajan iş akışları:
- "Paketim nerede?"
- "Yarın benim için bir toplantı ayarla."
- "Aboneliğimi iptal et."
- "Hesap bakiyemi kontrol et."
Model, isteği tanıyabilir, uygun aracı çağırabilir ve konuşmayı doğal biçimde sürdürebilir.
Adım 6: Akıl Yürütme ve Yönergeleri Yapılandırın
GPT-Realtime-2.1, yapılandırılabilir akıl yürütme çabasını destekler.
Örnek:
{
"model": "gpt-realtime-2.1",
"reasoning": {
"effort": "medium"
},
"instructions": "Act as a professional travel assistant."
}
Önerilen ayarlar:
| Uygulama | Akıl Yürütme Düzeyi |
|---|---|
| Basit sesli komutlar | Düşük |
| Müşteri desteği | Orta |
| Karmaşık iş akışı ajanları | Yüksek |