Specyfikacja techniczna GPT-Realtime-2.1
| Specyfikacja | Szczegóły |
|---|---|
| Nazwa modelu | GPT-Realtime-2.1 |
| Dostawca | OpenAI |
| Rodzina modeli | seria GPT-Realtime |
| Typ modelu | Realtime, multimodalny model rozumowania głosowego |
| Główna zdolność | Agenci AI mowa-do-mowy |
| Modalności wejściowe | Tekst, audio, obraz |
| Modalności wyjściowe | Tekst, audio |
| Okno kontekstu | 128,000 tokenów |
| Maksymalna liczba tokenów wyjściowych | 32,000 tokenów |
| Wsparcie rozumowania | Konfigurowalny wysiłek rozumowania |
| Wywoływanie funkcji | Obsługiwane |
| Ustrukturyzowane wyjścia | Nieobsługiwane |
| Dostrajanie (fine-tuning) | Nieobsługiwane |
| Wejście wideo | Nieobsługiwane |
| Główny punkt końcowy API | Realtime API |
| Data odcięcia wiedzy | 30 września 2024 |
Źródło: dokumentacja modelu OpenAI GPT-Realtime-2.1.
Czym jest GPT-Realtime-2.1?
GPT-Realtime-2.1 to zaawansowany, działający w czasie rzeczywistym model głosowy firmy OpenAI, zaprojektowany do tworzenia konwersacyjnych agentów AI, którzy potrafią słuchać, rozumować i naturalnie odpowiadać głosem.
W porównaniu z tradycyjnymi asystentami głosowymi opartymi na oddzielnych etapach rozpoznawania mowy, rozumienia języka oraz syntezy mowy, GPT-Realtime-2.1 zapewnia natywną interakcję mowa-do-mowy, umożliwiając rozmowy o niższej latencji, lepszą obsługę przerywania oraz lepsze rozumienie kontekstu.
Model jest zoptymalizowany pod kątem produkcyjnych aplikacji głosowych, w tym agentów obsługi klienta, asystentów AI, automatyzacji sprzedaży, platform edukacyjnych i interaktywnych doświadczeń głosowych.
Wydajność GPT-Realtime-2.1 w benchmarkach
Ulepszenia GPT-Realtime-2.1 koncentrują się na praktycznych metrykach interakcji w czasie rzeczywistym:
| Zdolność | Ulepszenie |
|---|---|
| Obsługa przerywania głosu | Ulepszona |
| Odporność na hałas | Ulepszona |
| Rozpoznawanie ciągów alfanumerycznych | Ulepszone |
| Przepływy głosowe oparte na narzędziach | Obsługiwane |
| Interakcja mowa-do-mowy | Obsługiwana |
Główne funkcje GPT-Realtime-2.1
1. Natywna interakcja mowa-do-mowy
GPT-Realtime-2.1 eliminuje konieczność używania oddzielnych potoków rozpoznawania mowy i syntezy mowy.
Tradycyjna architektura głosowa:
User Voice
↓
Speech-to-Text
↓
LLM Processing
↓
Text-to-Speech
↓
Voice Response
GPT-Realtime-2.1:
User Voice
↓
GPT-Realtime-2.1
↓
Voice Response
To zmniejsza latencję i poprawia płynność rozmowy.
2. Lepsza jakość rozmów głosowych
GPT-Realtime-2.1 poprawia kilka wyzwań rozmów głosowych w świecie rzeczywistym:
Lepsza obsługa przerywania
Użytkownicy mogą naturalnie przerywać AI w trakcie mówienia.
Przykład:
Użytkownik:
"Zarezerwuj mi lot do—właściwie zmień to na Tokio."
Model potrafi wyjść z takiej sytuacji i kontynuować rozmowę bez restartowania interakcji.
Lepsza obsługa ciszy i hałasu
Model jest zoptymalizowany do środowisk, w których jakość dźwięku jest niedoskonała:
- Centra obsługi telefonicznej
- Urządzenia mobilne
- Przestrzenie publiczne
- Urządzenia inteligentne
3. Zaawansowane użycie narzędzi przez agentów głosowych
GPT-Realtime-2.1 obsługuje wywoływanie narzędzi, pozwalając agentom głosowym wykonywać akcje.
Przykłady:
Obsługa klienta:
User:
"Where is my order?"
AI:
→ Calls order database API
→ Retrieves status
→ Responds by voice
Przepływ w przedsiębiorstwie:
Voice command
↓
Reasoning
↓
API execution
↓
Voice confirmation
Dzięki temu GPT-Realtime-2.1 nadaje się do autonomicznych agentów głosowych.
4. Konfigurowalna zdolność rozumowania
W przeciwieństwie do wcześniejszych modeli głosowych w czasie rzeczywistym, które były optymalizowane głównie pod kątem szybkości, GPT-Realtime-2.1 wprowadza konfigurowalny poziom rozumowania.
Deweloperzy mogą zrównoważyć:
- Latencję odpowiedzi
- Dokładność
- Złożoność zadań
Niski poziom rozumowania:
- Proste rozmowy
- Asystenci FAQ
Wyższy poziom rozumowania:
- Złożone prośby klientów
- Wieloetapowe przepływy pracy
- Operacje biznesowe
5. Lepsze rozpoznawanie liczb i informacji technicznych
Agenci głosowi często mają trudności z:
- Numerami kont
- Numerami seryjnymi
- Adresami
- Kodami produktów
- Informacjami finansowymi
GPT-Realtime-2.1 poprawia rozpoznawanie danych alfanumerycznych, dzięki czemu lepiej nadaje się do systemów głosowych w przedsiębiorstwach.
6. Obsługa wejść multimodalnych
GPT-Realtime-2.1 obsługuje:
| Wejście | Wsparcie |
|---|---|
| Tekst | ✅ |
| Audio | ✅ |
| Obraz | ✅ |
| Wideo | ❌ |
Wejście obrazu umożliwia scenariusze takie jak:
- Wizualne wsparcie klienta
- Interpretacja dokumentów
- Asystenci oparci na kamerze
GPT-Realtime-2.1 vs GPT-Realtime-2 vs GPT-4o Realtime
| Model | Mocna strona | Najlepsze zastosowanie |
|---|---|---|
| GPT-Realtime-2.1 | Najlepsze rozumowanie w czasie rzeczywistym + możliwości agenta głosowego | Produkcyjni agenci głosowi |
| GPT-Realtime-2 | Mocne rozumowanie głosowe w czasie rzeczywistym | Zaawansowane aplikacje konwersacyjne |
| GPT-4o Realtime | Szybka interakcja multimodalna | Ogólni asystenci głosowi |
GPT-Realtime-2.1 vs GPT-Realtime-2
GPT-Realtime-2.1 ulepsza:
- Odzyskiwanie po przerwaniu wypowiedzi
- Obsługę hałasu
- Dokładność rozpoznawania
- Odporność konwersacyjną
Oba modele oferują:
- Architekturę mowa-do-mowy
- Wywoływanie narzędzi
- Wsparcie rozumowania
- Dostęp przez Realtime API
GPT-Realtime-2.1 vs GPT-4o Realtime
GPT-Realtime-2.1 jest pozycjonowany pod bardziej zaawansowane przepływy pracy agentów.
W porównaniu z GPT-4o Realtime:
| Zdolność | GPT-Realtime-2.1 | GPT-4o Realtime |
|---|---|---|
| Rozumowanie | Silniejsze | Ogólne |
| Kontekst | 128K | 32K |
| Użycie narzędzi | Obsługiwane | Obsługiwane |
| Agenci głosowi | Zaawansowani | Ogólni |
| Złożone przepływy pracy | Lepiej dopasowany | Odpowiedni |
Jak używać API GPT-Realtime-2.1 z CometAPI
GPT-Realtime-2.1 jest projektowany do agentów głosowych o niskiej latencji. Obsługuje interakcję mowa-do-mowy w czasie rzeczywistym, wejście/wyjście audio, wejście obrazu, konfigurowalny poziom rozumowania oraz wywoływanie funkcji dla przepływów głosowych z narzędziami. OpenAI udostępnia go przez Realtime API, w tym metody komunikacji w czasie rzeczywistym oparte na WebRTC, WebSocket i SIP.
CometAPI zapewnia zunifikowaną warstwę API do integracji zaawansowanych modeli AI, pozwalając deweloperom uzyskać dostęp do przepływów w stylu GPT-Realtime-2.1 bez utrzymywania oddzielnej autentykacji dostawców, logiki SDK i infrastruktury.
Krok 1: Uzyskaj klucz API CometAPI
Utwórz konto CometAPI i wygeneruj token API w konsoli deweloperskiej.
Twoje żądanie API powinno zawierać:
Authorization: Bearer YOUR_COMETAPI_API_KEY
Content-Type: application/json
Klucz API uwierzytelnia Twoje żądania i pozwala Twojej aplikacji wywoływać dostępne modele AI przez CometAPI.
Krok 2: Utwórz sesję GPT-Realtime-2.1
GPT-Realtime-2.1 działa poprzez utrzymywaną sesję w czasie rzeczywistym zamiast tradycyjnego, żądaniowo-odpowiedziowego czatu.
Sesja w czasie rzeczywistym utrzymuje:
- Strumień wejściowy audio
- Odpowiedzi modelu
- Stan rozmowy
- Wywołania narzędzi
- Przerwania
Realtime API firmy OpenAI obsługuje komunikację w czasie rzeczywistym poprzez interfejsy WebRTC, WebSocket i SIP.
Przykład:
curl https://api.cometapi.com/v1/realtime/sessions \
-H "Authorization: Bearer YOUR_COMETAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '
{
"model": "gpt-realtime-2.1",
"modalities": [
"audio",
"text"
],
"voice": "alloy",
"instructions": "You are a helpful customer support voice assistant."
}
'
Przykładowa odpowiedź:
{
"id": "sess_xxxxx",
"model": "gpt-realtime-2.1",
"status": "active"
}
Krok 3: Wyślij wejście audio do GPT-Realtime-2.1
Po utworzeniu sesji strumieniuj audio użytkownika.
Przykładowy przepływ:
User microphone
|
↓
Audio stream
|
↓
GPT-Realtime-2.1
|
↓
Generated voice response
Wejście audio może obejmować:
- Rozmowy telefoniczne
- Komendy głosowe
- Połączenia wsparcia klienta
- Interaktywne asystenty
W porównaniu z wcześniejszymi modelami w czasie rzeczywistym, GPT-Realtime-2.1 poprawia interakcję głosową dzięki lepszej detekcji ciszy, obsłudze hałasu i zachowaniu podczas przerywania.
Krok 4: Odbieraj odpowiedzi audio w czasie rzeczywistym
Model zwraca generowane odpowiedzi audio przez połączenie w czasie rzeczywistym.
Przykładowe zdarzenie:
{
"type": "response.audio.delta",
"delta": "base64_audio_chunk"
}
Twoja aplikacja może natychmiast odtwarzać otrzymane fragmenty audio.
Typowe implementacje:
- Aplikacje głosowe WebRTC
- Asystenci przeglądarkowi
- Mobilne aplikacje głosowe
- Telefoniczni agenci AI
Krok 5: Dodaj wywoływanie funkcji dla agentów głosowych
GPT-Realtime-2.1 obsługuje wywoływanie funkcji, co pozwala agentom głosowym wykonywać działania zewnętrzne.
Przykład:
{
"tools": [
{
"type": "function",
"name": "check_order_status",
"description": "Retrieve customer order information",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
}
}
}
]
}
Możliwe przepływy agentów głosowych:
- "Gdzie jest moja paczka?"
- "Zarezerwuj mi spotkanie na jutro."
- "Anuluj moją subskrypcję."
- "Sprawdź mój stan konta."
Model potrafi rozpoznać żądanie, wywołać odpowiednie narzędzie i naturalnie kontynuować rozmowę.
Krok 6: Skonfiguruj rozumowanie i instrukcje
GPT-Realtime-2.1 obsługuje konfigurowalny poziom rozumowania.
Przykład:
{
"model": "gpt-realtime-2.1",
"reasoning": {
"effort": "medium"
},
"instructions": "Act as a professional travel assistant."
}
Zalecane ustawienia:
| Aplikacja | Poziom rozumowania |
|---|---|
| Proste polecenia głosowe | Niski |
| Obsługa klienta | Średni |
| Złożeni agenci przepływów pracy | Wysoki |