GPT-Realtime-2.1 的技術規格
| 規格 | 詳細資訊 |
|---|---|
| 模型名稱 | GPT-Realtime-2.1 |
| 提供者 | OpenAI |
| 模型系列 | GPT-Realtime 系列 |
| 模型類型 | 即時多模態語音推理模型 |
| 主要能力 | 語音到語音的 AI 代理 |
| 輸入模態 | 文字、音訊、影像 |
| 輸出模態 | 文字、音訊 |
| 上下文視窗 | 128,000 個 token |
| 最大輸出 token 數 | 32,000 個 token |
| 推理支援 | 可配置的推理強度 |
| 函式呼叫 | 支援 |
| 結構化輸出 | 不支援 |
| 微調 | 不支援 |
| 影片輸入 | 不支援 |
| 主要 API 端點 | Realtime API |
| 知識截止日期 | 2024 年 9 月 30 日 |
來源:OpenAI GPT-Realtime-2.1 模型文件。
什麼是 GPT-Realtime-2.1?
GPT-Realtime-2.1 是 OpenAI 的先進即時語音模型,專為構建能透過音訊自然傾聽、推理與回應的對話式 AI 代理而設計。
與仰賴分離式語音辨識、語意理解與文字轉語音流程的傳統語音助理不同,GPT-Realtime-2.1 提供原生的語音到語音互動,實現更低延遲的對話,並具備更佳的打斷處理與情境理解能力。
該模型針對量產級語音應用進行最佳化,包括客服代理、AI 助理、銷售自動化、教育平台與互動式語音體驗。
GPT-Realtime-2.1 基準效能
GPT-Realtime-2.1 的改進聚焦於實用的即時互動指標:
| 能力 | 改進 |
|---|---|
| 語音打斷處理 | 已改進 |
| 抗噪性 | 已改進 |
| 英數字辨識 | 已改進 |
| 基於工具的語音工作流程 | 支援 |
| 語音到語音互動 | 支援 |
GPT-Realtime-2.1 的主要特性
1. 原生語音到語音互動
GPT-Realtime-2.1 省去分離式語音辨識與文字轉語音等管線需求。
傳統語音架構:
User Voice
↓
Speech-to-Text
↓
LLM Processing
↓
Text-to-Speech
↓
Voice Response
GPT-Realtime-2.1:
User Voice
↓
GPT-Realtime-2.1
↓
Voice Response
這可降低延遲並改善對話流暢度。
2. 改善的語音對話品質
GPT-Realtime-2.1 對多項真實語音情境難題進行改進:
更佳的打斷處理
使用者可在 AI 說話時自然地打斷。
範例:
使用者:
「幫我訂一班飛往——其實改成東京。」
模型可在不重啟互動的情況下從對話變更中恢復。
更佳的靜默與噪聲處理
模型針對音訊品質不完美的環境進行最佳化:
- 呼叫中心
- 行動裝置
- 公共空間
- 智慧裝置
3. 進階語音代理工具使用
GPT-Realtime-2.1 支援工具呼叫,使語音代理可執行動作。
範例:
客服服務:
User:
"Where is my order?"
AI:
→ Calls order database API
→ Retrieves status
→ Responds by voice
企業工作流程:
Voice command
↓
Reasoning
↓
API execution
↓
Voice confirmation
這使 GPT-Realtime-2.1 適用於自主語音代理。
4. 可配置的推理能力
不同於先前主要為速度最佳化的即時語音模型,GPT-Realtime-2.1 引入可配置的推理強度。
開發者可在以下之間取得平衡:
- 回應延遲
- 準確性
- 任務複雜度
低推理:
- 簡單對話
- 常見問題助理
較高推理:
- 複雜的客戶請求
- 多步驟工作流程
- 商務作業
5. 對數字與技術資訊的更佳辨識
語音代理常見困難:
- 帳戶號碼
- 序號
- 地址
- 產品代碼
- 財務資訊
GPT-Realtime-2.1 改善了英數字辨識,使其更適合企業級語音系統。
6. 多模態輸入支援
GPT-Realtime-2.1 支援:
| 輸入 | 支援 |
|---|---|
| 文字 | ✅ |
| 音訊 | ✅ |
| 影像 | ✅ |
| 影片 | ❌ |
影像輸入可支援以下情境:
- 視覺化客服支援
- 文件解讀
- 基於相機的助理
GPT-Realtime-2.1 vs GPT-Realtime-2 vs GPT-4o Realtime
| 模型 | 優勢 | 最佳用途 |
|---|---|---|
| GPT-Realtime-2.1 | 最佳即時推理 + 語音代理能力 | 量產環境語音代理 |
| GPT-Realtime-2 | 強大的即時語音推理 | 進階對話應用 |
| GPT-4o Realtime | 快速的多模態互動 | 通用語音助理 |
GPT-Realtime-2.1 與 GPT-Realtime-2 的比較
GPT-Realtime-2.1 的改進:
- 語音打斷恢復
- 噪聲處理
- 辨識準確性
- 對話穩健性
兩者皆具備:
- 語音到語音架構
- 工具呼叫
- 推理支援
- 可透過 Realtime API 存取
GPT-Realtime-2.1 與 GPT-4o Realtime 的比較
GPT-Realtime-2.1 更適合進階代理工作流程。
與 GPT-4o Realtime 相比:
| 能力 | GPT-Realtime-2.1 | GPT-4o Realtime |
|---|---|---|
| 推理 | 更強 | 一般 |
| 上下文 | 128K | 32K |
| 工具使用 | 支援 | 支援 |
| 語音代理 | 進階 | 一般 |
| 複雜工作流程 | 更適合 | 適合 |
如何透過 CometAPI 使用 GPT-Realtime-2.1 API
GPT-Realtime-2.1 專為低延遲的語音代理應用而設計。它支援即時語音到語音互動、音訊輸入/輸出、影像輸入、可配置的推理強度,以及為工具驅動的語音工作流程提供函式呼叫。OpenAI 透過 Realtime API(包含 WebRTC、WebSocket 與基於 SIP 的即時通訊方式)對外提供。
CometAPI 提供統一的 API 抽象層,讓開發者可存取 GPT-Realtime-2.1 風格的工作流程,而無需維護各供應商的身分驗證、SDK 邏輯與基礎設施。
步驟 1:取得你的 CometAPI API 金鑰
建立 CometAPI 帳戶,並在開發者主控台生成 API 權杖。
你的 API 請求需包含:
Authorization: Bearer YOUR_COMETAPI_API_KEY
Content-Type: application/json
API 金鑰用於驗證你的請求,讓你的應用程式可透過 CometAPI 呼叫可用的 AI 模型。
步驟 2:建立 GPT-Realtime-2.1 會話
GPT-Realtime-2.1 透過持續性的即時會話運作,而非傳統的請求-回應式聊天補全。
即時會話會維持:
- 音訊輸入串流
- 模型回應
- 對話狀態
- 工具呼叫
- 打斷事件
OpenAI 的 Realtime API 支援透過 WebRTC、WebSocket 與 SIP 介面進行即時通訊。
範例:
curl https://api.cometapi.com/v1/realtime/sessions \
-H "Authorization: Bearer YOUR_COMETAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '
{
"model": "gpt-realtime-2.1",
"modalities": [
"audio",
"text"
],
"voice": "alloy",
"instructions": "You are a helpful customer support voice assistant."
}
'
範例回應:
{
"id": "sess_xxxxx",
"model": "gpt-realtime-2.1",
"status": "active"
}
步驟 3:將音訊輸入傳送至 GPT-Realtime-2.1
建立會話後,串流傳送使用者音訊。
範例流程:
User microphone
|
↓
Audio stream
|
↓
GPT-Realtime-2.1
|
↓
Generated voice response
音訊輸入可包含:
- 電話對話
- 語音指令
- 客服電話
- 互動式助理
與較早的即時模型相比,GPT-Realtime-2.1 透過更佳的靜默偵測、噪聲處理與打斷行為,改善了語音互動。
步驟 4:接收即時音訊回應
模型會透過即時連線回傳產生的音訊回應。
範例事件:
{
"type": "response.audio.delta",
"delta": "base64_audio_chunk"
}
你的應用程式可即時播放收到的音訊片段。
常見實作:
- 基於 WebRTC 的語音應用
- 瀏覽器端助理
- 行動語音應用
- AI 電話代理
步驟 5:為語音代理加入函式呼叫
GPT-Realtime-2.1 支援函式呼叫,使語音代理可執行外部動作。
範例:
{
"tools": [
{
"type": "function",
"name": "check_order_status",
"description": "Retrieve customer order information",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
}
}
}
]
}
可能的語音代理工作流程:
- 「我的包裹在哪裡?」
- 「幫我預約明天的會議。」
- 「取消我的訂閱。」
- 「查詢我的帳戶餘額。」
模型可辨識請求、呼叫相應工具,並自然地延續對話。
步驟 6:配置推理與指示
GPT-Realtime-2.1 支援可配置的推理強度。
範例:
{
"model": "gpt-realtime-2.1",
"reasoning": {
"effort": "medium"
},
"instructions": "Act as a professional travel assistant."
}
建議設定:
| 應用 | 推理等級 |
|---|---|
| 簡單語音指令 | 低 |
| 客服支援 | 中 |
| 複雜工作流程代理 | 高 |