GPT-Realtime-2 的技術規格
| 規格 | 詳細資訊 |
|---|---|
| 發布 | 2026 年 5 月 7 日 |
| API | Realtime API (GA) |
| 輸入 | 音訊、文字、影像 |
| 輸出 | 音訊、文字 |
| 推理能力 | GPT-5-class |
| 串流 | 是 |
| 全雙工 | 是 |
| 函式呼叫 | 是 |
| 多模態 | 是 |
| 中斷 | 支援 |
| 低延遲 | 是 |
| 企業級 SLA | 是 |
| 生產就緒 | 是 |
什麼是 GPT-Realtime-2
GPT-Realtime-2 透過採用統一的、音訊原生架構與 GPT-5-class 推理能力,突破傳統語音處理流程,為會話式 AI 帶來重大躍進。其對串流語音、多模態輸入、函式呼叫與企業級部署的支援,讓其非常適合下一代語音代理、客戶支援、醫療、教育與智慧助理等場景。
GPT-Realtime-2 的功能與亮點
1. GPT-5-Class 推理能力
與以往的即時模型不同,GPT-Realtime-2 能解決:
- 多步驟任務
- 推理密集型查詢
- 規劃
- 排程
- 複雜對話
而不僅僅是產生流暢的語音。
2. 超低延遲
專為:
- 電話代理
- 語音助理
- 客戶服務
- AI 伴侶
而設計。2026 年 7 月的更新將 p95 延遲至少降低了 25%。
3. 工具呼叫
在即時對話期間,模型可以:
- 搜尋資料庫
- 查詢庫存
- 查詢 CRM
- 擷取文件
- 執行 API
- 呼叫自訂函式
而無需結束對話。
4. 自然語音
模型支援:
- 中斷
- 自然停頓
- 對話節奏
- 語助詞
- 情緒感知的時間控制
- 動態語速
使對話更貼近人類溝通。
5. 多模態理解
輸入可以包含:
- 語音
- 文字
- 影像
可支援如下場景:
"我在解釋問題時,請看這張圖片。"
6. 生產級可靠性
GA Realtime API 新增:
- SLA 支援
- 穩定的 SDK
- 生產環境端點
- 企業級部署
超越早期的 beta 服務。
GPT-Realtime-2 的基準表現
OpenAI 更強調質性改進,而非發布完整的基準測試套件。對外公開的指標包含:
| 指標 | GPT-Realtime-2 |
|---|---|
| 語音到語音 | 原生 |
| GPT-5-Class 推理能力 | 是 |
| 工具呼叫 | 是 |
| 影像理解 | 是 |
| 串流 | 是 |
| 生產級 SLA | 是 |
| 中斷 | 原生 |
| p95 延遲改進(v2.1) | ≥25% |
GPT-Realtime-2 與其他語音模型對比
| 功能 | GPT-Realtime-2 | GPT-4o Realtime | Gemini Live | ElevenLabs Conversational AI |
|---|---|---|---|---|
| 音訊原生 | ✅ | 部分 | 是 | 否 |
| GPT-5 級推理能力 | ✅ | 否 | 否 | 否 |
| 函式呼叫 | ✅ | 受限 | 受限 | 否 |
| 影像輸入 | ✅ | 是 | 是 | 否 |
| 企業級 API | ✅ | Beta | 是 | 是 |
| 串流 | ✅ | 是 | 是 | 是 |
| 全雙工 | ✅ | 部分 | 是 | 否 |
| 生產級 SLA | ✅ | 否 | 是 | N/A |
GPT-Realtime-2 透過將先進推理與低延遲語音互動結合於可用於生產環境的 API 中而脫穎而出。
限制
- 音訊 token 成本高於純文字推理。
- 長時間語音會話需要謹慎管理頻寬與延遲。
- 儘管模型可辨識聲音線索,獨立研究指出情緒脈絡未必能在後續決策中一致體現,因此在敏感應用中仍需人類監督。
如何在 CometAPI 上使用 GPT-Realtime-2 API
CometAPI 提供統一的 API 閘道,讓開發者能以一致介面存取多個 AI 模型——包括相容 OpenAI 的即時模型(可用性取決於提供者所支援的型錄)。
一般流程如下:
步驟 1:建立帳戶
在 CometAPI 平台註冊並取得 API 金鑰。
步驟 2:設定驗證
在請求標頭中加入您的 API 金鑰:
Authorization: Bearer YOUR_API_KEY
步驟 3:選擇模型
指定即時模型的識別符(例如您 CometAPI 帳戶支援的 GPT-Realtime-2 模型名稱)。
步驟 4:建立即時連線
開啟 API 支援的 WebSocket 或即時連線,以雙向串流音訊。
步驟 5:串流音訊
持續傳送麥克風音訊並接收串流語音回應,以實現低延遲對話。
步驟 6:啟用進階功能
依 CometAPI 的實作,您可以設定:
- 函式/工具呼叫
- 對話記憶
- 影像輸入
- 語音活動偵測
- 中斷處理
- 推理層級(若支援)
在實作前,請參考 CometAPI 最新文件以確認支援的模型名稱、端點、驗證與即時協定細節,因這些可能與 OpenAI 的官方 API 獨立演進。