gpt-realtime-1.5 的技術規格
| 項目 | gpt-realtime-1.5(公開定位) |
|---|---|
| 模型系列 | GPT Realtime 1.5(針對語音優化的變體) |
| 主要模態 | 語音到語音(S2S) |
| 輸入類型 | 音訊(串流)、文字 |
| 輸出類型 | 音訊(串流)、文字、結構化工具呼叫 |
| API | Realtime API(WebRTC / 持續串流會話) |
| 延遲特性 | 為低延遲、即時對話互動優化 |
| 會話模型 | 有狀態的串流會話 |
| 工具使用 | 支援函式呼叫與工具整合 |
| 目標使用場景 | 即時語音代理、助理、互動式系統 |
注意:精確的 Token 上限與上下文視窗大小未在公開摘要中明確記載;該模型的定位偏重即時響應能力,而非極長上下文會話。
什麼是 gpt-realtime-1.5?
gpt-realtime-1.5 是一款針對即時對話系統設計的低延遲、語音到語音優化模型。不同於傳統的請求—回應模型,它透過持續的串流會話運作,支援自然的輪流發言、打斷處理與動態語音互動。
它專為在對話流程速度比最大上下文長度更重要的應用而打造。
主要功能
- 真正的語音到語音互動 — 接受即時音訊輸入,並以即時串流輸出語音回應。
- 低延遲架構 — 為語音代理提供亞秒級對話響應而設計。
- 串流優先設計 — 透過持續會話運作(WebRTC 或串流協議)。
- 自然輪流發言 — 支援打斷處理與動態對話流程。
- 支援工具呼叫 — 可在即時會話中觸發結構化函式呼叫。
- 可用於生產的語音代理基礎 — 專為互動式助理、資訊亭與嵌入式裝置打造。
基準與效能定位
OpenAI 將 gpt-realtime-1.5 定位為早期即時模型的進化版本,在長時間語音會話期間的指令遵循、穩定性與語調自然度上均有所提升。
不同於偏重程式碼的模型(例如 Codex 變體),其表現更著重於對話延遲、語音自然度與會話穩定性,而非排行榜式基準測試。
gpt-realtime-1.5 與相關模型比較
| 特性 | gpt-realtime-1.5 | gpt-audio-1.5 |
|---|---|---|
| 主要目標 | 即時語音互動 | 支援音訊的聊天工作流程 |
| 延遲 | 為最小延遲優化 | 品質/速度均衡 |
| 會話類型 | 持續串流會話 | 標準 Chat Completions 流程 |
| 上下文容量 | 為響應速度優化 | 支援較大上下文 |
| 最佳使用情境 | 即時語音代理 | 支援音訊的對話助理 |
選擇建議
- 在呼叫中心、資訊亭、AI 接待或即時嵌入式助理場景,選擇 gpt-realtime-1.5。
- 若語音聊天應用需要更長對話記憶或多模態工作流程,選擇 gpt-audio-1.5。
代表性使用案例
- AI 呼叫中心代理
- 智慧裝置助理
- 互動式資訊亭
- 即時教學系統
- 即時語言練習工具
- 語音控制應用
- 如何存取 GPT realtime 1.5 API
步驟 1:註冊取得 API Key
登入 cometapi.com。若尚未成為我們的使用者,請先註冊。登入你的 CometAPI 控制台。取得介面的存取憑證 API key。在個人中心的 API token 中點擊「Add Token」,取得 Token Key:sk-xxxxx 並提交。

步驟 2:向 GPT realtime 1.5 API 發送請求
選擇 “gpt-realtime-1.5” 端點發送 API 請求並設定請求本文。請求方法與請求本文請參考我們網站的 API 文件取得。我們的網站也提供 Apifox 測試,方便你使用。將 <YOUR_API_KEY> 替換為你帳戶中的實際 CometAPI 金鑰。基礎 URL 為 Chat Completions
將你的問題或請求放入 content 欄位—這是模型會回應的內容。處理 API 回應以取得生成的答案。
步驟 3:擷取並驗證結果
處理 API 回應以取得生成的答案。處理完成後,API 會回傳任務狀態與輸出資料。