gpt-audio-1.5 的技術規格
| 項目 | gpt-audio-1.5(公開規格) |
|---|---|
| 模型系列 | GPT Audio 系列(以音訊為先的變體) |
| 輸入類型 | 文字、音訊(語音輸入) |
| 輸出類型 | 文字、音訊(語音輸出)、結構化輸出(支援函式呼叫) |
| 上下文視窗 | 128,000 tokens。 |
| 最大輸出 tokens | 16,384(記載於相關 gpt-audio 清單)。 |
| 效能等級 | 較高智慧;中等速度(平衡)。 |
| 延遲特性 | 針對語音互動最佳化(中/低延遲,取決於端點)。 |
| 可用性 | Chat Completions API(音訊輸入/輸出)與平台 Playground;整合於即時/語音介面。 |
| 安全/使用說明 | 針對語音內容設置防護;在生產級語音代理中,請依照慣常的安全與驗證流程對待模型輸出。 |
注意:
gpt-realtime-1.5為密切相關的即時音訊/語音優先變體,針對更低延遲與即時會話進行最佳化;請參見下文比較。
什麼是 gpt-audio-1.5?
gpt-audio-1.5 是一個具備音訊能力的 GPT 模型,可透過 Chat Completions 與相關具音訊能力的 API 同時支援語音輸入與語音輸出。其定位為面向普遍可用的核心音訊模型,用於打造語音代理與語音優先體驗,並在品質與速度之間取得平衡。
主要功能
- 語音輸入/輸出支援:處理口語輸入,並以語音或文字回應,適用於自然語音流程。
- 適用於音訊工作流程的大型上下文:支援超大上下文(文件記載為 128k tokens),可用於多輪、長對話歷程或大型多模態工作階段。
- 串流與 Chat Completions 相容性:可在 Chat Completions 中運作,支援串流音訊回應與函式呼叫等結構化輸出。
- 效能/延遲平衡:為提供高品質音訊回應而調校,在中等吞吐量下運作——適合品質重要的聊天機器人與語音助理。
- 生態系與整合:受平台 Playground 支援,並可用於官方即時/語音端點與合作夥伴整合(Azure/Microsoft Foundry 註解提及類似音訊模型)。
gpt-audio-1.5 與相關音訊模型比較
| 屬性 | gpt-audio-1.5 | gpt-realtime-1.5 |
|---|---|---|
| 主要聚焦 | 針對 Chat Completions 與對話流程提供高品質音訊輸入/輸出。 | 即時 S2S(語音到語音),面向即時語音代理與串流情境提供更低延遲。 |
| 上下文視窗 | 128k tokens。 | 32k tokens(即時變體之文件記載)。 |
| 最大輸出 tokens | 16,384(文件記載)。 | 通常配置為較短的即時回應(文件列出較小的最大 tokens)。 |
| 最佳用途 | 聊天機器人、需要完整聊天語意與音訊的語音助理。 | 即時語音代理、自助服務亭與低延遲對話介面。 |
代表性使用案例
- 用於客戶支援與內部服務台的對話式語音代理。
- 嵌入於應用程式、裝置與自助機中的語音助理。
- 免持工作流程(聽寫、語音搜尋、無障礙)。
- 透過 Chat Completions 將音訊與文字/影像混合的多模態體驗。
限制與操作考量
- 不可直接取代人工 QA:請務必在生產流程中以人工審查驗證語音輸出與後續動作。
- 資源規劃:大型上下文與音訊 I/O 會提升運算量與延遲——針對長時間會話設計串流/分段策略。
- 安全與政策限制:語音輸出具有說服力;大規模部署時請遵循平台安全準則與防護措施。
- 如何存取 GPT Audio 1.5 API
步驟 1:註冊取得 API 金鑰
登入 cometapi.com。若您尚未成為我們的用戶,請先註冊。登入您的 CometAPI 控制台。取得介面的存取憑證 API 金鑰。在個人中心的 API token 處點擊「Add Token」,取得 token 金鑰:sk-xxxxx,並提交。

步驟 2:向 GPT Audio 1.5 API 發送請求
選擇「gpt-audio-1.5」端點來發送 API 請求並設定請求本文。請求方法與請求本文可從我們網站的 API 文件取得。我們的網站也提供 Apifox 測試以便您使用。將 <YOUR_API_KEY> 替換為您帳戶中的實際 CometAPI 金鑰。base url 為 Chat Completions
將您的問題或請求填入 content 欄位——模型將回應該內容。處理 API 回應以取得生成的答案。
步驟 3:擷取並驗證結果
處理 API 回應以取得生成的答案。處理完成後,API 會回傳任務狀態與輸出資料。