gpt-audio-1.5 の技術仕様
| 項目 | gpt-audio-1.5 (公開仕様) |
|---|---|
| モデルファミリー | GPT Audio ファミリー(音声優先のバリアント) |
| 入力タイプ | テキスト、音声(音声入力) |
| 出力タイプ | テキスト、音声(音声出力)、構造化出力(関数呼び出しに対応) |
| コンテキストウィンドウ | 128,000 トークン。 |
| 最大出力トークン数 | 16,384(関連する gpt-audio のリスティングに記載)。 |
| パフォーマンス階層 | 高い知性;中程度の速度(バランス型)。 |
| レイテンシプロファイル | 音声対話向けに最適化(エンドポイントにより中/低レイテンシ)。 |
| 提供形態 | Chat Completions API(音声入出力)およびプラットフォームのプレイグラウンド;リアルタイム/音声サーフェス全体に統合。 |
| 安全性/使用上の注意 | 音声コンテンツ向けのガードレール;本番の音声エージェントでは、通常の安全対策と検証を適用すること。 |
注:
gpt-realtime-1.5は緊密に関連するリアルタイム音声/ボイス優先のバリアントで、低レイテンシとリアルタイムセッションに最適化されています。下記を参照して比較してください。
gpt-audio-1.5 とは?
gpt-audio-1.5 は、Chat Completions および関連する音声対応 API を通じて、音声入力と音声出力の両方をサポートする音声対応の GPT モデルです。品質と速度のバランスを取りつつ、音声エージェントや音声優先のエクスペリエンスを構築するための、一般提供される主要な音声モデルとして位置づけられています。
主な機能
- 音声入力/音声出力のサポート: 音声での入力に対応し、音声またはテキストで自然なボイスフローの応答を返します。
- 音声ワークフロー向けの大きなコンテキスト: 非常に大きなコンテキスト(ドキュメント上は 128k トークン)をサポートし、マルチターンの長い会話履歴や大規模なマルチモーダルセッションが可能。
- ストリーミングと Chat Completions との互換性: Chat Completions 内で動作し、音声ストリーミング応答や関数呼び出しの構造化出力に対応。
- 性能/レイテンシのバランス: 音声応答の品質を重視しつつ中程度のスループットに調整—品質が重要なチャットボットや音声アシスタントに適しています。
- エコシステムと統合: プラットフォームのプレイグラウンドでサポートされ、公式のリアルタイム/音声エンドポイントやパートナー統合で利用可能(Azure/Microsoft Foundry の注記では類似の音声モデルに言及)。
gpt-audio-1.5 と関連音声モデルの比較
| 特性 | gpt-audio-1.5 | gpt-realtime-1.5 |
|---|---|---|
| 主な焦点 | Chat Completions と会話フロー向けの高品質な音声入出力。 | 低レイテンシのライブ音声エージェントやストリーミング向けのリアルタイム S2S(音声対音声)。 |
| コンテキストウィンドウ | 128k トークン。 | 32k トークン(リアルタイム版の仕様に記載)。 |
| 最大出力トークン数 | 16,384(記載あり)。 | 通常は短いリアルタイム応答向けに設定(ドキュメントではより小さい最大トークン数を記載)。 |
| 最適な用途 | チャットボット、完全なチャット意味論+音声が必要な音声対応アシスタント。 | ライブ音声エージェント、キオスク、低レイテンシの会話型インターフェース。 |
代表的なユースケース
- カスタマーサポートや社内ヘルプデスク向けの会話型音声エージェント。
- アプリ、デバイス、キオスクに組み込まれた音声対応アシスタント。
- ハンズフリーのワークフロー(ディクテーション、音声検索、アクセシビリティ)。
- Chat Completions を介して音声とテキスト/画像を組み合わせるマルチモーダル体験。
制約と運用上の考慮事項
- 人間の QA の代替にはならない: 本番環境では、音声出力や後段のアクションを人によるレビューで常に検証してください。
- リソース計画: 大きなコンテキストと音声入出力は計算資源やレイテンシを増やす可能性があります—長いセッションではストリーミング/分割戦略を設計しましょう。
- 安全性とポリシーの制約: 音声出力は説得力を持ち得ます。大規模展開時はプラットフォームの安全ガイドラインとガードレールに従ってください。
- GPT Audio 1.5 API へのアクセス方法
ステップ 1: API キーに登録
cometapi.com にログインします。まだユーザーでない場合は、まず登録してください。CometAPI console にサインインします。インターフェースのアクセス認証 API キーを取得します。パーソナルセンターの API トークンで「Add Token」をクリックし、トークンキー(sk-xxxxx)を取得して送信します。

ステップ 2: GPT Audio 1.5 API にリクエストを送信
“gpt-audio-1.5” エンドポイントを選択して API リクエストを送信し、リクエストボディを設定します。リクエストメソッドとリクエストボディは当社ウェブサイトの API ドキュメントに記載しています。当社サイトでは便利な Apifox テストも提供しています。<YOUR_API_KEY> をアカウントの実際の CometAPI キーに置き換えてください。ベース URL は Chat Completions です。
質問や依頼内容を content フィールドに挿入します—モデルはその内容に応答します。API レスポンスを処理して生成された回答を取得します。
ステップ 3: 結果の取得と検証
API レスポンスを処理して生成結果を取得します。処理後、API はタスクのステータスと出力データを返します。