GPT-Realtime-2.1 の技術仕様
| 仕様 | 詳細 |
|---|---|
| モデル名 | GPT-Realtime-2.1 |
| プロバイダー | OpenAI |
| モデルファミリー | GPT-Realtime series |
| モデルタイプ | リアルタイムのマルチモーダル音声推論モデル |
| 主な機能 | 音声対音声のAIエージェント |
| 入力モダリティ | Text, Audio, Image |
| 出力モダリティ | Text, Audio |
| コンテキストウィンドウ | 128,000 tokens |
| 最大出力トークン数 | 32,000 tokens |
| 推論サポート | 設定可能な推論の強度 |
| 関数呼び出し | Supported |
| 構造化出力 | Not supported |
| ファインチューニング | Not supported |
| 動画入力 | Not supported |
| 主な API エンドポイント | Realtime API |
| 知識カットオフ | 2024年9月30日 |
出典: OpenAI GPT-Realtime-2.1 のモデルドキュメント。
GPT-Realtime-2.1 とは?
GPT-Realtime-2.1 は、OpenAI が提供する高度なリアルタイム音声モデルで、音声で「聞き・考え・自然に応答」する会話型AIエージェントの構築に適しています。
別個の音声認識・言語理解・音声合成パイプラインに依存する従来の音声アシスタントと異なり、GPT-Realtime-2.1 はネイティブの音声対音声インタラクションを提供し、より低遅延で、割り込み処理や文脈理解に優れた会話を実現します。
本モデルは、カスタマーサービス、AIアシスタント、セールスオートメーション、教育プラットフォーム、インタラクティブな音声体験など、プロダクションの音声アプリケーション向けに最適化されています。
GPT-Realtime-2.1 のベンチマーク性能
GPT-Realtime-2.1 は、実運用のリアルタイム対話指標に注力して改善されています:
| 機能 | 改善点 |
|---|---|
| 音声の割り込み処理 | 改善 |
| ノイズ耐性 | 改善 |
| 英数字認識 | 改善 |
| ツールベースの音声ワークフロー | 対応 |
| 音声対音声インタラクション | 対応 |
GPT-Realtime-2.1 の主な機能
1. ネイティブな音声対音声インタラクション
GPT-Realtime-2.1 は、個別の音声認識や音声合成パイプラインを不要にします。
従来の音声アーキテクチャ:
User Voice
↓
Speech-to-Text
↓
LLM Processing
↓
Text-to-Speech
↓
Voice Response
GPT-Realtime-2.1:
User Voice
↓
GPT-Realtime-2.1
↓
Voice Response
これにより遅延が減り、会話の流れが向上します。
2. 音声会話品質の向上
GPT-Realtime-2.1 は、実環境での音声に関する複数の課題を改善しています。
割り込み対応の改善
ユーザーは AI が発話中でも自然に割り込めます。
例:
ユーザー:
「フライトを予約して—いや、やっぱり東京に変更で。」
インタラクションを最初からやり直すことなく、会話の変更に追随できます。
無音・ノイズ処理の改善
以下のように音声品質が万全でない環境向けに最適化されています:
- コールセンター
- モバイルデバイス
- 公共空間
- スマートデバイス
3. 高度な音声エージェントのツール利用
GPT-Realtime-2.1 はツール呼び出しに対応し、音声エージェントがアクションを実行できます。
例:
カスタマーサービス:
User:
"Where is my order?"
AI:
→ Calls order database API
→ Retrieves status
→ Responds by voice
エンタープライズワークフロー:
Voice command
↓
Reasoning
↓
API execution
↓
Voice confirmation
これにより、自律的な音声エージェントに適しています。
4. 設定可能な推論能力
速度重視だった従来のリアルタイム音声モデルとは異なり、GPT-Realtime-2.1 は推論の強度を設定可能にしました。
開発者は次のバランスを取れます:
- 応答遅延
- 正確性
- タスクの複雑さ
低い推論設定:
- シンプルな会話
- FAQ アシスタント
高い推論設定:
- 複雑な顧客要望
- 複数ステップのワークフロー
- 事業運用
5. 数字と技術情報の認識精度向上
音声エージェントが苦手とする以下の項目を改善しました:
- 口座番号
- シリアル番号
- 住所
- 製品コード
- 財務情報
英数字認識が向上し、エンタープライズ向け音声システムにより適しています。
6. マルチモーダル入力対応
GPT-Realtime-2.1 は次をサポートします:
| 入力 | 対応 |
|---|---|
| テキスト | ✅ |
| 音声 | ✅ |
| 画像 | ✅ |
| 動画 | ❌ |
画像入力により、次のようなユースケースが可能になります:
- ビジュアルカスタマーサポート
- 文書の解釈
- カメラベースのアシスタント
GPT-Realtime-2.1 と GPT-Realtime-2 と GPT-4o Realtime の比較
| モデル | 強み | 最適な用途 |
|---|---|---|
| GPT-Realtime-2.1 | 最も優れたリアルタイム推論と音声エージェント機能 | プロダクション向け音声エージェント |
| GPT-Realtime-2 | 強力なリアルタイム音声推論 | 高度な会話型アプリ |
| GPT-4o Realtime | 高速なマルチモーダル対話 | 汎用音声アシスタント |
GPT-Realtime-2.1 と GPT-Realtime-2 の比較
GPT-Realtime-2.1 で改善された点:
- 音声割り込みからの復帰
- ノイズ処理
- 認識精度
- 会話の堅牢性
共通点:
- 音声対音声アーキテクチャ
- ツール呼び出し
- 推論サポート
- Realtime API へのアクセス
GPT-Realtime-2.1 と GPT-4o Realtime の比較
GPT-Realtime-2.1 は、より高度なエージェントワークフロー向けに位置付けられています。
GPT-4o Realtime と比較:
| 機能 | GPT-Realtime-2.1 | GPT-4o Realtime |
|---|---|---|
| 推論 | より強力 | 一般的 |
| コンテキスト | 128K | 32K |
| ツール利用 | 対応 | 対応 |
| 音声エージェント | 高度 | 一般的 |
| 複雑なワークフロー | より適している | 適している |
CometAPI で GPT-Realtime-2.1 API を使う方法
GPT-Realtime-2.1 は低遅延の音声エージェントアプリケーション向けに設計されています。音声対音声のリアルタイム対話、音声入出力、画像入力、推論強度の設定、ツール対応の音声ワークフローのための関数呼び出しをサポートします。OpenAI は Realtime API を通じて、WebRTC、WebSocket、SIP ベースのリアルタイム通信手段を提供しています。
CometAPI は先進モデルへの統合を単一レイヤーで提供し、プロバイダー認証や SDK ロジック、インフラを個別に管理することなく、GPT-Realtime-2.1 スタイルのワークフローにアクセスできます。
ステップ1: CometAPI の API キーを取得
CometAPI アカウントを作成し、開発者コンソールから API トークンを生成します。
API リクエストには次を含めます:
Authorization: Bearer YOUR_COMETAPI_API_KEY
Content-Type: application/json
API キーはリクエストを認証し、CometAPI 経由で利用可能な AI モデルを呼び出せるようにします。
ステップ2: GPT-Realtime-2.1 セッションを作成
GPT-Realtime-2.1 は、従来のリクエスト-レスポンス型ではなく、永続的なリアルタイムセッションで動作します。
リアルタイムセッションは次を保持します:
- 音声入力ストリーム
- モデルの応答
- 会話状態
- ツール呼び出し
- 割り込み
OpenAI の Realtime API は、WebRTC、WebSocket、SIP インターフェースによるリアルタイム通信をサポートします。
例:
curl https://api.cometapi.com/v1/realtime/sessions \
-H "Authorization: Bearer YOUR_COMETAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '
{
"model": "gpt-realtime-2.1",
"modalities": [
"audio",
"text"
],
"voice": "alloy",
"instructions": "You are a helpful customer support voice assistant."
}
'
応答例:
{
"id": "sess_xxxxx",
"model": "gpt-realtime-2.1",
"status": "active"
}
ステップ3: GPT-Realtime-2.1 に音声入力を送信
セッション作成後、ユーザー音声をストリーミングします。
ワークフロー例:
User microphone
|
↓
Audio stream
|
↓
GPT-Realtime-2.1
|
↓
Generated voice response
音声入力には次が含まれます:
- 電話での会話
- 音声コマンド
- カスタマーサポートの通話
- 対話型アシスタント
GPT-Realtime-2.1 は、以前のリアルタイムモデルと比べ、無音検出、ノイズ処理、割り込み挙動が改善されています。
ステップ4: リアルタイム音声応答を受信
モデルは、生成した音声応答をリアルタイム接続を通じて返します。
イベント例:
{
"type": "response.audio.delta",
"delta": "base64_audio_chunk"
}
アプリケーションは受信した音声チャンクを即時再生できます。
典型的な実装例:
- WebRTC 音声アプリケーション
- ブラウザベースのアシスタント
- モバイル音声アプリ
- AI 電話エージェント
ステップ5: 音声エージェントに関数呼び出しを追加
GPT-Realtime-2.1 は関数呼び出しをサポートし、音声エージェントが外部アクションを実行できます。
例:
{
"tools": [
{
"type": "function",
"name": "check_order_status",
"description": "Retrieve customer order information",
"parameters": {
"type": "object",
"properties": {
"order_id": {
"type": "string"
}
}
}
}
]
}
想定される音声エージェントのワークフロー:
- "私の荷物はどこですか?"
- "明日の会議を予約して。"
- "サブスクリプションを解約して。"
- "口座残高を確認して。"
モデルはリクエストを理解し、適切なツールを呼び出して、自然に会話を続けます。
ステップ6: 推論と指示を設定
GPT-Realtime-2.1 は推論の強度設定をサポートします。
例:
{
"model": "gpt-realtime-2.1",
"reasoning": {
"effort": "medium"
},
"instructions": "Act as a professional travel assistant."
}
推奨設定:
| アプリケーション | 推論レベル |
|---|---|
| シンプルな音声コマンド | 低 |
| カスタマーサポート | 中 |
| 複雑なワークフローエージェント | 高 |