GPT-Image-1.5 API とは?
GPT-Image-1.5 は OpenAI の GPT Image ファミリーの最新メンバーで、ChatGPT の刷新された Images 体験を支えるモデルです。画像生成を「目新しい実験」から本番運用レベルのクリエイティブツールへと進化させることを目指して設計されており、より高いフォトリアリズム、反復的な編集に対するきめ細かな制御、そして対話型やエンタープライズ向けワークフローを支える高速な推論を実現します。
gpt-image-1.5 API は、1 つ以上の画像入力(ファイル識別子またはバイト列)とテキストプロンプトを受け取り、生成画像または編集済み画像を返すマルチモーダル画像モデルのエンドポイントです。以下をサポートします:
- テキストから画像の生成(プロンプトから作成)
- 画像編集 / インペイント / コンポジット(既存画像に対して指示を適用、複数画像入力に対応)
- Responses API を介した反復的なマルチターン編集ワークフロー(“tweak & iterate” な UI を実現)
この API は、旧来の DALL·E の制約とは異なる形で画像プロンプトを扱います。GPT 画像モデルは大幅に長いテキストプロンプト(目安として 32,000 文字)を受け付けられるため、複雑で制約の多い指示も実用的になります。
主な特徴(実用面)
- 編集容易性 / マルチターンでの一貫性の向上: 反復編集において、キャラクターの外見、ライティング、主要な視覚属性を維持します。これにより、製品カタログやブランドアセットのような「同一モデルで繰り返し編集」するワークフローがより信頼できるものになります。
- スループットの向上 — GPT Image 1 比で最大 4× の高速化により、反復的なクリエイティブワークフローのレイテンシーを低減。
- コスト最適化 — 画像の入出力コストを GPT Image 1 比で約 20% 低減し、高ボリュームユーザーの 1 画像あたりの反復コストを削減。
- 複数画像のコンポジット & スタイル参照 — 複数の参照画像を受け付け、シーンを合成したりスタイル/ライティングを転移。
- 品質/忠実度のパラメータ — スピードと忠実度のトレードオフを調整可能(大量生成では低品質、本番アセットでは高品質など)。
- マルチターン編集 / Responses API 連携 — 段階的なワークフロー(変更点を指示し、「微調整を重ねる」状態保持型の反復)を可能にします。
技術的な能力
- テキストプロンプト上限(画像モデル): 最大32,000 文字(注:OpenAI は GPT 画像モデルのテキスト長許容量としてこれを文書化)。長文かつ制約の多いプロンプトに利用可能。
- 画像入力: File ID(マルチターンフローでは推奨)または生のバイト列を受け付けます。合成や参照のために複数画像の指定が可能。
- 出力: PNG/JPEG もしくはプラットフォーム既定の画像アーティファクトを API が返します(ChatGPT では添付として返される場合あり)。複数候補の生成や、反復要求による出力の洗練に対応。
- 生成モード: テキストからの生成、画像編集(指示に基づくインペイント/拡張)、およびバリアント。マルチターン編集では「add/subtract/combine」スタイルの指示をサポート。
- 指示に敏感な編集: モデルは指示の忠実性(「ロゴは変更しない」「ポーズとライティングを維持」などの不変条件の保持)に最適化。プロンプトエンジニアリングのパターン(各反復で不変条件を明示的に繰り返す)がセマンティックドリフトの低減に有効。
ベンチマーク性能
- リーダーボードでの位置付け: とある統合レポートでは、Artificial Analysis のテキストから画像ランキングにおいて GPT Image 1.5 が約 1264 ポイントで首位、次点モデルに対して有意な差を示したとされています。
- タスク別指標(編集 & 保持): Microsoft Foundry の評価要約では、単一ターンの BinaryEval における二値変更の成功率が 100%、顔保持スコアが AuraFace 指標で**約 90%**と報告。これらの比較表では、編集の忠実性や保持性能で一部競合や従来の OpenAI モデルを上回る結果が示されています。

同種モデルとの比較
- GPT Image 1(従来世代)比: より高速(最大 4×)、より低コスト(画像 I/O コストが約 20% 減)、編集の忠実性も強化。プロトタイプ/デモ段階から「本番対応の」画像ワークフローへ。
- Google の Nano Banana Pro / Gemini 画像モデル比: GPT-Image-1.5 と Google の Nano Banana Pro / Gemini 3 ファミリーは互いに拮抗しており、プロンプトの種類によって得手不得手が分かれます。OpenAI は編集の忠実性と反復速度を強調し、Google は一部の例でスタジオ級のリアリズムが評価されています。
- Qwen Image やその他のオープン/クローズドモデル比: 単一ターンの編集・保持系指標では GPT-Image-1.5 が Qwen Image を上回るケースが見られる一方、マルチターンや特定領域の評価では差が縮まることがあります。
GPT-Image-1.5 が得意とする領域
- E コマースの製品イメージング: 大量バリアント、背景置換、単一写真からの一貫した商品カタログ作成(ブランド/ロゴの保持)。
- クリエイティブ & マーケティング用アセット制作: コンセプトの素早い反復、フォトリアルなモックアップ、制御されたスタイル転移。
- フォトレタッチ & 編集ワークフロー: 服装/ヘアスタイルのリアルな試着、人物同一性とライティングを保つ選択的レタッチ。
- デザインツール連携: デザインプラットフォームや CMS に組み込み、オンデマンドの画像バリアント生成(忠実度パラメータでコスト制御)。
- 多段のコンポジットパイプライン: 複数画像入力により、複雑なシーンの合成や参照ベースの生成が可能。
GPT Image 1.5 API の利用方法
Step 1: Sign Up for API Key
cometapi.com にログインしてください。まだユーザーでない場合は、先にご登録ください。CometAPI console にサインインします。インターフェースのアクセス認証 API キーを取得します。パーソナルセンターの API トークンで “Add Token” をクリックし、トークンキー(sk-xxxxx)を取得して送信します。
Step 2: Send Requests to GPT Image 1.5 API
“gpt-image-1.5” エンドポイントを選択して API リクエストを送り、リクエストボディを設定します。リクエストメソッドとリクエストボディは当社ウェブサイトの API ドキュメントをご参照ください。利便性のため、当社サイトでは Apifox テストも提供しています。アカウントの CometAPI キーで <YOUR_API_KEY> を置き換えてください。base url is Images (https://api.cometapi.com/v1/images/generations) and [Image Editing]
content フィールドに質問やリクエストを入力してください — モデルはその内容に応答します。API 応答を処理して生成結果を取得します。
Step 3: Retrieve and Verify Results
API 応答を処理して生成結果を取得します。処理後、API はタスクのステータスと出力データを返します。
See also Gemini 3 Pro Preview API