什麼是 GPT-Image-1.5 API?
GPT-Image-1.5 是 OpenAI 的 GPT Image 系列最新成員,也是驅動 ChatGPT 全新 Images 體驗的模型。它旨在將圖像生成從新奇實驗推向生產級創意工具:更高的照片級寫實度、對迭代編輯更細緻的控制,以及更快的推理以支援互動式與企業級工作流程。
gpt-image-1.5 API 是一個多模態圖像模型端點,可接受一個或多個圖像輸入(檔案識別符或位元組)以及文字提示,並返回生成的圖像或已編輯的圖像。它支援:
- 文字轉圖像生成(依提示建立),
- 圖像編輯 / 補畫(in-painting)/ 合成(將指令套用至現有圖像,可接受多張圖像作為輸入),以及
- 透過 Responses API 進行的迭代、多輪編輯工作流程(支援「微調與反覆迭代」的 UI)。
相較於舊版 DALL·E 的限制,API 對圖像提示的處理方式不同:GPT 圖像模型可接受明顯更長的文字提示(建議上限 32k 字元),使得複雜、約束繁多的指令成為可能。
主要特性(實用面)
- 可編輯性提升 / 多輪一致性: 在反覆編輯中保留角色外觀、光線與關鍵視覺屬性。這讓「相同模型、重複編輯」在產品型錄或品牌資產等工作流程中更可靠。
- 更快的吞吐量 — 4× 速度提升,相較 GPT Image 1 降低迭代式創意流程的延遲。
- 成本優化 — 與 GPT Image 1 相比,圖像輸入/輸出成本降低約 20%,為高量用戶降低每次影像迭代成本。
- 多圖合成與風格參照 — 可接受多張參考圖以合成場景或轉移風格/光線。
- 品質/保真度可調 — 透過 API 參數在速度與保真度間取捨(批量生成用較低品質;生產資產用較高品質)。
- 多輪編輯 / 整合 Responses API — 支援分步工作流程(先提出變更,之後在保留狀態下「進行微調」)。
技術能力
- 文字提示上限(圖像模型): 最多 32,000 個字元(注意:OpenAI 將此記為 GPT 圖像模型的文字長度容許值)。適用於冗長且約束繁多的提示。
- 圖像輸入: 接受檔案 ID(多輪流程建議使用)或原始位元組;可提供多張圖以進行合成與參考。
- 輸出: API 返回 PNG/JPEG 或平台預設的圖像產物(或作為附件出現在 ChatGPT 內)。輸出可包含多個候選圖像,並支援透過多次請求來逐步優化結果。
- 生成模式: 文字轉圖、圖像編輯(依指令補畫/延展)、以及變體。多輪編輯支援「新增/刪減/組合」式指令。
- 指令感知的編輯: 模型優化於指令遵循度(保留如「不要更改 logo」、「保持姿勢與光線」等不變項)。提示工程模式(在每次迭代中重申不變項)可降低語義漂移。
基準表現
- 排行榜位置: 某份綜合報告引述 Artificial Analysis 排行榜上,GPT Image 1.5 以 ~1264 分領先文字轉圖排名,較下一名有可觀差距。
- 任務層級指標(編輯與保留): Microsoft Foundry 的評估摘要顯示,GPT-Image-1.5 在單輪 BinaryEval 中達成近乎完美的二元修改成功率(100%),並在 AuraFace 指標上的人臉保留得分約 90%;該比較結果顯示其在保留性與編輯保真度方面領先部分競品。

GPT-Image-1.5 與同類模型的比較
- 對比 GPT Image 1(OpenAI 先前一代): 更快(最高 4×)、更便宜(圖像 I/O 成本約低 20%)、更強的編輯保真度——旨在將圖像工作流程從「原型/示範」推向「更適合生產」。
- 對比 Google 的 Nano Banana Pro / Gemini 圖像模型: GPT-Image-1.5 與 Google 的 Nano Banana Pro / Gemini 3 系列為旗鼓相當的競爭者——各自在不同提示類型上有優勢。OpenAI 的訊息強調編輯保真與迭代速度;Google 的方案在部分示例中因影棚級寫實感而受讚譽。
- 對比 Qwen Image 與其他開源/閉源模型: GPT-Image-1.5 在單輪評測的多項編輯與保留指標上優於 Qwen Image,但在多輪或其他特定領域測試中差距縮小。
GPT-Image-1.5 的強項
- 電商產品影像: 批量變體、背景替換、由單張照片建立一致的產品型錄(品牌/Logo 保留)。
- 創意與行銷素材製作: 快速概念迭代、照片級寫實模型圖、可控風格轉移。
- 照片修圖與編輯工作流程: 逼真服飾/髮型試穿、選擇性修飾,同時保留身份與光線。
- 設計工具整合: 接入設計平台或 CMS 以隨需生成圖像變體(透過保真度調節控制成本)。
- 多步合成管線: 多圖輸入允許合成與基於參考的生成,以打造複雜場景。
如何存取 GPT Image 1.5 API
步驟 1:註冊取得 API Key
登入 cometapi.com。若您尚未成為我們的用戶,請先註冊。登入您的 CometAPI console。取得該介面的存取憑證 API key。在個人中心的 API token 處點擊 “Add Token”,取得 token 金鑰:sk-xxxxx 並提交。
步驟 2:向 GPT Image 1.5 API 發送請求
選擇 “gpt-image-1.5” 端點發送 API 請求並設定請求主體。請求方法與請求主體可於我們的網站 API 文件取得。我們的網站亦提供 Apifox 測試以供便利。將 <YOUR_API_KEY> 替換為您帳號中的 CometAPI 實際金鑰。base url 為 Images(https://api.cometapi.com/v1/images/generations)與 [Image Editing]。
將您的問題或請求填入 content 欄位——模型將回應此內容。處理 API 回應以取得生成結果。
步驟 3:擷取並驗證結果
處理 API 回應以取得生成的答案。處理完成後,API 會返回任務狀態與輸出資料。