TL;DR
GPT-Image-2.5 是 OpenAI 最新一代的影像生成與編輯技術,於2026 年 9 月 8 日發佈,作為 ChatGPT Images 2.0 與 GPT-Image-2 API 世代的後繼者。
對開發者而言,GPT-Image-2.5 以兩個模型提供:Flare 與 Sunburst。Flare 設計為多數生產環境的預設選項,兼具更高影像品質與大幅更快的生成速度。Sunburst 則面向在意編輯精度與最終影像保真度高於延遲的工作流程。
這次升級不僅是畫面更銳利。GPT-Image-2.5 提升了參考影像保真度、局部編輯、多輪編輯一致性、視覺寫實度、指令遵循能力、透明背景生成,以及高解析度輸出。OpenAI 表示影像生成延遲相較於 Images 2.0 已降低最多 50%。
早期的人類偏好評測也相當亮眼。在 9 月 9 日的 Arena 快照中,Sunburst 以 1421 ± 13 的 Elo 排名第一,Flare 以 1399 ± 13 排名第二,領先 Image 2 的 1381 ± 4。
開發者可透過 CometAPI 存取兩種變體:GPT-Image-2.5 Flare 使用 gpt-image-2.5-flare 應對更快、量大工作,而 GPT-Image-2.5 Sunburst 使用 gpt-image-2.5-sunburst,在需要編輯精度與最終影像保真度時最為適合。兩者均可透過熟悉的 /v1/images/generations 與 /v1/images/edits 路由使用;若需透明輸出,建議選用 PNG 或 WebP。
Key Takeaways
- GPT-Image-2.5 是一個代際升級,而非僅小幅提升影像品質。
- 開發者可用兩個變體:Flare 著重速度與規模,Sunburst 著重最大編輯精度。
- 根據 OpenAI,Flare 提供比 Image 2 更高品質且延遲降低 50%。
- 兩個變體皆支援 low、medium、high、xhigh、max 與 auto 品質模式。
- 自訂輸出尺寸可達 4K 等級像素數,單邊最長可達 3840 像素。
- 目前 Arena 結果顯示,Sunburst 與 Flare 在文字轉影像與單影像編輯上均優於 Image 2。
- 兩個模型使用相同的官方 Token 費率:文字輸入 $5/M、影像輸入 $8/M、影像輸出 $30/M。
- CometAPI 的 Flare API 目前為構建生產影像工作流程的開發者提供更低的標示輸入/輸出價格。
What Is GPT-Image-2.5?
GPT-Image-2.5 是 OpenAI 最新的影像生成與影像編輯模型家族。在 ChatGPT 中,此技術以 ChatGPT Images 2.5 呈現。在 API 層,開發者可在兩個不同模型中選擇:
- gpt-image-2.5-flare
- gpt-image-2.5-sunburst
這個區別很重要,因為「GPT-Image-2.5」更應被理解為一個模型世代或家族,而非單一 API 模型 ID。
GPT-Image-2.5 建立在 CometAPI 中的 Image 2 API 能力之上,更加重視影像創作的工作流程設計。新世代不再把每次生成視為幾乎彼此獨立的結果,而是致力於在用戶反覆迭代時,保留主角、構圖、風格與先前的編輯。
OpenAI 強調在參考影像保真度與精準編輯上的提升,以及多輪一致性、更豐富的材質與更自然的光影。這使 GPT Image 2.5 對商業創意工作尤其實用,因為單一的編輯需求不應不可預期地重建整個素材。
一項重要變化是引入 xhigh 與 max。早期的 GPT Image 模型僅支援到 high 品質設定;因此 GPT-Image-2.5 為開發者提供了更多延遲與保真度之間的控制。模型也支援自訂尺寸最高至 8,294,400 總像素,儘管 OpenAI 標示 2560×1440 以上的解析度為實驗性。寬與高必須為 16 的倍數。
Flare vs Sunburst
Flare 與 Sunburst 共享 GPT-Image-2.5 的核心能力,但各自優化不同的生產環境約束。
| 決策因素 | Flare | Sunburst |
|---|---|---|
| 主要目標 | 以規模提供快速且高品質的生成 | 追求最大生成與編輯精度 |
| 相對延遲 | 較快;適合互動式工作流程 | 較慢;優先保真度與可控性 |
| 最佳工作負載 | 社群素材、原型、視覺搜尋、高量應用 | 行銷活動創意、產品主視覺、困難的局部編輯 |
| 編輯行為 | 強化參考保真與多輪一致性 | 當精確保留細節最重要時是最強選擇 |
| 建議路由 | 例行請求的預設模型 | 針對要求高的生成與最終編輯的精準層級 |
對多數應用而言,以 Flare 起步,並將困難的最終編輯路由至 Sunburst。如此可在保留高精度選項的同時維持回應速度。
What Is New in GPT-Image-2.5?
更佳的參考影像保真度
GPT-Image-2.5 最重要的改進之一是對來源影像的忠實程度。基於參考的生成長期存在尷尬的權衡:模型越積極地轉換影像,就越可能改變原應保持不變的身份、比例、產品、背景或細小視覺特徵。
GPT-Image-2.5 設計成更能保留這些細節。OpenAI 表示,在改變光線、環境、服裝、構圖或風格的同時,主體應更容易被辨識。這對產品背景替換、圍繞同一角色的活動變體、保留姿勢與身份的服裝更換,以及由相同素材打造的替代構圖都很重要。
OpenAI 的官方 “Remixed baby portrait” 範例展示了一個對來源敏感的編輯:更換服裝,同時保留姿勢與藍色棚拍背景。
OpenAI 官方輸入影像。
OpenAI 官方編輯輸出。
更精準的影像編輯
第二項重大升級是編輯的在地化(局部化)。若產品照片包含瓶子、背景、標題、Logo、陰影與道具,理想的影像編輯器應能只替換標題,而不會意外改變瓶身形狀、鏡頭角度或光線。GPT-Image-2.5 更擅長區分該變更與該固定的部分。
更可靠的多輪編輯
影像編輯的真正價值常在第一步之後顯現。典型的創意流程可能先生成產品場景、更換背景、移動產品、替換標題、加入促銷標章、調整光線,最後輸出透明版本。
較弱的影像模型在每一步中,可能逐步削弱先前建立的細節。GPT-Image-2.5 明確設計用於讓先前的更動在多輪編輯中更持久,讓影像生成更接近互動式編輯,而非一系列彼此無關的生成。
更自然的光線與材質
GPT-Image-2.5 也針對讓 AI 生成照片易被辨識的視覺偽影下功夫。OpenAI 報告指出,在自然光線與更豐富的材質方面有所提升。實務上,這對於肌膚、布料、玻璃、金屬、包裝、家具、食物攝影與寫實環境場景皆有幫助。
更佳的複雜指令遵循
現代影像生成提示愈來愈像設計簡報。使用者可能指定多個物件、精確位置、標題、產品包裝、攝影機視角、品牌色、光線、前景與背景關係、透明區域與排除項。GPT-Image-2.5 改善了將這些結構化需求轉譯成一致影像的能力。
透明背景與彈性輸出
兩個 GPT-Image-2.5 API 模型在輸出格式為 PNG 或 WebP 時支援透明背景。
background="transparent"
output_format="png"
官方影像生成規格也允許任意有效的 WIDTHxHEIGHT 尺寸,而非僅限幾個固定長寬比。這對電商素材、覆蓋圖層、簡報圖形、UI 元件、貼紙、獨立物件、縮圖與廣告創意素材十分實用。
GPT-Image-2.5 Benchmark Performance
影像生成基準需要謹慎解讀。沒有一個類似語言模型數學基準的單一指標,能同時涵蓋美學、提示遵循、編輯精度、視覺寫實度與參考保真度。對 GPT-Image-2.5 而言,三類定量證據目前有用:Arena 人類偏好結果、OpenAI 的延遲測量,以及 OpenAI 的安全堆疊評估。
Arena 文字轉影像基準
Arena 以盲測人類偏好評估模型:使用者會收到兩個匿名模型對同一任務的輸出,並選擇他們更偏好的結果。快照顯示如下:
Arena 初步快照
| 模型 | 文字轉影像 Elo | 排名 | 票數 |
|---|---|---|---|
| Sunburst | 1421 ± 13 | 1 | 3,149 |
| Flare | 1399 ± 13 | 2 | 2,856 |
| Image 2 (medium) | 1381 ± 4 | 3 | 78,731 |
| MAI Image 2.6 | 1331 ± 7 | 4 | 11,213 |
| Grok Imagine Image 2.0 (low) | 1315 ± 12 | 5 | 2,681 |
影像編輯基準
在 Arena 的單影像編輯排行榜中也可見相同趨勢。
| 模型 | 單影像編輯 Elo | 相較於 Image 2 的差異 |
|---|---|---|
| Sunburst | 1520 ± 9 | +59 |
| Flare | 1491 ± 9 | +30 |
| Image 2 | 1461 ± 3 | 基準 |
| Grok Imagine Image 2.0 | 1439 ± 8 | -22 |
| MAI Image 2.6 | 1434 | -27 |
Sunburst 的優勢在編輯中尤其明顯:其相對於 Image 2 的領先幅度大於文字轉影像,符合其作為精度導向模型的定位。
生成延遲
OpenAI 表示,GPT-Image-2.5 相較 Images 2.0 可將生成延遲降低最多 50%。對 API 而言,OpenAI 認為 Flare 在提供更高影像品質的同時,延遲較 Image 2 降低 50%。Sunburst 則刻意以更長的生成時間換取更高的精度。
安全評估
OpenAI 亦發布了量化安全評估,使用刻意要求違規影像的對抗性提示進行測試。
| 模型 | 安全生成 | 不安全(已阻擋) | 不安全(已呈現) |
|---|---|---|---|
| Sunburst | 77.0% | 21.9% | 1.09% |
| Flare | 79.4% | 19.2% | 1.41% |
| ChatGPT Images 2.0 baseline | 75.2% | 23.1% | 1.64% |
來源:OpenAI Images 2.5 安全評估。相較 1.64% 的基準,Sunburst 的最終不安全結果率下降 0.55 個百分點,Flare 下降 0.23 個百分點。
這些數據是安全壓力測試結果,非一般影像品質分數或對正常用戶流量的估計。
Flare vs Sunburst vs Image 2
對多數開發者而言,更實用的問題不是 GPT-Image-2.5 抽象上是否更好,而是哪個模型適合特定工作負載。
| 維度 | Flare | Sunburst | Image 2 |
|---|---|---|---|
| 主要目標 | 速度 + 高品質 | 最大精度 | 上一代通用影像模型 |
| 文字轉影像 | 優異 | 目前 Arena 最佳結果 | 優異 |
| 影像編輯 | 優異 | 三者中最佳 | 強勁 |
| Arena T2I Elo | 1399 ± 13 | 1421 ± 13 | 1381 ± 4 |
| Arena 影像編輯 Elo | 1491 ± 9 | 1520 ± 9 | 1461 ± 3 |
| 相對延遲 | 最快選擇 | 較慢 | 基準 |
| 參考保真度 | 提升 | 提升/聚焦精度 | 強勁 |
| 多輪編輯 | 提升 | 提升 | 較不優化 |
| 品質設定 | 最高至 max | 最高至 max | 最高至 high |
| 自訂尺寸 | 支援 | 支援 | 支援 |
| 4K 等級輸出 | 支援 | 支援 | 支援 |
| 透明背景 | 支援 | 支援 | 支援 |
| 最佳用途 | 應用、社群、原型、批次生成 | 活動、精修產品圖、困難編輯 | 既有整合 |
| 新 API 專案建議 | 是,預設 | 是,當精度更重要時 | 主要用於維持既有工作流程 |
哪個模型在品質上勝出?
目前是 Sunburst。它在兩大 Arena 影像類別中領先,且被 OpenAI 明確定位為其最強的影像生成與編輯模型。
哪個模型在速度上勝出?
答案是 Flare。其兼具高偏好分數與顯著降低的延遲,是此家族中最具吸引力的通用選項。
Flare 是否比 Sunburst 更便宜?
不,以官方單位費率來看並非如此。
兩個模型目前使用相同的已公布 Token 價格。Flare 的經濟優勢主要來自延遲與工作流程吞吐量,而非較低的 Token 價格。
GPT-Image-2.5 Pricing
OpenAI 目前對 Flare 與 Sunburst 採用相同的 Token 費率:
| Token 類型 | Flare | Sunburst |
|---|---|---|
| 文字輸入 | $5 / 1M tokens | $5 / 1M tokens |
| 快取文字輸入 | $1.25 / 1M tokens | $1.25 / 1M tokens |
| 影像輸入 | $8 / 1M tokens | $8 / 1M tokens |
| 快取影像輸入 | $2 / 1M tokens | $2 / 1M tokens |
| 影像輸出 | $30 / 1M tokens | $30 / 1M tokens |
因此官方 Token 費率不會形成簡單的「Flare 便宜、Sunburst 昂貴」的區分。差異來自工作流程行為。較快的模型能降低終端用戶等待時間、應用並發需求、生成中途放棄、迭代設計時間,以及被長時請求占用的基礎設施。
影像輸入成本
範例:參考影像編輯成本:總請求成本 = 文字輸入 Token × $5/M + 影像輸入 Token × $8/M + 影像輸出 Token × $30/M
CometAPI 中的 GPT-Image-2.5 Flare 與 Sunburst 價格
目前,CometAPI 提供相對官方輸入/輸出費率 20% 的標示折扣。由於 OpenAI 對 Flare 與 Sunburst 公布相同單位費率,兩個變體的對照也相同。
| 模型 | 模型 ID | CometAPI 輸入 | CometAPI 輸出 | 官方輸入/輸出 |
|---|---|---|---|---|
| Flare | gpt-image-2.5-flare | $4 / 1M tokens | $24 / 1M tokens | $5 / $30 per 1M tokens |
| Sunburst | gpt-image-2.5-sunburst | $4 / 1M tokens | $24 / 1M tokens | $5 / $30 per 1M tokens |
上述為簡化的標示輸入/輸出數字。OpenAI 會分開為文字輸入、影像輸入、快取輸入與影像輸出定價,因此參考影像與編輯工作負載應依據實際請求回傳的 Token 類別來預算。生產部署前請確認即時模型目錄,因供應商價格可能變動。
Best Use Cases for GPT-Image-2.5
產品攝影
參考保真與目標式編輯對電商尤其重要。賣家可保留同一產品,同時變換背景、光線、季節場景、促銷文字、陰影、構圖或區域性活動處理。
廣告與行銷活動創意
當一個主視覺需要多個嚴格控制的變體時,Sunburst 特別有吸引力。行銷團隊可在保留產品與品牌構圖的同時,變更標題、背景場景、促銷、語言或視覺處理。
大規模社群內容
Flare 的延遲優勢使其更適合社群影像生成器、創作者工具、個人化縮圖、迷因、個人檔案素材與自動化內容管線,在此類場景中,吞吐量與迭代速度往往比最後幾分的影像偏好分更重要。
視覺原型
設計師可使用 GPT-Image-2.5 快速探索應用畫面、網站概念、包裝、室內、產品概念、簡報視覺與廣告版面。
影像編輯產品
對讓使用者上傳照片的應用而言,改進的保留能力可能比純文字轉影像品質更重要。範例包括服裝更換、室內重新設計、背景替換、產品修飾、人像變體與個人化創意素材。
透明素材
原生的透明背景輸出讓模型更實用於獨立產品物件、貼紙、UI 圖形、簡報素材與合成管線。
GPT-Image-2.5 Limitations
文字仍可能失誤
近代 GPT Image 世代的文字渲染已大幅改善,但對高風險的廣告、包裝、菜單、法律文案與 UI 截圖,仍應人工檢核。
不保證精確版面控制
例如「將 Logo 精確放在左上角 40 像素處」的自然語言指令,並不等同於設計工具的確定性約束。對像素嚴格的版面,較佳做法是先生成視覺素材,再於設計工具或程式中精確組排文字或界面元素。
角色與品牌一致性仍可能漂移
多輪一致性有所提升,但並非完美。長影像序列、重複角色生成與大型品牌活動仍應包含品質控管。
超高解析度為實驗性
雖然 API 允許最高 8,294,400 總像素與最大邊 3840 像素,但 2560×1440 以上的解析度目前為實驗性。生產系統應先測試高解析度輸出,而非假設所有 4K 設定都表現一致。
複雜提示仍可能耗時
困難請求仍可能需要相當處理時間。應用應實作正確的載入狀態、逾時、暫時性失敗重試,以及批次管線的非同步處理。
Flare or Sunburst: Which Should You Choose?
選擇可簡化為一個問題:工作流程更重視速度,還是最終編輯精度?
當你正在打造以下類型時選擇 Flare:
- 面向消費者的影像應用
- 高量生成
- 社群內容工具
- 快速原型
- 視覺搜尋結果生成
- 產品體驗
- 使用者期望快速回饋的互動式編輯器
當你正在製作以下類型時選擇 Sunburst:
- 準備上線的活動素材
- 高品質產品影像
- 要求嚴格的參考影像編輯
- 困難的多步修訂
- 對精確保留細節比回應時間更重要的視覺
對多數新應用而言,Flare 應作為起點。Sunburst 更適合作為精準層,而非每次請求的預設選擇。複雜的生產系統可以將例行請求路由至 Flare,並將需要更高精度的編輯保留給 Sunburst。
Why Use GPT-Image-2.5 Through CometAPI?
CometAPI 能以超越標示價格差異的方式簡化生產影像堆疊:
- 一個 API:在受支援的生成與編輯工作流程中,使用相同的驗證與熟悉的
/v1/images/generations與/v1/images/edits路由。 - 模型切換:變更 model 欄位即可在
gpt-image-2.5-flare與gpt-image-2.5-sunburst間路由,或退回gpt-image-2,無需重建周邊整合。 - 統一計費:將受支援模型的使用與計費整合,而非為每條路由維護獨立帳號與發票。
- 多模型實驗:使用相同提示、參考影像、尺寸與品質設定進行對照,測量延遲、Token 使用、編輯準確度與輸出被接受比率。
- 成本最佳化:預設以 Flare 應對需要回應迅速的高量工作,當精度敏感時再升級至 Sunburst,並在既有工作流程需要成熟行為時保留 Image 2。以實際使用數據結合路由決策,而非僅依標示 Token 價格選擇。
實務上的優勢是營運一致性:團隊可在同一整合內測試與路由模型,為每個請求選擇合適的品質、延遲與成本組合。
Conclusion
GPT-Image-2.5 代表 OpenAI 從生成式影像創作邁向更可控影像編輯平台的最新一步。Flare 是最廣泛實用的版本:它結合新家族的品質與編輯提升,以及顯著降低的延遲,適合互動式應用與高量生產。
Sunburst 則更進一步追求精度。目前 Arena 結果將其置於 Flare 與 Image 2 之上,無論是文字轉影像或單影像編輯,使其成為要求嚴格的專業創意工作流程中更強的選擇。
然而,最關鍵的變化是工作流程的可靠性。更好的主體保留、目標式編輯、多輪一致性、自訂高解析度輸出與透明背景生成,讓 GPT-Image-2.5 更適合真正的創意管線,而非孤立的影像生成展示。
FAQ
What is GPT-Image-2.5?
GPT-Image-2.5 是 OpenAI 最新的影像生成與編輯模型家族,於 2026 年 9 月發佈。在 API 中分為 Flare 與 Sunburst。
What is the difference between ChatGPT Images 2.5 and GPT-Image-2.5?
ChatGPT Images 2.5 指的是整合到 ChatGPT 的影像生成體驗。開發者可透過包括 gpt-image-2.5-flare 與 gpt-image-2.5-sunburst 在內的 API 模型存取新世代。
What is GPT-Image-2.5Flare?
GPT-Image-2.5Flare 是以速度為導向的 GPT-Image-2.5 變體,也是 OpenAI 對多數 API 應用的推薦預設。重點在高影像品質、影像編輯與顯著更低的生成延遲。
What is GPT-Image-2.5 Sunburst?
GPT-Image-2.5 Sunburst 是 OpenAI 在生成與編輯上的最高能力變體。它面向在意精度與可控性高於生成速度的工作流程。
Is GPT-Image-2.5 better than Image 2?
目前證據顯示是。在 9 月 9 日的 Arena 快照中,Sunburst 在文字轉影像獲得 1421 ± 13,Flare 為 1399 ± 13,而 Image 2 為 1381 ± 4。單影像編輯對兩個新模型的優勢更為明顯。
Is GPT-Image-2.5 faster than Image 2?
Flare 是。OpenAI 表示,Flare 以更高的影像品質,提供比 Image 2 低 50% 的延遲。Sunburst 則刻意接受更長生成時間,以換取更嚴密的編輯控制。
Does GPT-Image-2.5 support 4K images?
是。兩個 API 變體都支援自訂尺寸,最高 8,294,400 總像素、單邊最長 3840 像素。OpenAI 目前將 2560×1440 以上視為實驗性。
How much does GPT-Image-2.5 cost?
OpenAI 目前對 Flare 與 Sunburst 收費相同:文字輸入每百萬 Token $5,影像輸入每百萬 Token $8,影像輸出每百萬 Token $30。快取輸入費率更低。
Should I use Flare or Sunburst?
對互動式、高量、面向消費者、社群與快速原型的工作負載,使用 Flare。當最大編輯精度與最終視覺保真度比延遲更重要時,使用 Sunburst。
