Che cos'è l'API GPT-Image-1.5?
GPT-Image-1.5 è il più recente membro della famiglia di modelli di immagine GPT di OpenAI ed è il modello alla base della rinnovata esperienza Images di ChatGPT. È progettato per portare la generazione di immagini dagli esperimenti di novità a strumenti creativi di livello produttivo: maggiore fotorealismo, controllo più fine per modifiche iterative e inferenza più rapida per supportare flussi di lavoro interattivi e aziendali.
L'API gpt-image-1.5 è un endpoint multimodale per immagini che accetta uno o più input immagine (identificatori di file o byte) più un prompt testuale e restituisce immagini generate o immagini modificate. Supporta:
- Generazione da testo a immagine (creazione da prompt),
- Editing di immagini / in-painting / compositing (applicazione di istruzioni a immagini esistenti, consentiti più input immagine), e
- Flussi di modifica iterativi e multi-turno tramite la Responses API (abilita interfacce “tweak & iterate”).
L'API tratta i prompt immagine in modo diverso rispetto ai vecchi limiti di DALL·E: i modelli di immagini GPT accettano prompt testuali significativamente più lunghi (la linea guida è 32,000 caratteri), rendendo fattibili istruzioni complesse e ricche di vincoli.
Funzionalità principali (pratiche)
- Modificabilità migliorata / coerenza multi-turno: preserva l'aspetto del personaggio/soggetto, l'illuminazione e gli attributi visivi chiave attraverso modifiche iterative. Questo rende più affidabile “lo stesso modello, modifiche ripetute” per flussi come cataloghi di prodotti o asset di brand.
- Throughput più veloce — miglioramenti di velocità 4× rispetto a GPT Image 1, mirati a ridurre la latenza per flussi creativi iterativi.
- Ottimizzazioni dei costi — costi di input/output immagine ridotti di circa 20% rispetto a GPT Image 1, abbassando il costo per iterazione immagine per utenti ad alto volume.
- Compositing multi-immagine e riferimento di stile — accetta più immagini di riferimento per comporre scene o trasferire stile/illuminazione.
- Selettori di qualità/fedeltà — parametri API che bilanciano velocità e fedeltà (usa qualità inferiore per generazione in bulk; qualità superiore per asset di produzione).
- Editing multi-turno / integrazione con Responses API — abilita flussi passo-passo (chiedi modifiche, poi “aggiusta” preservando lo stato).
Capacità tecniche
- Limite del prompt testuale (modelli di immagini): fino a 32,000 caratteri (nota: OpenAI documenta questo come la lunghezza di testo consentita per i modelli di immagini GPT). Usalo per prompt lunghi e ricchi di vincoli.
- Input immagine: accetta ID file (preferiti per flussi multi-turno) o byte grezzi; possono essere fornite più immagini per compositing e riferimento.
- Output: PNG/JPEG o artefatti immagine predefiniti dalla piattaforma (o come allegati all'interno di ChatGPT). Gli output possono includere più immagini candidate e supportare richieste iterative per perfezionare un risultato.
- Modalità di generazione: testo-a-immagine, editing di immagini (inpainting/estensione con istruzioni) e varianti. L'editing multi-turno supporta istruzioni in stile “aggiungi/sottrai/componi”.
- Editing sensibile alle istruzioni: i modelli sono ottimizzati per la fedeltà alle istruzioni (preservando invarianti specificati come “non cambiare il logo”, “mantieni posa e illuminazione”). Pattern di prompt engineering (invarianti esplicite ripetute a ogni iterazione) riducono la deriva semantica.
Prestazioni benchmark
- Posizionamento in classifica: Un report aggregato ha citato GPT Image 1.5 in testa alle classifiche testo-a-immagine con ~1264 punti su una leaderboard di Artificial Analysis, davanti al modello successivo con un margine misurabile.
- Metriche a livello di task (modifica e preservazione): un riepilogo di Microsoft Foundry delle metriche di valutazione mostra GPT-Image-1.5 con successo di modifica binaria quasi perfetto (100% su un BinaryEval a singolo turno) e forti punteggi di preservazione del volto (circa 90% su misure AuraFace) nella loro tabella di confronto rispetto ai concorrenti e ai precedenti modelli OpenAI. Queste metriche comparative collocano GPT-Image-1.5 davanti ad alcuni rivali per preservazione e fedeltà di editing.

Come si confronta GPT-Image-1.5 con i pari
- Vs. GPT Image 1 (generazione OpenAI precedente): più veloce (fino a 4×), più economico (~20% di costi IO immagine in meno) e con migliore fedeltà di editing — mirato a passare da “prototipo/demo” a flussi di lavoro di immagini “pronti per la produzione”.
- Vs. Google’s Nano Banana Pro / modelli di immagine Gemini: GPT-Image-1.5 e la famiglia Google Nano Banana Pro / Gemini 3 come rivali diretti — ciascuno ha punti di forza in diverse classi di prompt. La comunicazione di OpenAI enfatizza la fedeltà dell'editing e la velocità di iterazione; l'offerta di Google è stata lodata per il realismo a livello studio in alcuni esempi.
- Vs. Qwen Image e altri modelli aperti/chiusi: GPT-Image-1.5 supera Qwen Image su diverse metriche di editing e preservazione in valutazioni a singolo turno, ma le differenze si riducono in scenari multi-turno o in altri test specifici di dominio.
Dove GPT-Image-1.5 è forte
- Imaging di prodotto per e-commerce: varianti in bulk, sostituzioni di sfondo, cataloghi prodotto coerenti da una singola foto (preservazione di brand/logo).
- Produzione di asset creativi e marketing: iterazioni rapide di concept, mockup fotorealistici, trasferimenti di stile controllati.
- Ritocco fotografico e flussi editoriali: prove realistiche di abbigliamento/acconciature, ritocchi selettivi che preservano identità e illuminazione.
- Integrazione in strumenti di design: integrazione con piattaforme di design o CMS per varianti immagine on-demand (i selettori di fedeltà aiutano a controllare i costi).
- Pipeline di compositing multi-step: input multi-immagine consentono compositing e generazione basata su riferimenti per scene complesse.
Come accedere all'API GPT Image 1.5
Passaggio 1: registrati per la chiave API
Accedi a cometapi.com. Se non sei ancora nostro utente, registrati prima. Accedi alla tua console CometAPI. Ottieni la chiave API di credenziale di accesso all'interfaccia. Clicca “Add Token” nel token API nel centro personale, ottieni la chiave token: sk-xxxxx e invia.
Step 2: invia richieste all'API GPT Image 1.5
Seleziona l'endpoint “gpt-image-1.5” per inviare la richiesta API e imposta il body della richiesta. Il metodo e il body della richiesta sono disponibili nella documentazione API del nostro sito. Il nostro sito fornisce anche un test Apifox per tua comodità. Sostituisci <YOUR_API_KEY> con la tua effettiva chiave CometAPI del tuo account. base url is Images (https://api.cometapi.com/v1/images/generations) and [Image Editing]
Inserisci la tua domanda o richiesta nel campo content — è ciò a cui il modello risponderà. Elabora la risposta dell'API per ottenere l'immagine generata.
Passaggio 3: recupera e verifica i risultati
Elabora la risposta dell'API per ottenere il risultato generato. Dopo l'elaborazione, l'API risponde con lo stato dell'attività e i dati di output.
Vedi anche Gemini 3 Pro Preview API