Qu’est-ce que l’API GPT-Image-1.5 ?
GPT-Image-1.5 est le tout dernier membre de la famille GPT Image d’OpenAI et le modèle derrière la nouvelle expérience Images de ChatGPT. Il est conçu pour faire passer la génération d’images de l’expérimentation à des outils créatifs de qualité production : photoréalisme accru, contrôle plus fin pour des retouches itératives et inférence plus rapide pour soutenir des workflows interactifs et d’entreprise.
L’API gpt-image-1.5 est un endpoint de modèle d’image multimodal qui accepte une ou plusieurs images en entrée (identifiants de fichier ou octets), ainsi qu’un prompt texte, et renvoie des images générées ou des images éditées. Elle prend en charge :
- Génération texte-vers-image (création à partir d’un prompt),
- Édition d’image / inpainting / composition (appliquer des instructions à des images existantes, plusieurs images en entrée possibles), et
- Workflows d’édition itératifs et multi-tours via la Responses API (permet des interfaces « ajuster et itérer »).
L’API traite les prompts d’image différemment des anciennes limites de DALL·E : les modèles d’image GPT acceptent des prompts texte nettement plus longs (la recommandation de 32,000 caractères), ce qui rend possibles des instructions complexes et riches en contraintes.
Fonctionnalités principales (pratique)
- Éditabilité améliorée / cohérence multi‑tours : préserve l’apparence des personnages, l’éclairage et les attributs visuels clés au fil des retouches itératives. Cela rend « même modèle, retouches répétées » plus fiable pour des workflows tels que des catalogues produits ou des assets de marque.
- Débit accru — améliorations de vitesse 4× par rapport à GPT Image 1, visant à réduire la latence pour des workflows créatifs itératifs.
- Optimisations de coûts — coûts d’entrée/sortie d’images réduits d’environ 20% par rapport à GPT Image 1, réduisant le coût par itération d’image pour les gros volumes.
- Composition multi‑images et référence de style — accepte plusieurs images de référence pour composer des scènes ou transférer style/éclairage.
- Réglages de qualité/fidélité — paramètres d’API permettant d’arbitrer entre vitesse et fidélité (qualité plus basse pour la génération de masse ; qualité plus élevée pour les assets de production).
- Édition multi‑tours / intégration à la Responses API — permet des workflows pas à pas (demander des changements, puis « apporter des ajustements » en préservant l’état).
Capacités techniques
- Limite de prompt texte (modèles d’image) : jusqu’à 32,000 caractères (note : OpenAI documente ceci comme l’allocation de longueur de texte pour les modèles d’image GPT). À utiliser pour des prompts longs et fortement contraints.
- Entrées image : accepte des IDs de fichier (privilégiés pour les flux multi‑tours) ou des octets bruts ; plusieurs images peuvent être fournies pour la composition et comme références.
- Sorties : PNG/JPEG ou artefacts d’image par défaut de la plateforme renvoyés par l’API (ou en pièces jointes dans ChatGPT). Les sorties peuvent inclure plusieurs images candidates et prendre en charge des requêtes itératives pour affiner un résultat.
- Modes de génération : texte‑vers‑image, édition d’image (inpaint/extension avec instructions) et variantes. L’édition multi‑tours prend en charge des instructions de type « ajouter/supprimer/combiner ».
- Édition sensible aux instructions : les modèles sont optimisés pour la fidélité aux instructions (préservation d’invariants spécifiés comme « ne pas modifier le logo », « conserver la pose et l’éclairage »). Des schémas de prompt engineering (invariants explicites répétés à chaque itération) réduisent la dérive sémantique.
Performances de référence
- Classement : Un rapport agrégé a cité GPT Image 1.5 en tête des classements texte‑vers‑image avec ~1264 points sur un leaderboard d’Artificial Analysis, devant le modèle suivant avec une marge mesurable.
- Mesures au niveau des tâches (édition et préservation) : un résumé des métriques d’évaluation par Microsoft Foundry montre que GPT-Image-1.5 atteint un succès quasi parfait sur les modifications binaires (100% sur un BinaryEval mono‑tour) et de solides scores de préservation des visages (environ 90% sur les mesures AuraFace) dans leur tableau comparatif face aux concurrents et aux précédents modèles d’OpenAI. Ces métriques comparatives placent GPT-Image-1.5 devant certains rivaux en matière de préservation et de fidélité des éditions.

Comparaison de GPT-Image-1.5 avec ses pairs
- Vs. GPT Image 1 (génération précédente d’OpenAI) : plus rapide (jusqu’à 4×), moins cher (~20% de coût IO image en moins) et meilleure fidélité d’édition — vise à passer du « prototype/démo » à des workflows d’image « prêts pour la production ».
- Vs. les modèles d’image Nano Banana Pro / Gemini de Google : GPT-Image-1.5 et la famille Nano Banana Pro / Gemini 3 de Google sont des rivaux proches — chacun ayant des atouts selon les classes de prompts. Les communications d’OpenAI mettent l’accent sur la fidélité d’édition et la vitesse d’itération ; l’offre de Google a été saluée pour un réalisme de niveau studio dans certains exemples.
- Vs. Qwen Image et autres modèles ouverts/fermés : GPT-Image-1.5 surpasse Qwen Image sur plusieurs métriques d’édition et de préservation dans des évaluations mono‑tour, mais les écarts se réduisent en multi‑tours ou dans d’autres tests spécifiques à un domaine.
Domaines où GPT-Image-1.5 excelle
- Imagerie produit pour l’e‑commerce : variantes en masse, remplacement d’arrière‑plan, catalogues produits cohérents à partir d’une seule photo (préservation de la marque/du logo).
- Production d’assets créatifs et marketing : itérations rapides de concepts, maquettes photoréalistes, transferts de style contrôlés.
- Retouche photo et workflows éditoriaux : essayages réalistes de vêtements/coiffures, retouche sélective qui préserve l’identité et l’éclairage.
- Intégration aux outils de design : connexion aux plateformes de design ou aux CMS pour des variantes d’image à la demande (les réglages de fidélité aident à contrôler les coûts).
- Pipelines de composition en plusieurs étapes : des entrées multi‑images permettent la composition et la génération basée sur des références pour des scènes complexes.
Comment accéder à l’API GPT Image 1.5
Étape 1 : s’inscrire pour obtenir une clé API
Connectez‑vous à cometapi.com. Si vous n’êtes pas encore utilisateur, veuillez d’abord vous inscrire. Connectez‑vous à votre console CometAPI. Obtenez la clé API d’identification d’accès de l’interface. Cliquez sur « Add Token » dans la section des jetons API du centre personnel, récupérez la clé de jeton : sk-xxxxx et validez.
Étape 2 : envoyer des requêtes à l’API GPT Image 1.5
Sélectionnez l’endpoint « gpt-image-1.5 » pour envoyer la requête API et définir le corps de la requête. La méthode et le corps de la requête sont disponibles dans la documentation API de notre site web. Notre site propose également un test Apifox pour votre commodité. Remplacez <YOUR_API_KEY> par votre clé CometAPI réelle depuis votre compte. L’URL de base est Images (https://api.cometapi.com/v1/images/generations) et [Édition d’image]
Insérez votre question ou votre requête dans le champ content — c’est à cela que le modèle répondra. Traitez la réponse de l’API pour obtenir le résultat généré.
Étape 3 : récupérer et vérifier les résultats
Traitez la réponse de l’API pour obtenir le résultat généré. Après traitement, l’API renvoie l’état de la tâche et les données de sortie.
Voir aussi Gemini 3 Pro Preview API