¿Qué es la API de GPT-Image-1.5?
GPT-Image-1.5 es el miembro más reciente de la familia GPT Image de OpenAI y el modelo detrás de la renovada experiencia de Imágenes de ChatGPT. Está diseñado para llevar la generación de imágenes de experimentos de novedad a herramientas creativas de nivel de producción: mayor fotorrealismo, control más fino para ediciones iterativas e inferencia más rápida para admitir flujos de trabajo interactivos y empresariales.
La API gpt-image-1.5 es un endpoint de modelo de imágenes multimodal que acepta una o más entradas de imagen (identificadores de archivos o bytes) más un prompt de texto y devuelve imágenes generadas o editadas. Es compatible con:
- Generación de texto a imagen (crear a partir del prompt),
- Edición de imagen / inpainting / composición (aplicar instrucciones a imágenes existentes; se permiten múltiples imágenes de entrada), y
- Flujos de edición iterativos y multiturno a través de la Responses API (habilita interfaces de “ajustar e iterar”).
La API trata los prompts de imagen de manera diferente a los límites antiguos de DALL·E: los modelos de imagen GPT aceptan prompts de texto significativamente más largos (la pauta de 32k caracteres), lo que hace factibles instrucciones complejas y con muchas restricciones.
Características principales (prácticas)
- Mejor editabilidad / consistencia multiturno: preserva la apariencia del personaje, la iluminación y los atributos visuales clave a lo largo de ediciones iterativas. Esto hace que “mismo modelo, ediciones repetidas” sea más confiable para flujos como catálogos de productos o activos de marca.
- Mayor rendimiento — mejoras de velocidad de 4× respecto a GPT Image 1, orientadas a reducir la latencia en flujos creativos iterativos.
- Optimizaciones de coste — costes de entrada/salida de imagen reducidos en alrededor de 20% frente a GPT Image 1, lo que reduce el coste por imagen en iteraciones para usuarios de alto volumen.
- Composición multiimagen y referencia de estilo — acepta múltiples imágenes de referencia para componer escenas o transferir estilo/iluminación.
- Controles de calidad/fidelidad — parámetros de la API que equilibran velocidad frente a fidelidad (use menor calidad para generación masiva; mayor calidad para activos de producción).
- Edición multiturno / integración con la Responses API — habilita flujos paso a paso (solicitar cambios y luego “hacer ajustes” preservando el estado).
Capacidades técnicas
- Límite de prompt de texto (modelos de imagen): hasta 32,000 caracteres (nota: OpenAI documenta esto como la longitud de texto permitida para los modelos de imagen GPT). Úsalo para prompts largos y con muchas restricciones.
- Entradas de imagen: acepta IDs de archivo (preferidos para flujos multiturno) o bytes sin procesar; se pueden proporcionar múltiples imágenes para composición y referencia.
- Salidas: artefactos de imagen PNG/JPEG o predeterminados de la plataforma devueltos por la API (o como adjuntos dentro de ChatGPT). Las salidas pueden incluir múltiples imágenes candidatas y admitir solicitudes iterativas para refinar un resultado.
- Modos de generación: texto a imagen, edición de imagen (inpaint/extender con instrucciones) y variantes. La edición multiturno admite instrucciones del tipo “agregar/quitar/combinar”.
- Edición consciente de las instrucciones: los modelos están optimizados para la fidelidad a las instrucciones (preservando invariantes especificados como “no cambies el logotipo”, “mantén la pose y la iluminación”). Los patrones de ingeniería de prompts (repetir explícitamente los invariantes en cada iteración) reducen la deriva semántica.
Rendimiento en benchmarks
- Posición en la tabla de clasificación: un informe agregado citó a GPT Image 1.5 liderando los rankings de texto a imagen con ~1264 puntos en una tabla de Artificial Analysis, por delante del siguiente modelo por un margen medible.
- Métricas a nivel de tarea (edición y preservación): un resumen de Microsoft Foundry de métricas de evaluación muestra que GPT-Image-1.5 logra un éxito de modificación binaria casi perfecto (100% en un BinaryEval de un solo turno) y sólidas puntuaciones de preservación de rostro (alrededor de 90% en medidas de AuraFace) en su tabla comparativa frente a competidores y modelos anteriores de OpenAI. Esas métricas comparativas sitúan a GPT-Image-1.5 por delante de algunos rivales en preservación y fidelidad de edición.

Cómo se compara GPT-Image-1.5 con sus pares
- Vs. GPT Image 1 (generación anterior de OpenAI): más rápido (hasta 4×), más barato (~20% menos en coste de E/S de imagen) y mayor fidelidad de edición, enfocado a pasar de “prototipo/demo” a flujos de trabajo de imagen aptos para producción.
- Vs. Nano Banana Pro / modelos de imagen Gemini de Google: GPT-Image-1.5 y la familia Nano Banana Pro / Gemini 3 de Google como rivales cercanos: cada uno tiene fortalezas en distintas clases de prompts. El mensaje de OpenAI enfatiza la fidelidad en edición y la velocidad de iteración; la oferta de Google ha sido elogiada por realismo de nivel de estudio en algunos ejemplos.
- Vs. Qwen Image y otros modelos abiertos/cerrados: GPT-Image-1.5 supera a Qwen Image en varias métricas de edición y preservación en evaluaciones de un solo turno, pero las diferencias se reducen en multiturno u otras pruebas específicas de dominio.
Dónde destaca GPT-Image-1.5
- Imágenes de productos para e-commerce: variantes masivas, cambios de fondo, catálogos de productos consistentes a partir de una única foto (preservación de marca/logotipo).
- Producción de activos creativos y de marketing: iteraciones rápidas de concepto, maquetas fotorrealistas, transferencias de estilo controladas.
- Retoque fotográfico y flujos editoriales: pruebas realistas de ropa/peinados, retoque selectivo que preserva identidad e iluminación.
- Integración con herramientas de diseño: integración en plataformas de diseño o CMS para variantes de imagen bajo demanda (los controles de fidelidad ayudan a controlar costes).
- Pipelines de composición en varios pasos: entradas multiimagen permiten composición y generación basada en referencia para escenas complejas.
Cómo acceder a la API de GPT Image 1.5
Paso 1: Regístrate para obtener la clave de API
Inicia sesión en cometapi.com. Si aún no eres usuario, regístrate primero. Entra en tu consola de CometAPI. Obtén la clave de API de credenciales de acceso de la interfaz. Haz clic en “Add Token” en el token de API del centro personal, obtén la clave de token: sk-xxxxx y envíala.
Paso 2: Envía solicitudes a la API de GPT Image 1.5
Selecciona el endpoint “gpt-image-1.5” para enviar la solicitud a la API y configura el cuerpo de la solicitud. El método y el cuerpo de la solicitud se obtienen de la documentación de la API en nuestro sitio web. Nuestro sitio web también proporciona pruebas en Apifox para tu comodidad. Sustituye <YOUR_API_KEY> por tu clave real de CometAPI de tu cuenta. la URL base es Images (https://api.cometapi.com/v1/images/generations) y [Edición de imágenes]
Inserta tu pregunta o solicitud en el campo content—esto es a lo que responderá el modelo. Procesa la respuesta de la API para obtener la respuesta generada.
Paso 3: Recupera y verifica los resultados
Procesa la respuesta de la API para obtener la respuesta generada. Tras el procesamiento, la API responde con el estado de la tarea y los datos de salida.
Consulta también Gemini 3 Pro Preview API