O que é a API GPT-Image-1.5?
GPT-Image-1.5 é o mais novo membro da família GPT Image da OpenAI e o modelo por trás da experiência de Imagens reformulada do ChatGPT. Ela foi projetada para levar a geração de imagens de experimentos de novidade a ferramentas criativas em nível de produção: maior fotorrealismo, controle mais fino para edições iterativas e inferência mais rápida para suportar fluxos de trabalho interativos e empresariais.
A API gpt-image-1.5 é um endpoint multimodal de imagem que aceita uma ou mais entradas de imagem (identificadores de arquivo ou bytes) mais um prompt de texto e retorna imagens geradas ou editadas. Ela oferece suporte a:
- Geração de texto para imagem (criação a partir de prompt),
- Edição de imagem / inpainting / composição (aplica instruções a imagens existentes, permitindo múltiplas imagens de entrada), e
- Fluxos de edição iterativa e de múltiplas interações por meio da Responses API (possibilita interfaces “ajustar e iterar”).
A API trata prompts de imagem de forma diferente dos limites do antigo DALL·E: os modelos de imagem GPT aceitam prompts de texto significativamente mais longos (a diretriz de 32k caracteres), tornando viáveis instruções complexas e com muitas restrições.
Principais recursos (práticos)
- Editabilidade aprimorada / consistência em múltiplas interações: preserva a aparência de personagens, a iluminação e atributos visuais essenciais ao longo de edições iterativas. Isso torna “mesmo modelo, edições repetidas” mais confiável para fluxos como catálogos de produtos ou ativos de marca.
- Maior vazão — melhorias de velocidade de 4× em relação ao GPT Image 1, visando reduzir a latência em fluxos criativos iterativos.
- Otimizações de custo — custos de entrada/saída de imagem reduzidos em cerca de 20% vs. GPT Image 1, reduzindo o custo por iteração de imagem para usuários de alto volume.
- Composição com múltiplas imagens e referência de estilo — aceita várias imagens de referência para compor cenas ou transferir estilo/iluminação.
- Controles de qualidade/fidelidade — parâmetros da API que equilibram velocidade e fidelidade (use qualidade mais baixa para geração em lote; qualidade mais alta para ativos de produção).
- Edição em múltiplas interações / integração com a Responses API — permite fluxos de trabalho em etapas (pedir mudanças e depois “fazer ajustes” preservando o estado).
Capacidades técnicas
- Limite de prompt de texto (modelos de imagem): até 32,000 caracteres (observação: a OpenAI documenta isso como a permissão de comprimento de texto para modelos de imagem GPT). Use isto para prompts longos e com muitas restrições.
- Entradas de imagem: aceita IDs de arquivo (preferidos para fluxos de múltiplas interações) ou bytes brutos; várias imagens podem ser fornecidas para composição e referência.
- Saídas: PNG/JPEG ou artefatos de imagem padrão da plataforma retornados pela API (ou como anexos no ChatGPT). As saídas podem incluir múltiplas imagens candidatas e suportar solicitações iterativas para refinar um resultado.
- Modos de geração: texto para imagem, edição de imagem (preencher/estender com instruções) e variantes. A edição em múltiplas interações suporta instruções no estilo “adicionar/subtrair/combinar”.
- Edição consciente de instruções: os modelos são otimizados para fidelidade às instruções (preservando invariantes especificados como “não altere o logotipo”, “mantenha a pose e a iluminação”). Padrões de engenharia de prompts (invariantes explícitos repetidos a cada iteração) reduzem a deriva semântica.
Desempenho em benchmarks
- Posicionamento no ranking: um relatório agregado citou o GPT Image 1.5 liderando os rankings de texto para imagem com ~1264 pontos em um leaderboard da Artificial Analysis, à frente do próximo modelo por uma margem mensurável.
- Métricas por tarefa (edição e preservação): um resumo de métricas de avaliação da Microsoft Foundry mostra o GPT-Image-1.5 atingindo sucesso binário de modificação quase perfeito (100% em um BinaryEval de uma única interação) e fortes pontuações de preservação de rosto (cerca de 90% nas medidas AuraFace) em sua tabela comparativa versus concorrentes e modelos anteriores da OpenAI. Essas métricas comparativas colocam o GPT-Image-1.5 à frente de alguns rivais em preservação e fidelidade de edição.

Como o GPT-Image-1.5 se compara aos pares
- Vs. GPT Image 1 (geração anterior da OpenAI): mais rápido (até 4×), mais barato (~20% menor custo de E/S de imagem) e com maior fidelidade de edição — voltado para a transição de “protótipo/demo” para fluxos de trabalho de imagem adequados à produção.
- Vs. Nano Banana Pro / modelos de imagem Gemini do Google: GPT-Image-1.5 e a família Nano Banana Pro / Gemini 3 do Google como rivais próximos — cada um com pontos fortes em diferentes classes de prompt. A comunicação da OpenAI enfatiza fidelidade de edição e velocidade de iteração; a oferta do Google tem sido elogiada por realismo em nível de estúdio em alguns exemplos.
- Vs. Qwen Image e outros modelos abertos/fechados: o GPT-Image-1.5 superando o Qwen Image em várias métricas de edição e preservação em avaliações de uma única interação, mas as diferenças diminuem em testes de múltiplas interações ou outros domínios específicos.
Onde o GPT-Image-1.5 é forte
- Imagens de produtos para e-commerce: variantes em massa, trocas de fundo, catálogos de produtos consistentes a partir de uma única foto (preservação de marca/logotipo).
- Produção de ativos criativos e de marketing: iterações rápidas de conceito, mockups fotorrealistas, transferências de estilo controladas.
- Retoque de fotos e fluxos editoriais: testes realistas de roupas/penteados, retoques seletivos que preservam identidade e iluminação.
- Integração com ferramentas de design: plugue em plataformas de design ou CMS para variantes de imagem sob demanda (os controles de fidelidade ajudam no controle de custos).
- Pipelines de composição em múltiplas etapas: entradas de múltiplas imagens permitem composição e geração baseada em referência para cenas complexas.
Como acessar a API GPT Image 1.5
Etapa 1: Cadastre-se para obter a chave de API
Faça login em cometapi.com. Se você ainda não é nosso usuário, registre-se primeiro. Entre no seu console do CometAPI. Obtenha a credencial de acesso (chave de API) da interface. Clique em “Add Token” no token de API no centro pessoal, obtenha a chave do token: sk-xxxxx e envie.
Etapa 2: Envie solicitações para a API GPT Image 1.5
Selecione o endpoint “gpt-image-1.5” para enviar a solicitação de API e defina o corpo da requisição. O método e o corpo da requisição são obtidos na documentação da API em nosso site. Nosso site também fornece teste no Apifox para sua conveniência. Substitua <YOUR_API_KEY> pela sua chave CometAPI real da sua conta. A URL base é Imagens (https://api.cometapi.com/v1/images/generations) e [Edição de Imagem]
Insira sua pergunta ou solicitação no campo de conteúdo — é isso que o modelo responderá. Processe a resposta da API para obter a resposta gerada.
Etapa 3: Recupere e verifique os resultados
Processe a resposta da API para obter a resposta gerada. Após o processamento, a API responde com o status da tarefa e os dados de saída.
Veja também Prévia da API Gemini 3 Pro