Recursos básicos
- Texto → Imagem: geração totalmente orientada por prompt, com alta aderência ao prompt.
- Imagem → Imagem (edições): edições finas e direcionadas, mantendo a consistência do sujeito/personagem ao longo de múltiplas edições.
- Resolução máxima de saída: até 4K (os exemplos e tamanhos exatos de pixels suportados dependem da proporção; a API expõe predefinições de 1K/2K/4K)
- Planejamento iterativo e autocorreção: um pipeline interno em “múltiplas etapas” que detecta e corrige erros visuais comuns (perspectiva, texto, geometria fina).
- Renderização avançada de texto dentro da imagem: texto multilíngue claro e legível (de legendas curtas a parágrafos longos), adequado para pôsteres, mockups e infográficos.
- 5 personagens e fidelidade para até 14 objetos/imagens de referência em um único fluxo de trabalho.
- Marca d'água / procedência: todas as imagens geradas incluem uma marca d'água SynthID; o modelo incorpora metadados C2PA para procedência em algumas integrações de produto.
Versões e nomenclatura do Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Detalhes técnicos
Arquitetura
- Linhagem / backbone: o Nano Banana Pro é construído na pilha de imagens Gemini em evolução do Google — especificamente na nova arquitetura Gemini 3 Pro Image / GEMPIX 2 (um framework multimodal de imagem+texto de maior capacidade). É uma evolução do Gemini 2.5 Flash Image (o “nano-banana” original) para um modelo de imagem nativamente multimodal com capacidades ampliadas de raciocínio visão‑linguagem.
- Comportamento do modelo: multimodalidade nativa (imagem + texto + conhecimento de mundo), pipelines explícitos para fusão de múltiplas imagens e um planejador em estágios internos que refina as saídas em múltiplas passagens em vez de produzir uma única amostra estática. Relatos iniciais indicam um raciocínio geométrico/óptico mais forte (vidro, refração) em relação às versões anteriores.
- Raciocínio / refinamento interno: o modelo usa um processo “de raciocínio” visível internamente para refinar a composição (a documentação da API descreve esse comportamento e observa que essas etapas internas não são cobradas como tokens de imagem finais).
- Grounding e ferramentas: oferece suporte a Search grounding (pode incorporar fatos da web na geração de diagramas/infográficos). Também aceita instruções de sistema para um controle mais determinístico.
Parâmetros principais da API:
thinking_level(low / high) para equilibrar latência e profundidade de raciocínio;media_resolution(low/medium/high) para controlar os tokens de leitura de OCR/detalhes da imagem;generationConfig.imageConfigpara controlar proporção/resolução nas saídas de imagem.
Limites de imagem:
- Modalidades de entrada suportadas: texto e imagens (o modelo não aceita áudio ou vídeo como entradas para geração de imagens).
- Máximo de imagens por prompt: 14 (para a prévia do Gemini 3 Pro Image).
- Tamanho máximo da imagem (upload): 7 MB por imagem de entrada.
- Proporções suportadas: 1:1, 3:2, 16:9, 9:16, 21:9, etc.
Imagens de saída / tokens: limites altos, com suporte a 4K/4096px.
Desempenho em benchmarks
Resumo curto: benchmarks públicos/iniciais até agora são em sua maioria qualitativos/comunitários, mas relatam de forma consistente melhorias substanciais em resolução, redução de artefatos e fidelidade física em comparação com o nano-banana original (Gemini 2.5 Flash Image). “Desafios” específicos nomeados mostraram ganhos visuais claros, mas ainda não há tabelas numéricas padronizadas (públicas) do Google comparando v1 → v2 em métricas padrão de geração de imagens.
- Testes qualitativos da comunidade: bordas mais limpas, microdetalhes mais nítidos, cores mais fiéis e maior aderência ao prompt (menos adereços alucinados, personagens mais consistentes). Testes informais populares incluem o chamado “Wine Glass Test” e o “Glass Burger Challenge”, nos quais o GEMPIX2 (Nano Banana Pro) lida com transparência e refração de forma visivelmente melhor que compilações anteriores.
- Tratamento de texto: o Nano Banana Pro apresenta tipografia e posicionamento de texto visivelmente aprimorados dentro das imagens (um ponto fraco persistente para muitos modelos de imagem). Comparações da comunidade indicam menos glifos renderizados de forma ilegível.
- Throughput / UX: velocidade de iteração mais alta e uma UX que realiza refinamento em múltiplas etapas no back-end, fazendo com que os usuários vejam resultados iniciais mais confiáveis (reduzindo novas gerações manuais).
Limitações e riscos
- Filtros de conteúdo e detecção: plataformas que integram o modelo (por exemplo, Whisk/aplicativos de terceiros) podem habilitar detecção estrita de celebridades ou semelhança e bloquear certos resultados, o que afeta fluxos criativos que dependem de semelhanças realistas de celebridades.
- Casos limite de alucinação/raciocínio: embora melhorado, o modelo ainda pode produzir artefatos fisicamente irreais, especialmente com texto simbólico denso dentro de imagens ou diagramas altamente técnicos — embora o NB2 pareça reduzir esses erros em relação a versões anteriores.
- Segurança e uso indevido: modelos generativos de imagem podem ser usados para criar conteúdo problemático ou nocivo. O Google aplica restrições, filtros de conteúdo e a marca d'água SynthID para ajudar na procedência; ainda assim, já ocorreram usos indevidos (polêmica de alto perfil ligada a uma imagem gerada por Nano Banana em um contexto politicamente sensível).
Como o Nano Banana Pro se compara a outros modelos
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — forte integração móvel, fusão multi-imagem, autocorreção iterativa, 2K nativo/upscaling para 4K, integração estreita com apps do Google (Search, Photos, Workspace/Gemini). Ideal para fluxos que exigem edições confiáveis, continuidade e integração com serviços do Google.
- Midjourney — destaca-se em saídas artísticas estilizadas e engenharia de prompts guiada pela comunidade; normalmente não é voltado para fusão multi-imagem foto-realista ou pipelines de edição multimodal profundas.
- Stable Diffusion / pesos abertos — totalmente aberto, altamente personalizável e hospedável localmente; o ecossistema de checkpoints e fine-tuning é uma vantagem decisiva para pesquisa e uso offline. Menos integração móvel “one‑click” e menos coerência de edição multi-imagem pronta para uso do que o Nano Banana Pro.
- Seedream 4.0 (ByteDance) — recentemente posicionado explicitamente como concorrente do Nano Banana, enfatizando renderização ultrarrápida, saída em 2K e suporte a muitas imagens de referência (até seis). Posicionado como alternativa para profissionais/criadores.
(Essas comparações são de alto nível; escolha a ferramenta vencedora combinando-a ao seu fluxo: abertura/personalização → Stable Diffusion; arte estilizada → Midjourney; edição móvel integrada e consistente com iteração agressiva → família Nano Banana Pro/Gemini 3 Pro Image.)
Casos de uso no mundo real
- Edição de fotos móveis e filtros criativos (integrações com Google Photos — mudança de estilo, fusão de fundo, recomposição de retratos).
- Ativos de marketing e anúncios — geração rápida de conceitos, personagens de marca consistentes em múltiplos quadros/ângulos.
- Arte conceitual e storyboard — a fusão multi-imagem ajuda a manter a continuidade dos personagens entre painéis.
- E-commerce / mockups de produto — gera fotos de produto consistentes em diferentes contextos/condições de iluminação.
- Prototipagem rápida para ativos de AR/VR — saídas 2K/4K de alta qualidade que podem ser ampliadas para usos imersivos.
- Como acessar a API gemini-3-pro-image (Nano Banana Pro)
Etapas necessárias
- Faça login em cometapi.com. Se você ainda não é nosso usuário, registre-se primeiro
- Obtenha a chave de API de credenciais de acesso da interface. Clique em “Add Token” na seção de token de API no centro pessoal, obtenha a chave do token: sk-xxxxx e envie.
- Obtenha a URL deste site:
https://api.cometapi.com/
Método de uso
- Selecione o endpoint “
gemini-3-pro-image” para enviar a solicitação de API e defina o corpo da solicitação. O método e o corpo da solicitação são obtidos na documentação da API em nosso site. Nosso site também fornece teste no Apifox para sua conveniência. - Substitua <YOUR_API_KEY> pela sua chave CometAPI real da sua conta.
- Insira sua pergunta ou solicitação no campo content — é a isso que o modelo responderá.
- Processe a resposta da API para obter a resposta gerada.
A CometAPI fornece uma API REST totalmente compatível — para migração sem atrito. Detalhes principais :
- URL base: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Nomes de modelos:
gemini-3-pro-image - Autenticação: cabeçalho
Bearer YOUR_CometAPI_API_KEY - Content-Type:
application/json.