Funciones básicas
- Texto → Imagen: generación completamente guiada por prompt con fuerte adherencia al prompt.
- Imagen → Imagen (ediciones): ediciones finas y específicas con mantenimiento de la consistencia del sujeto/personaje a lo largo de múltiples ediciones.
- Resolución de salida máxima: hasta 4K (los ejemplos y tamaños de píxeles exactos compatibles dependen de la relación de aspecto; la API expone preajustes 1K/2K/4K)
- Planificación iterativa y autocorrección: un flujo interno “multietapa” que detecta y corrige errores visuales comunes (perspectiva, texto, geometría fina).
- Renderizado avanzado de texto dentro de la imagen: texto claro y legible en varios idiomas (desde subtítulos cortos hasta párrafos largos) apto para pósteres, maquetas e infografías.
- 5 personajes y fidelidad para hasta 14 objetos/imágenes de referencia en un único flujo de trabajo.
- Marca de agua / procedencia: todas las imágenes generadas incluyen una marca de agua SynthID; el modelo inserta metadatos C2PA para la procedencia en algunas integraciones de producto.
Versiones y nomenclatura de Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Detalles técnicos
Arquitectura
- Linaje / base: Nano Banana Pro se basa en la pila de imagen Gemini en evolución de Google, específicamente en la nueva arquitectura Gemini 3 Pro Image / GEMPIX 2 (un marco multimodal imagen+texto de mayor capacidad). Es una evolución de Gemini 2.5 Flash Image (el “nano-banana” original) hacia un modelo de imagen nativamente multimodal con capacidades ampliadas de razonamiento visión-lenguaje.
- Comportamiento del modelo: multimodalidad nativa (imagen + texto + conocimiento del mundo), canalizaciones explícitas para fusión multiimagen y un planificador interno por etapas que refina las salidas en múltiples pasadas en lugar de producir una sola muestra estática. Informes iniciales indican un razonamiento geométrico/óptico más sólido (vidrio, refracción) respecto a versiones anteriores.
- Pensamiento / refinamiento interno: el modelo utiliza un proceso de “pensamiento” visible internamente para refinar la composición (la API documenta este comportamiento y señala que esos pasos internos no se cobran como tokens de imagen finales).
- Grounding y herramientas: admite Search grounding (puede incorporar hechos web en la generación de diagramas/infografías). También admite instrucciones del sistema para un control más determinista.
Parámetros clave de la API:
thinking_level(low / high) para equilibrar latencia frente a profundidad de razonamiento;media_resolution(low/medium/high) para controlar los tokens de lectura de OCR/detalle de imagen;generationConfig.imageConfigpara controlar relación de aspecto/resolución en las salidas de imagen.
Límites de imagen:
- Modalidades de entrada compatibles: Texto e imágenes (el modelo no acepta audio ni video como entradas para generación de imágenes).
- Máximo de imágenes por prompt: 14 (para la vista previa de Gemini 3 Pro Image).
- Tamaño máximo de imagen (carga): 7 MB por imagen de entrada.
- Relaciones de aspecto compatibles: 1:1, 3:2, 16:9, 9:16, 21:9, etc.
Imágenes de salida / tokens: límites elevados, con compatibilidad para 4K/4096 px.
Rendimiento en benchmarks
Resumen breve: los benchmarks públicos/tempranos hasta ahora son mayormente cualitativos/impulsados por la comunidad, pero informan de mejoras sustanciales en resolución, reducción de artefactos y fidelidad física frente al nano-banana original (Gemini 2.5 Flash Image). “Retos” específicos han mostrado mejoras visuales claras, pero aún no hay tablas de benchmarks numéricos estandarizados (públicas) de Google comparando v1 → v2 en métricas estándar de generación de imágenes.
- Pruebas cualitativas de la comunidad: bordes más limpios, microdetalles más nítidos, colores más fieles y mayor adherencia al prompt (menos objetos de utilería alucinados, personajes más consistentes). Pruebas informales populares incluyen la llamada “Wine Glass Test” y el “Glass Burger Challenge”, donde GEMPIX2 (Nano Banana Pro) maneja notablemente mejor la transparencia y la refracción que compilaciones anteriores.
- Manejo de texto: Nano Banana Pro muestra mejoras visibles en tipografía y colocación de texto dentro de imágenes (una debilidad persistente de muchos modelos de imagen). Las comparativas de la comunidad indican menos glifos renderizados ilegibles.
- Rendimiento / UX: mayor velocidad de iteración y una UX que realiza refinamiento multietapa en el backend para que los usuarios vean resultados de primer pase más confiables (reduciendo relanzamientos manuales).
Limitaciones y riesgos
- Filtros de contenido y detección: las plataformas que integran el modelo (p. ej., Whisk/aplicaciones de terceros) pueden habilitar detección estricta de celebridades o parecidos y bloquear ciertos resultados, lo cual afecta flujos creativos que dependen de parecidos realistas de celebridades.
- Alucinaciones / casos límite de razonamiento: aunque mejorado, el modelo aún puede producir artefactos físicamente poco realistas, especialmente con texto simbólico denso dentro de imágenes o diagramas altamente técnicos, si bien NB2 parece reducir estos errores frente a versiones anteriores.
- Seguridad y uso indebido: los modelos de imagen generativa pueden utilizarse para crear contenido problemático o dañino. Google aplica restricciones, filtros de contenido y la marca de agua SynthID para ayudar con la procedencia; sin embargo, se han producido usos indebidos (controversia de alto perfil vinculada a una imagen generada por Nano Banana en un contexto políticamente sensible).
Cómo se compara Nano Banana Pro con otros modelos
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image): sólida integración móvil, fusión multiimagen, autocorrección iterativa, 2K nativo/escalado a 4K, estrechamente integrado en aplicaciones de Google (Search, Photos, Workspace/Gemini). Ideal para flujos que requieren ediciones confiables, continuidad e integración con servicios de Google.
- Midjourney: destaca en salidas artísticas estilizadas y en la ingeniería de prompts impulsada por la comunidad; no suele enfocarse en fusión multiimagen fotorrealista ni en canalizaciones de edición multimodal profunda.
- Stable Diffusion / pesos abiertos: totalmente abierto, altamente personalizable y desplegable localmente; el ecosistema de checkpoints y afinado fino es una ventaja decisiva para investigación y uso sin conexión. Menor integración móvil “de un clic” y menor coherencia de edición multiimagen lista para usar que Nano Banana Pro.
- Seedream 4.0 (ByteDance): recientemente posicionada explícitamente como competidor de Nano Banana, enfatiza renderizado ultrarrápido, salida 2K y compatibilidad con muchas imágenes de referencia (hasta seis). Orientada como alternativa para profesionales/creadores.
(Estas comparaciones son de alto nivel; elija la herramienta según su flujo de trabajo: apertura/personalización → Stable Diffusion; arte estilizado → Midjourney; edición móvil integrada y consistente con iteración agresiva → familia de imagen Nano Banana Pro/Gemini 3 Pro).
Casos de uso del mundo real
- Edición de fotos móviles y filtros creativos (integraciones con Google Photos: cambio de estilo, fusión de fondos, recomposición de retratos).
- Activos de marketing y publicidad: generación rápida de conceptos, personajes de marca consistentes en múltiples fotogramas/ángulos.
- Arte conceptual y storyboard: la fusión multiimagen ayuda a mantener la continuidad de personajes entre paneles.
- E-commerce / maquetas de producto: genere tomas de producto consistentes en distintos contextos/condiciones de luz.
- Prototipado rápido para activos AR/VR: salidas 2K/4K de alta calidad que pueden escalarse para usos inmersivos.
- Cómo acceder a la API de gemini-3-pro-image (Nano Banana Pro)
Pasos requeridos
- Inicie sesión en cometapi.com. Si aún no es usuario, regístrese primero.
- Obtenga la clave de API de acceso de la interfaz. Haga clic en “Add Token” en el apartado de token de la API en el centro personal, obtenga la clave del token: sk-xxxxx y envíela.
- Obtenga la URL de este sitio:
https://api.cometapi.com/
Método de uso
- Seleccione el endpoint “
gemini-3-pro-image” para enviar la solicitud a la API y configure el cuerpo de la solicitud. El método y el cuerpo de la solicitud se obtienen de la documentación de la API en nuestro sitio web. Nuestro sitio web también proporciona prueba en Apifox para su conveniencia. - Reemplace <YOUR_API_KEY> con su clave real de CometAPI de su cuenta.
- Inserte su pregunta o solicitud en el campo content—esto es a lo que responderá el modelo.
- Procese la respuesta de la API para obtener la respuesta generada.
CometAPI proporciona una API REST totalmente compatible—para una migración sin fricciones. Detalles clave :
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Model Names:
gemini-3-pro-image - Authentication:
Bearer YOUR_CometAPI_API_KEYheader - Content-Type:
application/json.