Fonctionnalités de base
- Texte → Image : génération entièrement pilotée par prompt, avec une forte conformité au prompt.
- Image → Image (modifications) : retouches fines et ciblées, avec maintien de la cohérence du sujet/personnage sur plusieurs modifications.
- Résolution de sortie maximale : jusqu’à 4K (les exemples et tailles exactes prises en charge dépendent du ratio d’aspect ; l’API expose des préréglages 1K/2K/4K)
- Planification itérative et auto‑correction : pipeline interne « multi‑étapes » qui détecte et corrige les erreurs visuelles courantes (perspective, texte, géométrie fine).
- Rendu avancé du texte dans l’image : texte multilingue clair et lisible (des légendes courtes aux longs paragraphes), adapté aux affiches, maquettes et infographies.
- 5 personnages et fidélité jusqu’à 14 objets/images de référence dans un seul flux de travail.
- Filigrane / provenance : toutes les images générées incluent un filigrane SynthID ; le modèle intègre des métadonnées C2PA pour la provenance dans certaines intégrations produits.
Versions et dénominations de Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Détails techniques
Architecture
- Lignée / ossature : Nano Banana Pro est construit sur l’empilement image Gemini en évolution de Google — spécifiquement la nouvelle architecture Gemini 3 Pro Image / GEMPIX 2 (un cadre image+texte multimodal de plus grande capacité). Il s’agit d’une évolution de Gemini 2.5 Flash Image (le « nano‑banana » d’origine) vers un modèle d’images nativement multimodal, avec des capacités élargies de raisonnement vision‑langage.
- Comportement du modèle : multimodalité native (image + texte + connaissances du monde), pipelines explicites pour la fusion multi‑images et planificateur interne en étapes qui affine les sorties en plusieurs passes plutôt que de produire un échantillon unique statique. Les premiers retours indiquent un raisonnement géométrique/optique plus solide (verre, réfraction) par rapport aux versions précédentes.
- Réflexion / affinage interne : le modèle utilise un processus de « réflexion » interne visible pour affiner la composition (la documentation de l’API décrit ce comportement et précise que ces étapes internes ne sont pas facturées comme des jetons d’image finaux).
- Ancrage & outils : prise en charge de l’ancrage via la recherche (peut intégrer des faits issus du web dans la génération de schémas/infographies). Prend également en charge les instructions système pour un contrôle plus déterministe.
Paramètres API clés :
thinking_level(low / high) pour arbitrer entre latence et profondeur de raisonnement ;media_resolution(low/medium/high) pour contrôler les jetons de lecture OCR/détails d’image ;generationConfig.imageConfigpour contrôler le ratio d’aspect/la résolution des sorties image.
Limites d’image :
- Modalités d’entrée prises en charge : texte et images (le modèle n’accepte pas l’audio ni la vidéo comme entrées pour la génération d’images).
- Nombre maximal d’images par prompt : 14 (pour l’aperçu Gemini 3 Pro Image).
- Taille maximale d’image (téléversement) : 7 Mo par image d’entrée.
- Ratios d’aspect pris en charge : 1:1, 3:2, 16:9, 9:16, 21:9, etc.
Images / jetons en sortie : limites élevées, avec prise en charge du 4K/4096 px.
Performances aux benchmarks
Résumé court : les benchmarks publics/précoces sont surtout qualitatifs/issus de la communauté, mais rapportent systématiquement des améliorations substantielles en résolution, réduction des artefacts et fidélité physique par rapport au nano‑banana d’origine (Gemini 2.5 Flash Image). Des « challenges » nommés ont montré des gains visuels nets, mais il n’existe pas encore (publiquement) de tableaux de benchmarks numériques standardisés de Google comparant v1 → v2 sur des métriques standard de génération d’images.
- Tests qualitatifs de la communauté : bords plus propres, micro‑détails plus nets, couleurs plus justes et meilleure conformité au prompt (moins d’accessoires halluciné·s, personnages plus cohérents). Des tests informels populaires incluent le « Wine Glass Test » et le « Glass Burger Challenge », où GEMPIX2 (Nano Banana Pro) gère nettement mieux la transparence et la réfraction que les versions antérieures.
- Traitement du texte : Nano Banana Pro montre des améliorations visibles en typographie et placement du texte dans les images (un point faible persistant de nombreux modèles d’image). Les comparaisons communautaires indiquent moins de glyphes rendus de façon illisible.
- Débit / UX : vitesse d’itération plus rapide et UX qui exécute un affinage multi‑étapes en arrière‑plan, de sorte que les utilisateurs voient des résultats initiaux plus fiables (réduction des relances manuelles).
Limitations et risques
- Filtres de contenu & détection : les plateformes intégrant le modèle (p. ex. Whisk/applications tierces) peuvent activer une détection stricte des célébrités ou ressemblances et bloquer certains résultats, ce qui affecte les workflows créatifs reposant sur des visages de célébrités réalistes.
- Hallucinations / cas limites de raisonnement : bien qu’amélioré, le modèle peut encore produire des artefacts physiquement irréalistes, surtout avec du texte symbolique dense dans les images ou des schémas très techniques — NB2 semble toutefois réduire ces erreurs par rapport aux versions précédentes.
- Sécurité & mésusage : les modèles d’images génératives peuvent être utilisés pour créer des contenus problématiques ou nuisibles. Google applique des contraintes, des filtres de contenu et le filigrane SynthID pour aider à la provenance ; néanmoins, des usages abusifs ont eu lieu (controverse médiatisée liée à une image Nano Banana générée dans un contexte politiquement sensible).
Comparaison de Nano Banana Pro avec d’autres modèles
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — forte intégration mobile, fusion multi‑images, auto‑correction itérative, 2K natif/4K upscaling, intégration étroite dans les apps Google (Search, Photos, Workspace/Gemini). Idéal pour des workflows nécessitant des retouches fiables, de la continuité et une intégration avec les services Google.
- Midjourney — excelle dans les rendus artistiques stylisés et le prompt engineering communautaire ; pas spécialement ciblé sur la fusion multi‑images photo‑réaliste ni sur des pipelines d’édition multimodale poussés.
- Stable Diffusion / poids ouverts — entièrement ouvert, hautement personnalisable et hébergeable localement ; l’écosystème de checkpoints et de fine‑tuning est un atout décisif pour la recherche et l’usage hors‑ligne. Moins d’intégration « en un clic » sur mobile et cohérence d’édition multi‑images moins constante par défaut que Nano Banana Pro.
- Seedream 4.0 (ByteDance) — récemment positionné explicitement comme un concurrent de Nano Banana, mettant l’accent sur le rendu ultra‑rapide, la sortie 2K et la prise en charge de nombreuses images de référence (jusqu’à six). Positionné comme une alternative pro/créateurs.
(Ces comparatifs sont à haut niveau ; choisissez l’outil en fonction de votre workflow : ouverture/personalisation → Stable Diffusion ; art stylisé → Midjourney ; édition mobile intégrée et cohérente avec itération agressive → famille Nano Banana Pro/Gemini 3 Pro Image.)
Cas d’usage concrets
- Retouche photo mobile & filtres créatifs (intégrations Google Photos — restylage, fusion d’arrière‑plan, recomposition de portraits).
- Assets marketing & publicitaires — génération rapide de concepts, personnages de marque cohérents sur plusieurs cadres/angles.
- Concept art & story‑board — la fusion multi‑images aide à conserver la continuité des personnages sur plusieurs panneaux.
- E‑commerce / maquettes produit — générer des photos produit cohérentes dans différents contextes/éclairages.
- Prototypage rapide pour assets AR/VR — sorties 2K/4K de haute qualité pouvant être upscalées pour des usages immersifs.
- Comment accéder à l’API gemini-3-pro-image (Nano Banana Pro)
Étapes requises
- Connectez‑vous à cometapi.com. Si vous n’êtes pas encore utilisateur, enregistrez‑vous d’abord.
- Obtenez la clé d’API d’accès de l’interface. Cliquez sur « Add Token » dans la section API token du centre personnel, récupérez la clé de jeton : sk‑xxxxx et soumettez.
- Récupérez l’URL du site :
https://api.cometapi.com/
Méthode d’utilisation
- Sélectionnez l’endpoint “
gemini-3-pro-image” pour envoyer la requête API et définissez le corps de la requête. La méthode et le corps de la requête sont disponibles dans la documentation API de notre site. Notre site propose aussi un test Apifox pour votre commodité. - Remplacez <YOUR_API_KEY> par votre clé CometAPI réelle depuis votre compte.
- Insérez votre question ou demande dans le champ content — c’est à cela que le modèle répondra.
- . Traitez la réponse de l’API pour obtenir la réponse générée.
CometAPI fournit une API REST entièrement compatible — pour une migration sans friction. Détails clés :
- Base URL : https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Model Names :
gemini-3-pro-image - Authentication :
Bearer YOUR_CometAPI_API_KEYheader - Content-Type :
application/json.