Базовые возможности
- Текст → Изображение: полнофункциональная генерация по промпту со строгим соблюдением промпта.
- Изображение → Изображение (правки): точечные, аккуратные правки с сохранением согласованности субъекта/персонажа через несколько итераций.
- Максимальное разрешение вывода: до 4K (примерные и поддерживаемые точные размеры зависят от соотношения сторон; в API доступны пресеты 1K/2K/4K)
- Итеративное планирование и самокоррекция: внутренний «многоэтапный» пайплайн, который обнаруживает и исправляет типичные визуальные ошибки (перспектива, текст, тонкая геометрия).
- Продвинутая отрисовка текста внутри изображения: чёткий, разборчивый многоязычный текст (от коротких подписей до длинных абзацев), подходящий для постеров, мокапов и инфографики.
- 5 персонажей и точное соответствие до 14 объектам/референс-изображениям за один рабочий процесс.
- Водяные знаки / происхождение: все сгенерированные изображения включают водяной знак SynthID; модель встраивает метаданные C2PA для подтверждения происхождения в некоторых продуктовых интеграциях.
Версии и наименования Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Технические детали
Архитектура
- Происхождение/бэкбон: Nano Banana Pro основана на развивающемся стекe изображений Google Gemini — в частности, на новой архитектуре Gemini 3 Pro Image / GEMPIX 2 (более ёмкая мультимодальная система изображение+текст). Это эволюция Gemini 2.5 Flash Image (оригинального «nano-banana») в нативно мультимодальную модель с расширенными возможностями визуально-языкового рассуждения.
- Поведение модели: нативная мультимодальность (изображение + текст + знания о мире), явные пайплайны для слияния нескольких изображений и внутренний поэтапный планировщик, который улучшает результат несколькими проходами, а не выдаёт один статичный сэмпл. Ранние сообщения указывают на более сильное геометрическое/оптическое рассуждение (стекло, преломление) по сравнению с предыдущими версиями.
- Thinking / внутренняя доработка: модель использует видимый внутренний процесс «thinking» для уточнения композиции (это поведение задокументировано в API, и отмечается, что эти внутренние шаги не тарифицируются как финальные токены изображения).
- Grounding и инструменты: поддерживает Search grounding (может включать факты из веба в генерацию диаграмм/инфографики). Также поддерживает системные инструкции для более детерминированного контроля.
Ключевые параметры API:
thinking_level(low / high) для баланса между задержкой и глубиной рассуждения;media_resolution(low/medium/high) для управления токенами OCR/чтения деталей изображения;generationConfig.imageConfigдля управления соотношением сторон/разрешением на выходе.
Ограничения изображений:
- Поддерживаемые входные модальности: текст и изображения (модель не принимает аудио или видео в качестве входов для генерации изображений).
- Макс. число изображений на промпт: 14 (для предварительной версии Gemini 3 Pro Image).
- Макс. размер изображения (загрузка): 7 MB на одно входное изображение.
- Поддерживаемые соотношения сторон: 1:1, 3:2, 16:9, 9:16, 21:9 и т. д.
Выходные изображения / токены: высокие лимиты, поддерживается 4K/4096px.
Производительность по бенчмаркам
Кратко: публичные/ранние бенчмарки в основном качественные и комьюнити-ориентированные, но стабильно сообщают о существенных улучшениях в разрешении, снижении артефактов и физической достоверности по сравнению с оригинальным nano-banana (Gemini 2.5 Flash Image). Есть явные визуальные выигрыши в ряде именованных «челленджей», но (пока) нет стандартизированных численных таблиц бенчмарков от Google с сравнением v1 → v2 по стандартным метрикам генерации изображений.
- Качественные комьюнити-тесты: более чистые края, более резкие микро-детали, более точные цвета и более верное следование промпту (меньше галлюцинированных объектов, более последовательные персонажи). Популярные неформальные тесты включают так называемые «Wine Glass Test» и «Glass Burger Challenge», где GEMPIX2 (Nano Banana Pro) заметно лучше справляется с прозрачностью и преломлением, чем более ранние сборки.
- Обработка текста: Nano Banana Pro демонстрирует заметно улучшенную типографику и размещение текста внутри изображений (давняя слабость многих моделей изображений). Сравнения в сообществе указывают на меньшее количество искажённых отрисованных глифов.
- Пропускная способность / UX: более быстрая скорость итераций и UX, выполняющий многоэтапную доработку на бэкенде, поэтому пользователи видят более надёжные результаты с первого прохода (меньше перегенераций).
Ограничения и риски
- Фильтры контента и детекция: платформы, интегрирующие модель (например, Whisk/сторонние приложения), могут включать строгую детекцию знаменитостей или сходства и блокировать определённые результаты, что влияет на креативные процессы, полагающиеся на реалистичные портретные сходства знаменитостей.
- Галлюцинации / пограничные случаи рассуждений: хотя ситуация улучшилась, модель всё ещё может создавать физически нереалистичные артефакты, особенно при плотном символическом тексте внутри изображений или в очень технических диаграммах — хотя NB2, по-видимому, снижает эти ошибки по сравнению с ранними версиями.
- Безопасность и злоупотребления: генеративные модели изображений могут использоваться для создания проблемного или вредного контента. Google применяет ограничения, контент-фильтры и водяной знак SynthID для подтверждения происхождения; тем не менее, случаи злоупотреблений случались (громкий скандал, связанный с изображением Nano Banana в политически чувствительном контексте).
Сравнение Nano Banana Pro с другими моделями
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — сильная мобильная интеграция, слияние нескольких изображений, итеративная самокоррекция, родные 2K/апскейл до 4K, тесно интегрирована в приложения Google (Search, Photos, Workspace/Gemini). Лучший выбор для сценариев, где нужны надёжные правки, согласованность и интеграция с сервисами Google.
- Midjourney — превосходит в стилизованных художественных результатах и комьюнити-ориентированном инженерии промптов; обычно не нацелен на фото-точное слияние нескольких изображений или глубокие мультимодальные пайплайны редактирования.
- Stable Diffusion / открытые веса — полностью открыта, высоко настраиваема и может размещаться локально; экосистема чекпоинтов и тонкой донастройки — решающее преимущество для исследований и офлайн-использования. Менее «в один клик» мобильная интеграция и менее стабильная согласованность многоизображенческих правок «из коробки», чем у Nano Banana Pro.
- Seedream 4.0 (ByteDance) — недавно позиционируется как конкурент Nano Banana, делая акцент на сверхбыстром рендеринге, 2K-выводе и поддержке множества референс-изображений (до шести). Позиционируется как альтернатива для профи/креаторов.
(Сравнения на высоком уровне; выбирайте победителя, сопоставляя инструмент с вашим процессом: открытость/настраиваемость → Stable Diffusion; стилизованное искусство → Midjourney; интегрированное, согласованное мобильное редактирование с агрессивной итерацией → семейство Nano Banana Pro / Gemini 3 Pro Image.)
Практические сценарии использования
- Мобильное редактирование фото и креативные фильтры (интеграции Google Photos — смена стиля, слияние фона, перекомпоновка портрета).
- Маркетинговые и рекламные ассеты — быстрый генеративный концептинг, согласованные бренд-персонажи в нескольких кадрах/ракурсах.
- Концепт-арт и сторибординг — слияние нескольких изображений помогает сохранять целостность персонажей между панелями.
- E-commerce / продуктовые мокапы — генерация согласованных продуктовых снимков в разных контекстах/условиях освещения.
- Быстрый прототипинг для AR/VR-ассетов — высококачественные 2K/4K-выводы, которые можно апскейлить для иммерсивных сценариев.
- Как получить доступ к API gemini-3-pro-image (Nano Banana Pro)
Требуемые шаги
- Войдите на cometapi.com. Если вы ещё не наш пользователь, сначала зарегистрируйтесь.
- Получите учётные данные доступа — API key интерфейса. Нажмите “Add Token” в разделе API token в личном кабинете, получите ключ токена: sk-xxxxx и отправьте.
- Получите URL этого сайта:
https://api.cometapi.com/
Метод использования
- Выберите конечную точку “
gemini-3-pro-image” для отправки API-запроса и задайте тело запроса. Метод и тело запроса берутся из документации API на нашем сайте. Мы также предоставляем тестирование в Apifox для удобства. - Замените <YOUR_API_KEY> на ваш фактический ключ CometAPI из вашего аккаунта.
- Вставьте свой вопрос или запрос в поле content — именно на это модель ответит.
- Обработайте ответ API, чтобы получить сгенерированный результат.
CometAPI предоставляет полностью совместимый REST API — для бесшовной миграции. Ключевые детали:
- Base URL: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Model Names:
gemini-3-pro-image - Authentication: заголовок
Bearer YOUR_CometAPI_API_KEY - Content-Type:
application/json