Tính năng cơ bản
- Văn bản → Hình ảnh: tạo sinh hoàn toàn dựa trên prompt với mức tuân thủ prompt cao.
- Hình ảnh → Hình ảnh (chỉnh sửa): chỉnh sửa tinh, có mục tiêu, giữ nhất quán chủ thể/nhân vật qua nhiều lần chỉnh.
- Độ phân giải đầu ra tối đa: lên đến 4K (ví dụ và kích thước pixel chính xác tùy theo tỷ lệ khung hình; API cung cấp preset 1K/2K/4K)
- Lập kế hoạch lặp và tự hiệu chỉnh: pipeline “đa giai đoạn” nội bộ phát hiện và sửa lỗi thị giác thường gặp (phối cảnh, văn bản, hình học tinh).
- Kết xuất văn bản trong ảnh nâng cao: chữ rõ ràng, dễ đọc, đa ngôn ngữ (từ chú thích ngắn đến đoạn dài) phù hợp poster, mockup, infographic.
- 5 nhân vật và độ trung thực cho tối đa 14 đối tượng/hình tham chiếu trong một quy trình.
- Đóng dấu mờ / nguồn gốc: mọi ảnh tạo sinh đều có watermark SynthID; mô hình nhúng siêu dữ liệu C2PA cho provenance trong một số tích hợp sản phẩm.
Phiên bản & cách đặt tên Gemini 3 Pro Image
gemini-3-pro-image-previewgemini-3-pro-image
Chi tiết kỹ thuật
Kiến trúc
- Dòng dõi / backbone: Nano Banana Pro được xây dựng trên hệ Gemini image stack đang phát triển của Google — cụ thể là kiến trúc Gemini 3 Pro Image / GEMPIX 2 (khung đa phương thức hình ảnh+văn bản dung lượng cao hơn). Đây là sự phát triển từ Gemini 2.5 Flash Image (bản “nano-banana” gốc) thành mô hình hình ảnh đa phương thức bản địa với năng lực suy luận thị giác-ngôn ngữ mở rộng.
- Hành vi mô hình: đa phương thức bản địa (hình ảnh + văn bản + tri thức thế giới), pipeline rõ ràng cho hợp nhất đa ảnh, và bộ lập kế hoạch theo giai đoạn nội bộ tinh chỉnh đầu ra qua nhiều lượt thay vì tạo một mẫu tĩnh duy nhất. Báo cáo sớm cho thấy suy luận hình học/quang học mạnh hơn (thủy tinh, khúc xạ) so với các phiên bản trước.
- Suy nghĩ / tinh chỉnh nội bộ: mô hình sử dụng quy trình “suy nghĩ” hiển thị bên trong để tinh chỉnh bố cục (API có ghi nhận hành vi này và lưu ý các bước nội bộ đó không bị tính là token ảnh cuối cùng).
- Grounding & công cụ: Hỗ trợ Search grounding (có thể đưa dữ kiện web vào tạo sinh sơ đồ/infographic). Cũng hỗ trợ chỉ dẫn hệ thống để kiểm soát mang tính xác định cao hơn.
Các tham số API chính:
thinking_level(low / high) để đánh đổi giữa độ trễ và độ sâu suy luận;media_resolution(low/medium/high) để điều khiển token đọc chi tiết/OCR hình ảnh;generationConfig.imageConfigđể điều khiển tỷ lệ khung/độ phân giải đầu ra ảnh.
Giới hạn hình ảnh:
- Phương thức đầu vào được hỗ trợ: Văn bản và hình ảnh (mô hình không nhận âm thanh hay video làm đầu vào tạo ảnh).
- Số ảnh tối đa mỗi prompt: 14 (đối với bản xem trước Gemini 3 Pro Image).
- Kích thước ảnh tải lên tối đa: 7 MB mỗi ảnh đầu vào.
- Tỷ lệ khung hình được hỗ trợ: 1:1, 3:2, 16:9, 9:16, 21:9, v.v.
Ảnh đầu ra / token: giới hạn cao, hỗ trợ 4K/4096px.
Hiệu năng benchmark
Tóm tắt ngắn: các benchmark công khai/giai đoạn đầu chủ yếu mang tính định tính/đến từ cộng đồng, nhưng nhất quán ghi nhận cải thiện đáng kể về độ phân giải, giảm lỗi tạo sinh và độ đúng vật lý so với nano-banana bản gốc (Gemini 2.5 Flash Image). Một số “thử thách” được nêu tên cho thấy cải thiện thị giác rõ rệt, nhưng hiện chưa có bảng số liệu chuẩn hóa (công khai) từ Google so sánh v1 → v2 theo các chỉ số tạo ảnh tiêu chuẩn.
- Kiểm thử định tính từ cộng đồng: viền sạch hơn, chi tiết vi mô sắc nét hơn, màu sắc trung thực hơn, và tuân thủ prompt tốt hơn (ít đạo cụ bịa đặt, nhân vật nhất quán hơn). Các bài test không chính thức phổ biến gồm “Wine Glass Test” và “Glass Burger Challenge”, nơi GEMPIX2 (Nano Banana Pro) xử lý độ trong suốt và khúc xạ tốt hơn hẳn các bản trước.
- Xử lý văn bản: Nano Banana Pro thể hiện cải thiện rõ rệt về kiểu chữ và bố trí chữ trong ảnh (một điểm yếu dai dẳng của nhiều mô hình ảnh). So sánh cộng đồng cho thấy ít ký tự render bị méo/loạn hơn.
- Thông lượng / UX: tốc độ lặp nhanh hơn và UX thực hiện tinh chỉnh đa giai đoạn ở backend nên người dùng thấy kết quả lượt đầu đáng tin cậy hơn (giảm phải “reroll” thủ công).
Hạn chế & rủi ro
- Bộ lọc nội dung & phát hiện: các nền tảng tích hợp mô hình (ví dụ, Whisk/ứng dụng bên thứ ba) có thể bật phát hiện người nổi tiếng hoặc độ giống và chặn một số đầu ra, ảnh hưởng đến quy trình sáng tạo dựa vào chân dung người nổi tiếng chân thực.
- Trường hợp biên về ảo tưởng/suy luận: dù đã cải thiện, mô hình vẫn có thể tạo các hiện tượng phi thực tế, đặc biệt với văn bản ký hiệu dày đặc trong ảnh hoặc sơ đồ kỹ thuật cao — dù NB2 có vẻ giảm lỗi này so với các bản trước.
- An toàn & lạm dụng: mô hình ảnh tạo sinh có thể bị dùng cho nội dung có vấn đề/gây hại. Google áp dụng ràng buộc, bộ lọc nội dung và watermark SynthID để hỗ trợ provenance; tuy vậy, việc lạm dụng vẫn xảy ra (tranh cãi nổi bật gắn với ảnh Nano Banana tạo ra trong bối cảnh nhạy cảm chính trị).
Nano Banana Pro so với các mô hình khác
- Nano Banana Pro (GEMPIX 2 / Gemini 3 Pro Image) — tích hợp di động mạnh, hợp nhất đa ảnh, tự hiệu chỉnh lặp, 2K gốc/4K upscaling, tích hợp chặt với các ứng dụng Google (Search, Photos, Workspace/Gemini). Phù hợp quy trình cần chỉnh sửa đáng tin, tính liên tục và tích hợp với dịch vụ Google.
- Midjourney — vượt trội về phong cách nghệ thuật và cộng đồng tối ưu prompt; không nhắm trọng tâm vào hợp nhất đa ảnh chính xác như ảnh chụp hay pipeline chỉnh sửa đa phương thức sâu.
- Stable Diffusion / open weights — mở hoàn toàn, tùy biến cao và có thể triển khai cục bộ; hệ sinh thái checkpoint và fine-tuning là lợi thế quyết định cho nghiên cứu và sử dụng offline. Ít “một cú nhấp” trên di động và độ nhất quán chỉnh sửa đa ảnh mặc định kém hơn Nano Banana Pro.
- Seedream 4.0 (ByteDance) — gần đây được định vị là đối thủ Nano Banana, nhấn mạnh kết xuất siêu nhanh, đầu ra 2K và hỗ trợ nhiều hình tham chiếu (tối đa sáu). Nhắm tới người dùng pro/creator như một lựa chọn thay thế.
(Các so sánh này ở mức cao; hãy chọn công cụ thắng cuộc theo quy trình của bạn: mở/tùy biến → Stable Diffusion; nghệ thuật phong cách → Midjourney; chỉnh sửa di động tích hợp, nhất quán với lặp nhanh → Nano Banana Pro/ gia đình Gemini 3 Pro Image.)
Trường hợp sử dụng thực tế
- Chỉnh ảnh di động & bộ lọc sáng tạo (tích hợp Google Photos — restyle, hòa nền, tái bố cục chân dung).
- Tài sản marketing & quảng cáo — tạo nhanh concept, nhân vật thương hiệu nhất quán qua nhiều khung/góc.
- Concept art & storyboard — hợp nhất đa ảnh giúp giữ liên tục nhân vật qua các khung.
- Thương mại điện tử / mockup sản phẩm — tạo ảnh sản phẩm nhất quán trong bối cảnh/ánh sáng khác nhau.
- Dựng mẫu nhanh cho tài sản AR/VR — đầu ra 2K/4K chất lượng cao có thể upscale cho trải nghiệm đắm chìm.
- Cách truy cập API gemini-3-pro-image (Nano Banana Pro)
Các bước cần thiết
- Đăng nhập vào cometapi.com. Nếu bạn chưa là người dùng của chúng tôi, vui lòng đăng ký trước.
- Lấy khóa API thông tin xác thực của giao diện. Nhấp “Add Token” tại mục API token trong trung tâm cá nhân, lấy khóa token: sk-xxxxx và gửi.
- Lấy url của trang này:
https://api.cometapi.com/
Cách sử dụng
- Chọn endpoint “
gemini-3-pro-image” để gửi yêu cầu API và thiết lập phần thân yêu cầu. Phương thức yêu cầu và phần thân yêu cầu được lấy từ tài liệu API trên trang web của chúng tôi. Trang web cũng cung cấp kiểm thử Apifox để bạn tiện sử dụng. - Thay <YOUR_API_KEY> bằng khóa CometAPI thực tế từ tài khoản của bạn.
- Chèn câu hỏi hoặc yêu cầu của bạn vào trường content — đây là nội dung mà mô hình sẽ phản hồi.
- . Xử lý phản hồi API để lấy câu trả lời được tạo.
CometAPI cung cấp REST API tương thích hoàn toàn — cho việc chuyển đổi liền mạch. Chi tiết chính:
- URL cơ sở: https://api.cometapi.com/v1beta/models/gemini-3-pro-image-preview:generateContent
- Tên mô hình:
gemini-3-pro-image - Xác thực:
Bearer YOUR_CometAPI_API_KEYheader - Content-Type:
application/json