Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-model/Nghiên cứu CometAPI

Nano Banana 2.1: Tính năng, Điểm chuẩn, Giá & Hướng dẫn truy cập

Nano Banana 2.1 là gì? Tìm hiểu cách nó cải thiện khả năng tạo sinh 4K, kết xuất văn bản, tính nhất quán với ảnh tham chiếu, chỉnh sửa, grounding dựa trên tìm kiếm, hiệu năng

CometAPI
AnnaĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Oct 8, 2026 16 phút đọc
Nano Banana 2.1: Tính năng, Điểm chuẩn, Giá & Hướng dẫn truy cập
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR: Google ra mắt Nano Banana 2.1 (model ID: gemini-nano-banana-2.1) vào ngày 6 tháng 10 năm 2026, là mẫu mới nhất cho tạo ảnh hiệu suất cao và chỉnh sửa hội thoại dựa trên Gemini 3.6 Flash. Được định vị là đối tác hiệu quả hơn của Nano Banana Pro, model này mang lại chất lượng tiệm cận Pro với tốc độ cấp Flash và chi phí mỗi ảnh vào khoảng một nửa so với tiền nhiệm (Nano Banana 2).

Các nâng cấp chính bao gồm thiết kế thị giác vượt trội, chỉnh sửa dựa trên mask, tính nhất quán chủ thể (tối đa 4 nhân vật và 10 đối tượng trên tối đa 14 ảnh tham chiếu), kết xuất văn bản/infographic chính xác, đầu ra 1K/2K/4K (bao gồm các tỷ lệ khung hình cực đoan cố định), grounding bằng Google Search, và mức Thinking có thể cấu hình. Các benchmark nội bộ của Google cho thấy model này vượt trội so với các mẫu Nano Banana trước đây về ưu tiên tổng thể, thiết kế/độ đúng sự kiện của infographic và nhiều chỉ số chỉnh sửa. Đối với nhà phát triển muốn chi phí thấp nhất và tích hợp đơn giản nhất, các nền tảng như CometAPI cung cấp quyền truy cập hợp nhất, được chiết khấu vào dòng Nano Banana cùng hơn 500 model khác.

Key Takeaways

  • Nano Banana 2.1 là model ảnh cấp Flash mới nhất của Google DeepMind (dựa trên Gemini 3.6 Flash), phát hành ngày 6 tháng 10 năm 2026, và được mô tả là vượt trội so với các model Nano Banana trước “trên toàn bộ các mặt”.
  • Thế mạnh nổi bật: thiết kế thị giác cải thiện và hình ảnh tự nhiên hơn, chỉnh sửa chính xác dựa trên mask/ink, nhất quán nhiều nhân vật/đối tượng, văn bản trong ảnh và infographic dễ đọc, grounding Search cho tính đúng sự kiện đời thực, và độ phân giải tới 4K với tỷ lệ toàn cảnh cố định.
  • Giá: ~$0.0336 mỗi 1K ảnh (khoảng một nửa so với ~$0.067 của Nano Banana 2), với các mức độ phân giải và Thinking cao hơn có sẵn; có chiết khấu theo lô.
  • Benchmark (nội bộ Google, 10/2026): Ưa thích tổng thể 1050 (Thinking) so với 990 của Nano Banana 2 và 935 của Nano Banana Pro; Tính đúng sự kiện của infographic 0.521 so với 0.179/0.265.
  • Truy cập qua ứng dụng Gemini, AI Studio, API và các nhà cung cấp hợp nhất như CometAPI để đơn giản hóa quy trình đa model và tiết kiệm chi phí.
  • Lý tưởng cho sáng tạo marketing, mockup sản phẩm, infographic, kể chuyện nhân vật nhất quán, và sản xuất khối lượng lớn nơi tốc độ + chất lượng + chi phí là trọng yếu.

What Is Nano Banana 2.1?

Nano Banana 2.1 là một model suy luận đa phương thức gốc trong dòng Gemini 3, được tối ưu hóa đặc biệt cho tạo ảnh và chỉnh sửa ảnh theo hội thoại. Model này dựa trên Gemini 3.6 Flash và đóng vai trò “cỗ máy” hiệu quả cao tương ứng với phiên bản cao cấp Nano Banana Pro (Gemini 3 Pro Image):

  • Inputs: Chuỗi văn bản (prompt, tài liệu) và hình ảnh, với cửa sổ ngữ cảnh lớn (được báo cáo tới 1M token trong một số mô tả; tài liệu nhà phát triển liệt kê 131.072 token input).
  • Outputs: Ảnh (tới 4K) và văn bản (tới 64K token theo mô tả model card).
  • Năng lực cốt lõi: Tạo ảnh từ văn bản, hợp nhất/chỉnh sửa nhiều ảnh, chỉnh sửa cục bộ chính xác, kết xuất văn bản có thể đọc trong ảnh, và grounding qua Google Search và Image Search cho độ đúng sự kiện.

Model được phát hành rộng rãi cùng ngày trên ứng dụng Gemini, AI Mode trong Google Search, Google AI Studio, Google Flow, Stitch, Google Ads, nền tảng Gemini Enterprise, và Gemini API (model ID: gemini-nano-banana-2.1). Nano Banana 2 đồng thời được đánh dấu ngừng hỗ trợ, với lịch tắt vào ngày 29 tháng 10 năm 2026.

Google định vị 2.1 là mang lại “tạo ảnh và chỉnh sửa ở cấp Pro” với “tốc độ cấp Flash”, phù hợp cả cho lặp nhanh và tạo tài sản sản xuất khi không cần mức suy luận Pro tối đa.

What Is Special About Nano Banana 2.1?

Google nhấn mạnh các bước nhảy vọt đáng chú ý trong ba lĩnh vực chính phân biệt 2.1 với các model trước trong họ. Đây là cốt lõi cho tuyên bố “model hiệu quả mạnh mẽ nhất” của họ.

1. Thiết kế thị giác vượt trội và hình ảnh tự nhiên hơn

Nano Banana 2.1 tạo ra đầu ra bóng bẩy, chân thực và thẩm mỹ hơn ở các độ phân giải 1K (mặc định), 2K và 4K. Cải tiến gồm ánh sáng, bố cục, chi tiết chất liệu tốt hơn và ưu tiên tổng thể cao hơn trong so sánh song song. Các tỷ lệ khung hình cực đoan (1:4, 4:1, 1:8, 8:1) không còn gặp lỗi ghép lát (tiling) vốn ảnh hưởng Nano Banana 2 ở độ phân giải cao, cho phép ảnh toàn cảnh và siêu rộng/siêu cao sạch sẽ, phù hợp cho banner, mạng xã hội hoặc màn hình immersive.

Model tận dụng hiểu biết thế giới thực của Gemini cùng tùy chọn grounding Search theo thời gian thực để tạo các cảnh lịch sử chính xác, infographic phức tạp hoặc sơ đồ phản ánh thông tin hiện tại (ví dụ thời tiết, sự kiện hoặc chi tiết sản phẩm). Điều này giảm các hiện tượng ảo giác phổ biến ở model sinh ảnh trước đây và hỗ trợ các trường hợp chuyên nghiệp như mockup marketing, hình ảnh giáo dục và trực quan hóa sản phẩm.

Điểm tính đúng sự kiện của infographic tăng mạnh lên 0.521 (chế độ Thinking) từ 0.179 trên Nano Banana 2, phản ánh việc tận dụng tốt hơn tri thức thế giới của Gemini và tùy chọn grounding Search.

2. Kết xuất văn bản và bố cục infographic tốt hơn

Các model ảnh AI từ trước thường gặp khó với văn bản dễ đọc, kiểu chữ nhất quán và sơ đồ dày đặc. Nano Banana 2.1 cải thiện cụ thể khả năng kết xuất văn bản và độ chính xác bố cục infographic. Google định vị model này cho thực đơn, biểu đồ, sơ đồ, trực quan hóa dữ liệu, mockup marketing và sáng tạo bản địa hóa.

Model cũng có thể kết hợp tạo ảnh với khả năng hiểu ngôn ngữ của Gemini. Một prompt có thể chỉ định hệ thống phân cấp, nhãn, dịch và bố cục trong một yêu cầu hội thoại. Ví dụ, người dùng có thể yêu cầu sơ đồ sản phẩm bằng tiếng Anh, rồi yêu cầu phiên bản tiếng Tây Ban Nha trong khi bảo toàn cùng cấu trúc thị giác.

Điều này không biến model thành một hệ thống thiết kế hoàn chỉnh. Các đội thương hiệu vẫn nên kiểm tra chính tả, nội dung pháp lý, giá và chữ nhỏ ở kích thước đầu ra cuối cùng. Lợi thế là model nay có thể tạo bản nháp đầu tiên hữu dụng hơn nhiều và có thể chỉnh sửa ảnh qua các lượt tiếp theo.

3. Nhất quán chủ thể trên nhiều tham chiếu

Nano Banana 2.1 hỗ trợ hợp nhất nhiều ảnh với tối đa 14 ảnh tham chiếu. Tài liệu model của Google chỉ rõ hỗ trợ tới bốn nhân vật và mười đối tượng cho tính nhất quán. Điều này cho phép các quy trình như:

  • Chụp ảnh sản phẩm với nhiều góc của cùng một mặt hàng.
  • Storyboard với dàn nhân vật lặp lại.
  • Ý tưởng thời trang giữ ổn định mẫu, trang phục và phụ kiện.
  • Thiết kế lại phòng giữ nguyên đồ nội thất trong khi thay ánh sáng và trang trí.
  • Cảnh catalog dựng từ các tham chiếu đối tượng riêng lẻ.

Khả năng này không chỉ là “tải nhiều ảnh hơn”. Prompt phải chỉ cho model ảnh nào định nghĩa danh tính, ảnh nào định nghĩa phong cách và ảnh nào nên xuất hiện trong bố cục cuối cùng. Một mẫu vận hành hữu ích là dán nhãn tham chiếu trong prompt—“Ảnh 1 là sản phẩm chính; Ảnh 2–4 xác định khuôn mặt người mẫu; Ảnh 5–7 xác định chi tiết bao bì”—sau đó yêu cầu một thay đổi có kiểm soát mỗi lần.

4. Thinking có thể cấu hình và chỉnh sửa nhiều lượt

Model hỗ trợ các mức Thinking tối thiểu, trung bình và cao, với mặc định là trung bình. Thinking cho phép model có thêm các bước nội bộ để suy nghĩ về bố cục, tham chiếu, vị trí văn bản và hướng dẫn phức tạp trước khi tạo ảnh cuối cùng.

Hành vi thực tế là chỉnh sửa theo hội thoại. Người sáng tạo có thể tạo một cảnh, yêu cầu di chuyển chủ thể, đổi ngôn ngữ trên biển hiệu, loại bỏ đối tượng, thay đổi góc máy, hoặc giữ nhân vật khi thay phông nền. API hỗ trợ tiếp tục tương tác với một interaction ID trước đó, hữu ích cho quy trình lặp.

Thinking cao nên dành cho bố cục khó hoặc hướng dẫn dày đặc. Thinking tối thiểu hữu ích cho biến thể nhanh. Hãy đo độ trễ và tỷ lệ chấp nhận trong tải công việc của bạn thay vì giả định rằng thiết lập cao nhất luôn tốt nhất.

Performance and Behavior

Google công bố chi tiết các benchmark AutoRater và ưu tiên nội bộ (tính đến tháng 10/2026) so sánh Nano Banana 2.1 (có và không có Thinking) với Nano Banana 2 (Gemini 3.1 Flash Image Thinking) và Nano Banana Pro (Gemini 3 Pro Image).

Text-to-Image Capabilities

Capability BenchmarkNano Banana 2.1 (Thinking)Nano Banana 2.1 (No Thinking)Nano Banana 2 (Thinking)Nano Banana Pro
Overall Preference1050 ± 141015 ± 13990 ± 7935 ± 8
Infographic Design1048 ± 171001 ± 17961 ± 12912 ± 12
Infographic Factuality0.5210.3280.1790.265

Editing Capabilities

Capability BenchmarkNano Banana 2.1 (Thinking)Nano Banana 2.1 (No Thinking)Nano Banana 2 (Thinking)Nano Banana Pro
General Editing1026 ± 12980 ± 15938 ± 11939 ± 10
Single-Character Consistency1028 ± 141021 ± 14981 ± 10991 ± 9
Multi-Character Consistency1106 ± 141068 ± 14978 ± 101011 ± 10
Mask/Ink-Based Editing1049 ± 151042 ± 16965 ± 12927 ± 12
Product Consistency1024 ± 18981 ± 18955 ± 22965 ± 14
Stylization1062 ± 201036 ± 17991 ± 12990 ± 12
Multi-Reference Editing1066 ± 221041 ± 20988 ± 13989 ± 12

Nguồn: Google DeepMind Nano Banana 2.1 Model Card.

Xếp hạng cộng đồng độc lập (ví dụ bảng xếp hạng Arena quanh thời điểm ra mắt) đặt Nano Banana 2.1 ở mức cạnh tranh (khoảng 5–6 cho Text-to-Image và Image Edit), thấp hơn các biến thể OpenAI GPT Image hàng đầu nhưng vượt trước các model Google trước đó và tiệm cận các đối thủ như MAI-Image-2.6 của Microsoft.

Về hành vi, Nano Banana 2.1 mạnh ở tuân thủ prompt, ánh sáng tự nhiên và tinh chỉnh lặp, dù vẫn có hạn chế đã biết (văn bản nhỏ hoặc dày có thể mờ ở độ phân giải thấp hơn, đôi khi nhầm trái/phải, chưa hoàn hảo về nhất quán nhân vật trong các trường hợp biên, và giới hạn về suy luận 3D/tri thức thế giới nâng cao). Kiến thức cắt ngắn phù hợp với nền tảng Gemini 3.6 Flash (khoảng tháng 3/2026 trong một số lĩnh vực).

Ghi chú hành vi: Model hỗ trợ grounding bằng Google Search và Image Search cho độ đúng sự kiện cao hơn (đặc biệt hữu ích cho infographic và chủ thể đời thực). Đầu ra bao gồm watermark SynthID. Độ trễ vẫn ở lớp Flash (thường tính bằng giây thay vì hàng chục giây như Pro), dù mức Thinking cao hơn sẽ tăng thời gian sinh. Kết xuất văn bản trong ảnh được cải thiện rõ rệt, hỗ trợ nhiều ngôn ngữ, font và phong cách cho poster, bao bì và sơ đồ.

Nano Banana 2.1 vs Nano Banana Pro vs Nano Banana 2 Lite

ModelPhù hợp nhất choVị trí độ phân giải / tốc độHồ sơ tham chiếu và suy luậnKhuyến nghị
Nano Banana 2.1Tạo sản phẩm, chỉnh sửa, quy trình nhiều tham chiếu1K/2K/4K với tốc độ cấp FlashTới 14 tham chiếu; bốn nhân vật và mười đối tượng; grounding Web và Image Search; Thinking có thể cấu hìnhMặc định tốt nhất cho hầu hết dự án image API mới
Nano Banana ProĐộ đúng sự kiện tối đa, bản địa hóa và kiểm soát sáng tạoChất lượng cao cấp và kiểm soát sâu; thường chậm hơn/tiêu tốn tài nguyên hơnTới năm nhân vật theo so sánh của Google; suy luận và bản địa hóa nâng caoNâng cấp cho asset chủ lực khó và công việc thị giác rủi ro cao
Nano Banana 2Tích hợp hiện có và quy trình hiệu quả trước đâyModel ảnh Flash trước đây với hỗ trợ 4KTri thức thế giới mạnh và nhất quán nhiều tham chiếuDi chuyển dự án mới sang 2.1 sau khi test hồi quy
Nano Banana 2 LiteTạo số lượng lớn, ưu tiên tốc độ hoặc chi phíTầng nhanh nhất và rẻ nhất; tập trung 1KKhông tối ưu cho nhiều tham chiếu hoặc tính liên tục nhiều lượtDùng cho thumbnail, bản nháp và lô lớn

Bảng này tóm tắt hướng dẫn tạo ảnh Nano Banana và thông báo Nano Banana 2. Đây không thay thế tài liệu giá/quota hiện hành.

Prompting tips for better Nano Banana 2.1 results

Viết brief sản xuất, không phải chồng từ khóa

Viết prompt như một brief sáng tạo ngắn. Nêu chủ thể, mục tiêu, khán giả, bố cục, ánh sáng, văn bản và định dạng đầu ra. Với ảnh sản phẩm, đưa vào các chi tiết không thể thay đổi của sản phẩm và nói rõ những gì có thể đổi.

Tách danh tính khỏi phong cách

Khi dùng tham chiếu, giải thích ảnh nào kiểm soát danh tính và ảnh nào kiểm soát phong cách. “Giữ nhãn và nắp chai y hệt tham chiếu 1; dùng ánh sáng editorial ấm từ tham chiếu 2; đặt sản phẩm trên mặt bàn đá vôi” đáng tin cậy hơn “kết hợp các ảnh này”.

Yêu cầu một chỉnh sửa mỗi lần

Sau kết quả đầu tiên, yêu cầu một hoặc hai thay đổi có kiểm soát: “Giữ nguyên chủ thể, góc máy và kiểu chữ. Chỉ thay phông nền bằng bức tường studio xanh nhạt.” Điều này bảo toàn tính nhất quán và làm cho việc khắc phục lỗi dễ hơn.

Xác thực văn bản và sự kiện

Phóng to chữ được tạo. Kiểm tra tên, ngày, đơn vị, giá, trích dẫn và nội dung dịch. Nếu ảnh được grounding từ tìm kiếm, lưu lại nguồn tìm kiếm cùng với asset để biên tập xem xét.

Limitations and responsible use

Nano Banana 2.1 vẫn có thể viết sai chữ nhỏ, thay đổi một đối tượng tham chiếu, tạo chủ thể không hoàn hảo về giải phẫu hoặc diễn giải sai hướng dẫn mơ hồ. Grounding Search cải thiện khả năng tiếp cận thông tin hiện tại nhưng không biến model ảnh thành hệ thống kiểm chứng sự kiện.

How to Access Nano Banana 2.1

Consumer / Interactive Access

  • Ứng dụng Gemini (web và di động)
  • AI Mode trong Google Search
  • Google AI Studio (thử prompt tương tác)
  • Google Flow, Stitch và công cụ Ads

Developer / API Access

Sử dụng Gemini API chính thức với model ID gemini-nano-banana-2.1. Tài liệu đầy đủ có trên Google AI for Developers và trang tạo ảnh. Input hỗ trợ văn bản, ảnh, video và PDF trong một số cấu hình; output là ảnh + văn bản. Mức Thinking và grounding Search là các tham số có thể cấu hình.

Chọn Nano Banana 2.1 qua CometAPI chủ yếu là một quyết định tích hợp và hạ tầng, không phải thay đổi model bên dưới. Bạn vẫn truy cập năng lực của Google Nano Banana 2.1, nhưng CometAPI cung cấp một lớp truy cập hợp nhất quanh model.

How to Use Nano Banana 2.1 on CometAPI

Bạn có thể truy cập Gemini Nano Banana 2.1 (gemini-nano-banana-2.1) APIqua CometAPI bằng một khóa API duy nhất, không cần thiết lập tài khoản Google API riêng cho model. Hiện CometAPI liệt kê Nano Banana 2.1 là model tạo ảnh của Google hỗ trợ quy trình text-to-image và chỉnh sửa ảnh.

Quan trọng là, CometAPI cũng hỗ trợ định dạng request/response Gemini API gốc cho các model ảnh Gemini. Điều này nghĩa là các nhà phát triển quen với cấu trúc generateContent có thể giữ mẫu contents, parts và generationConfig trong khi định tuyến request qua CometAPI. API gốc của Google dùng gemini-nano-banana-2.1 làm định danh model và trả dữ liệu ảnh sinh ra như một phần của phản hồi Gemini.

Try Nano Banana 2.1 Without Building an Integration First

Nếu muốn đánh giá model trước khi viết code ứng dụng, CometAPI cũng cung cấp quy trình Playground. Bạn có thể thử prompt và so sánh kết quả tạo ảnh trước khi cam kết triển khai API. CometAPI định vị danh mục và Playground của họ như một cách để đánh giá model trước khi tích hợp vào quy trình sản xuất.

Đối với nhà phát triển đã dùng Gemini API của Google, việc chuyển đổi đặc biệt đơn giản: giữ cấu trúc request kiểu Gemini và đổi xác thực/điểm cuối cơ sở để định tuyến request qua CometAPI.

The biggest reason I'd choose Nano Banana 2.1

Không chỉ đơn thuần là “tạo ảnh đẹp”.

Điểm thú vị là:

tạo + hiểu + chỉnh sửa + tham chiếu + lặp hội thoại.

Ví dụ:

“Dùng ảnh đầu tiên làm tham chiếu sản phẩm. Đặt sản phẩm vào cảnh thứ hai. Giữ chính xác logo và tỷ lệ. Đổi ánh sáng sang hoàng hôn. Xóa người ở hậu cảnh. Khiến nó trông như một bức ảnh quảng cáo cao cấp.”

Đó gần hơn nhiều với một trợ lý sản xuất hình ảnh so với một trình tạo ảnh từ văn bản truyền thống.

Và tài liệu hiện tại của Google định vị Nano Banana 2.1 là một “cỗ máy” hiệu quả cao cho tạo ảnh và chỉnh sửa hội thoại, với cải thiện về chất lượng thị giác, tuân thủ prompt, tính nhất quán và kết xuất văn bản.

Conclusion

Nano Banana 2.1 đại diện cho một bước nhảy có ý nghĩa trên biên hiệu quả của tạo ảnh AI: chất lượng cao hơn, tính nhất quán và điều khiển chỉnh sửa mạnh hơn, văn bản tốt hơn, và chi phí bằng một nửa model cấp Flash trước đó. Dù bạn là người sáng tạo lặp trong ứng dụng Gemini hay nhà phát triển xây dựng pipeline ảnh sản xuất, đây hiện là một trong những lựa chọn giá–hiệu suất mạnh nhất. Với các đội đã quản lý nhiều nhà cung cấp AI, truy cập model này (và phần còn lại của họ Nano Banana / Gemini) qua một nền tảng hợp nhất như CometAPI tiếp tục giảm ma sát và chi phí.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Oct 8, 2026
Cập nhật lần cuối Oct 8, 2026
0 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Đọc thêm