Tóm tắt nhanh: Gemini 3.6 Flash là mô hình Flash phiên bản sản xuất tháng 7/2026 của Google dành cho lập trình, công việc tri thức, phân tích đa phương thức và quy trình tác tử. Mô hình giữ nguyên cửa sổ đầu vào 1.048.576 token và giới hạn đầu ra 65.536 token của Gemini 3.5 Flash, nhưng Google báo cáo kết quả tốt hơn về lập trình, sử dụng máy tính, công việc tri thức và hiệu quả token, đồng thời có giá token đầu ra thấp hơn.
Gemini 3.6 Flash nên được xem là mô hình Flash lựa chọn ưu tiên cho lập trình phức tạp, suy luận đa phương thức và tác tử nhiều bước. Chỉ giữ Gemini 3.5 Flash khi bạn cần tính liên tục đầu ra hoặc chưa hoàn tất kiểm thử di trú. Dùng Gemini 3.5 Flash-Lite cho khối lượng lớn các tác vụ trích xuất, định tuyến, phân loại và các tác vụ dự đoán được, nơi chi phí thấp nhất quan trọng hơn độ sâu suy luận tối đa.
Điểm chính
- Gemini 3.6 Flash khả dụng rộng rãi dưới tên
gemini-3.6-flash; tài liệu Gemini API của Google ghi cập nhật mới nhất là tháng 7/2026. - Gemini 3.6 Flash hướng tới lập trình, công việc tri thức, phân tích đa phương thức, tác vụ sử dụng máy tính và quy trình tác tử nhiều bước.
- Google báo cáo kết quả tốt hơn Gemini 3.5 Flash trên DeepSWE, MLE Bench, OSWorld-Verified và GDPval-AA v2. Google báo cáo giảm 17% token đầu ra so với Gemini 3.5 Flash trên Artificial Analysis Index và giảm tới 65% token đầu ra trong đánh giá lập trình liên quan DeepSWE.
- Bảng giá Gemini API Standard chính thức là $1,50/1M token đầu vào và $7,50/1M token đầu ra, so với $1,50/1M và $9,00/1M của Gemini 3.5 Flash. Giá Batch và Flex cho Gemini 3.6 Flash là $0,75/1M đầu vào và $3,75/1M đầu ra; giá Priority là $2,70/1M đầu vào và $13,50/1M đầu ra. Trang mô hình Gemini 3.6 Flash của CometAPI ghi $1,20/1M đầu vào và $6,00/1M đầu ra, thấp hơn 20% so với giá Standard chính thức của Google tại thời điểm kiểm tra.
- Gemini 3.6 Flash có thể thay thế Gemini 3.5 Flash cho nhiều khối lượng công việc sản xuất mới, nhưng di trú nên bao gồm kiểm thử prompt, gọi công cụ, tham số, độ trễ, chi phí và hồi quy.
- Gemini 3.5 Pro không nằm trong đợt phát hành này; Google cho biết vẫn đang thử nghiệm với đối tác và sẽ phát hành rộng rãi khi sẵn sàng.
Gemini 3.6 Flash là gì?
Gemini 3.6 Flash là mô hình tầng Flash mặc định mới để đánh giá nếu bạn xây dựng tác tử AI, công cụ lập trình, quy trình tài liệu, trợ lý dựa trên tìm kiếm hoặc tự động hóa đa phương thức. Google phát hành vào ngày 21/7/2026 cùng với Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber, định vị xoay quanh kinh tế học tác tử sản xuất: hiệu quả token cao hơn, độ trễ thấp hơn, ít vòng gọi công cụ hơn và chi phí thấp hơn cho mỗi tác vụ thành công.
Điểm thay đổi quan trọng nhất không phải cái tên mô hình. Bản nâng cấp nằm ở chất lượng và kinh tế: Google cho biết Gemini 3.6 Flash dùng ít hơn 17% token đầu ra so với Gemini 3.5 Flash trên Artificial Analysis Index và giảm tới 65% token đầu ra trong công việc lập trình kiểu DeepSWE, đồng thời hạ giá đầu ra Standard từ $9,00/1M xuống $7,50/1M.
Năng lực cốt lõi:
- Đầu vào đa phương thức: Văn bản, hình ảnh, video, âm thanh, PDF.
- Cửa sổ ngữ cảnh: 1 triệu token đầu vào, 64k token đầu ra.
- Sử dụng công cụ: Gọi hàm gốc, tìm kiếm như một công cụ và sử dụng máy tính cho tự động hóa UI theo hướng tác tử.
- Phù hợp nhất cho: Tác vụ hàng ngày, lập trình tác tử, suy luận nâng cao, hiểu văn bản dài và sinh mã sẵn sàng sản xuất.
Khác với các mô hình “Pro” lớn tập trung vào trí tuệ tối đa, biến thể Flash nhấn mạnh tốc độ, quy mô và hiệu quả chi phí trong khi vẫn cung cấp hiệu năng hàng đầu ở các lĩnh vực mục tiêu. Gemini 3.6 Flash tiến thêm bằng cách giảm độ dài lời đáp và cải thiện độ chính xác.
Giới hạn kiến thức: Cập nhật đến tháng 3/2026 (từ tháng 1/2025 ở các phiên bản trước), mang lại kiến thức thực tế mới hơn.
Thẻ mô hình bổ sung chi tiết kiến trúc quan trọng: Gemini 3.6 Flash dựa trên Gemini 3.5 Flash. Điều đó khiến bản phát hành này giống một nâng cấp có mục tiêu, tập trung sản xuất hơn là một họ hoàn toàn mới. Google có vẻ tập trung vào các vấn đề nhà phát triển gặp trong quy trình tác tử thực tế: quá nhiều token đầu ra, quá nhiều lần gọi công cụ không cần thiết, chỉnh sửa ngoài ý muốn trong tác vụ chẩn đoán, vòng lặp sửa mã, diễn giải biểu đồ, xử lý tài liệu và suy luận đa phương thức kiểu UI.
Vì sao Google phát hành Gemini 3.6 Flash lúc này?
Tin mới nhất đằng sau đợt phát hành
Thông báo ngày 21/7 của Google làm ba việc cùng lúc:
- Ra mắt Gemini 3.6 Flash như một “ngựa thồ” mạnh mẽ.
- Ra mắt Gemini 3.5 Flash-Lite như mô hình lớp 3.5 nhanh và rẻ nhất cho khối lượng công việc thông lượng cao.
- Giới thiệu Gemini 3.5 Flash Cyber trong CodeMender cho các trường hợp phòng thủ an ninh mạng truy cập hạn chế.
Cùng thông báo đó cũng làm rõ trạng thái Gemini 3.5 Pro: vẫn đang thử nghiệm với đối tác và Google dự định phát hành rộng rãi khi sẵn sàng. Google cũng nói đã bắt đầu tiền huấn luyện Gemini 4.
Bối cảnh này quan trọng. Gemini 3.6 Flash không phải sự thay thế cho Pro. Đây là câu trả lời của Google cho một vấn đề sản xuất khác: nhiều hệ thống AI đang trở nên quá đắt, quá dài dòng và quá thiếu tin cậy khi mô hình liên tục gọi công cụ, suy luận trên ngữ cảnh dài và thử lại hành động. Một mô hình Flash nhanh và hiệu quả hơn có thể tạo tác động tức thì hơn so với một mẫu đầu bảng bị trì hoãn nếu nó giảm số token, lượt đối thoại và lần thử lại cần thiết để hoàn tất các tác vụ phổ biến.
Đợt phát hành xoay quanh chi phí trên mỗi tác vụ thành công
Các nhóm AI thường so sánh mô hình theo giá token. Điều đó hữu ích nhưng chưa đủ. Tác vụ theo hướng tác tử đưa vào các biến chi phí bổ sung:
- Mô hình thực hiện bao nhiêu bước suy luận?
- Gọi bao nhiêu công cụ?
- Bao lâu lại thực hiện các chỉnh sửa không cần thiết?
- Bao nhiêu lần thất bại và cần thử lại?
- Tiêu tốn bao nhiêu token đầu ra để giải thích thay vì giải quyết?
- Bao lâu phải leo thang lưu lượng lên một mô hình đắt hơn?
Gemini 3.6 Flash đáng chú ý vì Google tiếp thị nó xoay quanh các biến vận hành này, không chỉ là điểm benchmark tiêu đề. Nếu một mô hình giảm 17% token đầu ra, tránh vòng chỉnh sửa không cần thiết và tạo mã đúng hơn ngay lần đầu, khoản tiết kiệm thực tế có thể lớn hơn những gì bảng giá gợi ý.
Hiệu năng benchmark và so sánh
Đánh giá từ Google và bên thứ ba nhấn mạnh cải tiến cân bằng của 3.6 Flash. Nó không dẫn đầu mọi bảng xếp hạng, nhưng xuất sắc về hiệu năng điều chỉnh theo hiệu quả cho sử dụng thực tế.
Benchmark chọn lọc (Gemini 3.6 Flash vs. 3.5 Flash):
- DeepSWE (Datacurve – kỹ thuật phần mềm nhiều bước): 49% so với 37% (tăng độ chính xác đáng kể, ít vòng/lần chỉnh); mức dùng token giảm tới 65% ở một số trường hợp (ví dụ 276k xuống 97k token).
- MLE-Bench (Nghiên cứu ML): 63,9% so với 49,7%
- OSWorld-Verified (Sử dụng máy tính): 83,0% so với 78,4% (khả năng sử dụng máy tính tích hợp mặc định)
- GDPval-AA v2 (Công việc tri thức): 1421 so với 1349
- Artificial Analysis Intelligence Index: Khoảng 50 (vững, dù sau một số mẫu dẫn đầu như biến thể Claude ở ~60); nổi bật về hiệu quả token.
- Khác: Cải thiện ở Terminal-Bench, ngữ cảnh dài (ví dụ GDM-MRCR v2), SWE-Bench Pro, và tác vụ đa phương thức như phân tích tài liệu và biểu đồ.
Bảng so sánh: Gemini 3.6 Flash vs. đối thủ chính (xấp xỉ, dữ liệu tháng 7/2026)
| Tính năng/Mô hình | Gemini 3.6 Flash | Gemini 3.5 Flash | GPT-5.6 Luna (ước) | Grok 4.5 | Claude Sonnet 5 |
|---|---|---|---|---|---|
| Hiệu quả token đầu ra | Xuất sắc (tốt hơn 17%) | Tốt | Cao | Mạnh | Tốt |
| Lập trình (DeepSWE) | 49% | 37% | 67% | 54% | 54% |
| Sử dụng máy tính (OSWorld) | 83% | 78,4% | 72,6% | - | 81,2% |
| Công việc tri thức (Elo) | 1421 | 1349 | 1584 | 1535 | 1607 |
| Giá đầu ra ($/1M) | $7,50 | $9,00 | $6,00 | $6,00 | $10-15 |
| Phù hợp nhất cho | Tác tử hiệu quả | Tác tử chung | Trí tuệ cao | Lý luận | Sáng tạo |
Ghi chú bổ sung:
- SWE-Bench Pro: 58,7% (so với 55,1% của 3.5 Flash).
- Terminal-Bench 2.1: 78,0% (so với 76,2%).
- Mô hình xuất sắc trong bối cảnh tác tử và đa phương thức đồng thời duy trì tốc độ đặc trưng của dòng Flash.
Các thử nghiệm độc lập (ví dụ Artificial Analysis, thảo luận trên Reddit) ghi nhận tốc độ và hiệu quả mạnh mẽ, dù trong một số cài đặt có thể tiêu thụ nhiều token hơn so với một số đối thủ tối ưu hóa cực đoan. Phản hồi thực tế khen ngợi khả năng phân tích tài liệu, soạn thảo báo cáo và tác vụ đa phương thức (ví dụ từ khách hàng như Hebbia và Harvey).

Mới gì so với Gemini 3.5 Flash?
1. Hiệu quả token tốt hơn
Gemini 3.6 Flash được thiết kế để dùng ít token đầu ra hơn Gemini 3.5 Flash. Google dẫn chứng giảm 17% token đầu ra trên Artificial Analysis Index và giảm tới 65% trên một số khối lượng công việc lập trình DeepSWE.
Điều này quan trọng vì token đầu ra thường đắt hơn token đầu vào. Trong bảng giá Gemini API Standard chính thức, đầu vào của Gemini 3.6 Flash vẫn $1,50/1M, nhưng đầu ra giảm xuống $7,50/1M. Đầu ra của Gemini 3.5 Flash là $9,00/1M. Khi giá đầu ra thấp hơn kết hợp với ít token đầu ra hơn, chi phí mỗi tác vụ tác tử hoàn tất có thể giảm đáng kể.
2. Lập trình mạnh hơn và ít chỉnh sửa không mong muốn
Tài liệu nền tảng tác tử Gemini Enterprise của Google Cloud cho biết Gemini 3.6 Flash cải thiện sinh mã với tỷ lệ lỗi biên dịch và sửa đổi thấp hơn trên môi trường xây dựng, tạo mẫu và tác tử IDE. Mô hình cũng giảm “thiên hướng hành động”, nghĩa là xử lý tốt hơn các tác vụ chẩn đoán chỉ đọc mà không tự ý chỉnh sửa.
- Cải thiện quy trình: Ít bước suy luận hơn, ít lượt hội thoại hơn, ít gọi công cụ hơn và giảm vòng lặp thực thi. Mô hình ưu tiên kịch bản chẩn đoán ban đầu trước khi chỉnh sửa, nâng cao độ chính xác.
- Sinh mã: Mã chất lượng cao, sẵn sàng sản xuất với ít chỉnh sửa không mong muốn và vòng gỡ lỗi hơn.
- Sử dụng máy tính: Cải thiện từ 78,4% lên 83,0% trên OSWorld-Verified; hỗ trợ công cụ phía client bản địa.
3. Cải thiện chất lượng và tốc độ
- Cải tiến theo hướng tác tử: Ít bước suy luận/gọi công cụ; sử dụng máy tính tích hợp; hỗ trợ mạnh hơn cho điều phối đa tác tử và quy trình lặp.
- Tốc độ & độ tin cậy: Độ trễ được tối ưu cho sản xuất thông lượng cao; tích hợp với công cụ như Google Slides để tạo bản trình bày có thể chỉnh sửa từ tài liệu/PDF.
- An toàn: Tăng cường biện pháp bảo vệ chống lại C
4. Giá đầu ra thấp hơn
Google hạ giá đầu ra Standard chính thức từ $9,00/1M trên Gemini 3.5 Flash xuống $7,50/1M trên Gemini 3.6 Flash. Giá đầu vào giữ nguyên $1,50/1M.
Đây là cải thiện giá trực tiếp ngay cả trước khi tính đến lợi ích hiệu quả token.
5. Di trú và thay đổi tham số
Một số hành vi có thể khác so với các mô hình Gemini trước đó. Trang Nền tảng Tác tử của Google Cloud liệt kê các thay đổi có thể gây vỡ: không hỗ trợ giá trị tùy chỉnh cho các tham số như temperature, top-K và top-P trên bề mặt đó; giá trị tùy chỉnh của frequency penalty và presence penalty có thể gây lỗi; và không hỗ trợ các yêu cầu kết thúc bằng vai trò model trong một số API.
Bài học di trú đơn giản: đừng chỉ thay chuỗi mô hình. Hãy rà soát chính xác bề mặt API bạn dùng, loại bỏ tham số sinh không được hỗ trợ, kiểm thử lại xử lý trạng thái đa lượt và kiểm tra hành vi gọi công cụ.
Gemini 3.6 Flash có thể thay thế Gemini 3.5 Flash không?
Có, cho phần lớn kịch bản sản xuất. Google thực chất đã định vị 3.6 Flash là “ngựa thồ” mặc định mới, với 3.5 Flash có khả năng bị coi là kế thừa/di sản trong nhiều giao diện.
Lý do để chuyển:
- Tiết kiệm chi phí: Chi phí mỗi tác vụ thấp hơn nhờ giá + hiệu quả.
- Đầu ra tốt hơn: Cải thiện chất lượng trên lập trình, tác tử và công việc tri thức.
- Sẵn sàng cho tương lai: Tính năng mới như sử dụng máy tính nâng cao và tích hợp.
Khi nên giữ 3.5 hoặc cân nhắc thay thế khác:
- Tác vụ thông lượng rất cao nhạy cảm cực độ với độ trễ (hãy cân nhắc mô hình đồng hành 3.5 Flash-Lite với chi phí/tốc độ còn thấp hơn).
- Cần trí tuệ thô tối đa (chờ 3.5 Pro hoặc dùng mô hình lớn hơn).
- Tương thích kế thừa cụ thể.
Với hầu hết nhà phát triển xây dựng tác tử, ứng dụng hoặc tự động hóa trên Cometapi, di trú sang 3.6 Flash qua proxy là đơn giản và được khuyến nghị để có ROI tức thì.
Cách truy cập Gemini 3.6 Flash
- Google AI Studio / Gemini API: Lấy khóa API miễn phí tại aistudio.google.com. Dùng mô hình
gemini-3.6-flash. Bắt đầu nhanh với SDK chính thức (Python, JS, v.v.). - Vertex AI / Google Cloud: Cấp doanh nghiệp với hạn mức cao hơn, grounding và bảo mật.
- Ứng dụng Gemini & Tích hợp: Có trong Android Studio, GitHub Copilot (có tùy chọn), Google Slides, v.v.
- Qua Cometapi (Khuyến nghị cho sự tiện lợi): Cometapi cung cấp proxy hợp nhất tương thích OpenAI cho Gemini 3.6 Flash và các mô hình khác. Lợi ích gồm hạn mức tốc độ cao hơn, xác thực đơn giản, chuyển đổi đa nhà cung cấp và giảm chi phí quản lý. Lý tưởng để mở rộng ứng dụng mà không chạm giới hạn từng nhà cung cấp. Truy cập Cometapi.com để xem hướng dẫn thiết lập và bảng giá bổ sung cho tầng của Google.
Ví dụ gọi Python (chính thức hoặc qua proxy):
import google.generativeai as genai
genai.configure(api_key="YOUR_KEY")
model = genai.GenerativeModel('gemini-3.6-flash')
response = model.generate_content("Your prompt here")
Hãy thử trong AI Studio trước, rồi tích hợp. Bộ nhớ đệm và API dạng batch sẽ tối ưu chi phí hơn nữa.
Kết luận & Khuyến nghị
Gemini 3.6 Flash là một nâng cấp thực dụng, giá trị cao tinh chỉnh dòng Flash của Google cho nhu cầu thực tế. Sự kết hợp giữa trí tuệ, hiệu quả và khả năng tiếp cận khiến nó trở thành lựa chọn hàng đầu cho phát triển AI năm 2026.
CometAPI Khuyến nghị: Tích hợp qua Cometapi để có trải nghiệm mượt mà nhất—API hợp nhất, hạn mức tốt hơn và A/B testing dễ dàng giữa các mô hình. Dù bạn đang xây tác tử, xử lý tài liệu hay vận hành ứng dụng, hãy bắt đầu thử nghiệm với 3.6 Flash ngay hôm nay để cắt giảm chi phí và tăng hiệu năng.
Câu hỏi thường gặp
Gemini 3.6 Flash là gì?
Gemini 3.6 Flash là mô hình Flash ổn định tháng 7/2026 của Google dành cho lập trình, công việc tri thức, suy luận đa phương thức và quy trình tác tử. Nó dựa trên Gemini 3.5 Flash nhưng cải thiện hiệu quả token, hành vi lập trình, hiệu năng sử dụng máy tính và điểm công việc tri thức.
Gemini 3.6 Flash có giá bao nhiêu?
Giá trả phí tầng Standard chính thức của Gemini API là $1,50 cho mỗi triệu token đầu vào và $7,50 cho mỗi triệu token đầu ra. Batch và Flex là $0,75/1M đầu vào và $3,75/1M đầu ra. Priority là $2,70/1M đầu vào và $13,50/1M đầu ra. Trang mô hình của CometAPI ghi $1,20/1M đầu vào và $6,00/1M đầu ra tại thời điểm kiểm tra.
Gemini 3.6 Flash có rẻ hơn Gemini 3.5 Flash không?
Có, đối với token đầu ra. Cả hai có giá $1,50/1M token đầu vào trên tầng Standard của Google, nhưng đầu ra của Gemini 3.6 Flash là $7,50/1M so với $9,00/1M của Gemini 3.5 Flash. Google cũng báo cáo ít token đầu ra hơn trong nhiều tác vụ, có thể tiếp tục giảm tổng chi phí.
Gemini 3.6 Flash có thể thay Gemini 3.5 Flash không?
Với nhiều khối lượng công việc thì có. Đây là ứng viên mặc định tốt hơn cho tác tử lập trình, phân tích đa phương thức và quy trình công cụ phức tạp. Tuy nhiên, người dùng sản xuất nên benchmark trước khi thay 3.5 Flash, đặc biệt nếu phụ thuộc vào phong cách đầu ra ổn định, định dạng JSON chính xác hoặc tham số sinh kế thừa.
Cải thiện benchmark chính là gì?
Google báo cáo Gemini 3.6 Flash vượt Gemini 3.5 Flash trên DeepSWE (49% vs 37%), MLE Bench (63,9% vs 49,7%), OSWorld-Verified (83,0% vs 78,4%) và GDPval-AA v2 (1421 vs 1349). Google cũng báo cáo giảm 17% token đầu ra trên Artificial Analysis Index.
Tôi truy cập Gemini 3.6 Flash qua CometAPI như thế nào?
Tạo khóa CometAPI, dùng https://api.cometapi.com/v1 cho các lời gọi tương thích OpenAI và đặt model là gemini-3.6-flash nếu nó khả dụng trong bảng điều khiển của bạn. Với các tính năng gốc của Gemini, hãy dùng tuyến đường gốc nhà cung cấp được tài liệu hóa trên trang mô hình Gemini 3.6 Flash của CometAPI.
