Tóm tắt Bản phát hành Gemini mới nhất của Google không phải là Gemini 3.5 Pro được mong đợi từ lâu. Thay vào đó, Google ra mắt ba mô hình tập trung vào hiệu suất: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber. Thông điệp thực tế rất rõ: Google đang ưu tiên kinh tế vận hành của agent, độ trễ, hiệu quả token và tự động hóa bảo mật chuyên biệt trong khi mẫu Pro đầu bảng vẫn đang được thử nghiệm.
Đối với nhà phát triển, điều tốt nhất không phải là chờ đợi thụ động Gemini 3.5 Pro. Hãy dùng Gemini 3.6 Flash làm ứng viên nâng cấp mặc định cho agent phức tạp và quy trình coding, dùng Gemini 3.5 Flash-Lite cho các luồng trích xuất và định tuyến khối lượng lớn, và duy trì chiến lược dự phòng đa mô hình cho các tác vụ suy luận tuyến đầu. CometAPI cung cấp quyền truy cập thống nhất tới 500+ mô hình qua một khóa API tương thích OpenAI, vì vậy có thể thử nghiệm Gemini song song với GPT, Claude, DeepSeek, Kimi, Qwen và các mô hình khác mà không cần xây lại tích hợp của bạn.
Điểm chính rút ra
- Google đã công bố Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber vào ngày 21 tháng 7 năm 2026. Gemini 3.5 Pro không được phát hành trong đợt này. Google nói rằng họ đang thử nghiệm với các đối tác và sẽ phổ biến rộng rãi khi sẵn sàng.
- Gemini 3.6 Flash khả dụng chung trong Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, ứng dụng Gemini và Google Antigravity. Gemini 3.5 Flash-Lite khả dụng chung trong Gemini API và hướng tới các luồng công việc thông lượng cao, chi phí thấp.
- Gemini 3.5 Flash Cyber có quyền truy cập hạn chế, được thiết kế để phát hiện lỗ hổng, xác thực và tạo bản vá trong CodeMender.
- Google báo cáo Gemini 3.6 Flash dùng ít hơn 17% token đầu ra so với 3.5 Flash trên Artificial Analysis và ít hơn tới 65% token đầu ra trong các bài kiểm thử kiểu DeepSWE.
- Artificial Analysis độc lập báo cáo Gemini 3.6 Flash có điểm Intelligence Index là 50, tốc độ 251.3 token đầu ra/giây và giảm chi phí trung bình mỗi tác vụ từ $0.59 xuống $0.50 so với Gemini 3.5 Flash.
- DeepSWE liệt kê Gemini 3.6 Flash đạt 49% pass@1 với chi phí trung bình $3.53 mỗi tác vụ, so với Gemini 3.5 Flash đạt 37% pass@1 và $7.34 chi phí trung bình mỗi tác vụ.
- CometAPI hiện liệt kê Gemini 3.6 Flash ở mức $1.20/M input và $6.00/M output, và Gemini 3.5 Flash-Lite ở mức $0.24/M input và $2.016/M output. Hãy kiểm tra bảng điều khiển trực tiếp trước khi công bố giá trong giao diện sản phẩm.
Google đã phát hành gì?
Gemini 3.6 Flash
Gemini 3.6 Flash là mô hình quan trọng nhất trong đợt phát hành dành cho nhà phát triển nói chung. Đây là mô hình tầng Flash ổn định phục vụ sản xuất, được xây dựng cho agent, coding, luồng công việc đa phương thức, phân tích tài liệu, suy luận ngữ cảnh dài và công việc tri thức.
Google mô tả Gemini 3.6 Flash là một mô hình “workhorse” mang lại khả năng coding, công việc tri thức và đa phương thức tốt hơn Gemini 3.5 Flash đồng thời cải thiện hiệu quả token. Trang Gemini API chính thức nói rằng mô hình được thiết kế cho kỷ nguyên agent và đặc biệt hiệu quả cho lập trình nhanh và vòng lặp lặp lại.
ID công khai của mô hình là:
gemini-3.6-flash
Thông số cốt lõi xem trang mô hình Gemini 3.6 Flash.
Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite là mô hình hiệu suất trong đợt phát hành. Google định vị nó là mô hình lớp 3.5 nhanh nhất và tiết kiệm chi phí nhất, tối ưu cho thực thi thông lượng cao, phân tích tài liệu, dịch thuật, phân loại, định tuyến và trích xuất dữ liệu đơn giản.
ID công khai của mô hình là:
gemini-3.5-flash-lite
Thông số cốt lõi xem trang mô hình Gemini 3.5 Flash-Lite.
Điểm khác biệt chính không phải là cửa sổ ngữ cảnh. Flash-Lite giữ nguyên cấu hình 1M input và 64K output như 3.6 Flash. Khác biệt là mục đích định tuyến: Flash-Lite dành cho thông lượng và kiểm soát chi phí; 3.6 Flash dành cho các tác vụ khó hơn nơi chất lượng và độ tin cậy khi dùng công cụ quan trọng hơn.
Gemini 3.5 Flash Cyber
Gemini 3.5 Flash Cyber là mô hình an ninh mạng chuyên biệt được xây dựng trên Gemini 3.5 Flash và tinh chỉnh cho khám phá lỗ hổng, xác thực và tạo bản vá.
Đây không phải là mô hình API công khai thông thường. Google cho biết nó sẽ khả dụng cho chính phủ và các đối tác tin cậy thông qua CodeMender như một chương trình thí điểm truy cập hạn chế. Giới hạn đó quan trọng với nhà phát triển: đừng thiết kế lộ trình SaaS công khai quanh việc truy cập trực tiếp Flash Cyber trừ khi bạn là một phần của chương trình thí điểm hoặc chương trình an ninh phòng thủ đã được thẩm định.
Mô hình vẫn quan trọng vì nó cho thấy hướng đi của Google với Gemini: các mô hình chuyên gia hiệu quả được điều phối bởi hạ tầng agent. Thay vì khiến một mô hình tuyến đầu làm mọi thứ, Google đang xây dựng các hệ thống chuyên biệt nhỏ hơn có thể chạy quét lặp lại, tổng hợp báo cáo và vá mã với chi phí thấp hơn.
Có nên bỏ qua Gemini 3.5 Pro?
Câu trả lời thực tế
Với hầu hết các đội ngũ sản xuất, có: hãy bắt đầu đánh giá Gemini 3.6 Flash và Gemini 3.5 Flash-Lite ngay bây giờ thay vì chờ Gemini 3.5 Pro hoặc Gemini 4 Pro.
Điều đó không có nghĩa Gemini 3.5 Pro sẽ không quan trọng. Nó có nghĩa các mô hình khả dụng mới nhất đã bao phủ phần lớn các khối lượng công việc AI quy mô lớn: agent coding, agent truy xuất, luồng tài liệu, phân tích đa phương thức, trích xuất dữ liệu, định tuyến prompt, tự động hóa UI, rà soát ngữ cảnh dài và thực thi các tiểu tác vụ của agent.
Thông báo của chính Google nói Gemini 3.5 Pro vẫn đang thử nghiệm với đối tác và sẽ phát hành rộng rãi khi sẵn sàng. Không cần có trang mô hình API gemini-3.5-pro công khai, bảng giá cuối cùng hay model card để bắt đầu cải thiện kinh tế sản xuất ngay hôm nay.
Khi nào vẫn nên chờ Gemini 3.5 Pro
Bạn vẫn nên theo dõi Gemini 3.5 Pro hoặc Gemini 4 Pro nếu khối lượng công việc của bạn cần suy luận tuyến đầu hơn là thông lượng. Ví dụ gồm: tổng hợp nghiên cứu nâng cao, kỹ thuật đa tệp phức tạp, toán khó, suy luận khoa học, phân tích doanh nghiệp rủi ro cao, và các tác vụ nơi mô hình Flash vẫn thất bại dù đã thiết kế prompt và công cụ cẩn thận.
Chiến lược mô hình mạnh nhất không phải “chờ Pro” hay “thay tất cả bằng Flash”. Đó là định tuyến theo tầng:
- Dùng Gemini 3.5 Flash-Lite cho các tiểu tác vụ giá rẻ, khối lượng lớn.
- Dùng Gemini 3.6 Flash cho coding, phân tích đa phương thức, rà soát tài liệu, tổng hợp ngữ cảnh dài và các luồng công việc dạng agent.
- Định tuyến các yêu cầu khó nhất hoặc rủi ro cao tới một mô hình suy luận tuyến đầu thông qua CometAPI.
- Thêm Gemini 3.5 Pro vào bộ benchmark khi Google và CometAPI cung cấp.
Điểm chuẩn Gemini 3.6 Flash: Cải thiện gì?
Bảng điểm chuẩn của Google DeepMind
Trang Gemini 3.6 Flash của Google DeepMind liệt kê các so sánh sau với Gemini 3.5 Flash:
| Benchmark | Nội dung đo lường | Gemini 3.6 Flash | Gemini 3.5 Flash | Thay đổi |
|---|---|---|---|---|
| SWE-Bench Pro | Tác vụ lập trình theo hướng agent đa dạng | 58.7% | 55.1% | +3.6 điểm |
| DeepSWE v1.1 | Kỹ nghệ phần mềm tầm nhìn dài | 49% | 37% | +12 điểm |
| Terminal-Bench 2.1 | Lập trình terminal theo hướng agent | 78.0% | 76.2% | +1.8 điểm |
| MLE-Bench | Kỹ thuật machine learning | 63.9% | 49.7% | +14.2 điểm |
| GDPval-AA v2 | Elo công việc tri thức | 1421 | 1349 | +72 Elo |
| OSWorld-Verified | Sử dụng máy tính theo hướng agent | 83.0% | 78.4% | +4.6 điểm |
| CharXiv reasoning, no tools | Tổng hợp biểu đồ và thông tin | 85.2% | 84.2% | +1.0 điểm |
| CharXiv reasoning, with tools | Tổng hợp biểu đồ và thông tin | 89.4% | 84.9% | +4.5 điểm |
| GDM-MRCR v2, 128K average | Truy xuất ngữ cảnh dài | 91.8% | 77.3% | +14.5 điểm |
| GDM-MRCR v2, 1M pointwise | Truy xuất ngữ cảnh dài | 54.0% | 26.6% | +27.4 điểm |
Các mức tăng lớn nhất nằm đúng ở những lĩnh vực quan trọng với agent: lập trình tầm nhìn dài, kỹ thuật machine learning, truy xuất ngữ cảnh dài và sử dụng máy tính. Mức tăng nhỏ hơn ở Terminal-Bench và CharXiv cho thấy đây không phải là một đợt “mọi thứ tăng gấp đôi”. Đây là cải tiến có mục tiêu về độ tin cậy, hiệu quả token và thực thi nhiều bước khó.
Dữ liệu độc lập từ Artificial Analysis
Artificial Analysis cung cấp đối trọng hữu ích với các bảng điểm chuẩn của nhà cung cấp. Bài viết tháng 7 năm 2026 nói Gemini 3.6 Flash giữ cùng mức điểm Intelligence Index như Gemini 3.5 Flash: 50. Điều này quan trọng vì gợi ý rằng Gemini 3.6 Flash không nhất thiết là bước nhảy về “trí thông minh thô”.
Cải thiện lớn nằm ở hiệu suất:
| Chỉ số | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Artificial Analysis Intelligence Index | 50 | 50 |
| Thời gian trung bình mỗi tác vụ | 1.3 phút | 2.7 phút |
| Chi phí trung bình mỗi tác vụ | $0.50 | $0.59 |
| Tốc độ đầu ra | 251.3 token/s | Không có trong bảng |
| Thời gian tới token đầu tiên | 14.00s | Không có trong bảng |
Vì vậy tiêu đề tốt nhất không phải là “Gemini 3.6 Flash thông minh hơn mọi thứ”. Chính xác hơn là: Gemini 3.6 Flash khiến tác vụ của agent rẻ hơn và nhanh hơn mà không hy sinh mức “trí thông minh” của Gemini 3.5 Flash.
DeepSWE: Dữ liệu coding tầm nhìn dài
DeepSWE của Datacurve đặc biệt phù hợp vì tập trung vào các tác vụ kỹ nghệ phần mềm tầm nhìn dài nguyên bản. Bảng xếp hạng mô tả 113 tác vụ trên 91 kho và 5 ngôn ngữ.
Trên bảng xếp hạng ngày 21 tháng 7 năm 2026:
| Mô hình | Pass@1 | Chi phí trung bình | Token đầu ra | Bước agent |
|---|---|---|---|---|
| Gemini 3.6 Flash high | 49% ±5 | $3.53 | 97K | 108 |
| Gemini 3.5 Flash medium | 37% ±2 | $7.34 | 276K | 86 |
Con số thú vị nhất không chỉ là mức tăng 12 điểm pass@1. Đó là mức giảm token đầu ra: 97K so với 276K. Tương đương khoảng 65% ít token đầu ra hơn, khớp với tuyên bố khi ra mắt của Google. Với agent coding, ít token đầu ra hơn có thể đồng nghĩa ít trôi dạt, ít vòng sửa chữa dài dòng, ít ô nhiễm ngữ cảnh và chi phí thấp hơn cho mỗi vấn đề được hoàn tất.

Nguồn: Gemini
Điểm chuẩn Gemini 3.5 Flash-Lite: Vì sao quan trọng
Flash-Lite là mô hình thông lượng
Gemini 3.5 Flash-Lite được thiết kế cho thực thi khối lượng lớn. Đây là mô hình cần thử khi hệ thống của bạn cần xử lý hàng nghìn hoặc hàng triệu tác vụ nhỏ hoặc trung bình:
- trích xuất hóa đơn,
- phân tích danh mục sản phẩm,
- gán nhãn đoạn tài liệu,
- dịch thuật,
- phân loại,
- tổng hợp kết quả tìm kiếm,
- viết lại truy vấn,
- định tuyến lệnh gọi công cụ,
- tác vụ coding nhẹ,
- thực thi tiểu tác vụ của agent,
- trích xuất dữ liệu đa phương thức.
Google cho biết Flash-Lite đạt 350 token đầu ra mỗi giây theo Artificial Analysis và có giá $0.30/M token đầu vào và $2.50/M token đầu ra trên hạng Gemini API tiêu chuẩn.
Flash-Lite so với Gemini 3.1 Flash-Lite
Model card của Google DeepMind cho thấy mức tăng lớn so với Gemini 3.1 Flash-Lite:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite | Thay đổi |
|---|---|---|---|
| SWE-Bench Pro | 54.2% | 38.3% | +15.9 điểm |
| Terminal-Bench 2.1 | 54.0% | 31.0% | +23.0 điểm |
| MLE-Bench | 39.2% | 22.0% | +17.2 điểm |
| GDPval-AA v2 | 1140 | 642 | +498 Elo |
| OSWorld-Verified | 74.0% | 54.3% | +19.7 điểm |
| CharXiv, no tools | 74.5% | 73.2% | +1.3 điểm |
| CharXiv, with tools | 76.5% | 75.6% | +0.9 điểm |
| GDM-MRCR v2, 128K average | 72.2% | 60.1% | +12.1 điểm |
| GDM-MRCR v2, 1M pointwise | 21.3% | 12.3% | +9.0 điểm |
Artificial Analysis cũng báo cáo mức tăng Intelligence Index từ 25 của Gemini 3.1 Flash-Lite lên 36 cho Gemini 3.5 Flash-Lite, trong khi thời gian mỗi tác vụ giảm từ 1.0 phút xuống 0.6 phút. Sự đánh đổi là chi phí mỗi tác vụ tăng từ $0.04 lên $0.09 trong bộ benchmark đó vì mô hình mới có giá cao hơn 3.1 Flash-Lite.

Nguồn: Gemini
Sự đánh đổi đó có thể chấp nhận nếu chất lượng cải thiện giúp giảm số lần thử lại phía sau, giảm nhu cầu rà soát thủ công hoặc leo thang sang mô hình đắt hơn. Ít hấp dẫn hơn nếu khối lượng công việc của bạn đã được giải tốt hoàn hảo bởi Gemini 3.1 Flash-Lite. Hãy thử nghiệm trước khi chuyển toàn bộ lưu lượng.
Ý nghĩa của đợt phát hành Gemini
Khẳng định sự chuyển dịch từ “mô hình lớn nhất” sang “workhorse tốt nhất”
Thị trường AI thường tập trung vào các mô hình đầu bảng tuyến đầu. Gemini 3.6 Flash chỉ ra hướng khác: hệ thống AI sản xuất cần những mô hình đáng tin cậy, nhanh, tiết kiệm chi phí có thể hoàn thành nhiều tác vụ thực tế mà không lãng phí.
Đó là lý do đợt phát hành nhấn mạnh hiệu quả token, ít lệnh gọi công cụ, độ trễ thấp và ít vòng sửa đổi. Với nhà phát triển, đây không phải là chỉ số phụ. Chúng quyết định liệu agent AI có thể chạy ở quy mô mà không khiến đội tài chính bất ngờ hay không.
Trao cho Google một mô hình sản xuất mạnh hơn trong khi Gemini 3.5 Pro còn chờ
Gemini 3.5 Pro vẫn đang thử nghiệm với đối tác. Thay vì chờ Pro, Google phát hành một mô hình Flash mạnh hơn và một mô hình Flash-Lite rẻ hơn. Điều đó cho nhà phát triển hai lựa chọn tức thời:
- Gemini 3.6 Flash cho trí tuệ “workhorse” mạnh hơn.
- Gemini 3.5 Flash-Lite cho thực thi khối lượng lớn, nhanh và rẻ hơn.
Đây là chiến lược sản phẩm thực dụng. Nhiều doanh nghiệp không cần mô hình đắt nhất cho mọi yêu cầu. Họ cần danh mục mô hình và logic định tuyến.
Khiến định tuyến mô hình trở nên quan trọng hơn
Không nên dùng Gemini 3.6 Flash ở mọi nơi. Flash-Lite cũng vậy. Những hệ thống AI năm 2026 tốt nhất sẽ định tuyến động:
- Bắt đầu rẻ khi tác vụ đơn giản.
- Dùng Gemini 3.6 Flash khi suy luận, hiểu đa phương thức hoặc sử dụng công cụ quan trọng.
- Chỉ leo thang khi yêu cầu không đạt ngưỡng tự tin.
- Bộ nhớ đệm các ngữ cảnh dài lặp lại.
- Theo dõi chi phí trên mỗi tác vụ thành công, không chỉ chi phí mỗi token.
Đây là khuyến nghị mạnh nhất từ CometAPI trong bài viết: đừng chọn một mô hình làm toàn bộ chiến lược AI. Hãy xây router và để mỗi mô hình “xứng đáng” với lưu lượng của nó.
Câu hỏi thường gặp
Gemini 3.5 Pro hiện đã khả dụng chưa?
Chưa dưới dạng mô hình Gemini API khả dụng chung tính đến thời điểm viết, tháng 7 năm 2026. Google nói Gemini 3.5 Pro đang thử nghiệm với đối tác và sẽ phát hành rộng rãi khi sẵn sàng.
Gemini 3.6 Flash có tốt hơn Gemini 3.5 Flash không?
Với nhiều quy trình agent sản xuất và coding, có. Google báo cáo kết quả điểm chuẩn tốt hơn và dùng ít token đầu ra hơn. Artificial Analysis báo cáo chất lượng Intelligence Index tương tự nhưng thời gian mỗi tác vụ thấp hơn và chi phí mỗi tác vụ thấp hơn.
Gemini 3.5 Flash-Lite phù hợp nhất cho gì?
Gemini 3.5 Flash-Lite phù hợp nhất cho các khối lượng công việc khối lượng lớn, nhạy độ trễ và nhạy chi phí như trích xuất, phân loại, dịch thuật, tìm kiếm, định tuyến và thực thi tiểu agent.
Tôi có thể dùng Gemini 3.5 Flash Cyber qua Gemini API công khai không?
Google mô tả Gemini 3.5 Flash Cyber là mô hình truy cập hạn chế khả dụng cho chính phủ và đối tác tin cậy qua CodeMender. Nó không được định vị là mô hình API công khai tiêu chuẩn.
Gemini 3.6 Flash có giá bao nhiêu?
Bảng giá Gemini API tiêu chuẩn của Google niêm yết Gemini 3.6 Flash ở mức $1.50 cho 1M token đầu vào và $7.50 cho 1M token đầu ra. CometAPI hiện liệt kê $1.20/M input và $6.00/M output. Luôn xác minh giá trực tiếp trước khi đưa vào sản xuất.
Gemini 3.5 Flash-Lite có giá bao nhiêu?
Bảng giá Gemini API tiêu chuẩn của Google niêm yết Gemini 3.5 Flash-Lite ở mức $0.30 cho 1M token đầu vào và $2.50 cho 1M token đầu ra. CometAPI hiện liệt kê $0.24/M input và $2.016/M output. Luôn xác minh giá trực tiếp trước khi triển khai sản xuất.
Nhà phát triển có nên chờ Gemini 3.5 Pro không?
Đa số đội ngũ không nên chờ. Hãy bắt đầu thử nghiệm Gemini 3.6 Flash cho các luồng công việc phức tạp và Gemini 3.5 Flash-Lite cho các tiểu tác vụ khối lượng lớn ngay bây giờ. Thêm Gemini 3.5 Pro vào bộ benchmark khi đặc tả công khai, giá và khả dụng được xác nhận.
Kết luận
Đợt phát hành Gemini tháng 7 năm 2026 của Google nên được hiểu là một đợt phát hành tập trung vào hiệu suất, không phải bản Pro đầu bảng. Gemini 3.6 Flash không làm mất đi nhu cầu về Gemini 3.5 Pro trong tương lai, nhưng nó mang đến cho nhà phát triển một thứ hữu dụng ngay lập tức: mô hình khả dụng chung với hiệu năng mạnh về coding, đa phương thức, ngữ cảnh dài và tác vụ dạng agent, đồng thời chi phí token đầu ra thấp hơn Gemini 3.5 Flash.
Gemini 3.5 Flash-Lite lấp đầy nửa còn lại của ngăn xếp sản xuất. Đây là mô hình rẻ, nhanh cho các tiểu tác vụ không cần độ sâu suy luận tối đa. Gemini 3.5 Flash Cyber cho thấy tương lai của các agent phòng thủ chuyên biệt, nhưng quyền truy cập hạn chế khiến nó phù hợp hơn như một tín hiệu chiến lược thay vì công cụ chung cho nhà phát triển hiện nay.
