TL;DR: Gemini 3.7 Flash(model ID gemini-3.7-flash), phát hành ngày 13 tháng 8, 2026, là mô hình hạng Flash chủ lực mạnh nhất của Google cho lập trình, luồng công việc tác tử, phát triển web và các tác vụ đòi hỏi kiến thức chuyên sâu.
Mô hình cung cấp cửa sổ ngữ cảnh 1,048,576 token, tối đa 65,536 token đầu ra, mức độ tư duy có thể điều chỉnh (low/medium/high), hỗ trợ đa phương thức mạnh mẽ và mức giá mở đầu $0.75 cho mỗi 1M input token / $3.75 cho mỗi 1M output token đến ngày 31 tháng 12, 2026. Truy cập qua Interactions API của Google hoặc thuận tiện hơn cho ngăn xếp đa mô hình thông qua endpoint hợp nhất của CometAPI. Hướng dẫn này bao quát điểm mới, tham số API, cách dùng từng bước với CometAPI, ví dụ mã, điểm chuẩn và thực tiễn tốt nhất.
Các ý chính
- Gemini 3.7 Flash mang lại cải thiện lớn so với 3.6 Flash trong lập trình (FrontierCode 1.1 Main: 43.6% so với 34.4%; DeepSWE v1.1: 65.3% so với ~49%), phát triển web (WebDev Arena Elo 1588 so với 1538), xử lý tài liệu (GDP.pdf 34% so với 22%), và tự động hóa nghiệp vụ (AutomationBench 30.4% so với 17%).
- Sử dụng Interactions API (
client.interactions.create) để có tính năng mới nhất;thinking_levelthay thế các tham số “budget” cũ. - CometAPI cung cấp một API key duy nhất và truy cập tương thích OpenAI (hoặc chuẩn Gemini) tới Gemini 3.7 Flash cùng 500+ mô hình khác, đơn giản hóa thanh toán, chuyển đổi và kiểm soát chi phí.
- Hỗ trợ đầu vào đa phương thức (văn bản, hình ảnh, video, âm thanh, PDF) với đầu ra văn bản; công cụ tích hợp gồm gọi hàm (function calling), thực thi mã, search grounding, computer use (preview), và nhiều hơn nữa.
- $0.75 cho 1M input token và $3.75 cho 1M output token đến ngày 31 tháng 12, 2026; giá mở đầu kết thúc vào ngày 31 tháng 12, 2026; hãy lên kế hoạch cho mức chuẩn $1.50 / $7.50 sau đó.
- Lý tưởng cho tác tử sản xuất, sinh mã độ chính xác cao và luồng công việc nhiều bước nơi hiệu quả chi phí và độ tin cậy là quan trọng.
Google phát hành Gemini 3.7 Flash vào ngày 13 tháng 8, 2026—chỉ ba tuần sau Gemini 3.6 Flash—như mô hình “workhorse” thông minh nhất cho lập trình và tác tử. Mục tiêu là kỹ nghệ phần mềm phức tạp, thực thi đa bước dạng tác tử, tạo web/UI với độ tuân thủ thiết kế cao, và các lĩnh vực đậm đặc kiến thức như tài chính, pháp lý và khoa học sinh học.
Quan trọng: Gemini 3.7 Flash giới thiệu/kế thừa các thay đổi hành vi API quan trọng của Gemini 3.x. Đặc biệt, nhà phát triển khi di trú ứng dụng Gemini cũ nên loại bỏ
temperature,top_p, vàtop_k, thaythinking_budgetbằngthinking_level, bỏcandidate_countkhông được hỗ trợ, và dừng tiền điền (pre-fill) lượt của mô hình.
Gemini 3.7 Flash là gì?
Gemini 3.7 Flash là mô hình hạng Flash mới nhất của Google, phát hành ngày 13 tháng 8, 2026.
Google mô tả đây là “mô hình chủ lực thông minh nhất cho lập trình và tác tử.” Bản phát hành đáng chú ý vì xuất hiện chỉ ba tuần sau 3.6 Flash, cho thấy Google đang tăng tốc chu kỳ lặp cho các mô hình Flash hướng nhà phát triển.
Thay vì chỉ định vị Gemini 3.7 Flash như một chatbot nhanh hơn, Google nhắm tới các khối lượng công việc nơi hệ thống AI cần:
- suy luận qua nhiều bước;
- viết và gỡ lỗi phần mềm;
- sử dụng công cụ;
- tương tác với hệ thống bên ngoài;
- phân tích tài liệu lớn;
- chuyển thiết kế thành giao diện hoạt động;
- thực thi quy trình nghiệp vụ;
- vận hành như một tác tử AI.
Sự khác biệt đó rất quan trọng.
Một chatbot truyền thống có thể trả lời:
“Làm thế nào để triển khai OAuth?”
Một mô hình lập trình định hướng tác tử được kỳ vọng hiểu kho mã, kiểm tra tệp, xác định phụ thuộc, đề xuất thay đổi, thực thi công cụ, chẩn đoán lỗi và lặp lại cho đến khi triển khai hoạt động.
Gemini 3.7 Flash được thiết kế nặng về kịch bản thứ hai.
Gemini 3.7 Flash API: Thông số cốt lõi
Trang tài liệu chính thức của Gemini API liệt kê Gemini 3.7 Flash ở trạng thái sẵn sàng chung với các thông số nổi bật sau.
| Thông số | Gemini 3.7 Flash |
|---|---|
| Model ID | gemini-3.7-flash |
| Tình trạng | Phát hành rộng rãi |
| Cửa sổ ngữ cảnh | 1,000,000 token |
| Đầu ra tối đa | 64,000 token |
| Mức tư duy mặc định | Medium |
| Các mức tư duy | Low, Medium, High |
| Đầu vào | Hỗ trợ đa phương thức qua nền tảng Gemini |
| Trọng tâm chính | Lập trình, tác tử, phát triển web, công việc tri thức |
| Giá đầu vào mở đầu | $0.75 / 1M token |
| Giá đầu ra mở đầu | $3.75 / 1M token |
| Hết hiệu lực giá mở đầu | December 31, 2026 |
| Giá đầu vào chuẩn sau mở đầu | $1.50 / 1M token |
| Giá đầu ra chuẩn sau mở đầu | $7.50 / 1M token |
Cửa sổ ngữ cảnh 1M token đặc biệt hữu ích cho kho mã lớn, tài liệu kỹ thuật dài, tài liệu doanh nghiệp và phiên tác tử nhiều bước.
Gemini 3.7 Flash API đã thay đổi gì?
Đây là một trong những phần quan trọng nhất cho nhà phát triển.
Gemini 3.7 Flash không chỉ đơn giản là đổi:
gemini-3.6-flash
thành:
gemini-3.7-flash
Thế hệ Gemini 3.x giới thiệu các thay đổi hành vi API có thể làm hỏng ứng dụng cũ. Tài liệu di trú của Gemini 3.7 nêu rõ một số thay đổi.
1. temperature, top_p, và top_k đã bị loại bỏ (deprecated)
Tích hợp Gemini cũ thường có cấu hình như:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40
}
Với Gemini 3.x, nên loại bỏ các tham số lấy mẫu này.
Google cho biết các tham số này đã deprecated và các thế hệ mô hình tương lai có thể từ chối chúng thay vì lặng lẽ chấp nhận.
Với Gemini 3.7 Flash, hãy dùng điều khiển tư duy:
generation_config = {
"thinking_level": "medium"
}
Đây là thay đổi khái niệm quan trọng.
Thay vì chủ yếu kiểm soát độ ngẫu nhiên, nhà phát triển có thể kiểm soát tường minh mức nỗ lực suy luận.
2. thinking_budget trở thành thinking_level
Ứng dụng dùng cấu hình tư duy cũ có thể như:
{
"thinking_budget": 4096
}
Gemini 3.7 Flash dùng:
{
"thinking_level": "medium"
}
Các mức hỗ trợ:
lowmediumhigh
Google mô tả low hữu ích cho tác vụ nhạy độ trễ, medium là mặc định và dùng chung, và high phù hợp cho suy luận khó, toán, lập trình và tác vụ tác tử.
3. Cần loại bỏ candidate_count
Danh sách di trú của Google cũng yêu cầu bỏ candidate_count, không được hỗ trợ trong Gemini 3.x.
Do đó, cấu hình cũ như:
{
"candidate_count": 3
}
không nên mang sang Gemini 3.7 Flash.
4. Không còn hỗ trợ lượt mô hình được tiền điền
Kiến trúc hội thoại cũ đôi khi kết thúc yêu cầu bằng lượt mô hình được tiền điền một phần.
Hành vi API mới của Gemini yêu cầu nhà phát triển nghĩ lại mẫu này.
Google khuyến nghị dùng trạng thái hội thoại phía máy chủ thông qua previous_interaction_id cho tương tác nhiều lượt và loại bỏ lượt mô hình được tiền điền.
5. Gọi hàm cần chú ý bổ sung
Hướng dẫn di trú cũng nêu các thay đổi gọi hàm.
Với ứng dụng dùng công cụ, nhà phát triển cần chú ý:
- tài sản đa phương thức;
- hướng dẫn nội tuyến;
- siêu dữ liệu phản hồi hàm;
call_id;- tên hàm;
- lỗi gọi hàm sai định dạng.
Đối với API generateContent, Google nói đối tượng FunctionResponse nên bao gồm cả call_id và name.
Điều này đặc biệt quan trọng với ứng dụng tác tử vì gọi hàm không còn là “tùy chọn.” Nó là trung tâm cho cách các tác tử lập trình và quy trình làm việc vận hành.
Cách dùng Gemini 3.7 Flash API với CometAPI
CometAPI là cổng API hợp nhất cung cấp truy cập 500+ mô hình (bao gồm toàn bộ họ Gemini) với một API key, endpoint tương thích OpenAI, giá cạnh tranh và quản trị đa nhà cung cấp đơn giản. Điều này đặc biệt hữu ích nếu ứng dụng của bạn đã dùng SDK OpenAI hoặc cần chuyển đổi giữa Gemini, Claude, GPT và mô hình khác mà không phải viết lại xác thực hoặc logic thanh toán.
Dưới đây là hướng dẫn đầy đủ, định hướng sản xuất. Mỗi bước chính là một H2 để rõ ràng và tối ưu SEO.
Đăng ký CometAPI và lấy API Key
- Truy cập https://www.cometapi.com/ và tạo tài khoản (Google, GitHub hoặc email).
- Điều hướng đến phần API Keys / Console: https://www.cometapi.com/console/token.
- Nhấp Create API Key, đặt tên mô tả (ví dụ: gemini-3.7-flash-prod), và sao chép key.
- Lưu trữ an toàn dưới dạng biến môi trường:Bash
export COMETAPI_KEY="your-key-here"
Không bao giờ commit key vào hệ thống quản lý mã nguồn hoặc để lộ trên mã phía client.
CometAPI dùng mô hình trả theo mức sử dụng với mức giá thường cạnh tranh so với nhà cung cấp trực tiếp và không có mức tối thiểu theo tháng.
Cài đặt SDK cần thiết
For native Gemini style (recommended for full feature parity):
Bash
pip install google-genai
For OpenAI-compatible calls (easiest migration):
Bash
pip install openai
Node.js equivalents are also available (@google/genai or the OpenAI Node SDK).
Cấu hình client cho CometAPI
Option A – Native Google GenAI client trỏ tới CometAPI (giữ Interactions API và điều khiển tư duy):
Python
import os
from google import genai
client = genai.Client(
http_options={
"api_version": "v1beta",
"base_url": "https://api.cometapi.com"
},
api_key=os.environ.get("COMETAPI_KEY")
)
Option B – Client tương thích OpenAI (lý tưởng nếu codebase của bạn đã dựa trên OpenAI):
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("COMETAPI_KEY"),
base_url="https://api.cometapi.com/v1"
)
Cả hai cách đều định tuyến qua CometAPI và chọn mô hình nguồn thông qua tham số model.
Gọi thử lần đầu với Gemini 3.7 Flash
Dùng phong cách Interactions API (qua GenAI client đã cấu hình):
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Write a production-ready Three.js script that renders a realistic 3D black hole with accretion disk and gravitational lensing.",
generation_config={
"thinking_level": "medium"
}
)
print(interaction.output_text)
Phong cách chat completions tương thích OpenAI:
Python
response = client.chat.completions.create(
model="gemini-3.7-flash", # Confirm exact model ID in CometAPI dashboard if aliased
messages=[
{"role": "system", "content": "You are an expert software engineer."},
{"role": "user", "content": "Write a Python function that safely handles concurrent payment retries with proper locking."}
],
max_tokens=4096
)
print(response.choices[0].message.content)
Ví dụ cURL (tương thích OpenAI):
Bash
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{"role": "user", "content": "Explain the key improvements in Gemini 3.7 Flash in 3 bullet points."}
]
}'
Luôn xác minh chuỗi model chính xác trong bảng điều khiển Models của CometAPI, vì các bộ tổng hợp đôi khi dùng định danh hơi khác hoặc alias.
Cấu hình mức tư duy và tùy chọn sinh nâng cao
Đối với tác vụ lập trình/tác tử phức tạp, đặt rõ mức tư duy:
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Analyze this payment processing pipeline for race conditions and rewrite the locks safely.",
generation_config={
"thinking_level": "high" # or "low" / "medium"
}
)
- low: Nhanh nhất, phù hợp chat thời gian thực hoặc soạn thảo đơn giản.
- medium (mặc định): Cân bằng tốt nhất cho hầu hết công việc lập trình và tác tử.
- high: Độ sâu suy luận và dùng công cụ tối đa; tiêu thụ token/chi phí cao hơn.
Thêm đầu vào đa phương thức (Hình ảnh, PDF, Video, Âm thanh)
Gemini 3.7 Flash hỗ trợ tự nhiên đầu vào hỗn hợp. Ví dụ với hình ảnh + prompt văn bản (dùng GenAI client):
Python
from google.genai import types
# Assume image bytes or file path handled appropriately
response = client.models.generate_content( # or interactions equivalent
model="gemini-3.7-flash",
contents=[
types.Part.from_bytes(data=image_bytes, mime_type="image/jpeg"),
"Describe the UI design system in this mockup and generate matching React + Tailwind code."
]
)
Mẫu tương tự áp dụng cho PDF, video và âm thanh. Điều này mạnh mẽ cho quy trình từ thiết kế đến mã, hỏi đáp tài liệu và phân tích video.
Triển khai gọi hàm / dùng công cụ
Khai báo công cụ trong yêu cầu và để mô hình quyết định khi nào gọi. CometAPI chuyển tiếp những khai báo này tới backend Gemini. Tuân theo schema gọi hàm chính thức của Gemini (name, description, parameters dạng JSON Schema). Sau khi nhận lệnh gọi hàm, thực thi công cụ và trả kết quả ở lượt tiếp theo.
Tham số API cho Gemini 3.7 Flash
Khi gọi qua Interactions API (khuyến nghị), các tham số chính gồm:
- model: "gemini-3.7-flash" (bắt buộc)
- input: Chuỗi hoặc nội dung có cấu trúc (văn bản + phần đa phương thức)
- generation_config (đối tượng tùy chọn):
- thinking_level: "low" | "medium" | "high" (mặc định medium)
- Các trường cấu hình khác hỗ trợ cho đầu ra có cấu trúc, an toàn, v.v.
- tools / khai báo hàm cho việc dùng công cụ
- hướng dẫn hệ thống (qua vai trò system hoặc trường chuyên biệt tùy client)
- Thiết lập môi trường/tác tử khi dùng managed agents (ví dụ: Antigravity)
Các lời gọi phong cách generateContent bản địa vẫn khả dụng nhưng Interactions API được ưu tiên để truy cập đầy đủ tính năng và điều phối tác tử.
Hỗ trợ đếm token, caching (ngầm định + tường minh), suy luận theo lô và tùy chọn ưu tiên/linh hoạt.
Các tham số và khái niệm cấu hình quan trọng được tóm tắt dưới đây.
| Tham số | Mục đích | Hướng dẫn cho Gemini 3.7 Flash |
|---|---|---|
| model | Chọn mô hình | gemini-3.7-flash |
| input | Chỉ dẫn người dùng trong Interactions API | Bắt buộc |
| generation_config | Điều khiển sinh | Dùng các trường hỗ trợ của Gemini 3.x |
| thinking_level | Kiểm soát nỗ lực suy luận | low, medium, high |
| contents | Đầu vào generateContent của Gemini | Dùng với yêu cầu kiểu Gemini |
| parts | Các thành phần nội dung | Nội dung văn bản/đa phương thức |
| temperature | Độ ngẫu nhiên khi lấy mẫu | Không dùng |
| top_p | Lấy mẫu nucleus | Không dùng |
| top_k | Lấy mẫu Top-K | Không dùng |
| thinking_budget | Điều khiển tư duy kiểu cũ | Thay bằng thinking_level |
| candidate_count | Nhiều phương án | Không hỗ trợ trong Gemini 3.x |
| previous_interaction_id | Duy trì hội thoại | Khuyến nghị cho luồng Interactions API nhiều lượt |
Google's migration documentation nêu rõ các tham số bị loại bỏ/không hỗ trợ và mẫu hội thoại mới.
Thực tiễn tốt nhất và mẹo di trú cho sản xuất
- Bắt đầu với
thinking_level="medium"và đo lường chất lượng so với độ trễ/chi phí. - Loại bỏ tham số deprecated (temperature, top_p, top_k, các ngân sách tư duy cũ).
- Ưu tiên Interactions API cho luồng đa bước dạng tác tử và tích hợp Antigravity.
- Với ứng dụng đa mô hình, giữ nguyên base URL của CometAPI và chỉ đổi chuỗi model—không cần xác thực lại.
- Kiểm thử kỹ với vòng lặp tác tử cụ thể của bạn; 3.7 Flash giảm vòng lặp thất bại nhưng vẫn hưởng lợi từ hướng dẫn hệ thống rõ ràng và schema công cụ tốt.
- Kết hợp với các mô hình khác của CometAPI (ví dụ: trình sinh ảnh chuyên biệt hoặc mô hình suy luận thay thế) khi Gemini 3.7 Flash không tối ưu cho một tiểu nhiệm vụ.
Xử lý streaming, caching và yêu cầu theo lô
- Streaming được hỗ trợ qua cờ stream chuẩn trong cả client tương thích OpenAI và bản địa.
- Bộ nhớ đệm ngữ cảnh (ngầm định và tường minh) giảm chi phí cho ngữ cảnh lớn lặp lại.
- Tùy chọn suy luận theo lô và ưu tiên có sẵn cho khối lượng lớn hoặc nhạy độ trễ—kiểm tra ma trận hỗ trợ hiện tại của CometAPI và các tùy chọn tiêu thụ chính thức của Gemini.
Giám sát sử dụng, chi phí và lỗi
Dùng bảng điều khiển CometAPI để theo dõi thời gian thực việc sử dụng, chi phí và hạn mức. Triển khai backoff lũy tiến cho lỗi 429 và tuân thủ hạn mức đã công bố. Ghi lại số liệu token từ siêu dữ liệu phản hồi để phân bổ chi phí chính xác.
Danh sách kiểm di trú Gemini 3.7 Flash API
Trước khi triển khai ứng dụng Gemini hiện có, kiểm tra từng mục dưới đây.
[ ] Change model ID to gemini-3.7-flash
[ ] Remove temperature
[ ] Remove top_p
[ ] Remove top_k
[ ] Replace thinking_budget with thinking_level
[ ] Remove candidate_count
[ ] Remove prefilled model turns
[ ] Review multi-turn conversation state
[ ] Review function-call handling
[ ] Check FunctionResponse call_id/name
[ ] Update SDK
[ ] Re-run production test suite
[ ] Benchmark low/medium/high thinking
[ ] Recalculate token costs
[ ] Test failure/retry behavior
Hướng dẫn di trú của Google khuyến nghị rõ các thay đổi này khi chuyển sang Gemini 3.7 Flash.
Câu hỏi thường gặp
Gemini 3.7 Flash API là gì?
Gemini 3.7 Flash API cung cấp quyền truy cập lập trình tới mô hình Gemini 3.7 Flash của Google. Google định vị mô hình cho lập trình, tác tử, phát triển web, công việc tri thức và luồng công việc nhiều bước phức tạp.
Gemini 3.7 Flash có giá bao nhiêu?
Đến ngày 31 tháng 12, 2026, giá mở đầu là $0.75 cho mỗi triệu input token và $3.75 cho mỗi triệu output token.
Từ ngày 1 tháng 1, 2027, Google cho biết giá trở thành $1.50 cho mỗi triệu input token và $7.50 cho mỗi triệu output token.
Tôi còn có thể dùng temperature với Gemini 3.7 Flash không?
Không nên. Tài liệu di trú Gemini 3.x của Google nói temperature, top_p, và top_k đã deprecated và nên loại bỏ.
Tôi có thể dùng Gemini 3.7 Flash qua CometAPI không?
Nền tảng CometAPI hiện quảng bá khả dụng Gemini 3.7 Flash và cung cấp cả mẫu API kiểu Gemini lẫn tương thích OpenAI. Vì mô hình mới phát hành, nhà phát triển nên xác minh trang mô hình hiện tại và khả năng endpoint trước khi triển khai sản xuất.
CometAPI có tốt hơn Gemini API chính thức không?
Không có lựa chọn nào “tốt hơn” một cách tuyệt đối. Gemini API chính thức là lựa chọn tự nhiên nếu bạn muốn hệ sinh thái bản địa của Google và chức năng đặc thù nhà cung cấp. CometAPI hấp dẫn hơn khi bạn cần giao diện hợp nhất cho nhiều nhà cung cấp AI, quản trị tập trung và đổi mô hình dễ dàng.
Kết luận: Có đáng dùng Gemini 3.7 Flash?
Với nhà phát triển xây dựng ứng dụng AI năm 2026, Gemini 3.7 Flash rất đáng được cân nhắc.
Bản phát hành ít mang tính làm chatbot “thông minh hơn đôi chút” và nhiều hơn ở việc làm cho một mô hình tương đối rẻ trở nên giỏi “thực sự làm việc.”
Cân nhắc kỹ thuật lớn nhất là di trú.
Nếu ứng dụng của bạn viết quanh API Gemini cũ, đừng chỉ đổi tên mô hình. Hãy bỏ các tham số lấy mẫu deprecated, chuyển sang thinking_level, loại candidate_count không được hỗ trợ, dừng tiền điền lượt mô hình, và rà soát hành vi gọi hàm.
Với đội ngũ xây dựng thuần quanh Google, Gemini API bản địa là điểm khởi đầu hiển nhiên.
Với đội ngũ xây dựng ngăn xếp AI đa mô hình, CometAPI là lựa chọn hấp dẫn: một lớp API, truy cập mô hình tập trung và khả năng thử nghiệm Gemini cùng các họ mô hình lớn khác mà không cần tạo tích hợp riêng cho từng nhà cung cấp.
Khuyến nghị thực tiễn đơn giản là:
Bắt đầu với Gemini 3.7 Flash ở mức tư duy medium, đo đạc trên khối lượng công việc thực, rồi dùng low hoặc high chọn lọc dựa trên độ trễ, chất lượng và chi phí. Nếu sản phẩm của bạn cũng cần nhiều nhà cung cấp AI, đánh giá cùng khối lượng công việc qua CometAPI để so sánh mô hình mà không phải thiết kế lại kiến trúc ứng dụng.
Sự kết hợp giữa hiệu năng tác tử mạnh hơn, cửa sổ ngữ cảnh 1M token, suy luận có thể cấu hình và giá năm 2026 hấp dẫn khiến Gemini 3.7 Flash trở thành một trong những bản phát hành API đáng chú ý cho nhà phát triển đang xây dựng tác tử AI sản xuất hiện nay.
