TLDR: Gemini 3.7 Flash(model ID gemini-3.7-flash),於 2026 年 8 月 13 日發布,是 Google 面向程式開發、代理式工作流程、網頁開發與知識密集型任務的最強大 Flash 級主力模型。
它提供 1,048,576 個 token 的上下文視窗、最多 65,536 個輸出 token、可調整的思考層級(low/medium/high)、強大的多模態支援,並在 2026 年 12 月 31 日前享有每 1M 輸入 token $0.75 / 每 1M 輸出 token $3.75 的入門價格。可透過 Google 的 Interactions API 存取,或為了更方便的多模型棧,透過 CometAPI 的統一端點。此指南涵蓋新功能、API 參數、使用 CometAPI 的逐步教學、程式碼範例、基準測試與最佳實務。
重點摘要
- Gemini 3.7 Flash 在程式開發(FrontierCode 1.1 Main:43.6% vs 34.4%;DeepSWE v1.1:65.3% vs ~49%)、網頁開發(WebDev Arena Elo 1588 vs 1538)、文件處理(GDP.pdf 34% vs 22%)與商務自動化(AutomationBench 30.4% vs 17%)方面相較 3.6 Flash 有重大提升。
- 使用 Interactions API(
client.interactions.create)以獲得最新功能;thinking_level取代舊的預算參數。 - CometAPI 提供單一 API 金鑰與與 OpenAI 相容(或原生 Gemini)端點,存取 Gemini 3.7 Flash 與 500+ 其他模型,簡化計費、切換與成本控制。
- 多模態輸入(文字、圖片、影片、音訊、PDF)搭配文字輸出;內建工具包含函式呼叫、程式碼執行、搜尋溯源、電腦操作(預覽)等。
- 每 1M 輸入 token $0.75 與 每 1M 輸出 token $3.75,至 2026 年 12 月 31 日止,入門價格於 2026 年 12 月 31 日結束;之後請規劃標準費率 $1.50 / $7.50。
- 適合用於生產級代理、精準的程式碼生成,以及在乎成本效率與可靠性的多步驟工作流程。
Google 於 2026 年 8 月 13 日發布 Gemini 3.7 Flash——距離 Gemini 3.6 Flash 僅三週——作為其最智慧的主力模型,專注於程式開發與代理。它鎖定複雜的軟體工程、代理式多步驟執行、具強設計遵循的網頁/UI 生成,以及金融、法律、生物科學等知識密集領域。
**重要:**Gemini 3.7 Flash 引入或沿用重要的 Gemini 3.x API 行為變更。特別是,升級舊版 Gemini 應用的開發者應移除
temperature、top_p與top_k,以thinking_level取代thinking_budget,移除不支援的candidate_count,並停止預先填充模型回合。
什麼是 Gemini 3.7 Flash?
Gemini 3.7 Flash 是 Google 最新的 Flash 級生成式 AI 模型,於2026 年 8 月 13 日發布。
Google 形容它是其**「迄今最智慧的程式開發與代理主力模型」**。此版本值得注意之處在於,距 3.6 Flash 僅相隔三週,意味著 Google 正加速面向開發者的 Flash 系列迭代節奏。
與其把 Gemini 3.7 Flash 定位為更快的聊天機器人,Google 鎖定的是 AI 系統需要:
- 進行多步推理;
- 撰寫與除錯軟體;
- 使用工具;
- 與外部系統互動;
- 分析大型文件;
- 將設計轉化為可運作的介面;
- 執行商務工作流程;
- 作為 AI 代理的一部分運作。
這樣的區別很重要。
傳統聊天機器人可能會回答:
“How do I implement OAuth?”
而面向代理的程式模型則預期能理解版本庫、檢視檔案、識別相依項、提出變更、執行工具、診斷錯誤,並迭代直至實作可行。
Gemini 3.7 Flash 的設計重心顯著偏向第二種情境。
Gemini 3.7 Flash API:核心規格
官方 Gemini API 文件列示 Gemini 3.7 Flash 已經一般可用,具備以下重點規格。
| 規格 | Gemini 3.7 Flash |
|---|---|
| Model ID | gemini-3.7-flash |
| Availability | 一般可用 |
| Context window | 1,000,000 tokens |
| Maximum output | 64,000 tokens |
| Default thinking level | Medium |
| Thinking levels | Low, Medium, High |
| Input | 透過 Gemini 平台支援多模態能力 |
| Primary focus | 程式開發、代理、網頁開發、知識型工作 |
| Intro input price | $0.75 / 1M tokens |
| Intro output price | $3.75 / 1M tokens |
| Intro price expiration | December 31, 2026 |
| Standard input price after intro | $1.50 / 1M tokens |
| Standard output price after intro | $7.50 / 1M tokens |
1M token 的上下文視窗對大型版本庫、冗長技術文件、企業文件與多步驟代理式工作階段尤其有用。
Gemini 3.7 Flash API 有哪些變更?
這是對開發者最重要的章節之一。
Gemini 3.7 Flash 並非僅僅把:
gemini-3.6-flash
改成:
gemini-3.7-flash
Google 的 Gemini 3.x 世代引入了可能會破壞舊版應用的 API 行為變更。Gemini 3.7 的遷移文件特別指出了若干項更動。
1. temperature、top_p 與 top_k 已棄用
舊版 Gemini 整合常見的設定如下:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40
}
對於 Gemini 3.x,應移除這些取樣參數。
Google 表示這些參數已棄用,未來的模型世代可能會拒絕它們,而非靜默接受。
對於 Gemini 3.7 Flash,請改用思考控制:
generation_config = {
"thinking_level": "medium"
}
這是重要的概念性變化。
與其主要控制隨機性,開發者現在可以明確控制推理投入程度。
2. thinking_budget 變更為 thinking_level
使用舊版推理設定的應用可能有如下內容:
{
"thinking_budget": 4096
}
Gemini 3.7 Flash 使用:
{
"thinking_level": "medium"
}
支援的層級為:
lowmediumhigh
Google 認為 low 適合延遲敏感的任務,medium 為預設且通用設定,high 適用於困難的推理、數學、程式開發與代理式任務。
3. 應移除 candidate_count
Google 的遷移清單亦指出要移除 candidate_count,因為在 Gemini 3.x 中不受支援。
因此,像這樣的舊版設定:
{
"candidate_count": 3
}
不應直接沿用到 Gemini 3.7 Flash。
4. 不再支援預先填充的模型回合
舊的對話架構有時會以部分預填的模型回合作結。
Gemini 新的 API 行為要求開發者重新思考此模式。
Google 建議,多回合互動請透過 previous_interaction_id 使用伺服器端對話狀態,並移除預先填充的模型回合。
5. 函式呼叫需要額外注意
遷移指引也強調了函式呼叫的變更。
對使用工具的應用,開發者應留意:
- 多模態資產;
- 內嵌指示;
- 函式回應中繼資料;
call_id;- 函式名稱;
- 異常函式呼叫錯誤。
針對 generateContent API,Google 表示 FunctionResponse 物件應包含 call_id 與 name。
這對代理應用尤其重要,因為函式呼叫不再是可有可無的「加分項」,而是程式開發與工作流程代理運作的核心。
如何透過 CometAPI 使用 Gemini 3.7 Flash API
CometAPI 是統一的 API 門戶,提供 500+ 模型(包括完整的 Gemini 系列)存取、單一 API 金鑰、與 OpenAI 相容的端點、具競爭力的定價,以及簡化的多供應商管理。若你的應用已使用 OpenAI SDK,或需要在不重寫授權或計費邏輯的情況下於 Gemini、Claude、GPT 與其他模型間切換,這尤其實用。
以下是完整、面向生產的操作導覽。每個主要步驟以 H2 結構編排,便於閱讀與 SEO。
註冊 CometAPI 並取得 API 金鑰
- 造訪 https://www.cometapi.com/ 建立帳戶(Google、GitHub 或電子郵件)。
- 前往 API Keys / Console 區域:https://www.cometapi.com/console/token。
- 點擊 Create API Key,給它易識別的名稱(例如:gemini-3.7-flash-prod),並複製金鑰。
- 以環境變數安全儲存:Bash
export COMETAPI_KEY="your-key-here"
請勿將金鑰提交至版本控制或暴露在前端程式碼。
CometAPI 採用隨用隨付定價,通常具與直接供應商相當的競爭力,且無每月最低消費。
安裝所需 SDK
對原生 Gemini 風格(建議以獲得完整功能一致性):
Bash
pip install google-genai
對與 OpenAI 相容的呼叫(最易遷移):
Bash
pip install openai
Node.js 等價套件亦可用(@google/genai 或 OpenAI 的 Node SDK)。
為 CometAPI 設定用戶端
選項 A – 指向 CometAPI 的原生 Google GenAI 用戶端(保留 Interactions API 與思考控制):
Python
import os
from google import genai
client = genai.Client(
http_options={
"api_version": "v1beta",
"base_url": "https://api.cometapi.com"
},
api_key=os.environ.get("COMETAPI_KEY")
)
選項 B – 與 OpenAI 相容的用戶端(若你的程式碼基礎已採用 OpenAI,則更理想):
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("COMETAPI_KEY"),
base_url="https://api.cometapi.com/v1"
)
兩種作法都會透過 CometAPI 路由流量,並以 model 參數選擇上游模型。
發出你的第一個 Gemini 3.7 Flash 呼叫
採用 Interactions API 風格(透過已設定的 GenAI 用戶端):
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Write a production-ready Three.js script that renders a realistic 3D black hole with accretion disk and gravitational lensing.",
generation_config={
"thinking_level": "medium"
}
)
print(interaction.output_text)
與 OpenAI 相容的 chat completions 風格:
Python
response = client.chat.completions.create(
model="gemini-3.7-flash", # Confirm exact model ID in CometAPI dashboard if aliased
messages=[
{"role": "system", "content": "You are an expert software engineer."},
{"role": "user", "content": "Write a Python function that safely handles concurrent payment retries with proper locking."}
],
max_tokens=4096
)
print(response.choices[0].message.content)
cURL 範例(與 OpenAI 相容):
Bash
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{"role": "user", "content": "Explain the key improvements in Gemini 3.7 Flash in 3 bullet points."}
]
}'
務必在 CometAPI 的 Models 儀表板確認可用的精確模型字串,因為聚合平台有時會使用不同識別字或別名。
設定思考層級與進階生成選項
對複雜的程式開發或代理任務,請明確設定思考層級:
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Analyze this payment processing pipeline for race conditions and rewrite the locks safely.",
generation_config={
"thinking_level": "high" # or "low" / "medium"
}
)
- low:最快,適用即時聊天或簡單撰寫。
- medium(預設):多數程式與代理式工作最佳平衡。
- high:最大推理深度與工具使用;消耗較多 token/成本。
加入多模態輸入(圖片、PDF、影片、音訊)
Gemini 3.7 Flash 原生接受混合模態。以下為圖片 + 文字提示範例(使用 GenAI 用戶端):
Python
from google.genai import types
# Assume image bytes or file path handled appropriately
response = client.models.generate_content( # or interactions equivalent
model="gemini-3.7-flash",
contents=[
types.Part.from_bytes(data=image_bytes, mime_type="image/jpeg"),
"Describe the UI design system in this mockup and generate matching React + Tailwind code."
]
)
PDF、影片與音訊亦可採相似方式加入。這對設計到程式碼、文件問答與影片分析工作流程非常強大。
實作函式呼叫 / 工具使用
在請求中宣告工具,並讓模型決定何時呼叫。CometAPI 會將此傳遞至底層的 Gemini 後端。請依官方的 Gemini 函式呼叫結構(name、description、parameters 為 JSON Schema)設計。接收函式呼叫後,執行工具並在後續回合返回結果。
Gemini 3.7 Flash 的 API 參數
透過 Interactions API(建議)呼叫時,關鍵參數包括:
- model:"gemini-3.7-flash"(必填)
- input:字串或結構化內容(文字 + 多模態部分)
- generation_config(選填物件):
- thinking_level:"low" | "medium" | "high"(預設為 medium)
- 其他支援的結構化輸出、安全性等設定欄位
- tools/工具宣告以進行函式呼叫
- system instructions(透過 system 角色或依用戶端的專用欄位)
- 使用受管代理時的環境/代理設定(例如:Antigravity)
原生的 generateContent 風格呼叫仍可用,但 Interactions API 在完整功能與代理協調方面更佳。
支援 token 計數、快取(隱性 + 顯性)、批次推論,以及優先/彈性選項。
以下摘要最重要的參數與設定概念。
| 參數 | 用途 | Gemini 3.7 Flash 指南 |
|---|---|---|
| model | 選擇模型 | gemini-3.7-flash |
| input | Interactions API 的使用者指示 | 必填 |
| generation_config | 生成控制 | 使用 Gemini 3.x 支援的欄位 |
| thinking_level | 控制推理投入 | low、medium、high |
| contents | Gemini generateContent 的輸入 | 用於 Gemini 格式請求 |
| parts | 個別內容構件 | 文字/多模態內容 |
| temperature | 取樣隨機性 | 不使用 |
| top_p | 核心取樣 | 不使用 |
| top_k | Top-K 取樣 | 不使用 |
| thinking_budget | 舊版思考控制 | 以 thinking_level 取代 |
| candidate_count | 多候選 | 在 Gemini 3.x 不支援 |
| previous_interaction_id | 對話延續 | 建議用於多回合 Interactions API 工作流程 |
Google 的遷移文件明確指出已棄用/不支援的參數與新的對話模式。
生產最佳實務與遷移提示
- 以
thinking_level="medium" 起步,衡量品質 vs 延遲/成本。 - 移除棄用參數(temperature、top_p、top_k、舊思考預算)。
- 對代理式多步流程與 Antigravity 整合,優先使用 Interactions API。
- 對多模型應用,保留 CometAPI 的 base URL,僅更換 model 字串——無需重新驗證。
- 以你的代理迴圈充分測試;3.7 Flash 降低失敗迴圈,但仍受益於清晰的 system 指示與工具結構。
- 當子任務不適合 Gemini 3.7 Flash 時,搭配 CometAPI 的其他模型(如專用影像生成或替代推理模型)。
處理串流、快取與批次請求
- 串流支援於與 OpenAI 相容與原生用戶端的標準 stream 旗標。
- 上下文快取(隱性與顯性)可降低重複大型上下文的成本。
- 批次與優先推論選項可用於高量或延遲敏感工作——請查 CometAPI 當前支援矩陣與官方 Gemini 消費選項。
監控使用量、成本與錯誤
使用 CometAPI 儀表板進行即時使用量、成本追蹤與速率限制可視化。對 429 錯誤實作指數回退,並遵守任何已文件化的速率限制。從回應中繼資料記錄 token 使用量以精準歸因成本。
Gemini 3.7 Flash API 遷移檢查清單
在部署既有的 Gemini 應用前,請逐項檢查下列事項。
[ ] Change model ID to gemini-3.7-flash
[ ] Remove temperature
[ ] Remove top_p
[ ] Remove top_k
[ ] Replace thinking_budget with thinking_level
[ ] Remove candidate_count
[ ] Remove prefilled model turns
[ ] Review multi-turn conversation state
[ ] Review function-call handling
[ ] Check FunctionResponse call_id/name
[ ] Update SDK
[ ] Re-run production test suite
[ ] Benchmark low/medium/high thinking
[ ] Recalculate token costs
[ ] Test failure/retry behavior
Google 的遷移指南在升級至 Gemini 3.7 Flash 時,特別建議進行上述調整。
常見問答
什麼是 Gemini 3.7 Flash API?
Gemini 3.7 Flash API 提供對 Google Gemini 3.7 Flash 模型的程式化存取。Google 將此模型定位於程式開發、代理、網頁開發、知識型工作與複雜多步驟工作流程。
Gemini 3.7 Flash 的費用是多少?
至 2026 年 12 月 31 日,入門定價為每百萬(1M)輸入 token $0.75,與每百萬輸出 token $3.75。
自 2027 年 1 月 1 日起,Google 表示定價調整為每百萬輸入 token $1.50 與每百萬輸出 token $7.50。
我仍可在 Gemini 3.7 Flash 中使用 temperature 嗎?
不建議。Google 的 Gemini 3.x 遷移文件指出 temperature、top_p 與 top_k 已棄用,應移除。
我可以透過 CometAPI 使用 Gemini 3.7 Flash 嗎?
CometAPI 平台目前宣示提供 Gemini 3.7 Flash,並提供 Gemini 格式與與 OpenAI 相容的 API 模式。由於此模型剛發布,開發者在生產部署前應確認當前模型頁面與端點能力。
CometAPI 是否優於官方 Gemini API?
兩者並無絕對「更好」。若你偏好 Google 的原生生態與供應商特定功能,官方 Gemini API 是自然選擇。若你需要跨多家 AI 供應商的統一介面、集中管理與更容易的模型切換,CometAPI 更具吸引力。
最終評價:Gemini 3.7 Flash 值得使用嗎?
對 2026 年正在打造 AI 應用的開發者而言,Gemini 3.7 Flash 值得嚴肅看待。
這次發布重點不是讓聊天機器人稍微更聰明,而是讓相對便宜的模型更擅長真正「完成任務」。
最大的技術考量是遷移。
如果你的應用基於較舊的 Gemini API,請不要僅更改模型名稱。移除棄用的取樣參數、改用 thinking_level、刪除不支援的 candidate_count、停止預先填充模型回合,並檢視函式呼叫行為。
對專注於 Google 的團隊,原生 Gemini API 是明顯起點。
對打造多模型 AI 棧的團隊,CometAPI 提供有力選擇:單一 API 層、集中存取各模型,讓你能在不重設應用架構的前提下,同時試用 Gemini 與其他主流模型家族。
實務建議很簡單:
以中等思考投入(medium)啟用 Gemini 3.7 Flash,針對真實工作負載進行基準測試,然後依延遲、品質與成本需求,選擇性改用 low 或 high。若你的產品需要多個 AI 供應商,也請在 CometAPI 上以相同工作負載評估,以便免重設架構比較模型。
這樣的組合——更強的代理表現、1M-token 上下文視窗、可配置推理,以及 2026 年積極的定價——使 Gemini 3.7 Flash 成為目前正打造生產級 AI 代理的開發者最有看頭的 API 發布之一。
