TL;DR
Gemini 3.6 Flash 的費率為每百萬輸入權杖 $1.50、每百萬輸出權杖 $7.50,相較 Gemini 3.5 Flash,輸出單價更低,且據報在程式開發與代理表現上更佳。生產環境建議:將需要複雜推理與代理的任務交給 3.6 Flash,將較簡單、批量大的工作路由到更便宜的 Gemini 3.5 Flash-Lite。
Gemini 3.6 Flash 不僅僅是一次模型 ID 的更新。
對已使用 Gemini 3.5 Flash 的開發者而言,更大的變化在於經濟性。Google 將輸入價格維持在每百萬權杖 $1.50,並把輸出價格從 $9.00 降至 $7.50,同時在多項程式與代理式基準測試上回報更佳表現。
實務上的問題在於,這些改進是否足以支撐將生產工作負載遷移過去。
答案取決於工作負載。程式代理、多模態分析與多步驟工具使用可能比單純抽取或分類受益更多。遷移也需要一些 API 相容性檢查;如果只更換模型名稱,這些檢查很容易被忽略。
本指南涵蓋 Gemini 3.6 Flash 的 API 定價、免費層存取、基準結果、遷移變更、Python 範例,以及在切換生產流量前應該測試的項目。
什麼是 Gemini 3.6 Flash?
Gemini 3.6 Flash 是 Google 的新一代 Flash 模型,面向程式開發、多模態推理與多步驟代理工作流程。於 2026 年 7 月 21 日發布,旨在服務需要更強推理與代理表現、同時仍屬於 Google Flash 模型層級的生產工作負載。
其主要規格包括:
| 項目 | Gemini 3.6 Flash |
|---|---|
| 模型 ID | gemini-3.6-flash |
| 標準輸入單價 | $1.50 / 1M tokens |
| 標準輸出單價 | $7.50 / 1M tokens |
| 標準快取輸入單價 | $0.15 / 1M tokens |
| 預設思考層級 | medium |
| 輸入上下文 | 1,048,576 tokens |
| 最大輸出 | 65,536 tokens |
| 輸入 | 文字、影像、影片、音訊、PDF |
| 輸出 | 文字 |
| 最適用於 | 程式開發、多模態推理、複雜代理 |
Google 將 Gemini 3.6 Flash 定位於諸如程式開發、空間與多模態推理,以及多步驟代理任務等工作負載。
該模型亦支援函式呼叫、結構化輸出、程式碼執行、上下文快取、File Search、URL 內容、Google Search grounding 與 Google Maps grounding 等功能。
你可以在 Google 的最新 Gemini 模型指南中查看最新規格與遷移指引。
對於來自前一代的開發者,CometAPI 的 Gemini 3.5 Flash API 指南可作為有用的整合基線。
Gemini 3.6 Flash API 要花多少錢?
Gemini 3.6 Flash 在 Google 的標準付費層為每百萬輸入權杖 $1.50與每百萬輸出權杖 $7.50。
與 Gemini 3.5 Flash 相比,輸入價格不變;輸出價格由每百萬 $9.00 降至 $7.50,降幅 16.7%。
Google 另提供 Batch、Flex 與 Priority 三種處理模式。
| Gemini 3.6 Flash 方案 | 輸入 / 1M | 快取輸入 / 1M | 輸出 / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
重要:** 思考權杖按輸出權杖費率計費。因此,即使可見回應很短,實際可計費的輸出權杖數也可能比最終答案的字數所暗示的更多。
對於反覆傳送相同大型系統提示、程式庫內容、文件集合或對話歷史的應用程式,上下文快取也能帶來顯著差異。
在標準付費層中,Gemini 3.6 Flash 的快取輸入費率為每百萬權杖 $0.15,相較於一般輸入的 $1.50。
範例:15,000 個輸入權杖 + 8,000 個輸出權杖
考慮一個使用 15,000 個輸入權杖與 8,000 個輸出權杖的任務。
| 模型 | 預估成本 |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash(在相同權杖用量下) | $0.0825 |
| Gemini 3.6 Flash(輸出權杖減少 17%) | $0.0723 |
| Gemini 3.5 Flash-Lite(在相同權杖用量下) | $0.0245 |
在權杖用量相同的情況下,此範例中 Gemini 3.6 Flash 約便宜 12.7%。
Google 亦回報 Gemini 3.6 Flash 在 Artificial Analysis Index 上的輸出權杖使用減少 17%。若生產工作負載能重現該降幅,則此範例的模型化節省可提升至約23.5%。
另據 Google 報告,在 DeepSWE 上輸出權杖最多可減少65%。這些數字衡量的是不同工作負載,不能互相替代:17% 指的是 Artificial Analysis Index,而 65% 來自特定的程式基準。
基本權杖成本計算為:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
對於代理而言,實際成本更廣泛:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
這也是為什麼按權杖計價最便宜的模型,未必是完成任務總成本最低的模型。
Gemini 3.6 Flash 是否免費?
是。依據 Google 目前的 Gemini Developer API 定價,Gemini 3.6 Flash 的標準使用提供免費層存取。
免費層可用不代表無限的生產能力。API 限制取決於專案與使用層級,因此開發者應檢視套用於自身專案的速率限制,而非依賴第三方文章中的固定每分鐘請求數。
進行生產規劃時,請參考 Google 目前的Gemini API 定價與速率限制文件來估算容量。
開發者可透過 Gemini API 與 Google AI Studio 存取 Gemini 3.6 Flash。使用統一多模型工作流程的團隊,也可透過 CometAPI 的 Gemini 3.6 Flash 模型頁測試該模型。
Gemini 3.6 Flash 與 Gemini 3.5 Flash 有何差異?
Google 發布的結果顯示,在程式開發、代理式執行、電腦操作與知識工作上進步最大。
| 基準 | Gemini 3.6 Flash | Gemini 3.5 Flash | 變化 |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 百分點 |
| MLE-Bench | 63.90% | 49.70% | +14.2 百分點 |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 百分點 |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google 亦表示,與 Gemini 3.5 Flash 相比,Gemini 3.6 Flash 能以更少的推理步驟、對話輪次與工具呼叫完成多步驟工作流程。
該公司回報:
- 在 Artificial Analysis Index 上輸出權杖減少 17%。
- 在 DeepSWE 上輸出權杖最多減少 65%。
- 不必要的程式碼修改與執行迴圈更少。
- 多模態與空間推理有所提升。
原始結果請見 Google 的Gemini 3.6 Flash 發佈公告。
這些基準使 3.6 Flash 成為值得評估的強力候選,特別是對於一次請求可能演變為多輪推理、工具呼叫與修正的工作負載。
然而,這些結果不應取代在你自身應用上的測試。
Google 亦指出,3.6 Flash 在進行程式碼變更前,可能會先做更多的程式化檢視。在大型程式庫上,這有助於提升準確性;但對於範圍狹窄的前端修改,可能只會增加不必要的探索。
清楚的檔案邊界、驗收標準與實作說明仍然關鍵。
Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite:該用哪一個?
一旦你決定值得測試 3.6 Flash,下一個問題是是否每個請求都需要它。
對許多生產系統而言,答案往往是否定的。
Gemini 3.5 Flash-Lite 更為便宜,對於可預期的高量工作負載可作為更佳的預設選擇。
| 項目 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| 標準輸入單價 | $1.50 / 1M tokens | $0.30 / 1M tokens |
| 標準輸出單價 | $7.50 / 1M tokens | $2.50 / 1M tokens |
| 標準快取輸入單價 | $0.15 / 1M tokens | $0.03 / 1M tokens |
| 預設思考層級 | medium | minimal |
| 最適用於 | 複雜推理、程式開發、代理 | 抽取、路由、分類 |
在標準定價下,Flash-Lite 的輸入費率便宜5 倍,輸出費率便宜3 倍,相較於 Gemini 3.6 Flash。
下列情境可優先採用 Gemini 3.5 Flash-Lite:
- 分類
- 請求路由
- JSON 與結構化抽取
- 文件處理
- 資料轉換
- 大規模翻譯
- 輕量子代理
- 高量且可重複的任務
一個務實的路由策略可能如下:
| 工作負載 | 首選路由 | 升級處理 |
|---|---|---|
| 分類或路由 | Gemini 3.5 Flash-Lite | 驗證失敗後升級至 3.6 Flash |
| 結構化抽取 | Gemini 3.5 Flash-Lite | 複雜文件改用 3.6 Flash |
| 輕量子代理 | Gemini 3.5 Flash-Lite | 提高思考層級或使用 3.6 Flash |
| 多檔案程式開發 | Gemini 3.6 Flash | 若未解決則升級至更強後備 |
| 複雜工具工作流程 | Gemini 3.6 Flash | 工具或驗證失敗後使用後備 |
| 多模態推理 | Gemini 3.6 Flash | 依任務情境選擇後備 |
對於混合的生產流量,更有用的指標是:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
若第一次呼叫很便宜,但多次失敗且最終仍需較強模型,吸引力就會降低。
反之亦然。如果 Flash-Lite 已能滿足所需準確度,就沒有理由將數百萬筆可預期的分類請求送往 Gemini 3.6 Flash。
若你的應用需要此類路由,請參見我們的指南:透過相容 OpenAI 的基底 URL 呼叫多個 AI 模型。
遷移到 Gemini 3.6 Flash 時會有哪些變更?
從 Gemini 3.5 Flash 遷移到 Gemini 3.6 Flash,遠不只是替換模型 ID。
在切換生產流量前,開發者應檢視五個區域:已棄用的採樣參數、思考控制、candidate_count、預填的模型輪次,以及函式呼叫狀態。
1. 移除 temperature、top_p 與 top_k
Google 已在 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 中棄用這些採樣控制:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
新模型目前會忽略這些參數。Google 表示未來的 Gemini 模型世代在收到這些參數時,可能會回傳 HTTP 400 錯誤。
若需可預期的輸出格式,請改以更明確的系統指示與結構化輸出達成。
2. 以 thinking_level 取代 thinking_budget
Gemini 3.6 Flash 的預設思考層級為 medium。
Google 的遷移指引建議,將數值型的 thinking_budget 設定改為 thinking_level。
Gemini 3.5 Flash-Lite 的預設為 minimal,適用於許多高量的抽取、分類與路由工作負載。
當任務涉及多步驟推理、程式碼執行或工具使用時,應測試較高的思考層級。
3. 移除 candidate_count
Google 將 candidate_count 列為 Gemini 3.x 不支援的項目。
在多個模型共用相同產生設定時,這點很容易被忽略。請在遷移生產請求前移除。
4. 停止預填模型輪次
請求不再能以非空的 model 角色輪次作結。
舊版應用可能使用如下的負載:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
該模式現在可能回傳 HTTP 400。
若先前用預填來強制答案格式,請將要求移入 system_instruction,或改用結構化輸出。
5. 重新測試函式呼叫與多輪狀態
使用工具的代理需要獨立的遷移測試。
Google 建議在 Interactions API 中使用 previous_interaction_id 來進行伺服器端多輪狀態管理。
在回傳函式結果時,請同時保留函式名稱與原始呼叫 ID:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
使用 generateContent 的應用亦應驗證其 FunctionResponse 載荷,並在遷移後監控工具呼叫錯誤。
詳見 Google 的最新模型遷移指南與函式呼叫文件以取得最新實作細節。
如何在 Python 中呼叫 Gemini 3.6 Flash?
安裝或更新 Google 的 GenAI SDK:
pip install -U google-genai
設定你的 API 金鑰:
export GEMINI_API_KEY="your-api-key"
接著呼叫 Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
若任務需要更多推理,可設定思考層級:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
主要的遷移差異可總結如下:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
不要假設較高的思考層級一定更好。請在你的任務上測量延遲、權杖消耗與完成率。
在上線前該如何測試 Gemini 3.6 Flash?
你不需要龐大的公開基準套件就能判斷 Gemini 3.6 Flash 是否適合納入生產堆疊。
更好的起點是挑選 30-50 個與實際流量相似的近期任務。
涵蓋下列混合類型:
- 程式開發與除錯
- 多步驟工具使用
- 多模態文件
- 資料抽取
- 分類與路由
將相同輸入分別送往:
- 你目前的生產模型
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
保持提示、工具、驗證器與驗收標準不變。
追蹤:
- 輸入權杖
- 輸出與思考權杖
- 延遲
- 工具呼叫
- 重試
- 函式呼叫錯誤
- 驗證器通過率
- 人工修正時間
- 最終任務成功
接著比較產生被接受結果所需的總成本。
一個花費 $0.08 且一次成功的程式請求,可能比花 $0.02 但失敗兩次、最終仍需升級的請求更便宜。
同時,如果只是簡單的分類任務,而 Flash-Lite 已能穩定處理,為其支付 Gemini 3.6 Flash 的價格就沒有意義。
目標不是為所有請求找到同一模型,而是在只有更強模型才會改變結果的地方才使用它。
開發者可透過 CometAPI,使用相同的評估集合比較目前的Gemini 3.6 Flash與Gemini 3.5 Flash-Lite路由。
常見問題
Gemini 3.6 Flash API 的費用是多少?
Google 的標準付費費率為每百萬輸入權杖 $1.50與每百萬輸出權杖 $7.50。標準快取輸入為 $0.15/M。Batch 與 Flex 為 $0.75/M 輸入與 $3.75/M 輸出。
Gemini 3.6 Flash 是否免費?
是。Google 目前的 Gemini Developer API 定價列出 Gemini 3.6 Flash 的免費層標準使用。免費存取仍受專案與使用層級的速率限制約束。
Gemini 3.6 Flash 是否已全面提供?
是。Google 於 2026 年 7 月 21 日發布 gemini-3.6-flash,並在 Gemini API 文件中列為生產模型。
Gemini 3.6 Flash 的上下文視窗是多少?
Gemini 3.6 Flash 支援最多1,048,576 個輸入權杖與65,536 個輸出權杖。可接受文字、影像、影片、音訊與 PDF 輸入,並產出文字輸出。
Gemini 3.6 Flash 比 Gemini 3.5 Flash 更便宜嗎?
對輸出權杖而言是的。兩者的標準輸入單價皆為 $1.50/M,而 Gemini 3.6 Flash 的輸出單價自 $9.00/M 降至 $7.50/M。
我該用 Gemini 3.6 Flash 還是 Gemini 3.5 Flash-Lite?
當程式品質、多模態推理或複雜代理執行可降低失敗與重試時,使用 Gemini 3.6 Flash。對於高量抽取、分類、路由與其他可預期工作負載,先從成本更低的 Flash-Lite 開始。
遷移到 Gemini 3.6 Flash 前應更改哪些設定?
移除 temperature、top_p、top_k 與 candidate_count;以 thinking_level 取代 thinking_budget;移除預填的模型輪次;重新測試函式呼叫與多輪狀態管理。
結論
若你已使用 Gemini 3.5 Flash 處理程式、多模態或代理工作流程,Gemini 3.6 Flash 值得進行基準測試。
其輸出單價更低,且 Google 的早期結果顯示,有些工作負載可能也需要更少的權杖與更少的執行步驟。對於反覆推理、呼叫工具並重試失敗動作的代理而言,這些節省往往比標價差異更重要。
但這並不表示所有請求都該切換到 3.6 Flash。
Gemini 3.5 Flash-Lite 便宜許多,對於抽取、分類、路由等可預期工作往往已足夠。
較佳的生產策略是:在經濟上合理的地方使用各自的模型——簡單、高量任務用 Flash-Lite;需要更強推理以提升一次成功機率的任務用 3.6 Flash。
接著衡量真正重要的結果——獲得被接受答案的總成本。
若要在相同工作流程中比較兩者,請參見 CometAPI 的 Gemini 3.6 Flash 模型頁與Gemini 3.5 Flash-Lite 模型頁,或檢視 CometAPI 定價頁面上的最新模型路由。
