Gemini 3.6 Flash and 3.5 Flash Lite are now live on CometAPI →

Gemini 3.6 Flash API 定價與遷移指南 (2026)

CometAPI
Mia MarenJul 22, 2026
Gemini 3.6 Flash API 定價與遷移指南 (2026)

TL;DR

Gemini 3.6 Flash 的費率為每百萬輸入權杖 $1.50、每百萬輸出權杖 $7.50,相較 Gemini 3.5 Flash,輸出單價更低,且據報在程式開發與代理表現上更佳。生產環境建議:將需要複雜推理與代理的任務交給 3.6 Flash,將較簡單、批量大的工作路由到更便宜的 Gemini 3.5 Flash-Lite。

Gemini 3.6 Flash 不僅僅是一次模型 ID 的更新。

對已使用 Gemini 3.5 Flash 的開發者而言,更大的變化在於經濟性。Google 將輸入價格維持在每百萬權杖 $1.50,並把輸出價格從 $9.00 降至 $7.50,同時在多項程式與代理式基準測試上回報更佳表現。

實務上的問題在於,這些改進是否足以支撐將生產工作負載遷移過去。

答案取決於工作負載。程式代理、多模態分析與多步驟工具使用可能比單純抽取或分類受益更多。遷移也需要一些 API 相容性檢查;如果只更換模型名稱,這些檢查很容易被忽略。

本指南涵蓋 Gemini 3.6 Flash 的 API 定價、免費層存取、基準結果、遷移變更、Python 範例,以及在切換生產流量前應該測試的項目。

什麼是 Gemini 3.6 Flash?

Gemini 3.6 Flash 是 Google 的新一代 Flash 模型,面向程式開發、多模態推理與多步驟代理工作流程。於 2026 年 7 月 21 日發布,旨在服務需要更強推理與代理表現、同時仍屬於 Google Flash 模型層級的生產工作負載。

其主要規格包括:

項目Gemini 3.6 Flash
模型 IDgemini-3.6-flash
標準輸入單價$1.50 / 1M tokens
標準輸出單價$7.50 / 1M tokens
標準快取輸入單價$0.15 / 1M tokens
預設思考層級medium
輸入上下文1,048,576 tokens
最大輸出65,536 tokens
輸入文字、影像、影片、音訊、PDF
輸出文字
最適用於程式開發、多模態推理、複雜代理

Google 將 Gemini 3.6 Flash 定位於諸如程式開發、空間與多模態推理,以及多步驟代理任務等工作負載。

該模型亦支援函式呼叫、結構化輸出、程式碼執行、上下文快取、File Search、URL 內容、Google Search grounding 與 Google Maps grounding 等功能。

你可以在 Google 的最新 Gemini 模型指南中查看最新規格與遷移指引。

對於來自前一代的開發者,CometAPI 的 Gemini 3.5 Flash API 指南可作為有用的整合基線。

Gemini 3.6 Flash API 要花多少錢?

Gemini 3.6 Flash 在 Google 的標準付費層為每百萬輸入權杖 $1.50每百萬輸出權杖 $7.50

與 Gemini 3.5 Flash 相比,輸入價格不變;輸出價格由每百萬 $9.00 降至 $7.50,降幅 16.7%。

Google 另提供 Batch、Flex 與 Priority 三種處理模式。

Gemini 3.6 Flash 方案輸入 / 1M快取輸入 / 1M輸出 / 1M
Standard$1.50$0.15$7.50
Batch$0.75$0.075$3.75
Flex$0.75$0.075$3.75
Priority$2.70$0.27$13.50

重要:** 思考權杖按輸出權杖費率計費。因此,即使可見回應很短,實際可計費的輸出權杖數也可能比最終答案的字數所暗示的更多。

對於反覆傳送相同大型系統提示、程式庫內容、文件集合或對話歷史的應用程式,上下文快取也能帶來顯著差異。

在標準付費層中,Gemini 3.6 Flash 的快取輸入費率為每百萬權杖 $0.15,相較於一般輸入的 $1.50。

範例:15,000 個輸入權杖 + 8,000 個輸出權杖

考慮一個使用 15,000 個輸入權杖與 8,000 個輸出權杖的任務。

模型預估成本
Gemini 3.5 Flash$0.0945
Gemini 3.6 Flash(在相同權杖用量下)$0.0825
Gemini 3.6 Flash(輸出權杖減少 17%)$0.0723
Gemini 3.5 Flash-Lite(在相同權杖用量下)$0.0245

在權杖用量相同的情況下,此範例中 Gemini 3.6 Flash 約便宜 12.7%

Google 亦回報 Gemini 3.6 Flash 在 Artificial Analysis Index 上的輸出權杖使用減少 17%。若生產工作負載能重現該降幅,則此範例的模型化節省可提升至約23.5%

另據 Google 報告,在 DeepSWE 上輸出權杖最多可減少65%。這些數字衡量的是不同工作負載,不能互相替代:17% 指的是 Artificial Analysis Index,而 65% 來自特定的程式基準。

基本權杖成本計算為:

Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000

對於代理而言,實際成本更廣泛:

Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs

這也是為什麼按權杖計價最便宜的模型,未必是完成任務總成本最低的模型。

Gemini 3.6 Flash 是否免費?

是。依據 Google 目前的 Gemini Developer API 定價,Gemini 3.6 Flash 的標準使用提供免費層存取。

免費層可用不代表無限的生產能力。API 限制取決於專案與使用層級,因此開發者應檢視套用於自身專案的速率限制,而非依賴第三方文章中的固定每分鐘請求數。

進行生產規劃時,請參考 Google 目前的Gemini API 定價與速率限制文件來估算容量。

開發者可透過 Gemini API 與 Google AI Studio 存取 Gemini 3.6 Flash。使用統一多模型工作流程的團隊,也可透過 CometAPI 的 Gemini 3.6 Flash 模型頁測試該模型。

Gemini 3.6 Flash 與 Gemini 3.5 Flash 有何差異?

Google 發布的結果顯示,在程式開發、代理式執行、電腦操作與知識工作上進步最大。

基準Gemini 3.6 FlashGemini 3.5 Flash變化
DeepSWE49.00%37.00%+12.0 百分點
MLE-Bench63.90%49.70%+14.2 百分點
OSWorld-Verified83.00%78.40%+4.6 百分點
GDPval-AA v21,4211,34972

Google 亦表示,與 Gemini 3.5 Flash 相比,Gemini 3.6 Flash 能以更少的推理步驟、對話輪次與工具呼叫完成多步驟工作流程。

該公司回報:

  • 在 Artificial Analysis Index 上輸出權杖減少 17%
  • 在 DeepSWE 上輸出權杖最多減少 65%
  • 不必要的程式碼修改與執行迴圈更少。
  • 多模態與空間推理有所提升。

原始結果請見 Google 的Gemini 3.6 Flash 發佈公告

這些基準使 3.6 Flash 成為值得評估的強力候選,特別是對於一次請求可能演變為多輪推理、工具呼叫與修正的工作負載。

然而,這些結果不應取代在你自身應用上的測試。

Google 亦指出,3.6 Flash 在進行程式碼變更前,可能會先做更多的程式化檢視。在大型程式庫上,這有助於提升準確性;但對於範圍狹窄的前端修改,可能只會增加不必要的探索。

清楚的檔案邊界、驗收標準與實作說明仍然關鍵。

Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite:該用哪一個?

一旦你決定值得測試 3.6 Flash,下一個問題是是否每個請求都需要它。

對許多生產系統而言,答案往往是否定的。

Gemini 3.5 Flash-Lite 更為便宜,對於可預期的高量工作負載可作為更佳的預設選擇。

項目Gemini 3.6 FlashGemini 3.5 Flash-Lite
標準輸入單價$1.50 / 1M tokens$0.30 / 1M tokens
標準輸出單價$7.50 / 1M tokens$2.50 / 1M tokens
標準快取輸入單價$0.15 / 1M tokens$0.03 / 1M tokens
預設思考層級mediumminimal
最適用於複雜推理、程式開發、代理抽取、路由、分類

在標準定價下,Flash-Lite 的輸入費率便宜5 倍,輸出費率便宜3 倍,相較於 Gemini 3.6 Flash。

下列情境可優先採用 Gemini 3.5 Flash-Lite:

  • 分類
  • 請求路由
  • JSON 與結構化抽取
  • 文件處理
  • 資料轉換
  • 大規模翻譯
  • 輕量子代理
  • 高量且可重複的任務

一個務實的路由策略可能如下:

工作負載首選路由升級處理
分類或路由Gemini 3.5 Flash-Lite驗證失敗後升級至 3.6 Flash
結構化抽取Gemini 3.5 Flash-Lite複雜文件改用 3.6 Flash
輕量子代理Gemini 3.5 Flash-Lite提高思考層級或使用 3.6 Flash
多檔案程式開發Gemini 3.6 Flash若未解決則升級至更強後備
複雜工具工作流程Gemini 3.6 Flash工具或驗證失敗後使用後備
多模態推理Gemini 3.6 Flash依任務情境選擇後備

對於混合的生產流量,更有用的指標是:

Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks

若第一次呼叫很便宜,但多次失敗且最終仍需較強模型,吸引力就會降低。

反之亦然。如果 Flash-Lite 已能滿足所需準確度,就沒有理由將數百萬筆可預期的分類請求送往 Gemini 3.6 Flash。

若你的應用需要此類路由,請參見我們的指南:透過相容 OpenAI 的基底 URL 呼叫多個 AI 模型

遷移到 Gemini 3.6 Flash 時會有哪些變更?

從 Gemini 3.5 Flash 遷移到 Gemini 3.6 Flash,遠不只是替換模型 ID。

在切換生產流量前,開發者應檢視五個區域:已棄用的採樣參數、思考控制、candidate_count、預填的模型輪次,以及函式呼叫狀態。

1. 移除 temperaturetop_ptop_k

Google 已在 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 中棄用這些採樣控制:

generation_config = {
    "temperature": 0.7,
    "top_p": 0.9,
    "top_k": 40,
}

新模型目前會忽略這些參數。Google 表示未來的 Gemini 模型世代在收到這些參數時,可能會回傳 HTTP 400 錯誤。

若需可預期的輸出格式,請改以更明確的系統指示與結構化輸出達成。

2. 以 thinking_level 取代 thinking_budget

Gemini 3.6 Flash 的預設思考層級為 medium

Google 的遷移指引建議,將數值型的 thinking_budget 設定改為 thinking_level

Gemini 3.5 Flash-Lite 的預設為 minimal,適用於許多高量的抽取、分類與路由工作負載。

當任務涉及多步驟推理、程式碼執行或工具使用時,應測試較高的思考層級。

3. 移除 candidate_count

Google 將 candidate_count 列為 Gemini 3.x 不支援的項目。

在多個模型共用相同產生設定時,這點很容易被忽略。請在遷移生產請求前移除。

4. 停止預填模型輪次

請求不再能以非空的 model 角色輪次作結。

舊版應用可能使用如下的負載:

{
  "contents": [
    {
      "role": "user",
      "parts": [{"text": "Translate 'Hello world' to Spanish."}]
    },
    {
      "role": "model",
      "parts": [{"text": "Translation:"}]
    }
  ]
}

該模式現在可能回傳 HTTP 400。

若先前用預填來強制答案格式,請將要求移入 system_instruction,或改用結構化輸出。

5. 重新測試函式呼叫與多輪狀態

使用工具的代理需要獨立的遷移測試。

Google 建議在 Interactions API 中使用 previous_interaction_id 來進行伺服器端多輪狀態管理。

在回傳函式結果時,請同時保留函式名稱與原始呼叫 ID:

final_interaction = client.interactions.create(
    model="gemini-3.6-flash",
    previous_interaction_id=interaction.id,
    tools=tools,
    input=[
        {
            "type": "function_result",
            "name": step.name,
            "call_id": step.id,
            "result": [
                {
                    "type": "text",
                    "text": json.dumps(result),
                }
            ],
        }
    ],
)

使用 generateContent 的應用亦應驗證其 FunctionResponse 載荷,並在遷移後監控工具呼叫錯誤。

詳見 Google 的最新模型遷移指南函式呼叫文件以取得最新實作細節。

如何在 Python 中呼叫 Gemini 3.6 Flash?

安裝或更新 Google 的 GenAI SDK:

pip install -U google-genai

設定你的 API 金鑰:

export GEMINI_API_KEY="your-api-key"

接著呼叫 Gemini 3.6 Flash:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=(
        "Review this migration plan and list the three "
        "highest-risk compatibility issues."
    ),
)

print(interaction.output_text)

若任務需要更多推理,可設定思考層級:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Analyze this multi-step debugging problem.",
    generation_config={
        "thinking_level": "medium",
    },
)

print(interaction.output_text)

主要的遷移差異可總結如下:

# Older shared configuration
old_config = {
    "temperature": 0.2,
    "top_p": 0.9,
    "top_k": 40,
    "candidate_count": 1,
    "thinking_budget": 4096,
}

# Gemini 3.6 Flash
new_config = {
    "thinking_level": "medium",
}

不要假設較高的思考層級一定更好。請在你的任務上測量延遲、權杖消耗與完成率。

在上線前該如何測試 Gemini 3.6 Flash?

你不需要龐大的公開基準套件就能判斷 Gemini 3.6 Flash 是否適合納入生產堆疊。

更好的起點是挑選 30-50 個與實際流量相似的近期任務。

涵蓋下列混合類型:

  1. 程式開發與除錯
  2. 多步驟工具使用
  3. 多模態文件
  4. 資料抽取
  5. 分類與路由

將相同輸入分別送往:

  • 你目前的生產模型
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash-Lite

保持提示、工具、驗證器與驗收標準不變。

追蹤:

  • 輸入權杖
  • 輸出與思考權杖
  • 延遲
  • 工具呼叫
  • 重試
  • 函式呼叫錯誤
  • 驗證器通過率
  • 人工修正時間
  • 最終任務成功

接著比較產生被接受結果所需的總成本。

一個花費 $0.08 且一次成功的程式請求,可能比花 $0.02 但失敗兩次、最終仍需升級的請求更便宜。

同時,如果只是簡單的分類任務,而 Flash-Lite 已能穩定處理,為其支付 Gemini 3.6 Flash 的價格就沒有意義。

目標不是為所有請求找到同一模型,而是在只有更強模型才會改變結果的地方才使用它。

開發者可透過 CometAPI,使用相同的評估集合比較目前的Gemini 3.6 FlashGemini 3.5 Flash-Lite路由。

常見問題

Gemini 3.6 Flash API 的費用是多少?

Google 的標準付費費率為每百萬輸入權杖 $1.50每百萬輸出權杖 $7.50。標準快取輸入為 $0.15/M。Batch 與 Flex 為 $0.75/M 輸入與 $3.75/M 輸出。

Gemini 3.6 Flash 是否免費?

是。Google 目前的 Gemini Developer API 定價列出 Gemini 3.6 Flash 的免費層標準使用。免費存取仍受專案與使用層級的速率限制約束。

Gemini 3.6 Flash 是否已全面提供?

是。Google 於 2026 年 7 月 21 日發布 gemini-3.6-flash,並在 Gemini API 文件中列為生產模型。

Gemini 3.6 Flash 的上下文視窗是多少?

Gemini 3.6 Flash 支援最多1,048,576 個輸入權杖65,536 個輸出權杖。可接受文字、影像、影片、音訊與 PDF 輸入,並產出文字輸出。

Gemini 3.6 Flash 比 Gemini 3.5 Flash 更便宜嗎?

對輸出權杖而言是的。兩者的標準輸入單價皆為 $1.50/M,而 Gemini 3.6 Flash 的輸出單價自 $9.00/M 降至 $7.50/M。

我該用 Gemini 3.6 Flash 還是 Gemini 3.5 Flash-Lite?

當程式品質、多模態推理或複雜代理執行可降低失敗與重試時,使用 Gemini 3.6 Flash。對於高量抽取、分類、路由與其他可預期工作負載,先從成本更低的 Flash-Lite 開始。

遷移到 Gemini 3.6 Flash 前應更改哪些設定?

移除 temperaturetop_ptop_kcandidate_count;以 thinking_level 取代 thinking_budget;移除預填的模型輪次;重新測試函式呼叫與多輪狀態管理。

結論

若你已使用 Gemini 3.5 Flash 處理程式、多模態或代理工作流程,Gemini 3.6 Flash 值得進行基準測試。

其輸出單價更低,且 Google 的早期結果顯示,有些工作負載可能也需要更少的權杖與更少的執行步驟。對於反覆推理、呼叫工具並重試失敗動作的代理而言,這些節省往往比標價差異更重要。

但這並不表示所有請求都該切換到 3.6 Flash。

Gemini 3.5 Flash-Lite 便宜許多,對於抽取、分類、路由等可預期工作往往已足夠。

較佳的生產策略是:在經濟上合理的地方使用各自的模型——簡單、高量任務用 Flash-Lite;需要更強推理以提升一次成功機率的任務用 3.6 Flash。

接著衡量真正重要的結果——獲得被接受答案的總成本

若要在相同工作流程中比較兩者,請參見 CometAPI 的 Gemini 3.6 Flash 模型頁Gemini 3.5 Flash-Lite 模型頁,或檢視 CometAPI 定價頁面上的最新模型路由。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多