TLDR Google 最新的 Gemini 發布並非久候的 Gemini 3.5 Pro。相反,Google 釋出了三個以效率為重的模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及 Gemini 3.5 Flash Cyber。實務訊息很清楚:在旗艦 Pro 模型仍在測試期的同時,Google 正優先考量代理的經濟性、延遲、token 效率,以及專門的安全自動化。
對開發者而言,最佳做法不是被動等待 Gemini 3.5 Pro。將 Gemini 3.6 Flash 作為複雜代理與程式設計工作流程的預設升級候選,將 Gemini 3.5 Flash-Lite 用於高量提取與路由,並為前沿推理任務保留跨模型的回退策略。CometAPI 透過一個相容 OpenAI 的 API 金鑰提供對 500+ 模型的統一存取,因此可以在不重建整合的前提下,讓 Gemini 與 GPT、Claude、DeepSeek、Kimi、Qwen 及其他模型並行測試。
重要重點
- Google 宣布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber 於 2026 年 7 月 21 日推出。此次並未發布 Gemini 3.5 Pro。Google 表示該模型正與合作夥伴測試,準備就緒後將廣泛提供。
- Gemini 3.6 Flash 已在 Gemini API、Google AI Studio、Gemini Enterprise Agent Platform、Gemini app,以及 Google Antigravity 一般可用。Gemini 3.5 Flash-Lite 在 Gemini API 一般可用,目標是高吞吐、低成本工作流程。
- Gemini 3.5 Flash Cyber 為限量存取,設計用於在 CodeMender 中進行弱點檢測、驗證與修補。
- Google 報告 Gemini 3.6 Flash 在 Artificial Analysis 上比 3.5 Flash 少用 17% 的輸出 token,在 DeepSWE 風格測試中最多少用 65% 的輸出 token。
- Artificial Analysis 獨立報告Gemini 3.6 Flash 的 Intelligence Index 分數為 50,輸出速度 251.3 token/s,平均任務成本從 $0.59 降至 $0.50(相較 Gemini 3.5 Flash)。
- DeepSWE 列示 Gemini 3.6 Flash 的 pass@1 為 49%,平均每項任務成本 $3.53;相較之下,Gemini 3.5 Flash 的 pass@1 為 37%,平均每項任務成本 $7.34。
- CometAPI 目前列示 Gemini 3.6 Flash 為 $1.20/M 輸入、$6.00/M 輸出,Gemini 3.5 Flash-Lite 為 $0.24/M 輸入、$2.016/M 輸出。在產品 UI 公佈價格前請先查看即時儀表板。
Google 釋出了什麼?
Gemini 3.6 Flash
Gemini 3.6 Flash 是此次發布對一般開發者最重要的模型。它是一個穩定的 Flash 等級模型,面向生產代理、程式設計、多模態工作流程、文件分析、長上下文推理與知識型工作。
Google 將 Gemini 3.6 Flash 描述為能提升程式設計、知識型工作與多模態表現、同時改善 token 效率的工作馬模型。官方 Gemini API 頁面指出該模型為代理時代而設,特別適合快速程式設計與迭代循環。
模型的公開 ID 為:
gemini-3.6-flash
核心規格請參見 Gemini 3.6 Flash 模型頁面。
Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite 是此次發布中的效率模型。Google 將其定位為最快且最具成本效益的 3.5 級模型,優化於高吞吐執行、文件剖析、翻譯、分類、路由與簡單資料提取。
模型的公開 ID 為:
gemini-3.5-flash-lite
核心規格請參見 Gemini 3.5 Flash-Lite 模型 頁面。
關鍵差異不在上下文視窗。Flash-Lite 保持與 3.6 Flash 相同的 1M 輸入與 64K 輸出配置。差異在於路由意圖:Flash-Lite 針對吞吐與成本控管;3.6 Flash 則用於較困難、品質與工具可靠性更重要的任務。
Gemini 3.5 Flash Cyber
Gemini 3.5 Flash Cyber 是一個建立在 Gemini 3.5 Flash 之上、針對弱點探索、驗證與修補生成而微調的專業資安模型。
這不是一般的公開 API 模型。Google 表示它將透過 CodeMender 作為限量存取的試點計畫供政府與受信任的合作夥伴使用。這項限制對開發者很重要:若非該試點或經審核的防禦性安全計畫的一員,請勿將公開 SaaS 路線圖建立在對 Flash Cyber 的直接存取上。
該模型仍然重要,因為它展示了 Google 對 Gemini 的方向:由代理基礎設施協調的高效率專家模型。Google 並非讓一個前沿模型包辦所有事情,而是打造更小型的專業系統,以較低成本進行重複掃描、整合報告、並修補程式碼。
是否應該略過 Gemini 3.5 Pro?
實務答案
對多數生產團隊而言,是的:請現在就開始評估 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite,而非等待 Gemini 3.5 Pro 或 Gemini 4 Pro。
這不代表 Gemini 3.5 Pro 不重要。它意指最新可用的模型已覆蓋大量高量 AI 工作負載:程式設計代理、檢索代理、文件工作流程、多模態剖析、資料提取、提示路由、UI 自動化、長上下文審閱,以及代理子任務執行。
Google 自家公告表示 Gemini 3.5 Pro 仍在與合作夥伴測試,準備就緒後將廣泛發布。即使尚無公開的 gemini-3.5-pro API 模型頁面、最終定價表或模型卡,也能從今天開始改善生產經濟性。
何時仍應等待 Gemini 3.5 Pro
若你的工作負載對前沿推理的需求高於吞吐量,仍應關注 Gemini 3.5 Pro 或 Gemini 4 Pro。例子包括進階研究綜整、高度複雜的多檔工程、困難的數學、科學推理、高風險的企業分析,以及在經過仔細的提示與工具設計後,Flash 模型仍失敗的任務。
最強的模型策略不是「等 Pro」或「用 Flash 取代一切」,而是分層路由:
- 使用 Gemini 3.5 Flash-Lite 處理低成本、高量的子任務。
- 使用 Gemini 3.6 Flash 進行程式設計、多模態分析、文件審閱、長上下文綜整與代理式工作流程。
- 透過 CometAPI 將最困難或最高風險的請求路由至前沿推理模型。
- 當 Google 與 CometAPI 提供時,將 Gemini 3.5 Pro 納入基準測試組。
Gemini 3.6 Flash 基準:有哪些改進?
Google DeepMind 基準表
Google DeepMind 的 Gemini 3.6 Flash 頁面列示以下與 Gemini 3.5 Flash 的比較:
| 基準測試 | 衡量內容 | Gemini 3.6 Flash | Gemini 3.5 Flash | 變化 |
|---|---|---|---|---|
| SWE-Bench Pro | 多樣化代理式程式設計任務 | 58.7% | 55.1% | +3.6 點 |
| DeepSWE v1.1 | 長周期軟體工程 | 49% | 37% | +12 點 |
| Terminal-Bench 2.1 | 代理式終端程式設計 | 78.0% | 76.2% | +1.8 點 |
| MLE-Bench | 機器學習工程 | 63.9% | 49.7% | +14.2 點 |
| GDPval-AA v2 | 知識工作 Elo | 1421 | 1349 | +72 Elo |
| OSWorld-Verified | 代理式電腦操作 | 83.0% | 78.4% | +4.6 點 |
| CharXiv reasoning, no tools | 圖表與資訊綜整 | 85.2% | 84.2% | +1.0 點 |
| CharXiv reasoning, with tools | 圖表與資訊綜整 | 89.4% | 84.9% | +4.5 點 |
| GDM-MRCR v2, 128K average | 長上下文檢索 | 91.8% | 77.3% | +14.5 點 |
| GDM-MRCR v2, 1M pointwise | 長上下文檢索 | 54.0% | 26.6% | +27.4 點 |
最大幅度的提升恰好出現在對代理重要的領域:長周期程式設計、機器學習工程、長上下文檢索與電腦操作。在 Terminal-Bench 與 CharXiv 的小幅提升顯示這並非一個「全面翻倍」的版本,而是一個在可靠性、token 效率與困難的多步執行上進行精準強化的版本。
來自 Artificial Analysis 的獨立數據
Artificial Analysis 提供了對廠商基準表的有用補充。其 2026 年 7 月的文章指出,Gemini 3.6 Flash 與 Gemini 3.5 Flash 的 Intelligence Index 分數相同:50。這很重要,因為這表示 Gemini 3.6 Flash 並非必然是原始「智力」的大躍進。
最大的改善是效率:
| 指標 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Artificial Analysis Intelligence Index | 50 | 50 |
| 每個任務的平均耗時 | 1.3 分鐘 | 2.7 分鐘 |
| 每個任務的平均成本 | $0.50 | $0.59 |
| 輸出速度 | 251.3 token/s | 未列於此表 |
| 首個 token 時間 | 14.00s | 未列於此表 |
因此最佳的標題不是「Gemini 3.6 Flash 比所有東西都更聰明」。更準確的標題是:Gemini 3.6 Flash 讓代理工作負載在不犧牲 Gemini 3.5 Flash 智能水平的前提下,更便宜且更快。
DeepSWE:長周期程式設計數據
Datacurve 的 DeepSWE 特別重要,因為它聚焦於原創的長周期軟體工程任務。其排行榜涵蓋 91 個版本庫、5 種語言的 113 項任務。
在 2026 年 7 月 21 日的排行榜:
| 模型 | Pass@1 | 平均成本 | 輸出 token | 代理步數 |
|---|---|---|---|---|
| Gemini 3.6 Flash high | 49% ±5 | $3.53 | 97K | 108 |
| Gemini 3.5 Flash medium | 37% ±2 | $7.34 | 276K | 86 |
最有趣的數字不只是 12 點的 pass@1 提升,而是輸出 token 的下降:97K 對 276K。這約等於少了 65% 的輸出 token,與 Google 的發布主張相符。對程式設計代理而言,更少的輸出 token 可能意味著更少漂移、更少冗長的修復迴圈、更低的上下文汙染,以及更低的每項完成問題成本。

來源:Gemini
Gemini 3.5 Flash-Lite 基準:為何重要
Flash-Lite 是吞吐量模型
Gemini 3.5 Flash-Lite 專為高量執行而設。當系統需要處理數千或數百萬個小型或中型任務時,這是應測試的模型:
- 收據提取,
- 產品目錄剖析,
- 文件分塊標記,
- 翻譯,
- 分類,
- 搜尋結果綜整,
- 查詢改寫,
- 工具調用路由,
- 輕量程式設計任務,
- 代理子任務執行,
- 多模態資料提取。
Google 表示,依據 Artificial Analysis,Flash-Lite 可達到每秒 350 個輸出 token,且在標準 Gemini API 層級的定價為每 1M 輸入 token $0.30、每 1M 輸出 token $2.50。
Flash-Lite 與 Gemini 3.1 Flash-Lite 的比較
Google DeepMind 的模型卡顯示相較於 Gemini 3.1 Flash-Lite 有重大提升:
| 基準測試 | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite | 變化 |
|---|---|---|---|
| SWE-Bench Pro | 54.2% | 38.3% | +15.9 點 |
| Terminal-Bench 2.1 | 54.0% | 31.0% | +23.0 點 |
| MLE-Bench | 39.2% | 22.0% | +17.2 點 |
| GDPval-AA v2 | 1140 | 642 | +498 Elo |
| OSWorld-Verified | 74.0% | 54.3% | +19.7 點 |
| CharXiv, no tools | 74.5% | 73.2% | +1.3 點 |
| CharXiv, with tools | 76.5% | 75.6% | +0.9 點 |
| GDM-MRCR v2, 128K average | 72.2% | 60.1% | +12.1 點 |
| GDM-MRCR v2, 1M pointwise | 21.3% | 12.3% | +9.0 點 |
Artificial Analysis 也報告 Intelligence Index 從 Gemini 3.1 Flash-Lite 的 25 提升至 Gemini 3.5 Flash-Lite 的 36,同時每項任務耗時從 1.0 分鐘降至 0.6 分鐘。取捨在於,由於新模型定價高於 3.1 Flash-Lite,該基準集的每項任務成本從 $0.04 增至 $0.09。

來源:Gemini
若品質的改善能降低下游重試、人工作業或升級至更昂貴模型的需求,這樣的取捨是可接受的。若你的工作負載已被 Gemini 3.1 Flash-Lite 完美解決,則吸引力較低。請在全面遷移流量前先測試。
此次 Gemini 發布的意義
從「最大模型」轉向「最佳主力」的趨勢獲得驗證
AI 市場經常著眼於前沿旗艦模型。Gemini 3.6 Flash 指向不同方向:生產級 AI 系統需要可靠、快速、具成本效益的模型,能在不浪費的情況下完成大量真實任務。
這也是為何此次發布強調 token 效率、更少工具調用、更低延遲與更少修訂迴圈。對開發者而言,這些不是次要指標。它們決定了 AI 代理能否在不讓財務團隊驚訝的情況下擴大運行。
在 Gemini 3.5 Pro 等待期間,Google 提供了更強的生產模型
Gemini 3.5 Pro 仍在合作夥伴測試中。Google 沒有等待 Pro,而是釋出更強的 Flash 模型以及更便宜的 Flash-Lite 模型。這為開發者提供了兩個即時選項:
- Gemini 3.6 Flash:更強的主力型智能。
- Gemini 3.5 Flash-Lite:更便宜、更快速的高量執行。
這是務實的產品策略。許多企業不需要在每次請求上使用最昂貴的模型。他們需要模型組合與路由邏輯。
讓模型路由更為重要
Gemini 3.6 Flash 不應用於所有場景;Flash-Lite 也不應如此。2026 年最好的 AI 系統將動態路由:
- 當任務簡單時先用便宜模型。
- 當推理、多模態理解或工具使用重要時使用 Gemini 3.6 Flash。
- 當請求未達信心門檻時再升級。
- 對重覆的長上下文進行快取。
- 監控每項成功任務的成本,而非僅監控每個 token 的成本。
這也是本文中最強的 CometAPI 建議:不要選一個模型作為整個 AI 策略。打造路由器,讓每個模型憑表現獲得流量。
常見問答
現在可以使用 Gemini 3.5 Pro 嗎?
在截至 2026 年 7 月的寫作時點,尚未作為一般可用的公開 Gemini API 模型。Google 表示 Gemini 3.5 Pro 正與合作夥伴測試,準備就緒後會廣泛提供。
Gemini 3.6 Flash 是否比 Gemini 3.5 Flash 更好?
對許多生產代理與程式設計工作流程而言,是的。Google 報告更佳的基準結果與更低的輸出 token 用量。Artificial Analysis 報告智能水平相近,但每項任務耗時更短、成本更低。
Gemini 3.5 Flash-Lite 最適合什麼?
Gemini 3.5 Flash-Lite 最適合高量、對延遲與成本敏感的工作負載,例如提取、分類、翻譯、搜尋、路由與子代理執行。
可以透過公開 Gemini API 使用 Gemini 3.5 Flash Cyber 嗎?
Google 將 Gemini 3.5 Flash Cyber 描述為限量存取模型,透過 CodeMender 提供給政府與受信任的合作夥伴。它並非標準的公開 API 模型。
Gemini 3.6 Flash 的費用是多少?
Google 的標準 Gemini API 定價為每 1M 輸入 token $1.50、每 1M 輸出 token $7.50。CometAPI 目前列示為 $1.20/M 輸入與 $6.00/M 輸出。生產上線前請務必驗證即時定價。
Gemini 3.5 Flash-Lite 的費用是多少?
Google 的標準 Gemini API 定價為每 1M 輸入 token $0.30、每 1M 輸出 token $2.50。CometAPI 目前列示為 $0.24/M 輸入與 $2.016/M 輸出。生產上線前請務必驗證即時定價。
開發者是否應該等待 Gemini 3.5 Pro?
多數團隊不需要等待。請現在就開始測試 Gemini 3.6 Flash(用於複雜工作流程)與 Gemini 3.5 Flash-Lite(用於高量子任務)。當公開規格、定價與供應確認後,再將 Gemini 3.5 Pro 納入基準測試組。
最終結論
Google 於 2026 年 7 月的 Gemini 發布最好被理解為一次效率發布,而非旗艦 Pro 發布。Gemini 3.6 Flash 並未抹去未來對 Gemini 3.5 Pro 的需求,但它提供了立刻有用的東西:一個一般可用、在程式設計、多模態、長上下文與代理式表現上很強、且相較 Gemini 3.5 Flash 具有更低輸出 token 成本的模型。
Gemini 3.5 Flash-Lite 則補足了生產堆疊的另一半。它是用於不需要最大推理深度的子任務的便宜、快速模型。Gemini 3.5 Flash Cyber 指向專家型防禦安全代理的未來,但其限量存取使它目前更像是策略訊號,而非一般開發者工具。
