Gemini 3.5 Flash-Lite 的技術規格
| 項目 | Gemini 3.5 Flash-Lite |
|---|---|
| 提供方 | Google DeepMind |
| 模型 ID | gemini-3.5-flash-lite |
| 模型系列 | Gemini 3.5 |
| 可用性 | 一般可用性(GA) |
| 輸入類型 | 文字、影像、影片、音訊、PDF |
| 輸出類型 | 文字 |
| 上下文視窗 | 1,048,576 tokens |
| 最大輸出 | 65,536 tokens |
| 思考 | 支援(預設:minimal;亦支援 medium 與 high) |
| 函式呼叫 | 是 |
| 程式碼執行 | 是 |
| 檔案搜尋 | 是 |
| URL 上下文 | 是 |
| 搜尋佐證 | 是 |
| 結構化輸出 | 是 |
| 電腦操作 | 不支援 |
| 快取 | 支援 |
| 主要重點 | 高吞吐量、低延遲、低成本推論 |
什麼是 Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite 是 Google 在 Gemini 3.5 系列中速度最快且成本效益最高的模型。它針對延遲、吞吐量與 API 成本比極致推理表現更重要的工作負載進行最佳化。典型應用包括文件解析、結構化資料擷取、路由、輕量程式撰寫,以及大規模運行的自主子代理。Google 將其定位為從 Gemini 3.1 Flash-Lite 與 Gemini 2.5 Flash 升級至生產部署的推薦路徑。
Gemini 3.5 Flash-Lite 的主要功能
- 為高量、低成本推論最佳化。
- 支援 1 百萬 token 的上下文視窗,可處理長文件與儲存庫。
- 原生多模態輸入,包括文字、影像、影片、音訊與 PDF。
- 支援 Function Calling、Code Execution、File Search、URL Context、Search Grounding 與 Structured Outputs。
- 可設定思考等級(
minimal、medium、high),在速度與推理品質間取得平衡。 - 在維持極低延遲的同時,相較 Gemini 3.1 Flash-Lite,大幅提升程式撰寫、推理與代理式工作流程。
Gemini 3.5 Flash-Lite 的基準測試表現
Google 表示,Gemini 3.5 Flash-Lite 在程式撰寫、文件理解與代理式工作流程方面,較先前的 Flash-Lite 世代有大幅提升,同時仍是 Gemini 3.5 系列中成本最低的模型。Gemini 3.5 Flash-Lite 在 Terminal-Bench 2.1 測試中取得 54% 的成績,較其前代的 31% 有顯著提升。
其強項在於分類、擷取、對話回覆與簡單的檢索增強回答,這些正是快速、低成本模型所擅長的領域。
Gemini 3.5 Flash-Lite 與 Gemini 3.6 Flash、Gemini 3.5 Flash 的比較
| 面向 | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| 定位 | 面向高量日常任務(如文件處理、搜尋)的最快且成本最低選擇 | 目前的 Flash 旗艦:在智能、效率與代理表現間取得最佳平衡 | 強大的代理/程式能力模型(現已大多被 3.6 取代) |
| 最適用於 | 高吞吐、低成本的工作流程 | 程式撰寫、多模態、複雜代理、知識型工作 | 一般代理與程式相關任務 |
| 智能/效能 | 良好(超越舊款 Lite;在多數代理任務具競爭力) | 三者中最高(在程式與代理方面有明顯提升) | 強勁(在 Flash 系列中接近前沿) |
| 主要基準 | - Terminal-Bench: ~54% - 在文件與高量任務上表現強勁 | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2% - 多數程式/代理面向低於 3.6 |
| 速度 | 最快(~350 輸出 token/秒) | 非常快(~280 t/s) | 快 |
| 效率 | 對大量任務表現卓越 | 最佳(平均輸出 token 減少 17%;在程式任務最高可達 65%) | 良好 |
| 多模態 | 文字 + 影像 + 影片 + 音訊 | 文字 + 影像 + 影片 + 音訊(更強推理) | 文字 + 影像 + 影片 + 音訊 |
| 上下文視窗 | ~1M tokens | ~1M tokens | ~1M tokens |
| 最大輸出 Token 數 | ~64k | ~64k | ~64k |
| 定價(每 1M tokens) | 最便宜:~$0.30 input / $2.50 output | $1.50 input / $7.50 output | $1.50 input / $9.00 output |
| 有效成本 | 在簡單任務上最低 | 因效率提升而低於 3.5 | 高於 3.6 |
摘要建議
- 請選擇 3.5 Flash-Lite — 當你需要在高量或簡單任務上達到最高速度與最低成本。
- 請選擇 3.6 Flash — 適合大多數使用者與開發者(目前的整體最佳選擇)。
- 請選擇 3.5 Flash — 僅在你已有與其綁定的工作流程時使用(規劃升級至 3.6)。
Gemini 3.5 Flash-Lite 的限制
- 著重效率而非前沿級推理能力。
- 不支援電腦操作(Computer Use)。
- 不支援原生影像與音訊生成。
- 目前不支援微調。
- 複雜的多步驟推理任務通常更適合 Gemini 3.5 Flash 或 Gemini 3.6 Flash。