Gemini 3.5 Flash-Lite 的技術規格
| 項目 | Gemini 3.5 Flash-Lite |
|---|---|
| 供應商 | Google DeepMind |
| 模型 ID | gemini-3.5-flash-lite |
| 模型系列 | Gemini 3.5 |
| 可用性 | General Availability (GA) |
| 輸入類型 | Text, Image, Video, Audio, PDF |
| 輸出類型 | Text |
| 上下文視窗 | 1,048,576 tokens |
| 最多輸出 | 65,536 tokens |
| 思考 | Supported (default: minimal; also medium and high) |
| 函式呼叫 | Yes |
| 程式碼執行 | Yes |
| 檔案搜尋 | Yes |
| URL 上下文 | Yes |
| 搜尋依據 | Yes |
| 結構化輸出 | Yes |
| 電腦使用 | Not supported |
| 快取 | Supported |
| 主要側重 | 高吞吐量、低延遲、低成本推理 |
什麼是 Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite 是 Google 在 Gemini 3.5 系列中速度最快、成本效益最高的模型。它專為延遲、吞吐量與 API 成本比最大化推理效能更重要的工作負載所優化。典型應用包含文件解析、結構化資料擷取、路由、輕量程式設計,以及可大規模運作的自主子代理。Google 將其定位為從 Gemini 3.1 Flash-Lite 與 Gemini 2.5 Flash 升級至生產部署的建議路徑。
Gemini 3.5 Flash-Lite 的主要功能
- 針對「高量、低成本推理」進行最佳化。
- 支援 1 million-token 的上下文視窗,適用於長文件與程式庫。
- 原生多模態輸入,包括文字、圖片、影片、音訊與 PDF。
- 支援 Function Calling、Code Execution、File Search、URL Context、Search Grounding 與 Structured Outputs。
- 可設定的思考層級(
minimal、medium、high),以在速度與推理品質間取得平衡。 - 與 Gemini 3.1 Flash-Lite 相比,顯著提升程式設計、推理與代理式工作流程,同時維持極低延遲。
Gemini 3.5 Flash-Lite 的基準測試表現
Google 表示,Gemini 3.5 Flash-Lite 在程式設計、文件理解與代理式工作流程方面,大幅超越先前的 Flash-Lite 世代,同時仍是 Gemini 3.5 系列中成本最低的模型。Gemini 3.5 Flash-Lite 在 Terminal-Bench 2.1 測試中取得 54%,相較於其前代的 31% 有顯著進步。
其強項在分類、擷取、聊天回覆,以及簡單的檢索增強回答。這正是快速、低成本模型能發揮所長之處。
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| 面向 | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| 定位 | 針對高量日常任務(如文件處理、搜尋)的最快且最便宜選擇 | 當前旗艦 Flash:在智能、效率與代理表現間達到最佳平衡 | 強大的代理/程式設計模型(現多由 3.6 取代) |
| 最適用於 | 高吞吐、低成本的工作流程 | 程式設計、多模態、複雜代理、知識型工作 | 一般代理與程式設計任務 |
| 智能 / 表現 | 良好(優於舊版 Lite;在許多代理任務上具競爭力) | 三者中最高(在程式設計與代理方面有顯著提升) | 強大(在 Flash 系列中接近前沿) |
| 關鍵基準 | - Terminal-Bench:~54%- 擅長文件與高量任務 | - DeepSWE:49% (vs 37%)- MLE-Bench:63.9% (vs 49.7%)- OSWorld:83% (vs 78.4%) | - Terminal-Bench:76.2%- 在多數程式設計/代理任務上低於 3.6 |
| 速度 | 最快(~350 個輸出 token/秒) | 非常快(~280 t/s) | 快速 |
| 效率 | 對高量工作表現極佳 | 最佳(平均輸出 token 減少 17%;在程式設計上最高可達 65%) | 良好 |
| 多模態 | 文字 + 圖片 + 影片 + 音訊 | 文字 + 圖片 + 影片 + 音訊(更強的推理) | 文字 + 圖片 + 影片 + 音訊 |
| 上下文視窗 | ~1M tokens | ~1M tokens | ~1M tokens |
| 最大輸出 token 數 | ~64k | ~64k | ~64k |
| 價格(每 1M tokens) | 最便宜:~$0.30 輸入 / $2.50 輸出 | $1.50 輸入 / $7.50 輸出 | $1.50 輸入 / $9.00 輸出 |
| 有效成本 | 在簡單工作中每次任務成本最低 | 因效率提升而低於 3.5 | 高於 3.6 |
摘要建議
- 選擇 3.5 Flash-Lite — 當你需要在高量或簡單任務中追求最高速度與最低成本時。
- 選擇 3.6 Flash — 適合大多數使用者與開發者(目前整體最佳選擇)。
- 選擇 3.5 Flash — 僅在現有流程依賴它時(並規劃升級至 3.6)。
Gemini 3.5 Flash-Lite 的限制
- 以效率為優先,而非前沿級推理能力。
- 不支援電腦使用。
- 不支援原生圖片與音訊生成。
- 目前不支援微調。
- 複雜的多步推理任務通常更適合 Gemini 3.5 Flash 或 Gemini 3.6 Flash。