Gemini 3.6 Flash and 3.5 Flash Lite are now live on CometAPI →
G

Gemini 3.5 Flash Lite

輸入:$0.24/M
輸出:$2.016/M
發布時間:Jul 21, 2026

Gemini 3.5 Flash-Lite 是一款低延遲、具成本效益的多模態模型,針對子智能體任務與文件解析的高吞吐量、低成本執行進行優化。該模型支援文字、圖片、影片、音訊與 PDF 輸入,並專為大規模的智能體化工作流程、簡單資料擷取,以及以延遲與 API 成本為主要限制的應用情境而設計。

商業用途

Gemini 3.5 Flash Lite 的 Playground

探索 Gemini 3.5 Flash Lite 的 Playground — 一個互動式環境,可測試模型並即時執行查詢。嘗試提示、調整參數,並立即迭代以加速開發並驗證使用案例。

Gemini 3.5 Flash-Lite 的技術規格

項目Gemini 3.5 Flash-Lite
提供方Google DeepMind
模型 IDgemini-3.5-flash-lite
模型系列Gemini 3.5
可用性一般可用性(GA)
輸入類型文字、影像、影片、音訊、PDF
輸出類型文字
上下文視窗1,048,576 tokens
最大輸出65,536 tokens
思考支援(預設:minimal;亦支援 medium 與 high)
函式呼叫
程式碼執行
檔案搜尋
URL 上下文
搜尋佐證
結構化輸出
電腦操作不支援
快取支援
主要重點高吞吐量、低延遲、低成本推論

什麼是 Gemini 3.5 Flash-Lite?

Gemini 3.5 Flash-Lite 是 Google 在 Gemini 3.5 系列中速度最快且成本效益最高的模型。它針對延遲、吞吐量與 API 成本比極致推理表現更重要的工作負載進行最佳化。典型應用包括文件解析、結構化資料擷取、路由、輕量程式撰寫,以及大規模運行的自主子代理。Google 將其定位為從 Gemini 3.1 Flash-Lite 與 Gemini 2.5 Flash 升級至生產部署的推薦路徑。

Gemini 3.5 Flash-Lite 的主要功能

  • 為高量、低成本推論最佳化。
  • 支援 1 百萬 token 的上下文視窗,可處理長文件與儲存庫。
  • 原生多模態輸入,包括文字、影像、影片、音訊與 PDF。
  • 支援 Function Calling、Code Execution、File Search、URL Context、Search Grounding 與 Structured Outputs。
  • 可設定思考等級(minimalmediumhigh),在速度與推理品質間取得平衡。
  • 在維持極低延遲的同時,相較 Gemini 3.1 Flash-Lite,大幅提升程式撰寫、推理與代理式工作流程。

Gemini 3.5 Flash-Lite 的基準測試表現

Google 表示,Gemini 3.5 Flash-Lite 在程式撰寫、文件理解與代理式工作流程方面,較先前的 Flash-Lite 世代有大幅提升,同時仍是 Gemini 3.5 系列中成本最低的模型。Gemini 3.5 Flash-Lite 在 Terminal-Bench 2.1 測試中取得 54% 的成績,較其前代的 31% 有顯著提升。

其強項在於分類、擷取、對話回覆與簡單的檢索增強回答,這些正是快速、低成本模型所擅長的領域。

Gemini 3.5 Flash-Lite 與 Gemini 3.6 Flash、Gemini 3.5 Flash 的比較

面向Gemini 3.5 Flash-LiteGemini 3.6 FlashGemini 3.5 Flash
定位面向高量日常任務(如文件處理、搜尋)的最快且成本最低選擇目前的 Flash 旗艦:在智能、效率與代理表現間取得最佳平衡強大的代理/程式能力模型(現已大多被 3.6 取代)
最適用於高吞吐、低成本的工作流程程式撰寫、多模態、複雜代理、知識型工作一般代理與程式相關任務
智能/效能良好(超越舊款 Lite;在多數代理任務具競爭力)三者中最高(在程式與代理方面有明顯提升)強勁(在 Flash 系列中接近前沿)
主要基準- Terminal-Bench: ~54% - 在文件與高量任務上表現強勁- DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%)- Terminal-Bench: 76.2% - 多數程式/代理面向低於 3.6
速度最快(~350 輸出 token/秒)非常快(~280 t/s)
效率對大量任務表現卓越最佳(平均輸出 token 減少 17%;在程式任務最高可達 65%)良好
多模態文字 + 影像 + 影片 + 音訊文字 + 影像 + 影片 + 音訊(更強推理)文字 + 影像 + 影片 + 音訊
上下文視窗~1M tokens~1M tokens~1M tokens
最大輸出 Token 數~64k~64k~64k
定價(每 1M tokens)最便宜:~$0.30 input / $2.50 output$1.50 input / $7.50 output$1.50 input / $9.00 output
有效成本在簡單任務上最低因效率提升而低於 3.5高於 3.6

摘要建議

  • 請選擇 3.5 Flash-Lite — 當你需要在高量或簡單任務上達到最高速度與最低成本。
  • 請選擇 3.6 Flash — 適合大多數使用者與開發者(目前的整體最佳選擇)。
  • 請選擇 3.5 Flash — 僅在你已有與其綁定的工作流程時使用(規劃升級至 3.6)。

Gemini 3.5 Flash-Lite 的限制

  • 著重效率而非前沿級推理能力。
  • 不支援電腦操作(Computer Use)。
  • 不支援原生影像與音訊生成。
  • 目前不支援微調。
  • 複雜的多步驟推理任務通常更適合 Gemini 3.5 Flash 或 Gemini 3.6 Flash。

常見問題

Gemini 3.5 Flash Lite 的定價

探索 Gemini 3.5 Flash Lite 的競爭性定價,專為滿足各種預算和使用需求而設計。我們靈活的方案確保您只需為實際使用量付費,讓您能夠隨著需求增長輕鬆擴展。了解 Gemini 3.5 Flash Lite 如何在保持成本可控的同時提升您的專案效果。

彗星價格 (USD / M Tokens)官方價格 (USD / M Tokens)折扣
輸入:$0.24/M
輸出:$2.016/M
輸入:$0.3/M
輸出:$2.52/M
-20%

Gemini 3.5 Flash Lite 的範例程式碼和 API

存取完整的範例程式碼和 API 資源,以簡化您的 Gemini 3.5 Flash Lite 整合流程。我們詳盡的文件提供逐步指引,協助您在專案中充分發揮 Gemini 3.5 Flash Lite 的潛力。

import os

from google import genai
from google.genai import types

client = genai.Client(
    api_key=os.environ["COMETAPI_KEY"],
    http_options={
        "api_version": "v1beta",
        "base_url": "https://api.cometapi.com",
        "retry_options": {"attempts": 1},
    },
)

response = client.models.generate_content(
    model="gemini-3.5-flash-lite",
    contents="Write a three.js script that renders an interactive 3D robot.",
    config=types.GenerateContentConfig(max_output_tokens=8192),
)

print(f"Response ID: {response.response_id}")
print(f"Model Version: {response.model_version}")
print(f"Finish Reason: {response.candidates[0].finish_reason}")
print(response.text)

Python Code Example

import os

from google import genai
from google.genai import types


client = genai.Client(
    api_key=os.environ["COMETAPI_KEY"],
    http_options={
        "api_version": "v1beta",
        "base_url": "https://api.cometapi.com",
        "retry_options": {"attempts": 1},
    },
)

response = client.models.generate_content(
    model="gemini-3.5-flash-lite",
    contents="Write a three.js script that renders an interactive 3D robot.",
    config=types.GenerateContentConfig(max_output_tokens=8192),
)

print(f"Response ID: {response.response_id}")
print(f"Model Version: {response.model_version}")
print(f"Finish Reason: {response.candidates[0].finish_reason}")
print(response.text)

JavaScript Code Example

import { GoogleGenAI } from "@google/genai";


const ai = new GoogleGenAI({
  apiKey: process.env.COMETAPI_KEY,
  httpOptions: {
    apiVersion: "v1beta",
    baseUrl: "https://api.cometapi.com",
    retryOptions: { attempts: 1 },
  },
});

const response = await ai.models.generateContent({
  model: "gemini-3.5-flash-lite",
  contents: "Write a three.js script that renders an interactive 3D robot.",
  config: {
    maxOutputTokens: 8192,
  },
});

console.log(`Response ID: ${response.responseId}`);
console.log(`Model Version: ${response.modelVersion}`);
console.log(`Finish Reason: ${response.candidates[0].finishReason}`);
console.log(response.text);

Curl Code Example

#!/bin/bash

curl "https://api.cometapi.com/v1beta/models/gemini-3.5-flash-lite:generateContent" \
  -H "x-goog-api-key: $COMETAPI_KEY" \
  -H 'Content-Type: application/json' \
  -X POST \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "Write a three.js script that renders an interactive 3D robot."
          }
        ]
      }
    ],
    "generationConfig": {
      "maxOutputTokens": 8192
    }
  }'

Gemini 3.5 Flash Lite的版本

Gemini 3.5 Flash Lite擁有多個快照的原因可能包括:更新後輸出結果存在差異需保留舊版快照以確保一致性、為開發者提供適應與遷移的過渡期,以及不同快照對應全球或區域端點以優化使用者體驗等潛在因素。各版本間的具體差異請參閱官方文件說明。

版本
gemini-3.5-flash-lite
gemini-3.5-flash-lite-thinking