Gemini 3.6 Flash and 3.5 Flash Lite are now live on CometAPI →
G

Gemini 3.5 Flash Lite

Đầu vào:$0.24/M
Đầu ra:$2.016/M
Ngày phát hành:Jul 21, 2026

Gemini 3.5 Flash-Lite là một mô hình đa phương thức có độ trễ thấp, hiệu quả về chi phí, được tối ưu hóa cho thực thi thông lượng cao với chi phí thấp trong các tác vụ tác tử phụ và phân tích tài liệu. Mô hình hỗ trợ đầu vào văn bản, hình ảnh, video, âm thanh và PDF, và được thiết kế cho các quy trình làm việc dựa trên tác tử với khối lượng lớn, trích xuất dữ liệu đơn giản, và các ứng dụng mà độ trễ và chi phí API là các ràng buộc chính.

Mới
Sử dụng thương mại

Playground cho Gemini 3.5 Flash Lite

Khám phá Playground của Gemini 3.5 Flash Lite — môi trường tương tác để kiểm tra mô hình và chạy truy vấn theo thời gian thực. Thử prompts, điều chỉnh tham số và lặp lại ngay lập tức để tăng tốc phát triển và xác thực các trường hợp sử dụng.

Thông số kỹ thuật của Gemini 3.5 Flash-Lite

Hạng mụcGemini 3.5 Flash-Lite
Nhà cung cấpGoogle DeepMind
ID mô hìnhgemini-3.5-flash-lite
Họ mô hìnhGemini 3.5
Tình trạng khả dụngKhả dụng rộng rãi (GA)
Loại đầu vàoVăn bản, Hình ảnh, Video, Âm thanh, PDF
Loại đầu raVăn bản
Cửa sổ ngữ cảnh1,048,576 token
Đầu ra tối đa65,536 token
Suy nghĩĐược hỗ trợ (mặc định: minimal; cũng có medium và high)
Gọi hàm
Thực thi mã
Tìm kiếm tệp
Ngữ cảnh URL
Grounding theo tìm kiếm
Đầu ra có cấu trúc
Sử dụng máy tínhKhông được hỗ trợ
Bộ nhớ đệmĐược hỗ trợ
Trọng tâm chínhSuy luận thông lượng cao, độ trễ thấp, chi phí thấp

Gemini 3.5 Flash-Lite là gì?

Gemini 3.5 Flash-Lite là mô hình nhanh nhất và tiết kiệm chi phí nhất của Google trong gia đình Gemini 3.5. Mô hình này được tối ưu cho khối lượng công việc mà độ trễ, thông lượng và chi phí API quan trọng hơn hiệu năng suy luận tối đa. Ứng dụng điển hình gồm phân tích tài liệu, trích xuất dữ liệu có cấu trúc, định tuyến, lập trình nhẹ và các tác nhân con tự trị hoạt động ở quy mô lớn. Google định vị đây là lộ trình nâng cấp được khuyến nghị từ Gemini 3.1 Flash-Lite và Gemini 2.5 Flash cho triển khai sản xuất.

Tính năng chính của Gemini 3.5 Flash-Lite

  • Tối ưu cho suy luận khối lượng lớn, chi phí thấp.
  • Hỗ trợ cửa sổ ngữ cảnh 1 triệu token cho tài liệu và kho mã dài.
  • Đầu vào đa phương thức gốc gồm văn bản, hình ảnh, video, âm thanh và PDF.
  • Hỗ trợ Gọi hàm, Thực thi mã, Tìm kiếm tệp, Ngữ cảnh URL, Grounding theo tìm kiếm và Đầu ra có cấu trúc.
  • Mức độ suy nghĩ có thể cấu hình (minimal, medium, high) để cân bằng tốc độ và chất lượng suy luận.
  • Cải thiện đáng kể lập trình, suy luận và quy trình tác nhân so với Gemini 3.1 Flash-Lite, đồng thời vẫn duy trì độ trễ rất thấp.

Hiệu năng benchmark của Gemini 3.5 Flash-Lite

Google cho biết Gemini 3.5 Flash-Lite vượt trội đáng kể so với các thế hệ Flash-Lite trước đó trong lập trình, hiểu tài liệu và quy trình tác nhân, đồng thời vẫn là mô hình có chi phí thấp nhất trong dòng Gemini 3.5. Gemini 3.5 Flash-Lite đạt 54% trong bài kiểm tra Terminal-Bench 2.1, một cải thiện lớn so với mức 31% của phiên bản tiền nhiệm.

Điểm mạnh của mô hình nằm ở phân loại, trích xuất, phản hồi trò chuyện và câu trả lời tăng cường truy xuất đơn giản. Đây chính là những lĩnh vực mà các mô hình nhanh, chi phí thấp có thể vượt trội.

Gemini 3.5 Flash-Lite so với Gemini 3.6 Flash và Gemini 3.5 Flash

Khía cạnhGemini 3.5 Flash-LiteGemini 3.6 FlashGemini 3.5 Flash
Định vịNhanh nhất & rẻ nhất cho các tác vụ hàng ngày khối lượng lớn (ví dụ: xử lý tài liệu, tìm kiếm)Flagship Flash hiện tại: Cân bằng tốt nhất giữa trí tuệ, hiệu quả & hiệu năng tác nhânMô hình tác nhân/lập trình mạnh (nay phần lớn đã bị 3.6 thay thế)
Phù hợp nhất choQuy trình thông lượng cao, chi phí thấpLập trình, đa phương thức, tác nhân phức tạp, công việc tri thứcCác tác vụ tác nhân & lập trình tổng quát
Trí tuệ / Hiệu năngTốt (vượt các bản Lite cũ; cạnh tranh ở nhiều tác vụ tác nhân)Cao nhất trong ba mẫu (tăng đáng kể ở lập trình & tác nhân)Mạnh (gần mức tiên tiến nhất của dòng Flash)
Benchmark chính- Terminal-Bench: ~54%- Mạnh ở tác vụ tài liệu & khối lượng lớn- DeepSWE: 49% (so với 37%)- MLE-Bench: 63.9% (so với 49.7%)- OSWorld: 83% (so với 78.4%)- Terminal-Bench: 76.2%- Thấp hơn 3.6 ở hầu hết các bài lập trình/tác nhân
Tốc độNhanh nhất (~350 token đầu ra/giây)Rất nhanh (~280 t/s)Nhanh
Hiệu quảXuất sắc cho khối lượng lớnTốt nhất (trung bình ít hơn 17% token đầu ra; tối đa 65% ở lập trình)Tốt
Đa phương thứcVăn bản + Hình ảnh + Video + Âm thanhVăn bản + Hình ảnh + Video + Âm thanh (suy luận mạnh hơn)Văn bản + Hình ảnh + Video + Âm thanh
Cửa sổ ngữ cảnh~1M token~1M token~1M token
Số token đầu ra tối đa~64k~64k~64k
Giá (mỗi 1M token)Rẻ nhất: ~$0.30 đầu vào / $2.50 đầu ra$1.50 đầu vào / $7.50 đầu ra$1.50 đầu vào / $9.00 đầu ra
Chi phí hiệu dụngThấp nhất cho mỗi tác vụ đơn giảnThấp hơn 3.5 nhờ tăng hiệu quảCao hơn 3.6

Khuyến nghị tóm tắt

  • Chọn 3.5 Flash-Lite — khi bạn cần tốc độ tối đa và chi phí tối thiểu cho tác vụ khối lượng lớn hoặc đơn giản.
  • Chọn 3.6 Flash — cho hầu hết người dùng và nhà phát triển (lựa chọn tổng thể tốt nhất hiện nay).
  • Chọn 3.5 Flash — chỉ khi bạn có các quy trình hiện có phụ thuộc vào nó (lên kế hoạch nâng cấp lên 3.6).

Hạn chế của Gemini 3.5 Flash-Lite

  • Tối ưu cho hiệu quả thay vì khả năng suy luận ở mức tiên tiến nhất.
  • Computer Use không được hỗ trợ.
  • Không hỗ trợ tạo hình ảnh và âm thanh gốc.
  • Hiện chưa hỗ trợ tinh chỉnh.
  • Các tác vụ suy luận nhiều bước phức tạp thường phù hợp hơn với Gemini 3.5 Flash hoặc Gemini 3.6 Flash.

Câu Hỏi Thường Gặp

Giá cả cho Gemini 3.5 Flash Lite

Khám phá mức giá cạnh tranh cho Gemini 3.5 Flash Lite, được thiết kế để phù hợp với nhiều ngân sách và nhu cầu sử dụng khác nhau. Các gói linh hoạt của chúng tôi đảm bảo bạn chỉ trả tiền cho những gì bạn sử dụng, giúp dễ dàng mở rộng quy mô khi yêu cầu của bạn tăng lên. Khám phá cách Gemini 3.5 Flash Lite có thể nâng cao các dự án của bạn trong khi vẫn kiểm soát được chi phí.

Giá Comet (USD / M Tokens)Giá Chính Thức (USD / M Tokens)Giảm giá
Đầu vào:$0.24/M
Đầu ra:$2.016/M
Đầu vào:$0.3/M
Đầu ra:$2.52/M
-20%

Mã mẫu và API cho Gemini 3.5 Flash Lite

Truy cập mã mẫu toàn diện và tài nguyên API cho Gemini 3.5 Flash Lite để tối ưu hóa quy trình tích hợp của bạn. Tài liệu chi tiết của chúng tôi cung cấp hướng dẫn từng bước, giúp bạn khai thác toàn bộ tiềm năng của Gemini 3.5 Flash Lite trong các dự án của mình.

import os

from google import genai
from google.genai import types

client = genai.Client(
    api_key=os.environ["COMETAPI_KEY"],
    http_options={
        "api_version": "v1beta",
        "base_url": "https://api.cometapi.com",
        "retry_options": {"attempts": 1},
    },
)

response = client.models.generate_content(
    model="gemini-3.5-flash-lite",
    contents="Write a three.js script that renders an interactive 3D robot.",
    config=types.GenerateContentConfig(max_output_tokens=8192),
)

print(f"Response ID: {response.response_id}")
print(f"Model Version: {response.model_version}")
print(f"Finish Reason: {response.candidates[0].finish_reason}")
print(response.text)

Python Code Example

import os

from google import genai
from google.genai import types


client = genai.Client(
    api_key=os.environ["COMETAPI_KEY"],
    http_options={
        "api_version": "v1beta",
        "base_url": "https://api.cometapi.com",
        "retry_options": {"attempts": 1},
    },
)

response = client.models.generate_content(
    model="gemini-3.5-flash-lite",
    contents="Write a three.js script that renders an interactive 3D robot.",
    config=types.GenerateContentConfig(max_output_tokens=8192),
)

print(f"Response ID: {response.response_id}")
print(f"Model Version: {response.model_version}")
print(f"Finish Reason: {response.candidates[0].finish_reason}")
print(response.text)

JavaScript Code Example

import { GoogleGenAI } from "@google/genai";


const ai = new GoogleGenAI({
  apiKey: process.env.COMETAPI_KEY,
  httpOptions: {
    apiVersion: "v1beta",
    baseUrl: "https://api.cometapi.com",
    retryOptions: { attempts: 1 },
  },
});

const response = await ai.models.generateContent({
  model: "gemini-3.5-flash-lite",
  contents: "Write a three.js script that renders an interactive 3D robot.",
  config: {
    maxOutputTokens: 8192,
  },
});

console.log(`Response ID: ${response.responseId}`);
console.log(`Model Version: ${response.modelVersion}`);
console.log(`Finish Reason: ${response.candidates[0].finishReason}`);
console.log(response.text);

Curl Code Example

#!/bin/bash

curl "https://api.cometapi.com/v1beta/models/gemini-3.5-flash-lite:generateContent" \
  -H "x-goog-api-key: $COMETAPI_KEY" \
  -H 'Content-Type: application/json' \
  -X POST \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "Write a three.js script that renders an interactive 3D robot."
          }
        ]
      }
    ],
    "generationConfig": {
      "maxOutputTokens": 8192
    }
  }'

Các phiên bản của Gemini 3.5 Flash Lite

Lý do Gemini 3.5 Flash Lite có nhiều snapshot có thể bao gồm các yếu tố tiềm năng như: sự thay đổi đầu ra sau các bản cập nhật cần các snapshot cũ để đảm bảo tính nhất quán, cung cấp cho nhà phát triển thời gian chuyển tiếp để thích ứng và di chuyển, cũng như các snapshot khác nhau tương ứng với các endpoint toàn cầu hoặc khu vực nhằm tối ưu hóa trải nghiệm người dùng. Để biết chi tiết về sự khác biệt giữa các phiên bản, vui lòng tham khảo tài liệu chính thức.

Phiên bản
gemini-3.5-flash-lite
gemini-3.5-flash-lite-thinking