Gemini 3.6 Flash and 3.5 Flash Lite are now live on CometAPI →

Cách sử dụng Gemini 3.6 Flash API

CometAPI
AnnaJul 23, 2026
Cách sử dụng Gemini 3.6 Flash API

TLDR: Gemini 3.6 Flash (gemini-3.6-flash) là mẫu Flash ổn định mới nhất của Google (GA từ tháng 7/2026), xuất sắc trong các quy trình dạng tác nhân (agentic), lập trình, tác vụ đa phương thức và hiệu quả. Mô hình dùng ít hơn khoảng 17% token đầu ra so với 3.5 Flash, đồng thời đạt hiệu năng mạnh hơn trên các benchmark như DeepSWE (49% so với 37%) và OSWorld-Verified (83% so với 78.4%). Giá: $1.50/M token đầu vào, $7.50/M token đầu ra.

Hướng dẫn này bao gồm thiết lập, tham số, tính năng nâng cao, ví dụ từng bước, so sánh và lý do vì sao định tuyến qua CometAPI (một khóa cho 500+ mô hình, thường rẻ hơn) là lý tưởng cho sản xuất.

Điểm chính:

  • Lưu ý di trú: Ngừng dùng temperature/top_p/top_k; sử dụng Interactions API để có kết quả tốt nhất.
  • Hiệu quả: Ít token, bước và lần gọi công cụ giúp giảm chi phí thực tế.
  • Hỗ trợ đa phương thức & tác nhân mạnh: Văn bản, hình ảnh, video, âm thanh, PDF; công cụ gốc như Computer Use và function calling.
  • Cửa sổ ngữ cảnh 1M: Xử lý tài liệu/mã nguồn khổng lồ.
  • Mức độ “Thinking”: Kiểm soát độ sâu suy luận (tối thiểu đến cao).
  • Khuyến nghị CometAPI: Truy cập hợp chuẩn OpenAI thống nhất, giá cạnh tranh, không khóa nhà cung cấp.

Giới thiệu Gemini 3.6 Flash API

Gemini 3.6 Flash của Google là bước tiến đáng kể của dòng Flash, tối ưu cho kỷ nguyên tác nhân nơi tốc độ, hiệu quả chi phí và độ tin cậy là trọng yếu ở quy mô sản xuất. Ra mắt ngày 21/7/2026, mô hình kế thừa Gemini 3.5 Flash với năng lực lập trình, công việc tri thức, đa phương thức và cải thiện đáng kể hiệu suất token.

Các benchmark độc lập và dữ liệu của Google cho thấy thời gian hoàn thành nhiệm vụ giảm một nửa trong một số kịch bản (ví dụ 1.3 phút), đạt thông lượng cao và giảm tổng chi phí cho quy trình phức tạp. Với cửa sổ ngữ cảnh 1 triệu token và hỗ trợ đầu vào văn bản, hình ảnh, video, âm thanh, PDF, đây là lựa chọn lý tưởng cho nhà phát triển xây dựng agent, chatbot, công cụ nội dung và tự động hóa ở quy mô.

Phản hồi người dùng sớm đánh giá cao độ tin cậy với quy trình tác nhân nhiều bước, ít vòng lặp và chỉnh sửa. Mô hình cũng hỗ trợ các công cụ tích hợp như Computer Use.

Xem bài công bố đầy đủ: Google Blog - Introducing Gemini 3.6 Flash.

Bạn cần chuẩn bị trước khi bắt đầu

1. Khóa API Google (truy cập trực tiếp)

  • Truy cập Google AI Studio và tạo khóa API miễn phí.
  • Để có hạn mức cao hơn, thiết lập Cloud Billing (nạp trước khoảng $10).

2. Khóa CometAPI (khuyến nghị vì đơn giản & tiết kiệm)

CometAPI hợp nhất truy cập 500+ mô hình (bao gồm Gemini 3.6 Flash) qua một endpoint tương thích OpenAI. Không cần nhiều khóa hay bảng điều khiển nhà cung cấp.

  • Đăng ký tại CometAPI.com — gói miễn phí với tín dụng thử.
  • Lấy một khóa API duy nhất.
  • Lợi ích: tiết kiệm 20-40% chi phí, tương thích SDK OpenAI, phân tích sử dụng, chuyển đổi mô hình dễ dàng, uptime cao (99.9%), độ trễ thấp (<400ms trung bình).

Lưu ý giá CometAPI cho Gemini 3.6 Flash: Thường thấp hơn chính thức (ví dụ khoảng $1.2/M đầu vào trong các ví dụ của dòng Flash), trả theo mức sử dụng. Kiểm tra mức giá hiện tại trên bảng điều khiển của họ.

3. Môi trường phát triển

  • Python: pip install -U google-genai (hoặc openai cho tương thích CometAPI/OpenAI).
  • Node.js: @google/genai hoặc thư viện OpenAI.
  • Hiểu cơ bản về REST/JSON.

4. Công cụ & hạn mức

Xem xét hạn mức trong AI Studio hoặc tài liệu CometAPI. Bắt đầu bằng thử nghiệm prompt.

Bạn cần chuẩn bị trước khi bắt đầu

1. Khóa API Google (truy cập trực tiếp)

  • Truy cập Google AI Studio và tạo khóa API miễn phí.
  • Để có hạn mức cao hơn, thiết lập Cloud Billing (nạp trước khoảng $10).

2. Khóa CometAPI (khuyến nghị vì đơn giản & tiết kiệm)

CometAPI hợp nhất truy cập 500+ mô hình (bao gồm Gemini 3.6 Flash) qua một endpoint tương thích OpenAI. Không cần nhiều khóa hay bảng điều khiển nhà cung cấp.

  • Đăng ký tại CometAPI.com — gói miễn phí với tín dụng thử.
  • Lấy một khóa API duy nhất.
  • Lợi ích: tiết kiệm 20-40% chi phí, tương thích SDK OpenAI, phân tích sử dụng, chuyển đổi mô hình dễ dàng, uptime cao (99.9%), độ trễ thấp (<400ms trung bình).

Lưu ý giá CometAPI cho Gemini 3.6 Flash: Thường thấp hơn chính thức (ví dụ khoảng $1.2/M đầu vào trong các ví dụ của dòng Flash), trả theo mức sử dụng. Kiểm tra mức giá hiện tại trên bảng điều khiển của họ.

3. Môi trường phát triển

  • Python: pip install -U google-genai (hoặc openai cho tương thích CometAPI/OpenAI).
  • Node.js: @google/genai hoặc thư viện OpenAI.
  • Hiểu cơ bản về REST/JSON.

4. Công cụ & hạn mức

Xem xét hạn mức trong AI Studio hoặc tài liệu CometAPI. Bắt đầu bằng thử nghiệm prompt.

Tham số API và tính năng của Gemini 3.6 Flash

Gemini 3.6 Flash hỗ trợ Interactions API (khuyến nghị để dùng tính năng mới nhất) và các endpoint generateContent truyền thống.

Thông số cốt lõi:

  • Ngữ cảnh: 1M token (1,048,576).
  • Tối đa đầu ra: ~64k token.
  • Đầu vào đa phương thức: Văn bản, Hình ảnh, Video, Âm thanh, PDF.
  • Đầu ra: Văn bản (kèm media ở một số biến thể).
  • Công cụ: Gọi hàm (function calling), Computer Use (gốc), grounding với Search, thực thi mã, Files API.
  • Thinking: Mặc định "medium"; các mức: minimal, low, medium, high.
  • Khác: Đầu ra có cấu trúc, chỉ dẫn hệ thống, streaming, hội thoại có trạng thái.
  • Giá (Google trực tiếp): $1.50/M đầu vào, $7.50/M đầu ra (giảm từ $9/M đầu ra của 3.5 Flash). Kiểm tra CometAPI để có mức giá có thể thấp hơn.

Tài liệu đầy đủ: Gemini API Models Docs.

Tham số API & cấu hình sinh

Tham số chính trong generation_config (hoặc tương đương):

  • thinking_level: "minimal" | "low" | "medium" | "high" (điều chỉnh độ sâu suy luận so với tốc độ/chi phí).
  • System Instruction: Định hướng hành vi (ví dụ: "You are a helpful coding assistant. Output only valid JSON.").
  • Structured Outputs: Định nghĩa schema cho JSON đáng tin cậy.
  • Không dùng nữa: temperature, top_p, top_k — loại bỏ để tránh lỗi trong tương lai.
  • temperature: Điều khiển độ ngẫu nhiên (0-2; thấp hơn thì quyết định hơn).
  • topP / topK: Lấy mẫu nucleus/top-k.
  • maxOutputTokens: Giới hạn độ dài phản hồi (kiểm soát chi phí/độ trễ).

Ví dụ cấu hình (Python SDK):

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Your prompt here",
    system_instruction="Be concise and accurate.",
    generation_config={
        "thinking_level": "medium"
    }
)

Tài liệu đầy đủ: Gemini API Models Docs.

Tính năng nâng cao:

  • Đầu ra có cấu trúc
  • Sử dụng công cụ song song
  • Hiểu ngữ cảnh dài
  • Bộ nhớ đệm ngữ cảnh (ngầm/hiển)
  • Đầu vào đa phương thức (tới hạn mức file)
  • Bộ lọc an toàn (nâng cấp cho 3.6)

Cách truy cập Gemini 3.6 Flash API

Truy cập qua Google

Google cho biết Gemini 3.6 Flash có sẵn qua:

  • Gemini API thông qua Google AI Studio.
  • Android Studio.
  • Google Antigravity.
  • Gemini Enterprise Agent Platform.
  • Gemini Enterprise app.
  • Gemini app cho người dùng phổ thông.

Model ID chính thức là:

gemini-3.6-flash

Sử dụng trang mô hình và trang giá của Google để xác nhận hạn mức hiện tại, công cụ hỗ trợ, hạn mức tốc độ và điều khoản thanh toán trước khi triển khai.

Truy cập qua CometAPI

CometAPI cung cấp trang mô hình Gemini 3.6 Flash và hỗ trợ gọi tương thích OpenAI qua:

https://api.cometapi.com/v1

Các bước triển khai gợi ý với CometAPI:

  1. Tạo hoặc dùng lại khóa API CometAPI.
  2. Xác nhận gemini-3.6-flash có trong thư mục mô hình hoặc bảng điều khiển CometAPI.
  3. Thay base URL bằng https://api.cometapi.com/v1 cho quy trình chat tương thích OpenAI.
  4. Chạy bộ benchmark của bạn với Gemini 3.5 Flash, Gemini 3.6 Flash và Gemini 3.5 Flash-Lite.
  5. So sánh chất lượng, độ trễ, token đầu ra, số lần thử lại và chi phí cuối cùng.
  6. Chỉ định tuyến các workload nơi Gemini 3.6 Flash cải thiện chi phí trên mỗi nhiệm vụ thành công.

Ví dụ Quick Start với CometAPI

Đối với quy trình chat tương thích OpenAI, tài liệu CometAPI dùng base URL:

https://api.cometapi.com/v1

Ví dụ Python:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
)

completion = client.chat.completions.create(
    model="gemini-3.6-flash",
    messages=[
        {
            "role": "user",
            "content": "Summarize the attached release notes into migration risks and action items.",
        }
    ],
)

print(completion.choices[0].message.content)

Đối với các tính năng Gemini theo nhà cung cấp, trang mô hình Gemini của CometAPI cũng tài liệu các route kiểu v1beta. Hãy dùng định dạng yêu cầu phù hợp với tính năng ứng dụng của bạn cần.

Từng bước: Cách dùng Gemini 3.6 Flash API

Bước 1: Sinh văn bản cơ bản

Xem phần quickstart ở trên.

Bước 2: Đa phương thức (Hình ảnh/Âm thanh/PDF)

Dùng Files API cho file lớn.

Ví dụ (Python):

myfile = client.files.upload(file="path/to/document.pdf")
interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=[
        {"type": "text", "text": "Summarize this document and extract key data."},
        {"type": "file", "uri": myfile.uri, "mime_type": myfile.mime_type}
    ]
)

Bước 3: Gọi hàm & công cụ

Định nghĩa công cụ; mô hình sẽ tự động gọi.

Bước 4: Streaming phản hồi

Thêm stream=True để nhận đầu ra thời gian thực.

Bước 5: Hội thoại nhiều lượt (khuyến nghị có trạng thái)

Dùng previous_interaction_id để lưu lịch sử ở phía server.

Bước 6: Quy trình tác nhân & Computer Use

Tận dụng công cụ gốc cho tự động hóa.

Mẹo CometAPI: Thử nghiệm trên nhiều mô hình (ví dụ so sánh với Claude hoặc GPT) chỉ với một khóa.

Ví dụ nâng cao & thực hành tốt

  • Tác nhân lập trình: Prompt cho di trú mã hoặc debug với công cụ.
  • Phân tích tài liệu: Nạp PDF + câu hỏi để tóm tắt/trích xuất.
  • Tối ưu chi phí: Dùng thinking level thấp, caching và giới hạn max tokens.
  • Xử lý lỗi: Theo dõi metadata sử dụng; triển khai cơ chế thử lại.
  • Mở rộng sản xuất: Batch khi có thể; giám sát qua bảng điều khiển CometAPI.

Bao gồm chỉ dẫn hệ thống cho chuyên môn miền (ví dụ: "You are a senior Python engineer...").

Dữ liệu hỗ trợ: Trên OSWorld, 3.6 Flash đạt 83% so với các thế hệ trước. Tiết kiệm token chuyển trực tiếp thành hóa đơn thấp hơn và vòng lặp nhanh hơn.

Bảng so sánh: Gemini 3.6 Flash vs lựa chọn khác

Tính năng/Mô hìnhGemini 3.6 FlashGemini 3.5 FlashClaude Sonnet 5 (qua CometAPI)GPT-5.6 (qua CometAPI)
Cửa sổ ngữ cảnh1M token1M tokenKhác nhauKhác nhau
Giá đầu vào/đầu ra$1.50 / $7.50 (chính thức)Đầu ra cao hơnCạnh tranh qua CometAPI~$4/M
Hiệu suất token+17% ít token đầu raCơ sởSuy luận mạnhChất lượng cao
Năng lực lập trìnhXuất sắc (tăng trên DeepSWE)TốtRất mạnhXuất sắc
Tốc độ/Thông lượngCao (tối ưu Flash)CaoCân bằngCân bằng
Đa phương thứcGốc (văn bản/hình ảnh/video/...)MạnhMạnhMạnh
Truy cập CometAPICó, thống nhất & rẻ hơn

CometAPI giúp so sánh chéo mô hình dễ dàng với một endpoint.

API Gemini 3.6 Flash tốn bao nhiêu?

Giá chính thức Google Gemini API

Tầng Gemini 3.6 FlashĐầu vào / 1M tokenĐầu vào cache / 1M tokenĐầu ra / 1M tokenPhù hợp nhất
Standard$1.50$0.15$7.50Yêu cầu sản xuất bình thường
Batch$0.75$0.075$3.75Job offline nơi độ trễ ít quan trọng
Flex$0.75$0.075$3.75Workload chi phí thấp với công suất linh hoạt
Priority$2.70$0.27$13.50Workload nhạy độ trễ hoặc ưu tiên cao

Giá chính thức của Google cũng liệt kê phí grounding với Search và Maps. Với mô hình Gemini 3, trang giá ghi 5,000 prompt/tháng miễn phí cho grounding với Google Search hoặc Google Maps, sau đó $14 mỗi 1,000 truy vấn search ở tầng trả phí tương ứng. Luôn xác minh điều khoản grounding hiện tại vì sử dụng công cụ có thể thay đổi chi phí thực tế của agent.

Tín hiệu giá CometAPI

Giá mô hình Gemini 3.6 Flash của CometAPI:

RouteĐầu vào / 1M tokenĐầu ra / 1M token
Giá Standard chính thức Google$1.50$7.50
Giá niêm yết CometAPI$1.20$6.00
Mức giảm niêm yết20%20%

Kiểm tra bảng điều khiển CometAPI trước khi công bố giá hướng khách hàng hoặc đưa lưu lượng sản xuất. Trang công khai có thể chậm hơn cấu hình tính phí thực tế.

Giá Gemini 3.6 Flash vs Gemini 3.5 Flash

Mô hìnhĐầu vào Standard / 1MĐầu ra Standard / 1MCache ngữ cảnh / 1MThay đổi giá chính
Gemini 3.5 Flash$1.50$9.00$0.15Cơ sở
Gemini 3.6 Flash$1.50$7.50$0.15Giá đầu vào giữ nguyên, đầu ra giảm 16.7%
Gemini 3.5 Flash-Lite$0.30$2.50$0.03Rẻ hơn nhiều cho khối lượng lớn, tác vụ đơn giản

Gemini 3.6 Flash rẻ hơn 3.5 Flash ở token đầu ra, nhưng không phải mô hình Gemini rẻ nhất. Với phân loại, trích xuất, định tuyến đơn giản hoặc tác vụ phụ khối lượng lớn, Gemini 3.5 Flash-Lite có thể là mô hình khởi đầu tốt hơn. 3.6 Flash mạnh hơn đặc biệt thuyết phục khi độ chính xác cao hơn giúp giảm số lần thử lại, vòng lặp công cụ hoặc leo thang.

Kịch bản chi phí ví dụ

Giả sử một yêu cầu dùng 15,000 token đầu vào và 8,000 token đầu ra.

RouteChi phí ước tính
Gemini 3.5 Flash theo giá Standard chính thức$0.0945
Gemini 3.6 Flash theo giá Standard chính thức, cùng lượng token$0.0825
Gemini 3.6 Flash theo giá Standard chính thức, với 17% ít token đầu ra$0.0723
Gemini 3.6 Flash qua CometAPI ở mức $1.20/M đầu vào và $6.00/M đầu ra, cùng lượng token$0.0660
Gemini 3.6 Flash qua CometAPI, với 17% ít token đầu ra$0.0578

Đây chỉ là mô hình chi phí, không phải đảm bảo. Tiết kiệm thực tùy thuộc vào độ dài prompt, token thinking, đầu ra công cụ, tỷ lệ trúng cache, tỷ lệ thử lại và việc tác vụ của bạn có tái hiện được mức giảm token đầu ra như Google báo cáo hay không.

Hạn chế tiềm ẩn & xử lý sự cố

  • Hạn mức trên gói miễn phí.
  • Giới hạn kích thước/độ dài cho đa phương thức.
  • Kiến thức cắt ngắn (~tháng 3/2026).
  • Từ chối vì an toàn với chủ đề nhạy cảm.
  • Theo dõi token để kiểm soát chi phí.

Cách khắc phục phổ biến: Kiểm tra khóa API, dùng đúng model ID, xử lý sự kiện streaming đúng cách.

Khuyến nghị cuối

Gemini 3.6 Flash là một trong những bản phát hành Gemini thực dụng nhất cho nhà phát triển năm 2026 vì nó cải thiện kinh tế của agent AI thực tế. Mô hình hạ giá token đầu ra, giảm lượng token đầu ra, cải thiện nhiều benchmark về lập trình và tác nhân do Google báo cáo, đồng thời giữ bề mặt ngữ cảnh dài, đa phương thức, giàu công cụ vốn làm 3.5 Flash hữu dụng.

Với hệ thống sản xuất mới, hãy bắt đầu bằng benchmark Gemini 3.6 Flash như mô hình chủ lực cho tác vụ phức tạp. Ghép với Gemini 3.5 Flash-Lite cho khối lượng lớn chi phí thấp, giữ Gemini 3.5 Flash làm dự phòng tạm thời và dùng CometAPI để so sánh route giữa các họ mô hình với một khóa API.

Chiến lược tốt nhất không phải “thay tất cả bằng Gemini 3.6 Flash” mà là “chỉ gửi cho Gemini 3.6 Flash những công việc nơi năng lực bổ sung của nó hạ tổng chi phí đạt thành công”.

Tự thử

Câu hỏi thường gặp

Gemini 3.6 Flash có hỗ trợ đầu vào đa phương thức không?

Có. Trang Gemini API của Google liệt kê đầu vào văn bản, hình ảnh, video, âm thanh và PDF. Mô hình trả về đầu ra văn bản.

Gemini 3.6 Flash có sinh hình ảnh hoặc âm thanh không?

Không. Trang mô hình ghi nhận không hỗ trợ sinh hình ảnh và âm thanh cho Gemini 3.6 Flash.

Cửa sổ ngữ cảnh của Gemini 3.6 Flash là gì?

Gemini 3.6 Flash hỗ trợ tới 1,048,576 token đầu vào và tới 65,536 token đầu ra.

Nên dùng Gemini 3.6 Flash hay Gemini 3.5 Flash-Lite?

Dùng Gemini 3.6 Flash cho chất lượng lập trình, suy luận đa phương thức, agent phức tạp và tác vụ nặng công cụ. Dùng Gemini 3.5 Flash-Lite cho trích xuất, định tuyến, phân loại, dịch thuật khối lượng lớn và quy trình xử lý dữ liệu dự đoán được nơi chi phí và độ trễ quan trọng hơn độ sâu suy luận tối đa.

Gemini 3.6 Flash đã có sẵn chưa?

Có. Google liệt kê gemini-3.6-flash là mô hình Gemini API ổn định với cập nhật tháng 7/2026. Google công bố khả dụng ngày 21/7/2026 cho nhà phát triển, doanh nghiệp và người dùng ứng dụng Gemini.

Model ID của Gemini 3.6 Flash là gì?

Model ID chính thức là gemini-3.6-flash. CometAPI cũng liệt kê gemini-3.6-flash trên trang mô hình và đề cập route gemini-3.6-flash-thinking.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm