FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
technology/Nghiên cứu CometAPI

Định giá đầu vào được lưu vào bộ nhớ đệm của GPT 5.6 và Gemini 3.6 Falsh: Chi phí là bao nhiêu

So sánh giá cho đầu vào được lưu trong bộ nhớ đệm của GPT-5.6 và Gemini 3.6 Flash trên CometAPI, OpenRouter, OpenAI và Google, bao gồm cả chi phí ghi vào bộ nhớ đệm.

CometAPI
AnnaĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Aug 14, 2026 16 phút đọc
Định giá đầu vào được lưu vào bộ nhớ đệm của GPT 5.6 và Gemini 3.6 Falsh: Chi phí là bao nhiêu
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

DR

Định giá đầu vào được cache có thể giảm đáng kể chi phí cho các khối lượng công việc thường xuyên gửi lại một tiền tố lời nhắc lớn, không đổi; nhưng mức tiết kiệm phụ thuộc vào các quy tắc cụ thể theo mô hình về đọc cache, ghi cache, lưu trữ, định tuyến và thời hạn giữ. Nhãn “có hỗ trợ cache” chung chung là chưa đủ để ước tính chi phí; hãy sử dụng mức giá hiện tại được công bố cho đúng mô hình và tuyến.

TL;DR

  • GPT-5.6 Terra có mức giá đọc cache và ghi cache rõ ràng từ OpenAI, CometAPI và OpenRouter, mặc dù các tuyến gateway và các hạng ngữ cảnh dài có thể thay đổi mức áp dụng.
  • Google công bố mức $0.15 trên mỗi 1M token cho tính năng lưu đệm ngữ cảnh Standard của Gemini 3.6 Flash cùng với phí lưu trữ; hiện CometAPI công bố mức giá đầu vào và đầu ra tiêu chuẩn của mô hình mà không có dòng riêng cho đầu vào được cache.
  • So sánh liên quan không chỉ là đầu vào tiêu chuẩn so với đọc cache. Nó còn bao gồm lần ghi cache đầu tiên, bất kỳ phí lưu trữ nào, thời hạn cache, tính nhất quán tuyến và số lượng lượt trúng cache về sau.

Thông điệp chính

  • Kiểm tra giá ở cấp độ mô hình và hạng dịch vụ thay vì áp dụng một hệ số nhân cho toàn bộ gateway.
  • Tách riêng đọc cache, ghi cache, lưu trữ và cache phản hồi trong tính toán chi phí.
  • Xác minh việc sử dụng cache thực tế trong siêu dữ liệu phản hồi API trước khi dự báo tiết kiệm từ mức giá đã công bố.

Một yêu cầu lặp lại một tiền tố lớn và không đổi — lời nhắc hệ thống, tập lược đồ công cụ, tài liệu tham chiếu dài — không nhất thiết phải bị tính ở mức giá đầu vào đầy đủ cho mỗi lần gọi. Hầu hết các mô hình thế hệ hiện nay hỗ trợ một hình thức định giá đầu vào được cache: mức giá giảm cho phần lời nhắc mà nhà cung cấp nhận diện là đã xử lý trước đó. Cơ chế, kích cỡ giảm giá và mức độ công bố rõ ràng khác nhau tùy nhà cung cấp và tùy gateway, và sự khác biệt đó đáng để làm rõ thay vì coi “có hỗ trợ cache” như một tính năng đồng nhất.

Định giá đầu vào được cache là gì, và không phải là gì

Định giá đầu vào được cache giảm giá các token đầu vào trong một yêu cầu khớp với một tiền tố đã gửi trước đó. Nó không giảm giá token đầu ra, và không giống với cơ chế gateway khử trùng lặp hai yêu cầu hoàn toàn giống nhau rồi trả về một phản hồi miễn phí — đó là một cơ chế khác mà một số gateway cung cấp riêng. Định giá đầu vào được cache cụ thể là trả ít hơn cho phần lời nhắc mà nhà cung cấp mô hình đã thấy gần đây, không phải bỏ qua việc sinh đầu ra hoàn toàn.

Nó cũng không miễn phí để tạo ra. Ghi chú định giá GPT-5.6 của OpenAI nêu rằng ghi cache được tính phí bằng 1,25 lần mức đầu vào chưa cache, trong khi đọc cache nhận mức giảm 90%. Phí ghi lần đầu đó ảnh hưởng điểm hòa vốn và dễ bị bỏ sót nếu so sánh chỉ hiển thị mức giá đọc giảm. Các nhà cung cấp khác có thể dùng phí dựa trên lưu trữ thay vì mô hình ghi tương tự, vì vậy chi phí ghi và lưu trữ cần được kiểm tra riêng.

Trong thực tế, đơn vị cache tính phí thường là một tiền tố lời nhắc có thể tái sử dụng thay vì một tập hợp tùy ý các câu lặp lại. Nhà cung cấp thực hiện token hóa và đối sánh nội dung theo thứ tự, nên vật liệu có thể tái sử dụng cần xuất hiện trước phần đuôi đặc thù của yêu cầu. Hướng dẫn hệ thống ổn định, định nghĩa công cụ, chính sách và nội dung tham chiếu nên nằm gần đầu; thông điệp người dùng thay đổi, dấu thời gian, ID yêu cầu hoặc đoạn trích được truy xuất nên nằm về sau. Ngay cả một thay đổi không ảnh hưởng ngữ nghĩa gần phần đầu cũng có thể làm dịch chuyển token hóa hoặc phá vỡ đối sánh cho mọi thứ theo sau.

Các quy tắc đủ điều kiện cũng phụ thuộc vào từng mô hình. Nhà cung cấp có thể yêu cầu độ dài lời nhắc tối thiểu, chỉ nhận diện các điểm ngắt được ghi tài liệu, hoặc cung cấp một trường kiểm soát cache rõ ràng. Một mục cache có thể hết hạn giữa các lần gọi, và một gateway có thể cần giữ các yêu cầu liên quan trên một tuyến thượng nguồn tương thích. Điều đó đồng nghĩa triển khai nên xem “trúng cache” là kết quả quan sát được, không phải giả định từ sự tương tự của lời nhắc. Một lời nhắc được cấu trúc tốt cải thiện xác suất tái sử dụng, nhưng siêu dữ liệu phản hồi và hóa đơn mới xác định liệu mức giá giảm đã thực sự được áp dụng.

Những gì thực sự được công bố, theo mô hình và theo gateway

Bảng dưới đây là ảnh chụp mức giá được kiểm tra ngày 29 tháng 7, 2026. Giá tính bằng đô la Mỹ trên mỗi 1 triệu token trừ khi nêu đơn vị khác. Các hàng so sánh thông tin công khai hiện tại cho GPT-5.6 Terra và Gemini 3.6 Flash ở phía nhà cung cấp mô hình, CometAPI và OpenRouter; chúng không nên được coi là biểu giá cố định.

ModelGatewayStandard inputCached input (read)Cache writeDiscount disclosed?
GPT-5.6 TerraOfficial OpenAI rate$2.50 / 1M$0.25 / 1M$3.13 / 1MCó — giảm 90%, nêu trực tiếp
GPT-5.6 TerraCometAPI$2.00 / 1M$0.20 / 1M$2.50 / 1MCó — được liệt kê trên trang định giá của chính CometAPI
GPT-5.6 TerraOpenRouter$2.50 / 1MKhông được liệt kê là mức riêngKhông liệt kêKhông — chỉ mô tả là “rẻ hơn 60–80%” tổng thể, không có số liệu theo từng mô hình
Gemini 3.6 FlashOfficial Google rate$1.50 / 1M$0.15 / 1M (theo thông báo của chính Google)Không công bốCó, tại thời điểm ra mắt — qua tài liệu mô hình của Google
Gemini 3.6 FlashCometAPI$1.20 / 1MKhông được liệt kê là mức riêngKhông công bốKhông — trang của CometAPI đánh dấu “Caching” là tính năng được hỗ trợ nhưng không công bố mức giá đầu vào được cache riêng cho mô hình này tại thời điểm viết
Gemini 3.6 FlashOpenRouter$1.50 / 1MKhông được liệt kê là mức riêngKhông công bốKhông — tài liệu của OpenRouter mô tả hệ số cache chung của Google (0,25x mức đầu vào danh sách) thay vì xác nhận mức giá cụ thể cho mô hình này

Đọc bảng như một ảnh chụp theo mô hình và tuyến. Trang mô hình GPT-5.6 của CometAPI liệt kê GPT-5.6 Terra ở mức $2.00 đầu vào tiêu chuẩn, $0.20 đầu vào được cache và $2.50 ghi cache trên mỗi 1 triệu token. Trang mô hình Gemini 3.6 Flash của CometAPI hiện công bố $1.20 đầu vào và $6.00 đầu ra, nhưng không hiển thị dòng giá riêng cho đầu vào được cache hoặc lưu trữ cache. Định giá Gemini Developer API của Google liệt kê hạng Standard ở mức $1.50 đầu vào, $0.15 lưu đệm ngữ cảnh và $1.00 trên mỗi 1 triệu token mỗi giờ cho lưu trữ. OpenRouter hiện cung cấp các trường cache theo từng mô hình qua Models API: mục GPT-5.6 Terra trên tuyến mặc định bao gồm mức giá khuyến mại thấp hơn và một hạng ngữ cảnh dài riêng cao hơn, trong khi mục Gemini 3.6 Flash hiển thị các giá trị Standard, Flex và Priority khác nhau. Cách này chính xác hơn so với việc áp dụng một hệ số cache chung cho mọi mô hình.

Vì sao giá giữa gateway và nhà cung cấp có thể khác nhau

Giá của gateway không nhất thiết là phần cộng thêm trên một mức giá thượng nguồn bất biến. Nó có thể phản ánh công suất đã đàm phán, khuyến mãi tạm thời, hạng dịch vụ khác hoặc thỏa thuận thương mại theo tuyến cụ thể. Một tên mô hình cũng có thể ánh xạ tới nhiều biến thể thượng nguồn mà giá thay đổi theo độ dài ngữ cảnh hoặc đảm bảo độ trễ. Mục GPT-5.6 Terra của OpenRouter, chẳng hạn, công bố một tuyến mặc định và một tuyến ghi đè giá cao hơn khi đầu vào đạt ngưỡng ngữ cảnh dài. Google tách mức giá Standard, Batch, Flex và Priority cho Gemini 3.6 Flash. Do đó, một hàng so sánh đơn lẻ cần kèm ngày, tuyến, hạng và giả định ngữ cảnh để giữ ý nghĩa.

Điều ngược lại cũng quan trọng: nếu trang của gateway không công bố dòng giá đọc cache riêng, sự vắng mặt đó không nên bị chuyển thành “không có hỗ trợ cache” hoặc “giảm giá trực tiếp của nhà cung cấp tự động áp dụng”. Gateway có thể truyền qua một tính năng thượng nguồn mà không liệt kê riêng, chỉ cung cấp trên một số tuyến, hoặc tính phí yêu cầu theo mức đầu vào bình thường. Cách tiếp cận có cơ sở là sử dụng chính trang mô hình hiện tại của gateway để lập kế hoạch, rồi xác nhận mức giá thực tế từ bản ghi sử dụng hoặc dữ liệu thanh toán. Tài liệu của nhà cung cấp vẫn hữu ích để hiểu cơ chế, nhưng tự nó không thiết lập điều khoản thương mại của bên trung gian.

Nơi mức giảm thực sự có ý nghĩa

Kịch bản khiến chi phí thay đổi đáng kể là tiền tố lớn, tĩnh đi cùng phần yêu cầu nhỏ, biến động — lời nhắc hệ thống hoặc tập lược đồ công cụ được gửi lại trên mọi lần gọi trong vòng lặp tác nhân, tài liệu tham chiếu dài được truy vấn lặp lại bằng các câu hỏi khác nhau, hoặc lịch sử hội thoại được gửi lại trên mỗi lượt chatbot. Với khối lượng công việc như vậy, khoảng cách giữa việc trả giá đầu vào đầy đủ cho toàn bộ tiền tố mỗi lần và chỉ trả phí ghi một lần rồi mức giá đọc giảm về sau sẽ cộng dồn theo số lượng cuộc gọi. Nó không có tác dụng với các khối lượng công việc không lặp lại tiền tố — một yêu cầu đơn lẻ vốn không có nội dung được cache để giảm giá ngay từ đầu.

Tính toán hòa vốn thực tế so sánh chi phí chưa cache của tiền tố lặp lại trên tất cả các lần gọi với chi phí ghi cache hoặc lưu trữ cộng với các lần đọc cache giảm giá về sau. Kết quả phụ thuộc vào kích thước tiền tố, số lượt trúng cache, thời hạn cache và liệu gateway có giữ yêu cầu trên tuyến nhà cung cấp tương thích hay không. Nếu các điều kiện đó không ổn định, mức giảm công bố có thể phóng đại phần tiết kiệm thực tế trong sản xuất.

Mô hình chi phí đơn giản cho tiền tố lặp lại

Gọi P là số token trong tiền tố ổn định và N là số lần gọi tái sử dụng nó. Nếu U là giá đầu vào chưa cache trên mỗi token, tiền tố có chi phí N × P × U khi không có cache. Ước tính đơn giản khi có cache là P × W + (N − 1) × P × R + S, trong đó W là giá ghi cache, R là giá đọc cache và S là bất kỳ phí lưu trữ nào trong khoảng thời gian đó. Công thức giả định lần gọi đầu tiên tạo cache và mọi lần gọi sau đều trúng cache. Nó loại trừ phần đuôi biến động của mỗi yêu cầu, token đầu ra, thử lại và bất kỳ thay đổi tuyến nào gây trượt.

Xem xét một tiền tố minh họa 100.000 token được tái sử dụng cho 20 lần gọi ở mức giá chính thức của GPT-5.6 Terra. Với $2.50 trên mỗi 1 triệu token đầu vào chưa cache, việc xử lý lặp lại tiền tố đó sẽ tốn $5.00. Dựa trên mức ghi 1,25 lần và mức đọc giảm 90% đã công bố, một lần ghi 100.000 token sẽ tốn khoảng $0.3125 và mười chín lần đọc sẽ tốn khoảng $0.475, cho chi phí tiền tố kết hợp khoảng $0.7875. Chênh lệch khoảng $4.21 trước các chi phí đầu vào biến động và đầu ra. Đây là minh họa, không phải báo giá: nó chỉ đúng nếu cả mười chín lần gọi sau đều trúng cùng một cache hợp lệ và không có phí lưu trữ hoặc định tuyến bổ sung.

Điểm hòa vốn kéo theo trực tiếp từ mô hình trên. Phí ghi cao hơn chỉ hợp lý khi có đủ lượt đọc giảm giá xảy ra trước khi hết hạn. Với khối lượng công việc có phiên ngắn, chỉnh sửa lời nhắc thường xuyên hoặc độ gắn kết tuyến yếu, cache có thể bị tạo lại thường xuyên hơn dự kiến. Với vòng lặp tác nhân sống lâu hoặc phân tích tài liệu lặp lại với tiền tố ổn định, số lượt trúng có thể cao hơn nhiều. Do đó, dự báo nên dùng khoảng tỉ lệ trúng quan sát được thay vì giả định chuỗi hoàn hảo sau lần gọi đầu tiên.

Mẫu triển khai giúp cải thiện tái sử dụng cache

Cấu trúc lời nhắc tác động lớn hơn đến tỉ lệ trúng cache so với nhiều bảng tính giá ngụ ý. Đặt vật liệu ổn định nhất lên đầu và giữ cách tuần tự hóa có tính quyết định: hướng dẫn hệ thống, lược đồ công cụ, văn bản chính sách và ngữ cảnh tham chiếu dùng chung cần giữ nguyên thứ tự, khoảng trắng và cách biểu diễn trường giữa các lần gọi liên quan. Thêm nội dung dễ biến đổi về sau. Tránh chèn dấu thời gian, định danh ngẫu nhiên, bộ đếm thay đổi liên tục hoặc kết quả truy xuất đặc thù yêu cầu vào tiền tố tái sử dụng trừ khi thực sự cần nằm ở đó.

Đánh phiên bản nội dung ổn định một cách chủ động. Nếu lược đồ công cụ hoặc chính sách thay đổi, gán phiên bản mới một cách nhất quán thay vì để nhiều biến thể gần như giống nhau lưu hành. Với khối lượng hội thoại hoặc tác nhân, tái sử dụng một định danh phiên ổn định hoặc khóa cache khi API hỗ trợ, và tránh chuyển nhà cung cấp trong cùng chuỗi phụ thuộc cache. OpenRouter ghi tài liệu về định tuyến bám theo nhà cung cấp cho cache lời nhắc và cung cấp các điều khiển như session_idprompt_cache_key; các điều khiển này có thể cải thiện tính liên tục, nhưng chúng không đảm bảo trúng khi cache thượng nguồn đang lạnh hoặc đã hết hạn.

Ứng dụng cũng cần xuống cấp một cách êm khi bị trượt cache. Cache là tối ưu hóa chi phí và độ trễ, không phải phụ thuộc vào tính đúng đắn. Yêu cầu vẫn phải tạo ra kết quả hợp lệ giống nhau khi cache không khả dụng, và logic thử lại không nên mù quáng tạo các lần ghi lặp. Sự tách biệt đó giúp việc so sánh tuyến an toàn hơn: đội ngũ có thể thay đổi chính sách cache hoặc cấu hình gateway mà không cần thay đổi hành vi ngữ nghĩa của ứng dụng.

Cách xác minh kinh tế cache trong sản xuất

Bắt đầu với số liệu theo từng yêu cầu thay vì hóa đơn hàng tháng. Ghi log chính xác định danh mô hình, tuyến gateway hoặc nhà cung cấp khi có, hạng dịch vụ, tổng token đầu vào, token đọc cache, token ghi cache, token đầu ra, độ trễ và chi phí bị tính. Đối tượng usage của OpenRouter bao gồm cached_tokenscache_write_tokens; các nhà cung cấp khác cung cấp chi tiết tương đương dưới tên trường khác. Lưu giữ các trường sử dụng thô để một thay đổi giá về sau không xóa bằng chứng cần thiết nhằm dựng lại chi phí.

Tổng hợp dữ liệu theo phiên bản lời nhắc và khối lượng công việc, không chỉ theo mô hình. Các thước đo hữu ích gồm tỷ lệ yêu cầu đủ điều kiện trúng cache, tỷ lệ token đầu vào được tính theo giá đọc, số lần ghi trên mỗi lượt đọc thành công, thời gian giữa lần ghi và lần trúng cuối, và chi phí thực tế trên mỗi yêu cầu. Tỉ lệ trúng ở mức yêu cầu cao vẫn có thể mang lại ít giá trị nếu tiền tố được cache nhỏ, trong khi tỉ lệ trúng thấp hơn trên một tiền tố rất lớn có thể tiết kiệm nhiều hơn. Ghép các thước đo đó với các bách phân vị độ trễ, vì một tuyến rẻ hơn nhưng liên tục trượt hoặc đổi tuyến có thể tệ hơn về vận hành.

Cuối cùng, xem xét các bất thường thay vì làm mượt chúng. Sự sụt giảm đột ngột về token được cache có thể chỉ ra việc triển khai phiên bản lời nhắc, tuần tự hóa không ổn định, mục hết hạn, ngưỡng hạng ngữ cảnh dài hoặc thay đổi tuyến gateway. So sánh các yêu cầu bị ảnh hưởng với trang mô hình hiện tại và tài liệu của nhà cung cấp, rồi xác minh mức giá bị tính. Điều này thu hẹp khoảng cách giữa mức giảm công bố và phần tiết kiệm ứng dụng thực sự đạt được.

Cần kiểm tra gì trước khi giả định một mức giá áp dụng

Xác nhận năm mục trước khi sử dụng một mức giá công bố trong ngân sách: mô hình và hạng dịch vụ chính xác, tiền tố tối thiểu có thể tái sử dụng hoặc các điểm ngắt cache rõ ràng, phí ghi lần đầu hoặc lưu trữ, thời hạn cache và bằng chứng rằng yêu cầu thực sự đang trúng cache. OpenAI hiện nêu thời hạn cache tối thiểu 30 phút cho GPT-5.6, nhưng đó không phải quy tắc giữ chung. Google công bố các mức giá khác nhau cho các hạng Standard, Batch, Flex và Priority. Gateway cũng có thể định tuyến giữa các nhà cung cấp hoặc hạng, nên tuyến được chọn là quan trọng. Tài liệu prompt-caching của OpenRouter khuyến nghị kiểm tra các trường usage của phản hồi như cached_tokenscache_write_tokens. Đối với bất kỳ ước tính sản xuất nào, hãy so sánh trang mô hình hiện tại với hóa đơn và siêu dữ liệu sử dụng thực tế thay vì chỉ dựa vào nhãn “có hỗ trợ cache” chung chung.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Aug 1, 2026
Cập nhật lần cuối Aug 14, 2026
14 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm