Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/Nghiên cứu CometAPI

Bảng giá GPT-5.6 năm 2026: Chi phí API Sol, Terra & Luna

请提供相关的官方定价原文(或表格/链接),例如 Sol、Terra、Luna 的单价、上下文长度、缓存/长上下文费率、工具调用费、示例账单等。我将把可见文本精准翻译为越南语并严格保留原始结构;目前无法凭空生成或假设具体价格与费用。

CometAPI
Mia MarenĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 1, 2026 15 phút đọc
Bảng giá GPT-5.6 năm 2026: Chi phí API Sol, Terra & Luna
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Cập nhật giá: Mức giá Standard cho ngữ cảnh ngắn của GPT-5.6 hiện là $5 đầu vào / $30 đầu ra cho Sol, $2 / $12 cho Terra, và $0.20 / $1.20 cho Luna trên mỗi 1 triệu token.

Ngày 30 tháng 7 năm 2026, OpenAI giảm giá GPT-5.6 Terra 20% và Luna 80%. Giá Sol không thay đổi.

Lưu ý các yếu tố chi phí ẩn: alias chung gpt-5.6 được định tuyến tới Sol, các yêu cầu vượt quá 272K token đầu vào sẽ dùng mức giá ngữ cảnh dài cao hơn, và token đầu ra vẫn có giá cao gấp 6 lần token đầu vào trên cả ba bậc.

Với các workload Sol nhạy cảm với độ trễ, Fast mode mới của OpenAI cho tốc độ xử lý nhanh hơn đến 2.5× với mức giá gấp 2 lần Standard.

Lướt nhanh về giá OpenAI API

Với người dùng đang tìm kiếm tổng quát về giá OpenAI API, câu hỏi đầu tiên thường là: mình thực sự đang trả tiền cho model nào hiện tại? Bảng dưới đây cung cấp cái nhìn gọn về một số model văn bản hiện có của OpenAI trước khi đi sâu vào GPT-5.6.

(> Cập nhật giá — 30/07/2026: OpenAI đã giảm giá API GPT-5.6 Terra 20% và Luna 80%. Terra hiện có giá $2 mỗi 1M token đầu vào và $12 mỗi 1M token đầu ra, trong khi Luna là $0.20 đầu vào và $1.20 đầu ra. Giá Sol không thay đổi.)

ModelĐầu vào / 1M tokenĐầu vào cachedĐầu ra / 1M token
gpt-5.6-sol$5.00$0.50$30.00
gpt-5.6-terra$2.00$0.20$12.00
gpt-5.6-luna$0.20$0.02$1.20
gpt-5.5$5.00$0.50$30.00
gpt-5.4$2.50$0.25$15.00
gpt-5.4-mini$0.75$0.075$4.50
gpt-5.4-nano$0.20$0.02$1.25

Với mức giá mới, Luna ngang bằng mức $0.20 đầu vào của GPT-5.4 nano nhưng có mức đầu ra thấp hơn một chút là $1.20 so với $1.25.

Nguồn*:* OpenAI API pricing

Mẫu hình quan trọng nhất dễ bị bỏ sót: token đầu ra của GPT-5.6 có giá cao gấp 6 lần token đầu vào trên Sol, Terra và Luna. Các câu trả lời dài, agent dài dòng, và quy trình nhiều lập luận có thể làm chi phí tăng nhanh hơn so với những thay đổi nhỏ về độ dài prompt.

Để có cái nhìn rộng hơn về họ GPT-5.6—bao gồm khả năng model, định vị, benchmark, quyền truy cập API, và các tính năng ra mắt chính—xem của OpenAI thông báo GPT-5.6 hoặc của CometAPI hướng dẫn GPT-5.6. Bài viết này tập trung cụ thể vào giá, cách tính chi phí, và các yếu tố có thể ảnh hưởng hóa đơn API thực tế.

Giá GPT-5.6: Sol vs Terra vs Luna

GPT-5.6 giới thiệu ba bậc giá. OpenAI định vị Sol là tuyến flagship, Terra là lựa chọn cân bằng, và Luna là bậc chi phí thấp cho workload khối lượng lớn.

Để xem chi tiết về khả năng, cách truy cập API GPT-5.6 và các trường hợp sử dụng của từng model, xem thêm tại GPT-5.6 model .

Giá Standard GPT-5.6 cho yêu cầu có ≤272K token đầu vào

ModelĐầu vào ngắnĐầu vào cachedGhi cacheĐầu ra ngắnĐầu vào dàiĐầu vào dài cachedGhi cache dàiĐầu ra dài
gpt-5.6-sol$5.00$0.50$6.25$30.00$10.00$1.00$12.50$45.00
gpt-5.6-terra$2.00$0.20$2.50$12.00$4.00$0.40$5.00$18.00
gpt-5.6-luna$0.20$0.02$0.25$1.20$0.40$0.04$0.50$1.80

Nguồn*:* OpenAI API pricing

Giá ngữ cảnh dài: Các yêu cầu có hơn 272K token đầu vào sử dụng mức giá cao hơn. Đầu vào, đầu vào cached và ghi cache bị tính phí gấp 2× mức chuẩn, trong khi đầu ra bị tính gấp 1.5×. Mức giá cao hơn áp dụng cho toàn bộ yêu cầu.

Điểm khởi đầu hợp lý là test Luna cho các tác vụ đơn giản, khối lượng lớn; Terra cho workload ứng dụng cân bằng; và Sol cho các tác vụ khó nhất hoặc có tác động cao. Đây không phải khuyến nghị chung: độ chính xác, số lần retry, hành vi tool, và khâu review thủ công có thể lớn hơn chênh lệch về giá niêm yết.

Một chi tiết alias quan trọng

Hướng dẫn model của OpenAI (model guidance) nêu rằng alias chung gpt-5.6 được định tuyến tới gpt-5.6-sol.

Điều đó nghĩa là yêu cầu gửi tới gpt-5.6 dùng bậc giá Sol. Nếu workload của bạn chạy tốt trên Terra hoặc Luna, hãy dùng ID model cụ thể thay vì cho rằng alias chung sẽ chọn bậc rẻ nhất phù hợp.

Ví dụ 1: Một yêu cầu API điển hình

Bắt đầu với một dạng yêu cầu phổ biến:

  • 1,000 token đầu vào
  • 500 token đầu ra
ModelChi phí đầu vào hàng thángChi phí đầu ra hàng thángTổng cộng
gpt-5.6-sol$10,000$15,000$25,000
gpt-5.6-terra$4,000$6,000$10,000
gpt-5.6-luna$400$600$1,000

Với workload này, mức giá mới của Luna giảm ước tính hóa đơn token hàng tháng từ $5,000 xuống $1,000, trong khi Terra từ $12,500 xuống $10,000.

Cách tính cho Sol:

(1,000 / 1,000,000 × $5) + (500 / 1,000,000 × $30) = $0.020

Ví dụ này cũng cho thấy vì sao độ dài đầu ra quan trọng. Dù yêu cầu có số token đầu vào gấp đôi đầu ra, phần đầu ra chiếm 75% chi phí token của Sol vì đầu ra được định giá cao gấp sáu lần đầu vào.

Đối với chat, agent và sinh mã, kiểm soát độ dài không cần thiết đôi khi tiết kiệm nhiều hơn việc cắt bớt một prompt hệ thống nhỏ.

Ví dụ 2: Chi phí hàng tháng ở quy mô lớn

Giả sử một ứng dụng xử lý 1 triệu yêu cầu mỗi tháng, trung bình:

  • 2,000 token đầu vào mỗi yêu cầu
  • 500 token đầu ra mỗi yêu cầu

Tổng cộng 2 tỷ token đầu vào và 500 triệu token đầu ra mỗi tháng.

ModelChi phí đầu vào hàng thángChi phí đầu ra hàng thángTổng cộng
gpt-5.6-sol$10,000$15,000$25,000
gpt-5.6-terra$5,000$7,500$12,500
gpt-5.6-luna$2,000$3,000$5,000

Khoảng cách đủ lớn để đáng cân nhắc thử nghiệm định tuyến, nhưng hàng rẻ nhất không tự động là lựa chọn tốt nhất cho production. Nếu model rẻ hơn gây nhiều retry, tác vụ thất bại hoặc cần review thủ công, tổng chi phí quy trình có thể cao hơn.

Giá ngữ cảnh dài: Điều gì xảy ra trên 272K token?

Các model GPT-5.6 hỗ trợ cửa sổ ngữ cảnh 1.05M token, nhưng OpenAI áp dụng mức giá cao hơn khi yêu cầu chứa hơn 272,000 token đầu vào.

Với các yêu cầu ngữ cảnh dài:

  • đầu vào bị tính phí gấp 2× mức ngữ cảnh ngắn
  • đầu vào cached và ghi cache cũng gấp 2×
  • đầu ra gấp 1.5×
  • Mức cao hơn áp dụng cho toàn bộ yêu cầu, không chỉ phần vượt 272K

Với Sol, điều này thay đổi đầu vào từ $5 lên $10 mỗi 1M token và đầu ra từ $30 lên $45. Cấu trúc hệ số tương tự áp dụng cho Terra và Luna.

Điều này tạo ra một “vách chi phí” gần ngưỡng 272K. Với workload sát ngưỡng, hãy giảm trùng lặp khối truy xuất, lịch sử hội thoại cũ, tệp kho mã không cần thiết, hoặc đầu ra công cụ dài dòng trước khi gửi yêu cầu. Xem của OpenAI hướng dẫn tối ưu chi phí để có thêm gợi ý giảm token.

Giá Standard, Batch, Flex và Priority

Với workload văn bản GPT-5.6 đủ điều kiện, OpenAI cung cấp nhiều bậc xử lý.

BậcSol đầu vào/đầu raTerra đầu vào/đầu raLuna đầu vào/đầu raMục đích điển hình
Standard$5 / $30$2 / $12$0.20 / $1.20Lưu lượng đồng bộ bình thường
Batch$2.50 / $15$1 / $6$0.10 / $0.60Tác vụ ngoại tuyến không đồng bộ
Flex$2.50 / $15$1 / $6$0.10 / $0.60Workload nhạy giá có thể chấp nhận xử lý chậm hơn
Fast mode$10 / $60$4 / $24$0.40 / $2.40Lưu lượng ngữ cảnh ngắn nhạy cảm độ trễ

Batch và Flex vẫn rẻ hơn khoảng 50% so với Standard. Priority Processing được đổi tên thành Fast mode vào ngày 30/07/2026, dù các yêu cầu hiện có dùng service_tier: "priority" vẫn tương thích.

Với GPT-5.6 Sol, Fast mode cho tốc độ xử lý nhanh hơn đến 2.5× so với Standard với mức giá token gấp 2×, không đổi “độ thông minh” của model. Phù hợp khi độ trễ đối mặt người dùng đủ quan trọng để chấp nhận mức giá cao hơn.

Prompt Caching: Khi nào giúp tiết kiệm với GPT-5.6?

Với GPT-5.6, ghi cache có giá 1.25× mức đầu vào bình thường, còn lần đọc cache khớp sẽ dùng mức giảm giá cho đầu vào cached.

Xét một tiền tố dùng lại 100,000 token trên Sol:

Hành độngChi phí
Xử lý một lần như đầu vào thường (không cache)$0.50
Ghi tiền tố vào cache$0.63
Đọc tiền tố đã cache sau đó$0.05

Hai lần dùng không cache tốn $1.00. Một lần ghi cache cộng một lần đọc khớp từ cache tốn $0.675, tiết kiệm $0.325 trong ví dụ đơn giản này.

Giới hạn của ví dụ: So sánh này chỉ xét chi phí đầu vào của tiền tố có thể tái sử dụng. Nó không tính token đầu ra, các đầu vào chưa cache khác, công cụ, hay retry. Mức tiết kiệm thực tế phụ thuộc vào việc tiền tố có khớp yêu cầu cache hay không và tần suất được tái sử dụng.

Do đó, caching hữu ích nhất với các tiền tố prompt dài, ổn định và được lặp lại nhiều. Ghi cache mà không được dùng lại sẽ làm tăng chi phí thay vì giảm.

Hướng dẫn prompt caching của OpenAI tài liệu hóa giá ghi cache, lần đọc cached, breakpoint tường minh và hành vi TTL.

Các chi phí khác có thể làm thay đổi hóa đơn OpenAI API

Token lập luận và chế độ Pro

Token lập luận được tính như token đầu ra ngay cả khi không hiển thị dưới dạng văn bản phản hồi. Thiết lập lập luận cao hơn vì vậy có thể tăng tổng token đầu ra và độ trễ.

Nơi được hỗ trợ, reasoning.mode = "pro" nên được xem là cấu hình để benchmark, không phải quy tắc mặc định về tiết kiệm chi phí hay chất lượng. OpenAI không liệt kê một khoản phụ phí Pro cố định riêng; tác động chi phí đến từ lượng token phát sinh. Mốc hợp lý là test Standard và Pro trên các tác vụ đại diện và so sánh tỷ lệ thành công, tổng token đầu ra, độ trễ và số lần retry.

Tìm kiếm web và công cụ khác

Hiện OpenAI liệt kê tìm kiếm web tiêu chuẩn ở mức $10 mỗi 1,000 lượt gọi, cộng token nội dung tìm kiếm được tính theo mức giá model đã chọn. Hai lượt tìm kiếm web trên một yêu cầu Luna nhỏ do đó có thể tốn nhiều hơn phần token model của yêu cầu.

OpenAI cũng liệt kê mức giá web search preview riêng cho các model không lập luận ở mức $25 mỗi 1,000 lượt gọi, với token nội dung tìm kiếm miễn phí. Hãy kiểm tra chính xác tổ hợp công cụ và model trên trang giá chính thức thay vì áp một mức giá tìm kiếm web cho mọi endpoint.

Xử lý theo vùng

Các endpoint xử lý theo vùng hoặc cư trú dữ liệu đủ điều kiện cho các model phát hành từ ngày 05/03/2026 trở đi kèm phụ phí 10% theo trang giá của OpenAI. Các đội doanh nghiệp có yêu cầu cư trú dữ liệu nên tính yếu tố này vào ước tính ngân sách.

Cách tính chi phí OpenAI API

Với một yêu cầu cơ bản:

Chi phí token =

(token đầu vào / 1M × đơn giá đầu vào)

  • (token đầu ra / 1M × đơn giá đầu ra)

Cho kế hoạch production, mở rộng để bao gồm:

Tổng chi phí quy trình =

đầu vào chưa cache

  • đầu vào cached
  • ghi cache
  • token đầu ra và lập luận
  • phí công cụ
  • điều chỉnh theo bậc dịch vụ
  • phụ phí theo vùng, nếu có
  • retry và yêu cầu fallback

Chỉ số hữu ích nhất thường là:

Chi phí trên mỗi tác vụ thành công = tổng chi phí quy trình / số tác vụ thành công

Điều này tránh việc mức token rẻ hơn trở nên hấp dẫn giả tạo khi nó cũng gây nhiều thất bại hoặc khối lượng review lớn hơn.

Cách chọn model phù hợp mà không trả quá tay

Dùng bảng giá làm điểm khởi đầu, sau đó test trên tác vụ thực.

  1. Bắt đầu với model rẻ nhất có vẻ đáp ứng được tác vụ. Luna có thể là bài test đầu tiên hợp lý cho công việc đơn giản, khối lượng lớn, nhưng đừng mặc định nó sẽ tốt nhất cho mọi tác vụ trích xuất hay tóm tắt.
  2. Đo độ dài đầu ra. Token đầu ra GPT-5.6 có giá gấp 6× token đầu vào, vì vậy phản hồi dài dòng đáng được chú ý.
  3. Lưu ý ngưỡng 272K. Vượt ngưỡng này sẽ đổi mức giá cho toàn bộ yêu cầu.
  4. Dùng Batch hoặc Flex cho công việc không gấp. Kiểm tra ràng buộc vận hành trước khi đưa vào production.
  5. Chỉ cache các tiền tố có thể tái sử dụng. Đo tỷ lệ trúng cache thực tế thay vì mặc định prompt dài là nên cache.
  6. Theo dõi công cụ và retry. Chúng có thể xóa sạch phần tiết kiệm từ model rẻ hơn.

Với các đội so sánh tuyến giữa nhiều nhà cung cấp, giá CometAPI cung cấp cái nhìn trực tiếp đa-model. CometAPI QuickstartCookbook có thể dùng để chạy cùng một bộ test trên nhiều tuyến tương thích OpenAI.

FAQ

GPT-5.6 có giá bao nhiêu vào năm 2026?

Giá tùy model. Mức Standard cho ngữ cảnh ngắn của GPT-5.6 dao động từ $1 đầu vào / $6 đầu ra mỗi 1M token cho Luna đến $5 / $30 cho Sol. Cũng có các model chi phí thấp hơn như GPT-5.4 mini và nano. Hãy kiểm tra model cụ thể trên trang giá trực tiếp của OpenAI.

Giá ChatGPT API có giống giá GPT-5.6 không?

“ChatGPT API pricing” thường được dùng không chính thức để chỉ giá OpenAI API cho các model hỗ trợ chat, nhưng gói đăng ký ChatGPT và billing API là hai sản phẩm riêng. Việc tính phí API phụ thuộc model và loại sử dụng cụ thể.

Model GPT-5.6 nào rẻ nhất?

gpt-5.6-luna là model GPT-5.6 rẻ nhất, có giá $0.20 mỗi 1M token đầu vào và $1.20 mỗi 1M token đầu ra. OpenAI đã giảm cả hai mức 80% vào ngày 30/07, khiến Luna kinh tế hơn nhiều cho agent khối lượng lớn, phân loại, xử lý tài liệu và workflow công cụ được xác định rõ.

gpt-5.6 dùng model nào?

Hướng dẫn model của OpenAI nêu rằng alias gpt-5.6 định tuyến tới gpt-5.6-sol. Hãy dùng ID model Terra hoặc Luna cụ thể khi bạn muốn các bậc đó.

Khi nào áp dụng giá ngữ cảnh dài của GPT-5.6?

Khi đầu vào vượt 272,000 token, GPT-5.6 áp dụng mức giá ngữ cảnh dài cho toàn bộ yêu cầu: 2× cho các hạng mục liên quan đầu vào và 1.5× cho đầu ra.

Batch và Flex có rẻ hơn Standard với GPT-5.6 không?

Với các workload GPT-5.6 đủ điều kiện, mức token niêm yết của Batch và Flex rẻ hơn khoảng 50% so với Standard. Chúng có đặc tính xử lý khác nhau, vì vậy hãy xác nhận workload có thể chấp nhận các ràng buộc đó.

Ghi cache có tốn thêm chi phí với GPT-5.6 không?

Có. Ghi cache GPT-5.6 được tính 1.25× mức đầu vào bình thường, trong khi các lần đọc cache khớp dùng mức giá đầu vào cached đã giảm. Mức tiết kiệm phụ thuộc vào tái sử dụng thực tế.

So sánh chi phí GPT-5.6 trên chính workload của bạn

Bảng giá là điểm khởi đầu. Chi phí thực phụ thuộc vào prompt, độ dài đầu ra, tỷ lệ trúng cache, công cụ, retry và tỷ lệ thành công của tác vụ.

Với CometAPI, bạn có thể test Sol, Terra, Luna của GPT-5.6 và các model khác qua một API tương thích OpenAI dùng cùng một workload.

Các bước tiếp theo: so sánh giá model hiện tại, làm theo CometAPI Quickstart, hoặc dùng CometAPI Cookbook để xây dựng đánh giá model có thể lặp lại.

Chọn tuyến có chi phí thấp nhất mà vẫn đáp ứng yêu cầu về chất lượng, độ trễ và độ tin cậy.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Jul 15, 2026
Cập nhật lần cuối Sep 1, 2026
605 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm