TL;DR
Cập nhật giá: Mức giá Standard cho ngữ cảnh ngắn của GPT-5.6 hiện là $5 đầu vào / $30 đầu ra cho Sol, $2 / $12 cho Terra, và $0.20 / $1.20 cho Luna trên mỗi 1 triệu token.
Ngày 30 tháng 7 năm 2026, OpenAI giảm giá GPT-5.6 Terra 20% và Luna 80%. Giá Sol không thay đổi.
Lưu ý các yếu tố chi phí ẩn: alias chung gpt-5.6 được định tuyến tới Sol, các yêu cầu vượt quá 272K token đầu vào sẽ dùng mức giá ngữ cảnh dài cao hơn, và token đầu ra vẫn có giá cao gấp 6 lần token đầu vào trên cả ba bậc.
Với các workload Sol nhạy cảm với độ trễ, Fast mode mới của OpenAI cho tốc độ xử lý nhanh hơn đến 2.5× với mức giá gấp 2 lần Standard.
Lướt nhanh về giá OpenAI API
Với người dùng đang tìm kiếm tổng quát về giá OpenAI API, câu hỏi đầu tiên thường là: mình thực sự đang trả tiền cho model nào hiện tại? Bảng dưới đây cung cấp cái nhìn gọn về một số model văn bản hiện có của OpenAI trước khi đi sâu vào GPT-5.6.
(> Cập nhật giá — 30/07/2026: OpenAI đã giảm giá API GPT-5.6 Terra 20% và Luna 80%. Terra hiện có giá $2 mỗi 1M token đầu vào và $12 mỗi 1M token đầu ra, trong khi Luna là $0.20 đầu vào và $1.20 đầu ra. Giá Sol không thay đổi.)
| Model | Đầu vào / 1M token | Đầu vào cached | Đầu ra / 1M token |
|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $30.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $12.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $1.20 |
| gpt-5.5 | $5.00 | $0.50 | $30.00 |
| gpt-5.4 | $2.50 | $0.25 | $15.00 |
| gpt-5.4-mini | $0.75 | $0.075 | $4.50 |
| gpt-5.4-nano | $0.20 | $0.02 | $1.25 |
Với mức giá mới, Luna ngang bằng mức $0.20 đầu vào của GPT-5.4 nano nhưng có mức đầu ra thấp hơn một chút là $1.20 so với $1.25.
Nguồn*:* OpenAI API pricing
Mẫu hình quan trọng nhất dễ bị bỏ sót: token đầu ra của GPT-5.6 có giá cao gấp 6 lần token đầu vào trên Sol, Terra và Luna. Các câu trả lời dài, agent dài dòng, và quy trình nhiều lập luận có thể làm chi phí tăng nhanh hơn so với những thay đổi nhỏ về độ dài prompt.
Để có cái nhìn rộng hơn về họ GPT-5.6—bao gồm khả năng model, định vị, benchmark, quyền truy cập API, và các tính năng ra mắt chính—xem của OpenAI thông báo GPT-5.6 hoặc của CometAPI hướng dẫn GPT-5.6. Bài viết này tập trung cụ thể vào giá, cách tính chi phí, và các yếu tố có thể ảnh hưởng hóa đơn API thực tế.
Giá GPT-5.6: Sol vs Terra vs Luna
GPT-5.6 giới thiệu ba bậc giá. OpenAI định vị Sol là tuyến flagship, Terra là lựa chọn cân bằng, và Luna là bậc chi phí thấp cho workload khối lượng lớn.
Để xem chi tiết về khả năng, cách truy cập API GPT-5.6 và các trường hợp sử dụng của từng model, xem thêm tại GPT-5.6 model .
Giá Standard GPT-5.6 cho yêu cầu có ≤272K token đầu vào
| Model | Đầu vào ngắn | Đầu vào cached | Ghi cache | Đầu ra ngắn | Đầu vào dài | Đầu vào dài cached | Ghi cache dài | Đầu ra dài |
|---|---|---|---|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $2.50 | $12.00 | $4.00 | $0.40 | $5.00 | $18.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $0.25 | $1.20 | $0.40 | $0.04 | $0.50 | $1.80 |
Nguồn*:* OpenAI API pricing
Giá ngữ cảnh dài: Các yêu cầu có hơn 272K token đầu vào sử dụng mức giá cao hơn. Đầu vào, đầu vào cached và ghi cache bị tính phí gấp 2× mức chuẩn, trong khi đầu ra bị tính gấp 1.5×. Mức giá cao hơn áp dụng cho toàn bộ yêu cầu.
Điểm khởi đầu hợp lý là test Luna cho các tác vụ đơn giản, khối lượng lớn; Terra cho workload ứng dụng cân bằng; và Sol cho các tác vụ khó nhất hoặc có tác động cao. Đây không phải khuyến nghị chung: độ chính xác, số lần retry, hành vi tool, và khâu review thủ công có thể lớn hơn chênh lệch về giá niêm yết.
Một chi tiết alias quan trọng
Hướng dẫn model của OpenAI (model guidance) nêu rằng alias chung gpt-5.6 được định tuyến tới gpt-5.6-sol.
Điều đó nghĩa là yêu cầu gửi tới gpt-5.6 dùng bậc giá Sol. Nếu workload của bạn chạy tốt trên Terra hoặc Luna, hãy dùng ID model cụ thể thay vì cho rằng alias chung sẽ chọn bậc rẻ nhất phù hợp.
Ví dụ 1: Một yêu cầu API điển hình
Bắt đầu với một dạng yêu cầu phổ biến:
- 1,000 token đầu vào
- 500 token đầu ra
| Model | Chi phí đầu vào hàng tháng | Chi phí đầu ra hàng tháng | Tổng cộng |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $4,000 | $6,000 | $10,000 |
| gpt-5.6-luna | $400 | $600 | $1,000 |
Với workload này, mức giá mới của Luna giảm ước tính hóa đơn token hàng tháng từ $5,000 xuống $1,000, trong khi Terra từ $12,500 xuống $10,000.
Cách tính cho Sol:
(1,000 / 1,000,000 × $5) + (500 / 1,000,000 × $30) = $0.020
Ví dụ này cũng cho thấy vì sao độ dài đầu ra quan trọng. Dù yêu cầu có số token đầu vào gấp đôi đầu ra, phần đầu ra chiếm 75% chi phí token của Sol vì đầu ra được định giá cao gấp sáu lần đầu vào.
Đối với chat, agent và sinh mã, kiểm soát độ dài không cần thiết đôi khi tiết kiệm nhiều hơn việc cắt bớt một prompt hệ thống nhỏ.
Ví dụ 2: Chi phí hàng tháng ở quy mô lớn
Giả sử một ứng dụng xử lý 1 triệu yêu cầu mỗi tháng, trung bình:
- 2,000 token đầu vào mỗi yêu cầu
- 500 token đầu ra mỗi yêu cầu
Tổng cộng 2 tỷ token đầu vào và 500 triệu token đầu ra mỗi tháng.
| Model | Chi phí đầu vào hàng tháng | Chi phí đầu ra hàng tháng | Tổng cộng |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $5,000 | $7,500 | $12,500 |
| gpt-5.6-luna | $2,000 | $3,000 | $5,000 |
Khoảng cách đủ lớn để đáng cân nhắc thử nghiệm định tuyến, nhưng hàng rẻ nhất không tự động là lựa chọn tốt nhất cho production. Nếu model rẻ hơn gây nhiều retry, tác vụ thất bại hoặc cần review thủ công, tổng chi phí quy trình có thể cao hơn.
Giá ngữ cảnh dài: Điều gì xảy ra trên 272K token?
Các model GPT-5.6 hỗ trợ cửa sổ ngữ cảnh 1.05M token, nhưng OpenAI áp dụng mức giá cao hơn khi yêu cầu chứa hơn 272,000 token đầu vào.
Với các yêu cầu ngữ cảnh dài:
- đầu vào bị tính phí gấp 2× mức ngữ cảnh ngắn
- đầu vào cached và ghi cache cũng gấp 2×
- đầu ra gấp 1.5×
- Mức cao hơn áp dụng cho toàn bộ yêu cầu, không chỉ phần vượt 272K
Với Sol, điều này thay đổi đầu vào từ $5 lên $10 mỗi 1M token và đầu ra từ $30 lên $45. Cấu trúc hệ số tương tự áp dụng cho Terra và Luna.
Điều này tạo ra một “vách chi phí” gần ngưỡng 272K. Với workload sát ngưỡng, hãy giảm trùng lặp khối truy xuất, lịch sử hội thoại cũ, tệp kho mã không cần thiết, hoặc đầu ra công cụ dài dòng trước khi gửi yêu cầu. Xem của OpenAI hướng dẫn tối ưu chi phí để có thêm gợi ý giảm token.
Giá Standard, Batch, Flex và Priority
Với workload văn bản GPT-5.6 đủ điều kiện, OpenAI cung cấp nhiều bậc xử lý.
| Bậc | Sol đầu vào/đầu ra | Terra đầu vào/đầu ra | Luna đầu vào/đầu ra | Mục đích điển hình |
|---|---|---|---|---|
| Standard | $5 / $30 | $2 / $12 | $0.20 / $1.20 | Lưu lượng đồng bộ bình thường |
| Batch | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | Tác vụ ngoại tuyến không đồng bộ |
| Flex | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | Workload nhạy giá có thể chấp nhận xử lý chậm hơn |
| Fast mode | $10 / $60 | $4 / $24 | $0.40 / $2.40 | Lưu lượng ngữ cảnh ngắn nhạy cảm độ trễ |
Batch và Flex vẫn rẻ hơn khoảng 50% so với Standard. Priority Processing được đổi tên thành Fast mode vào ngày 30/07/2026, dù các yêu cầu hiện có dùng service_tier: "priority" vẫn tương thích.
Với GPT-5.6 Sol, Fast mode cho tốc độ xử lý nhanh hơn đến 2.5× so với Standard với mức giá token gấp 2×, không đổi “độ thông minh” của model. Phù hợp khi độ trễ đối mặt người dùng đủ quan trọng để chấp nhận mức giá cao hơn.
Prompt Caching: Khi nào giúp tiết kiệm với GPT-5.6?
Với GPT-5.6, ghi cache có giá 1.25× mức đầu vào bình thường, còn lần đọc cache khớp sẽ dùng mức giảm giá cho đầu vào cached.
Xét một tiền tố dùng lại 100,000 token trên Sol:
| Hành động | Chi phí |
|---|---|
| Xử lý một lần như đầu vào thường (không cache) | $0.50 |
| Ghi tiền tố vào cache | $0.63 |
| Đọc tiền tố đã cache sau đó | $0.05 |
Hai lần dùng không cache tốn $1.00. Một lần ghi cache cộng một lần đọc khớp từ cache tốn $0.675, tiết kiệm $0.325 trong ví dụ đơn giản này.
Giới hạn của ví dụ: So sánh này chỉ xét chi phí đầu vào của tiền tố có thể tái sử dụng. Nó không tính token đầu ra, các đầu vào chưa cache khác, công cụ, hay retry. Mức tiết kiệm thực tế phụ thuộc vào việc tiền tố có khớp yêu cầu cache hay không và tần suất được tái sử dụng.
Do đó, caching hữu ích nhất với các tiền tố prompt dài, ổn định và được lặp lại nhiều. Ghi cache mà không được dùng lại sẽ làm tăng chi phí thay vì giảm.
Hướng dẫn prompt caching của OpenAI tài liệu hóa giá ghi cache, lần đọc cached, breakpoint tường minh và hành vi TTL.
Các chi phí khác có thể làm thay đổi hóa đơn OpenAI API
Token lập luận và chế độ Pro
Token lập luận được tính như token đầu ra ngay cả khi không hiển thị dưới dạng văn bản phản hồi. Thiết lập lập luận cao hơn vì vậy có thể tăng tổng token đầu ra và độ trễ.
Nơi được hỗ trợ, reasoning.mode = "pro" nên được xem là cấu hình để benchmark, không phải quy tắc mặc định về tiết kiệm chi phí hay chất lượng. OpenAI không liệt kê một khoản phụ phí Pro cố định riêng; tác động chi phí đến từ lượng token phát sinh. Mốc hợp lý là test Standard và Pro trên các tác vụ đại diện và so sánh tỷ lệ thành công, tổng token đầu ra, độ trễ và số lần retry.
Tìm kiếm web và công cụ khác
Hiện OpenAI liệt kê tìm kiếm web tiêu chuẩn ở mức $10 mỗi 1,000 lượt gọi, cộng token nội dung tìm kiếm được tính theo mức giá model đã chọn. Hai lượt tìm kiếm web trên một yêu cầu Luna nhỏ do đó có thể tốn nhiều hơn phần token model của yêu cầu.
OpenAI cũng liệt kê mức giá web search preview riêng cho các model không lập luận ở mức $25 mỗi 1,000 lượt gọi, với token nội dung tìm kiếm miễn phí. Hãy kiểm tra chính xác tổ hợp công cụ và model trên trang giá chính thức thay vì áp một mức giá tìm kiếm web cho mọi endpoint.
Xử lý theo vùng
Các endpoint xử lý theo vùng hoặc cư trú dữ liệu đủ điều kiện cho các model phát hành từ ngày 05/03/2026 trở đi kèm phụ phí 10% theo trang giá của OpenAI. Các đội doanh nghiệp có yêu cầu cư trú dữ liệu nên tính yếu tố này vào ước tính ngân sách.
Cách tính chi phí OpenAI API
Với một yêu cầu cơ bản:
Chi phí token =
(token đầu vào / 1M × đơn giá đầu vào)
- (token đầu ra / 1M × đơn giá đầu ra)
Cho kế hoạch production, mở rộng để bao gồm:
Tổng chi phí quy trình =
đầu vào chưa cache
- đầu vào cached
- ghi cache
- token đầu ra và lập luận
- phí công cụ
- điều chỉnh theo bậc dịch vụ
- phụ phí theo vùng, nếu có
- retry và yêu cầu fallback
Chỉ số hữu ích nhất thường là:
Chi phí trên mỗi tác vụ thành công = tổng chi phí quy trình / số tác vụ thành công
Điều này tránh việc mức token rẻ hơn trở nên hấp dẫn giả tạo khi nó cũng gây nhiều thất bại hoặc khối lượng review lớn hơn.
Cách chọn model phù hợp mà không trả quá tay
Dùng bảng giá làm điểm khởi đầu, sau đó test trên tác vụ thực.
- Bắt đầu với model rẻ nhất có vẻ đáp ứng được tác vụ. Luna có thể là bài test đầu tiên hợp lý cho công việc đơn giản, khối lượng lớn, nhưng đừng mặc định nó sẽ tốt nhất cho mọi tác vụ trích xuất hay tóm tắt.
- Đo độ dài đầu ra. Token đầu ra GPT-5.6 có giá gấp 6× token đầu vào, vì vậy phản hồi dài dòng đáng được chú ý.
- Lưu ý ngưỡng 272K. Vượt ngưỡng này sẽ đổi mức giá cho toàn bộ yêu cầu.
- Dùng Batch hoặc Flex cho công việc không gấp. Kiểm tra ràng buộc vận hành trước khi đưa vào production.
- Chỉ cache các tiền tố có thể tái sử dụng. Đo tỷ lệ trúng cache thực tế thay vì mặc định prompt dài là nên cache.
- Theo dõi công cụ và retry. Chúng có thể xóa sạch phần tiết kiệm từ model rẻ hơn.
Với các đội so sánh tuyến giữa nhiều nhà cung cấp, giá CometAPI cung cấp cái nhìn trực tiếp đa-model. CometAPI Quickstart và Cookbook có thể dùng để chạy cùng một bộ test trên nhiều tuyến tương thích OpenAI.
FAQ
GPT-5.6 có giá bao nhiêu vào năm 2026?
Giá tùy model. Mức Standard cho ngữ cảnh ngắn của GPT-5.6 dao động từ $1 đầu vào / $6 đầu ra mỗi 1M token cho Luna đến $5 / $30 cho Sol. Cũng có các model chi phí thấp hơn như GPT-5.4 mini và nano. Hãy kiểm tra model cụ thể trên trang giá trực tiếp của OpenAI.
Giá ChatGPT API có giống giá GPT-5.6 không?
“ChatGPT API pricing” thường được dùng không chính thức để chỉ giá OpenAI API cho các model hỗ trợ chat, nhưng gói đăng ký ChatGPT và billing API là hai sản phẩm riêng. Việc tính phí API phụ thuộc model và loại sử dụng cụ thể.
Model GPT-5.6 nào rẻ nhất?
gpt-5.6-luna là model GPT-5.6 rẻ nhất, có giá $0.20 mỗi 1M token đầu vào và $1.20 mỗi 1M token đầu ra. OpenAI đã giảm cả hai mức 80% vào ngày 30/07, khiến Luna kinh tế hơn nhiều cho agent khối lượng lớn, phân loại, xử lý tài liệu và workflow công cụ được xác định rõ.
gpt-5.6 dùng model nào?
Hướng dẫn model của OpenAI nêu rằng alias gpt-5.6 định tuyến tới gpt-5.6-sol. Hãy dùng ID model Terra hoặc Luna cụ thể khi bạn muốn các bậc đó.
Khi nào áp dụng giá ngữ cảnh dài của GPT-5.6?
Khi đầu vào vượt 272,000 token, GPT-5.6 áp dụng mức giá ngữ cảnh dài cho toàn bộ yêu cầu: 2× cho các hạng mục liên quan đầu vào và 1.5× cho đầu ra.
Batch và Flex có rẻ hơn Standard với GPT-5.6 không?
Với các workload GPT-5.6 đủ điều kiện, mức token niêm yết của Batch và Flex rẻ hơn khoảng 50% so với Standard. Chúng có đặc tính xử lý khác nhau, vì vậy hãy xác nhận workload có thể chấp nhận các ràng buộc đó.
Ghi cache có tốn thêm chi phí với GPT-5.6 không?
Có. Ghi cache GPT-5.6 được tính 1.25× mức đầu vào bình thường, trong khi các lần đọc cache khớp dùng mức giá đầu vào cached đã giảm. Mức tiết kiệm phụ thuộc vào tái sử dụng thực tế.
So sánh chi phí GPT-5.6 trên chính workload của bạn
Bảng giá là điểm khởi đầu. Chi phí thực phụ thuộc vào prompt, độ dài đầu ra, tỷ lệ trúng cache, công cụ, retry và tỷ lệ thành công của tác vụ.
Với CometAPI, bạn có thể test Sol, Terra, Luna của GPT-5.6 và các model khác qua một API tương thích OpenAI dùng cùng một workload.
Các bước tiếp theo: so sánh giá model hiện tại, làm theo CometAPI Quickstart, hoặc dùng CometAPI Cookbook để xây dựng đánh giá model có thể lặp lại.
Chọn tuyến có chi phí thấp nhất mà vẫn đáp ứng yêu cầu về chất lượng, độ trễ và độ tin cậy.
