Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
ai-comparisons/Nghiên cứu CometAPI

GPT-5.6 Sol so với Claude Sonnet 5 so với Gemini 3.7 Flash Giá API

So sánh giá API của GPT-5.6 Sol, Claude Sonnet 5 và Gemini 3.7 Flash với cùng một khối lượng công việc, bao gồm bộ nhớ đệm (caching), thử lại (retries), xử lý theo lô (batch) và chi phí theo độ dài đầu ra.

CometAPI
Lei WangĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 1, 2026 14 phút đọc
GPT-5.6 Sol so với Claude Sonnet 5 so với Gemini 3.7 Flash Giá API
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

GPT-5.6 Sol, Claude Sonnet 5 và Gemini 3.7 Flash có giá bao nhiêu?

Làm thế nào để so sánh giá các mô hình AI giữa những nhà cung cấp khác nhau? Hãy bắt đầu với cùng một tỷ lệ đầu vào–đầu ra, cùng một đơn vị tiền tệ và cùng một định nghĩa về kết quả thành công. Một “giá trên mỗi 1M token” đơn lẻ là chưa đầy đủ vì token đầu vào và đầu ra được tính phí ở các mức khác nhau, các yêu cầu ngữ cảnh dài có thể bước vào bậc giá cao hơn, và việc thử lại hoặc câu trả lời bị từ chối có thể khiến chi phí hiệu dụng tăng cao hơn nhiều.

Tính đến ngày 26 tháng 8 năm 2026, một khối lượng công việc gồm 800,000 token đầu vào chưa được cache và 200,000 token đầu ra sẽ có chi phí khoảng $5.76 với GPT-5.6 Sol, $2.88 với Claude Sonnet 5, hoặc $1.08 với Gemini 3.7 Flash theo mức giá hiện tại của CometAPI. Các mô hình này có vị trí khác nhau về tốc độ và năng lực, vì vậy đây là so sánh hóa đơn—không phải tuyên bố rằng chúng mang lại chất lượng giống hệt nhau.

Cách so sánh giá API AI giữa các nhà cung cấp

Bài viết này sử dụng đô la Mỹ trên mỗi 1 triệu token văn bản tính phí. Kịch bản ví dụ thể hiện một quy trình hỗ trợ hoặc tri thức khối lượng lớn với 800,000 token đầu vào và 200,000 token đầu ra trên nhiều yêu cầu. Mỗi yêu cầu đều nằm dưới ngưỡng định giá ngữ cảnh ngắn 272,000 token của GPT-5.6 Terra.

Đường cơ sở loại trừ cache prompt, chiết khấu theo lô, phí công cụ, hình ảnh, âm thanh, và các cuộc gọi thất bại hoặc lặp lại. Nó cũng giả định rằng một câu trả lời được tạo ra sẽ được chấp nhận. Công thức là:

cost = (input tokens / 1M × input rate) + (output tokens / 1M × output rate)

Hãy sử dụng số token thực tế được trả về trong mỗi phản hồi thay vì ước tính từ số ký tự. Bộ tách token khác nhau giữa các họ mô hình, nghĩa là cùng một văn bản không nhất thiết tạo ra cùng một số lượng token tính phí.

Giá API của GPT-5.6 Sol, Claude Sonnet 5 và Gemini 3.7 Flash

Ba ID mô hình và mức giá dưới đây đã được kiểm tra lại với thư mục mô hình trực tiếp của CometAPI vào ngày 26 tháng 8 năm 2026. Mức CometAPI là số liệu dùng trong các phép tính ví dụ. Cột “official” được bao gồm như một mốc tham chiếu.

Giá API GPT-5.6 Sol

GPT-5.6 Terra: CometAPI liệt kê $1.60 trên mỗi 1M token đầu vào và $9.60 trên mỗi 1M token đầu ra, so với mức chính thức $2 / $12. Ghi chú cập nhật giá: mức trực tiếp phản ánh giảm 20%; changelog của CometAPI ghi nhận việc giảm giá Terra vào ngày 31 tháng 7 năm 2026, và con số đã được kiểm tra lại sau bài rà soát giá ngày 22 tháng 8.

Xác nhận cập nhật (ngày 26 tháng 8 năm 2026): Ghi chú có chú thích trước đó được giữ lại để neo tham chiếu đánh giá vẫn hiển thị. Cho các phép tính trong bài viết này, sử dụng GPT-5.6 Sol ở mức $3.20 trên mỗi 1M token đầu vào và $16 trên mỗi 1M token đầu ra, so với mức chính thức $4 / $20. CometAPI đã công bố chương trình khuyến mại vào ngày 24 tháng 8 năm 2026 và liệt kê kéo dài đến ngày 21 tháng 11 năm 2026.

Giá API Claude Sonnet 5

Claude Sonnet 5: Tính đến ngày 26 tháng 8 năm 2026, CometAPI liệt kê $1.60 trên mỗi 1M token đầu vào và $8 trên mỗi 1M token đầu ra, so với mức $2 / $10 hiện tại của Anthropic. Anthropic đã cập nhật bài đăng ra mắt vào ngày 10 tháng 8 năm 2026 để biến mức $2 / $10 thành cố định; mức tăng lên $3 / $15 vào ngày 1 tháng 9 trước đó đã không còn áp dụng.

Giá API Gemini 3.7 Flash

Gemini 3.7 Flash: Tính đến ngày 26 tháng 8 năm 2026, CometAPI liệt kê $0.60 trên mỗi 1M token đầu vào và $3 trên mỗi 1M token đầu ra, so với mức khởi điểm $0.75 / $3.75 của Google kéo dài đến ngày 31 tháng 12 năm 2026.

Model IDCometAPI đầu vào / đầu raOfficial đầu vào / đầu ra800K in + 200K out
gpt-5.6-sol$3.20 / $16$4 / $20$5.76
claude-sonnet-5$1.60 / $8$2 / $10$2.88
gemini-3.7-flash$0.60 / $3$0.75 / $3.75$1.08

Tất cả mức giá đều là USD trên mỗi 1M token. Xem các trang mô hình có đóng dấu ngày dành cho GPT-5.6, Claude Sonnet 5 và Gemini 3.7 Flash, cùng với hướng dẫn định giá của CometAPI. Claude Sonnet 5: CometAPI liệt kê $1.60 trên mỗi 1M token đầu vào và $8 trên mỗi 1M token đầu ra, so với mức $2 / $10 hiện tại của Anthropic. Anthropic ban đầu công bố mức giá chuẩn $3 / $15 cho tháng 9 năm 2026, nhưng đã cập nhật vào ngày 10 tháng 8 năm 2026 và giữ cố định mức $2 / $10. GPT-5.6 Terra cũng có bậc ngữ cảnh dài cao hơn, vì vậy đừng áp dụng mức ngữ cảnh ngắn cho các yêu cầu vượt trên ngưỡng đã công bố.

Gemini 3.7 Flash có hóa đơn token thấp nhất trong kịch bản này và được định vị như một mô hình Flash hiệu quả. Claude Sonnet 5 là một mô hình sản xuất cân bằng, trong khi GPT-5.6 Sol là lựa chọn đầu bảng cho các khối lượng công việc lập luận và lập trình khó hơn. Quyết định hữu ích không chỉ là “hàng nào rẻ nhất?” mà là “mô hình nào tạo ra kết quả chấp nhận được với ít tổng số token, ít lần thử lại và chạy lại nhất?”

1M token tốn bao nhiêu cho GPT, Claude và Gemini?

Với đường cơ sở 800K đầu vào và 200K đầu ra, phép tính là đơn giản. GPT-5.6 Sol có chi phí 0.8 × $3.20 + 0.2 × $16 = $5.76. Claude Sonnet 5 có chi phí 0.8 × $1.60 + 0.2 × $8 = $2.88. Gemini 3.7 Flash có chi phí 0.8 × $0.60 + 0.2 × $3 = $1.08.

Phép tính đó hữu ích cho việc lập ngân sách, nhưng chi phí trên mỗi đầu ra được chấp nhận mới là chỉ số sản xuất tốt hơn. Bảng dưới đây cho thấy điều gì xảy ra khi cùng một khối lượng công việc gặp phải chi phí vận hành phổ biến.

Mô hìnhCơ bảnRetry 5%Rerun 10%40% đầu ra
GPT-5.6 Sol$5.76$6.05$6.34$8.32
Claude Sonnet 5$2.88$3.02$3.17$4.16
Gemini 3.7 Flash$1.08$1.13$1.19$1.56

“5% retried” giả định rằng 5% toàn bộ khối lượng token được gửi lại. “10% rerun” giả định rằng cứ mười đầu ra thì có một thất bại kiểm tra chất lượng và được tạo lại với cùng tỷ lệ token. “40% output” giữ tổng ở mức 1M token nhưng thay đổi tỷ lệ thành 600K đầu vào và 400K đầu ra. Vì token đầu ra tốn kém hơn, tính dài dòng có thể làm hóa đơn tăng nhanh hơn tăng lưu lượng.

Thử lại và đầu ra thất bại làm tăng chi phí bao nhiêu?

Thử lại API và chạy lại tốn bao nhiêu?

Việc thử lại có thể nhân đôi khối lượng công việc tính phí. Ở đường cơ sở, thử lại 5% khối lượng làm tăng GPT-5.6 Sol từ $5.76 lên khoảng $6.05, trong khi chạy lại 10% sau khi thất bại chất lượng nâng lên khoảng $6.34. Thử lại là lặp lại một yêu cầu sau lỗi truyền tải hoặc lỗi dịch vụ; chạy lại là tạo lại một câu trả lời đã được trả về nhưng bị từ chối. Chỉ thử lại giới hạn tốc độ, timeout và lỗi máy chủ tạm thời. Hướng dẫn lỗi và thử lại của CometAPI khuyến nghị backoff lũy tiến với jitter và không tự động thử lại đối với yêu cầu sai định dạng hoặc lỗi xác thực. Giới hạn số lần thử để một sự cố phía nhà cung cấp không tạo ra “bão thử lại”.

Cache prompt có thể tiết kiệm bao nhiêu?

Tiết kiệm nhờ cache phụ thuộc vào mức tái sử dụng. Mức ngữ cảnh ngắn của GPT-5.6 Sol trên CometAPI liệt kê đọc cache ở $0.32/M và ghi cache ở $4/M. Nếu một nửa của 800K đầu vào là tiền tố có thể tái sử dụng trong cache, lần chạy đầu tiên tốn khoảng $6.08 vì ghi 400K token vào cache thêm phụ phí $0.32 so với đầu vào bình thường. Một lần chạy sau đó có cache-hit tốn khoảng $4.61 thay vì $5.76, tiết kiệm khoảng $1.15. Điểm hòa vốn: một lần tái sử dụng thành công là đã bù hơn phần phụ phí ghi ban đầu; cộng dồn hai lần chạy đầu, đường cache tốn khoảng $10.69 so với $11.52 nếu không cache. Các mô hình khác có quy tắc và tối thiểu cache khác nhau, hãy xác minh trước khi lập ngân sách.

Độ dài đầu ra ảnh hưởng chi phí API AI thế nào?

Câu trả lời dài tốn kém. Mức đầu ra trong cả ba hàng cao gấp năm lần mức đầu vào. Đặt giới hạn đầu ra phù hợp với tác vụ, yêu cầu định dạng súc tích, và dừng tạo khi cấu trúc yêu cầu đã hoàn tất.

Đầu ra AI thất bại tốn bao nhiêu?

Một tác vụ thất bại vẫn có thể tiêu thụ token. Một yêu cầu trả về câu trả lời không thể dùng có thể là thành công về mặt kỹ thuật và được tính phí đầy đủ. Theo dõi riêng các vi phạm định dạng, hoang tưởng, lỗi công cụ và việc con người từ chối so với lỗi HTTP.

Giá token không đo lường chi phí kỹ thuật. SDK đặc thù nhà cung cấp, hóa đơn riêng, giám sát trùng lặp và công việc di chuyển đều thêm chi phí vận hành. Khi so sánh ba họ mô hình thông qua CometAPI, các nhóm có thể sử dụng cùng một base URL tương thích OpenAI—https://api.cometapi.com/v1—và thay đổi ID mô hình trong khi giữ cùng một lớp thanh toán và quan sát. Năng lực đặc thù từng mô hình vẫn cần được thử nghiệm.

Cách giảm chi phí API của GPT, Claude và Gemini

Batch và Flex có thể giảm chi phí API bao nhiêu?

Batch và Flex là các chế độ xử lý, không phải chiết khấu tự động cho mọi yêu cầu. Hướng dẫn định giá GPT-5.6 của CometAPI cho biết mức token Batch và Flex đủ điều kiện thấp hơn khoảng 50% so với Standard, trong khi Anthropic liệt kê tiết kiệm lên đến 50% cho xử lý theo lô. Áp dụng độ nhạy 50% cho đường cơ sở $5.76 của GPT-5.6 Sol cho ra khoảng $2.88, nhưng hãy coi đó là minh họa cho đến khi cùng chế độ và mức giá xuất hiện trong tài khoản CometAPI của bạn. Dùng Batch cho các job bất đồng bộ; dùng Flex chỉ khi chấp nhận được độ trễ biến thiên.

GPT-5.6 Terra vs Claude Sonnet 5 vs Gemini 3.7 Flash: mô hình nào rẻ nhất?

Sử dụng cùng khối lượng 800K đầu vào và 200K đầu ra theo mức CometAPI được kiểm tra ngày 26 tháng 8 năm 2026, Gemini 3.7 Flash tốn $1.08, Claude Sonnet 5 tốn $2.88, và GPT-5.6 Terra tốn $3.20. Gemini rẻ nhất về chi phí token thuần trong so sánh này. GPT-5.6 Terra vẫn có thể kinh tế cho các tác vụ khó nếu năng lực của nó giảm số lần thử lại hoặc chỉnh sửa thủ công, vì vậy hãy so sánh chi phí trên mỗi kết quả được chấp nhận trước khi chọn tuyến sản xuất.

Định tuyến theo độ khó của tác vụ. Dùng mô hình chi phí thấp cho phân loại, trích xuất và bản nháp thường lệ, sau đó chỉ nâng cấp những yêu cầu mơ hồ hoặc giá trị cao. Tuyến dự phòng phải phù hợp về phương thức, hỗ trợ công cụ và định dạng đầu ra—không chỉ có mức giá thấp hơn.

Lập ngân sách đầu ra trước khi gọi. Đặt giới hạn đầu ra thực tế và ghi nhận số token đầu vào, đầu ra và token cache thực tế từ phản hồi. Hướng dẫn ước tính chi phí của CometAPI xem các ước tính trước khi gọi là hàng rào ngân sách và mức sử dụng thực tế là phép đo cuối cùng.

Cache nội dung ổn định, không phải ngữ cảnh thay đổi. Chỉ dẫn hệ thống, chính sách sản phẩm và tài liệu tham chiếu dài là ứng viên tốt khi lặp lại. Đo tỷ lệ cache hit và bao gồm chi phí ghi cache; nếu không, cache có thể trông rẻ hơn về lý thuyết nhưng tiết kiệm ít trong thực tế.

Retry có chọn lọc. Thêm backoff lũy tiến, jitter và số lần thử tối đa. Ghi log ID mô hình, trạng thái, ID yêu cầu, token, và việc yêu cầu có phải là retry hay không. Điều này làm cho chi tiêu trùng lặp trở nên minh bạch.

Tối ưu chi phí trên mỗi kết quả được chấp nhận. Chạy một bộ đánh giá cố định và tính total API spend / accepted outputs. Một mô hình đắt hơn có thể rẻ hơn tổng thể nếu nó cần ít thử lại hơn, prompt ngắn hơn hoặc ít chỉnh sửa thủ công hơn.

Kiểm tra lại trước khi triển khai. Tính sẵn có của mô hình, mức giá khởi điểm, ngưỡng bậc và chiết khấu có thể thay đổi. Truy vấn Models API hoặc xem thư mục mô hình công khai vào ngày bạn xuất bản hoặc phê duyệt ngân sách.

FAQ

“Chi phí trên mỗi 1M token” thực sự nghĩa là gì?

Đó là mức chuẩn hóa, không phải giá của mọi yêu cầu. Nhân mức đầu vào và đầu ra của mô hình với số token mà khối lượng công việc của bạn thực sự sử dụng. Giữ riêng token cache, bậc ngữ cảnh dài và các khoản phí dựa trên tác vụ.

Cái nào rẻ nhất: GPT, Claude hay Gemini?

Đối với các mô hình cụ thể và khối lượng 800K đầu vào/200K đầu ra được kiểm tra vào ngày 26 tháng 8 năm 2026, Gemini 3.7 Flash là lựa chọn chi phí thấp nhất ở $1.08 thông qua CometAPI, tiếp theo là Claude Sonnet 5 ở $2.88 và GPT-5.6 Sol ở $5.76. Đây không mặc định là lựa chọn tốt nhất cho mọi tác vụ; hãy so sánh chất lượng, độ trễ và chi phí trên mỗi đầu ra được chấp nhận với prompt của riêng bạn.

Nên so sánh giá chính thức hay giá của bên tổng hợp?

Hãy so sánh mức giá bạn thực sự sẽ trả, sau đó giữ mức chính thức làm tham chiếu. Sử dụng cùng một ngày, tiền tệ, tỷ lệ token, bậc và giả định chiết khấu cho mọi hàng.

Retry có luôn bị tính phí không?

Đừng mặc định cho rằng miễn phí. Một yêu cầu truyền tải thất bại có thể không tới giai đoạn suy luận, trong khi một kết quả ứng dụng bị timeout hoặc bị từ chối có thể đã tiêu thụ công việc của mô hình. Sử dụng dữ liệu sử dụng và hóa đơn thực tế, và ngăn chặn việc tự động retry các lỗi không thể retry.

Cache prompt có luôn giảm chi phí?

Không. Ghi cache có thể tốn hơn đầu vào thường, và tiết kiệm phụ thuộc vào số lần đọc lặp lại. Tính điểm hòa vốn từ mức giá ghi và đọc hiện tại của mô hình, sau đó theo dõi tỷ lệ cache hit thực tế.

Nên kiểm tra giá bao lâu một lần?

Kiểm tra trước khi công bố tuyên bố về giá, thay đổi mô hình sản xuất hoặc phê duyệt dự báo. Lưu ID mô hình và ngày xác minh cùng phép tính để có thể tái tạo ước tính sau này.

Kết luận: API AI nào rẻ nhất cho khối lượng công việc của bạn?

Một so sánh giá GPT vs Claude vs Gemini công bằng sử dụng một nguồn có đóng dấu ngày, một tỷ lệ token và một định nghĩa thành công. Mức giá theo token tạo ra đường cơ sở; cache, thử lại, độ dài đầu ra và thất bại chất lượng quyết định hóa đơn thực tế. CometAPI giúp thử nghiệm xuyên nhà cung cấp dễ hơn bằng cách giữ endpoint và lớp thanh toán nhất quán, nhưng mô hình có chi phí thấp nhất vẫn là mô hình đáp ứng mục tiêu chất lượng của bạn với ít tổng công việc nhất.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Sep 1, 2026
Cập nhật lần cuối Sep 1, 2026
0 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm