GPT-5.6 Luna price down 80%, Terra down 20% →

Làn sóng mô hình tháng 7 năm 2026: GPT-5.6, Gemini 3.6 Flash, Grok 4.5, Kimi K3 v.v.

CometAPI
AnnaAug 1, 2026
Làn sóng mô hình tháng 7 năm 2026: GPT-5.6, Gemini 3.6 Flash, Grok 4.5, Kimi K3 v.v.

Tóm tắt: Sáu bản phát hành mô hình lớn đã ra mắt trong khoảng ba tuần của tháng 7 năm 2026: bộ ba GPT-5.6 của OpenAI (Sol/Terra/Luna), Gemini 3.6 Flash của Google, Grok 4.5 của xAI, Kimi K3 của Moonshot AI, Claude Opus 5 của Anthropic và GLM-5.2 của Zhipu. Không có lựa chọn “tốt nhất” cho mọi trường hợp. Quyết định thực tế tùy thuộc vào độ sâu suy luận, hiệu suất lập trình, chi phí mỗi token, yêu cầu ngữ cảnh và việc triển khai trọng số mở có quan trọng hay không. So sánh này dựa trên thông tin chính thức hiện tại từ nhà cung cấp và danh sách của CometAPI, với các tuyên bố điểm chuẩn được gắn nguồn thay vì gộp thành một bảng xếp hạng “phổ quát”.

Điểm chính:

  • GPT-5.6 không phải một mô hình duy nhất — đó là ba mô hình (Sol/Terra/Luna) ở ba mức giá khác nhau; chọn sai bậc còn là sai lầm chi phí lớn hơn cả việc chọn sai họ mô hình.
  • Gemini 3.6 Flash và GLM-5.2 đều công bố cửa sổ ngữ cảnh 1.000.000 token; Kimi K3 cũng đạt con số đó — kích thước ngữ cảnh đã không còn là yếu tố khác biệt giữa các mô hình hàng đầu thế hệ này.
  • GLM-5.2 và Kimi K3 đều hỗ trợ triển khai với trọng số mở, nhưng không dùng cùng giấy phép. GLM-5.2 phát hành theo MIT License; Kimi K3 dùng Kimi K3 License riêng, cần xem kỹ điều khoản thương mại trước khi tự lưu trữ hoặc cung cấp dịch vụ mô hình.
  • Claude Opus 5 đã phát hành chính thức. Anthropic công bố vào ngày 24 tháng 7 năm 2026 với cửa sổ ngữ cảnh 1M token, đầu ra đồng bộ tối đa 128K và mức giá chính thức $5 cho mỗi triệu token đầu vào và $25 cho mỗi triệu token đầu ra; CometAPI hiện liệt kê ở mức $4/$20.

Thực sự đã phát hành trong tháng này

Tháng 7 năm 2026 là một tháng dày đặc bất thường về phát hành mô hình tiên phong và cận tiên phong. Trong khoảng ba tuần, OpenAI ra mắt dòng GPT-5.6 (9 Thg 7), xAI phát hành Grok 4.5 (8 Thg 7), Moonshot AI phát hành Kimi K3 (16 Thg 7), Google phát hành Gemini 3.6 Flash (21 Thg 7), và Anthropic chính thức tung ra Claude Opus 5 (24 Thg 7). GLM-5.2 của Zhipu ra mắt sớm hơn một chút vào tháng 6, nhưng cửa sổ ngữ cảnh 1M token và phát hành mở theo MIT khiến nó vẫn liên quan đến cùng các quyết định mua và triển khai.

Câu hỏi thực tế với bất kỳ ai xây dựng trên các mô hình này không phải là mô hình nào “tốt nhất” nói chung, mà là lựa chọn nào phù hợp công việc cụ thể. Sáu mô hình khác nhau đáng kể về chi phí, ngữ cảnh, hành vi lập trình, giấy phép và linh hoạt triển khai.

Bảng giá và thông số, so sánh trực tiếp

Tất cả mức giá dưới đây tính theo mỗi triệu token. Với mô hình có nhiều bậc, liệt kê tách riêng từng bậc.

Mô hìnhĐầu vàoĐầu raCửa sổ ngữ cảnhGiấy phépNgày phát hành
GPT-5.6 Sol$5.00$30.00Không công bốĐộc quyềnJul 9, 2026
GPT-5.6 Terra$2.50$15.00Không công bốĐộc quyềnJul 9, 2026
GPT-5.6 Luna$1.00$6.00Không công bốĐộc quyềnJul 9, 2026
Grok 4.5$2.00$4.00Không công bốĐộc quyềnJul 8, 2026
Kimi K3$3.00$15.001,048,576 tokenTrọng số mở (Kimi K3 License)Jul 16, 2026
Gemini 3.6 Flash$1.50$7.501,048,576 token (65,536 đầu ra)Độc quyềnJul 21, 2026
GLM-5.2$1.40$4.411,000,000 tokenMở (Giấy phép MIT)Jun 13, 2026
Claude Opus 5$5.00$25.001,000,000 token (đầu ra 128K)Độc quyềnJul 24, 2026

*Mức giá của nhà cung cấp chính thức được hiển thị; dùng một API hợp nhất với mức chiết khấu chuẩn sẽ làm tất cả các mức này giảm tương ứng — mục đích của bảng là thể hiện khoảng cách tương đối giữa các mô hình, không phải giá thanh toán của một nhà bán lẻ cụ thể.

Một vài điểm nổi bật từ bảng giá và thông số. Sol, bậc cao nhất của GPT-5.6, được định giá cho suy luận tiên phong và công việc tác tử hơn là dùng hằng ngày, trong khi giá đầu ra của Grok 4.5 tương đối thấp so với định vị của nó. GLM-5.2 có giá đầu ra thấp nhất trong nhóm và dùng Giấy phép MIT. Kimi K3 cũng cung cấp trọng số có thể tải xuống và ngữ cảnh 1M token, nhưng theo Kimi K3 License thay vì MIT. Gemini 3.6 Flash, Kimi K3, GLM-5.2 và Claude Opus 5 đều công bố cửa sổ ngữ cảnh khoảng 1M token, vì vậy chỉ riêng dung lượng ngữ cảnh không còn đủ để phân biệt. Mức giá do CometAPI liệt kê nhìn chung thấp hơn bảng giá nhà cung cấp, nhưng đánh giá ở cấp khối lượng công việc vẫn hữu ích hơn là chỉ so sánh giá mỗi token một cách cô lập.

Mỗi mô hình thực sự được tinh chỉnh cho điều gì

GPT-5.6 Sol được định vị cho suy luận tiên phong, lập trình theo tác tử và công việc kỹ thuật tầm dài — hỗ trợ chế độ "Max Reasoning Effort" và "Ultra Mode" triển khai các tác tử con song song. Đây là bậc nên chọn cho các bài toán khó, nhiều bước, không phải tác vụ thường nhật, xét tới khoảng cách giá so với Terra và Luna.

GPT-5.6 Terra là bậc trung cân bằng — năng suất hằng ngày, tài liệu, hỗ trợ lập trình và tự động hóa nghiệp vụ. Với hầu hết backend ứng dụng không cần độ sâu suy luận như Sol, Terra là mặc định hợp lý hơn.

GPT-5.6 Luna nhắm tới khối lượng nhẹ và cao: phân loại, luồng hỗ trợ khách hàng, onboarding, tạo nội dung lặp lại. Ở mức $1.00/$6.00 mỗi triệu token (trước khi chiết khấu cổng), giá đặt đúng cho kiểu tải có tần suất gọi cao và độ phức tạp thấp — và nó còn hỗ trợ định giá đầu vào được cache với mức giảm 90% so với giá đầu vào chuẩn, điều này quan trọng hơn ở đây so với các bậc cao do tính lặp lại của tải cao.

Grok 4.5 không công bố chuyên môn hóa rõ như các bậc GPT-5.6, nhưng định giá đặt nó ở giữa tùy chọn tiết kiệm và trung cấp — đáng để so sánh benchmark trực tiếp với Terra hoặc Kimi K3 cho khối lượng công việc cụ thể thay vì suy luận vị thế từ giá.

Kimi K3 là mô hình Mixture-of-Experts 2,8 nghìn tỷ tham số, xây dựng cho lập trình tầm dài, công việc tri thức đa phương thức và phân tích tài liệu/kho mã lớn trong ngữ cảnh 1M token. Moonshot AI đã phát hành toàn bộ trọng số nên có thể tự lưu trữ, nhưng theo Kimi K3 License, bao gồm các điều kiện thương mại khác với phát hành MIT chuẩn.

Gemini 3.6 Flash là bản tập trung hiệu năng của Google: được mô tả rõ là bản kế tiếp tối ưu chi phí và độ trễ từ 3.5 Flash chứ không phải mô hình tiên phong mới, với cải thiện thực trên benchmark lập trình và tác tử cùng giá mỗi token đầu ra thấp hơn tiền nhiệm. Đây là lựa chọn cho các tải tác tử nơi hiệu quả token và chi phí mỗi tác vụ hoàn tất quan trọng ngang với năng lực thô.

GLM-5.2 là lựa chọn mở có giấy phép thoáng nhất trong so sánh này. Z.ai phát hành theo Giấy phép MIT với ngữ cảnh 1M token và nhấn mạnh rõ vào lập trình tầm dài, dùng công cụ và nỗ lực suy nghĩ có thể điều chỉnh. Nhóm có thể truy cập qua API hoặc chạy trọng số công bố tại chỗ, tùy hạ tầng và yêu cầu đánh giá của mình.

So sánh năng lực lập trình

Sáu bản phát hành nhắm tới các mẫu kỹ thuật khác nhau, nên năng lực lập trình nên được hiểu theo mức độ phù hợp khối lượng công việc hơn là một bảng xếp hạng đơn.

  • Claude Opus 5 phù hợp nhất cho gỡ lỗi khó, phân tích nguyên nhân gốc, tái cấu trúc lớn và tác tử phần mềm chạy dài; Anthropic nhấn mạnh hành vi kiểm chứng và lặp tốt hơn.
  • GPT-5.6 Sol, Terra và Luna cung cấp lộ trình theo bậc từ lập trình và suy luận phức tạp tới công việc phát triển cân bằng và trợ giúp mã khối lượng lớn.
  • Gemini 3.6 Flash được tinh chỉnh cho các vòng lặp lập trình tác tử nhanh, nơi độ trễ và chi phí mỗi vòng lặp quan trọng.
  • Kimi K3 được thiết kế cho lập trình tầm dài trên kho mã rất lớn, với ngữ cảnh 1M token và trọng số có thể tải xuống.
  • GLM-5.2 kết hợp lập trình tầm dài, dùng công cụ, nỗ lực suy nghĩ có thể điều chỉnh và triển khai cục bộ theo Giấy phép MIT.
  • Grok 4.5 nên được coi là ứng viên để đánh giá trực tiếp với các mô hình khác vì định vị chính thức không cung cấp phân tách chuyên biệt cho lập trình như họ GPT theo bậc.

Đánh đổi khi so sánh (và chuyển đổi giữa) mô hình thường xuyên như vậy

Điều này không phải lập luận cho việc đuổi theo mọi bản phát hành mới. Chuyển tải sản xuất sang một mô hình mới mỗi khi có bản phát hành tốn kém thực sự: thử nghiệm lại prompt, xác nhận lại chất lượng đầu ra và kiểm tra lại bài toán chi phí mỗi tác vụ dựa trên traffic thực, không phải benchmark tổng hợp. Một API hợp nhất không loại bỏ công việc đánh giá đó, nhưng loại bỏ phần chi phí tài khoản/billing tách rời khi chạy so sánh — việc có thể gọi GPT-5.6 Terra, Gemini 3.6 Flash, Kimi K3 và GLM-5.2 qua cùng một dạng request và một hóa đơn giúp thực sự khả thi để thử nhiều ứng viên trước khi cam kết, thay vì mặc định dùng nhà cung cấp sẵn có khóa.

Đó là lợi thế thực, không phải giải pháp hoàn chỉnh — nó không thay thế việc đọc tài liệu thực của từng mô hình, và cũng không khiến lựa chọn mô hình trở nên miễn phí với các chi phí chuyển đổi nói trên. Điều nó làm là hạ chi phí để tìm ra mô hình nào thực sự phù hợp cho một khối lượng công việc, khác (và trung thực hơn) với tuyên bố “mô hình này là tốt nhất”.

Câu hỏi thường gặp

Mô hình AI nào tốt nhất phát hành trong tháng 7 năm 2026? Không có câu trả lời duy nhất. GPT-5.6 Sol và Claude Opus 5 nhắm tới công việc suy luận và lập trình đòi hỏi cao; Gemini 3.6 Flash nhấn mạnh vòng lặp tác tử hiệu quả; Kimi K3 kết hợp ngữ cảnh dài với trọng số mở; và GLM-5.2 kết hợp năng lực tầm dài với Giấy phép MIT. Lựa chọn đúng phụ thuộc khối lượng công việc và ràng buộc triển khai.

GPT-5.6 là một mô hình hay nhiều mô hình? Ba: Sol (đầu bảng, suy luận tiên phong), Terra (cân bằng, dùng hằng ngày) và Luna (nhanh và rẻ, tác vụ khối lượng lớn) — mỗi bậc định giá riêng, từ $0.80/$4.80 mỗi triệu token cho Luna đến $4.00/$24.00 cho Sol.

Claude Opus 5 đã phát hành chính thức chưa? Rồi. Anthropic công bố Claude Opus 5 vào ngày 24 tháng 7 năm 2026. Bản phát hành chính thức mô tả cửa sổ ngữ cảnh 1M token và định vị mô hình cho lập trình tác tử phức tạp và công việc tri thức; giá API chính thức là $5 mỗi triệu token đầu vào và $25 mỗi triệu token đầu ra.

Trong số các mô hình này, mô hình nào rẻ nhất để vận hành ở quy mô lớn? Theo giá đầu ra của nhà cung cấp trong bảng, GLM-5.2 là lựa chọn chi phí thấp nhất và có sẵn theo Giấy phép MIT. Kimi K3 cũng có trọng số mở, nhưng giấy phép Kimi K3 riêng và kích thước mô hình lớn hơn nhiều làm thay đổi kinh tế tự lưu trữ. GPT-5.6 Luna là lựa chọn độc quyền, chỉ-API có chi phí thấp nhất được đề cập ở đây.

Tôi có cần chọn một mô hình và gắn bó luôn, hay có thể thử nhiều mô hình? Thử nhiều mô hình với prompt và traffic thực của bạn thường đáng chi phí thiết lập trước khi cam kết tải sản xuất — một API hợp nhất (CometAPI trong số những lựa chọn khác) giúp việc đó rẻ hơn cụ thể, vì loại bỏ chi phí tài khoản tách rời khi chạy so sánh, dù không thay thế việc đọc tài liệu riêng của từng mô hình.

Kết luận

Làn sóng phát hành tháng 7 năm 2026 không tạo ra một người thắng rõ ràng. Nó tạo ra sáu lựa chọn đã xác nhận, đánh đổi khác nhau về độ sâu suy luận, hiệu suất lập trình, chi phí token, ngữ cảnh và giấy phép. GPT-5.6 Sol và Claude Opus 5 nhắm tới công việc suy luận và kỹ nghệ phần mềm khó nhất; Gemini 3.6 Flash và GPT-5.6 Luna nhấn mạnh hiệu quả; Kimi K3 mang lại trọng số mở và ngữ cảnh đa phương thức 1M token theo giấy phép riêng; GLM-5.2 cung cấp lựa chọn 1M token theo Giấy phép MIT. Tất cả đều có thể truy cập qua CometAPI với một khóa, giúp thử nghiệm có kiểm soát dễ hơn, nhưng lựa chọn mô hình vẫn nên dựa trên prompt, công cụ, mục tiêu độ trễ và tiêu chí thành công của khối lượng công việc thực tế.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm