Trong thế giới trợ lý viết mã bằng AI phát triển nhanh chóng, việc Moonshot AI ra mắt Kimi K2.7 Code vào ngày 12 tháng 6 năm 2026 nổi bật như một bước tiến quan trọng cho các nhà phát triển, tác tử AI và doanh nghiệp đang tìm kiếm giải pháp mạnh mẽ, tiết kiệm chi phí và nguồn mở.
Mô hình viết mã chuyên biệt này xây dựng trên dòng K2, nhấn mạnh các nhiệm vụ kỹ thuật phần mềm tầm dài, tuân thủ hướng dẫn đáng tin cậy trong ngữ cảnh khổng lồ, gọi công cụ nhiều lượt, đầu vào thị giác và đầu ra có cấu trúc cho quy trình tác tử. Với tổng 1 nghìn tỷ tham số nhưng chỉ 32 tỷ tham số được kích hoạt mỗi token nhờ thiết kế Hỗn hợp chuyên gia (MoE), mô hình mang lại năng lực tiệm cận các mô hình tiên tiến với chi phí chỉ bằng một phần so với các mô hình đóng như Claude Opus 4.8 hoặc GPT-5.5.
CometAPI hiện đã tích hợp Kimi K2.7 Code, giúp truy cập liền mạch qua một điểm cuối tương thích OpenAI với mức giá thấp hơn giá chính thức. Tích hợp này cho phép nhà phát triển chuyển đổi mô hình dễ dàng, tối ưu chi phí và xây dựng ứng dụng AI mạnh mẽ mà không cần quản lý nhiều nhà cung cấp.
Kimi K2.7 Code là gì?
Kimi K2.7 Code (còn được gọi là Kimi-K2.7-Code hoặc kimi-k2.7-code) là một mô hình MoE tập trung vào viết mã và tác tử do Moonshot AI phát triển. Mô hình được xây dựng rõ ràng cho các nhiệm vụ kỹ thuật phần mềm tầm dài—những kịch bản mà AI phải duy trì ngữ cảnh qua hàng nghìn bước, điều hướng kho mã, gọi công cụ, chỉnh sửa mã trên nhiều mô-đun, chạy kiểm thử, gỡ lỗi và lặp lại cho đến khi hoàn tất.
Đặc trưng chính:
- Trọng số mở trên Hugging Face (
moonshotai/Kimi-K2.7-Code). - Giấy phép MIT đã chỉnh sửa – cho phép dùng thương mại với yêu cầu ghi công cho các triển khai khối lượng lớn.
- Hỗ trợ đa phương thức gốc – văn bản + hình ảnh + video qua bộ mã hóa MoonViT (~400M tham số).
- Chế độ suy nghĩ luôn bật – bắt buộc để đạt hiệu năng tác tử đáng tin cậy; không thể tắt.
Khác với các mô hình trò chuyện chung, K2.7 Code được tinh chỉnh cho độ tin cậy trong các phiên kéo dài. Mô hình giảm “suy nghĩ quá mức” (token suy luận nội bộ dư thừa) khoảng 30% so với K2.6, dẫn tới chi phí thấp hơn, vòng lặp nhanh hơn và tỷ lệ thành công đầu-cuối tốt hơn trong các quy trình phức tạp.
Điều này khiến mô hình lý tưởng cho:
- Tái cấu trúc ở quy mô repo.
- Sinh mã đa ngôn ngữ (Python, Rust, Go, v.v.).
- Sử dụng công cụ theo kiểu tác tử (MCP, CI/CD, thao tác hệ thống tệp).
- Nhiệm vụ frontend, DevOps, tối ưu hiệu năng và kỹ thuật ML.
Có gì mới ở Kimi K2.7 Code?
1) Lập trình tầm dài mạnh hơn
Nâng cấp lớn nhất là hiệu năng tốt hơn trên các nhiệm vụ lập trình tầm dài. Moonshot cho biết K2.7 Code cải thiện thành công đầu-cuối trên các quy trình kỹ thuật phần mềm phức tạp, không chỉ là hoàn thành mã one-shot. Đó là kiểu nâng cấp mà nhà phát triển sẽ nhận ra khi một mô hình có thể giữ mạch dự án qua nhiều lượt thay vì lệch hướng sau vài bước đầu.
Tăng điểm đáng kể so với K2.6:
- +21.8% trên Kimi Code Bench v2 (62.0% so với 50.9%)
- +11.0% trên Program Bench (53.6% so với 48.3%)
- +31.5% trên MLS Bench Lite (35.1% so với 26.7%)
- +9.3% trên Kimi Claw 24/7 Bench
- +9.5% trên MCP Atlas
- +11.4% trên MCP Mark Verified (81.1% so với 72.8%)

2) Hiệu quả suy luận tốt hơn
Moonshot báo cáo rằng K2.7 Code dùng ít hơn khoảng 30% token suy nghĩ so với K2.6. Nhật ký thay đổi Workers AI của Cloudflare nhắc lại tuyên bố hiệu quả đó và bổ sung rằng việc giảm token suy luận có thể giảm chi phí suy luận cho các khối lượng công việc nặng về suy luận. Nói đơn giản: mô hình không chỉ thông minh hơn ở nhiệm vụ viết mã, mà còn kinh tế hơn khi “nghĩ”.
3) Hành vi suy nghĩ mặc định
Kimi K2.7 Code chỉ là mô hình suy nghĩ. Moonshot cho biết mô hình không hỗ trợ chế độ không suy nghĩ, và trong Kimi Code, nếu tắt suy nghĩ, hệ thống sẽ tự động quay về K2.6. Đây là chi tiết hữu ích cho đội ngũ xây dựng công cụ lập trình tác tử, vì điều đó có nghĩa bạn nên thiết kế với giả định suy nghĩ được bật theo mặc định.
4) Năng lực tầm dài nâng cao:
Khả năng khái quát tốt hơn giữa các ngôn ngữ (Python, Rust, Go, v.v.) và tình huống (frontend, DevOps, bảo mật, ML). Tỷ lệ thành công nhiệm vụ đầu-cuối cao hơn.
5) Đa phương thức và sử dụng công cụ cải tiến
Bộ mã hóa thị giác (400M tham số) cho hình ảnh/video; tích hợp MCP/công cụ liền mạch cho môi trường thực (GitHub, Postgres, trình duyệt, v.v.).
Kiến trúc và tham số của Kimi K2.7 Code
Kimi K2.7 Code sử dụng kiến trúc Hỗn hợp chuyên gia. Theo thẻ mô hình chính thức trên Hugging Face, mô hình có 1T tổng tham số và 32B tham số được kích hoạt. Nó gồm 61 lớp, 384 chuyên gia, 8 chuyên gia được chọn mỗi token, 1 chuyên gia dùng chung, chú ý MLA, kích hoạt SwiGLU, từ vựng 160K và độ dài ngữ cảnh 256K. Bộ mã hóa thị giác là MoonViT với 400M tham số.
Kiến trúc này giải thích sức hấp dẫn của mô hình. Một mô hình MoE nghìn tỷ tham số có thể duy trì trần năng lực rất lớn trong khi chỉ kích hoạt một tập con tham số mỗi token, là một lý do khiến hệ MoE hấp dẫn cho suy luận năng lực cao. K2.7 Code áp dụng cùng cách lượng tử hóa INT4 gốc như K2 Thinking, giúp triển khai hiệu quả.
Cửa sổ ngữ cảnh là một điểm bán hàng lớn khác. Tài liệu chính thức mô tả cửa sổ 256K, đủ lớn cho các codebase dài, hội thoại dài và phiên tác tử nhiều bước nơi việc giữ ngữ cảnh mang tính sống còn.
K2.7 Code chia sẻ thiết kế suy nghĩ đan xen và gọi công cụ nhiều bước như K2 Thinking, và khuyến nghị Kimi Code CLI là khung tác tử phù hợp nhất với mô hình. Đây là tín hiệu mạnh rằng Moonshot xem K2.7 Code như một “cỗ máy” tác tử chủ lực, không chỉ là mô hình giao diện trò chuyện.
Thông số cốt lõi (từ thẻ mô hình chính thức):
- Tổng tham số: 1T (1 trillion)
- Tham số được kích hoạt mỗi token: 32B (kích hoạt thưa khoảng 3% để hiệu quả)
- Chuyên gia (Experts): 384 tổng (8 được chọn mỗi token + 1 chuyên gia dùng chung)
- Số lớp (Layers): 61 (bao gồm 1 lớp đặc)
- Chú ý (Attention): MLA (Multi-head Latent Attention)
- Kích hoạt Feed-Forward: SwiGLU
- Kích thước từ vựng: ~160K–166K
- Bộ mã hóa thị giác: MoonViT (~400M tham số) cho đa phương thức gốc (văn bản + hình ảnh/video)
- Độ dài ngữ cảnh: 256K token (262,144)
- Lượng tử hóa: Hỗ trợ INT4 gốc để triển khai hiệu quả
- Huấn luyện: Tối ưu hóa Muon, huấn luyện trên lượng lớn token văn bản/thị giác với cải thiện độ ổn định.
Vì sao MoE quan trọng: Chỉ ~3% tham số được kích hoạt mỗi token, mang lại năng lực gần mức tiên tiến với chi phí tính toán thấp hơn nhiều so với các mô hình đặc có tổng kích thước tương tự. Điều này cho phép tự lưu trữ hoặc dùng API với chi phí phải chăng cho các tác vụ viết mã khối lượng lớn.
Mô hình lớn (~595 GB trọng số), nhắm tới suy luận cấp máy chủ (vLLM, SGLang, KTransformers). Nó tái sử dụng các kiểu triển khai từ K2.5/K2.6.
Điểm chuẩn hiệu năng: Tốt đến mức nào?
Moonshot cung cấp các điểm chuẩn chi tiết so sánh K2.7 Code với K2.6, GPT-5.5 và Claude Opus 4.8. Trong khi kiểm chứng độc lập vẫn đang diễn ra (ví dụ, một số thực hành ghi nhận kết quả pha trộn trên public kernel), mức tăng là ấn tượng đối với một chuyên gia viết mã.
Bảng điểm chuẩn chính:
| Điểm chuẩn | Kimi K2.6 | Kimi K2.7 Code | GPT-5.5 | Claude Opus 4.8 | Mức tăng (K2.7 so với K2.6) |
|---|---|---|---|---|---|
| Kimi Code Bench v2 | 50.9 | 62.0 | 69.0 | 67.4 | +21.8% |
| Program Bench | 48.3 | 53.6 | 69.1 | 63.8 | +11.0% |
| MLS Bench Lite | 26.7 | 35.1 | 35.5 | 42.8 | +31.5% |
| Kimi Claw 24/7 Bench | 42.9 | 46.9 | 52.8 | 50.4 | +9.3% |
| MCP Atlas | 69.4 | 76.0 | 79.4 | 81.3 | +9.5% |
| MCP Mark Verified | 72.8 | 81.1 | 92.9 | 76.4 | +11.4% |
Diễn giải:
- K2.7 Code thu hẹp khoảng cách với các mô hình tiên tiến trên nhiệm vụ viết mã/tác tử và vượt Opus 4.8 trên MCP Mark Verified.
- Mạnh ở lập trình đa ngôn ngữ, kỹ thuật phần mềm thực tế và kịch bản dùng công cụ.
- Lợi thế hiệu quả (ít hơn 30% token) thường khiến nó đáng chọn cho tác tử chạy dài dù không phải lúc nào cũng dẫn đầu về độ chính xác thô. Ít token hơn mỗi nhiệm vụ đồng nghĩa nhiều vòng lặp hơn trong giới hạn ngân sách/ngữ cảnh.
Lưu ý: Nhiều kết quả là nội bộ hoặc thiết lập cụ thể. Kiểm thử độc lập (ví dụ, KernelBench) cho thấy kết quả pha trộn ở một số tác vụ mức thấp, nhưng phản hồi thực tế nhìn chung nhấn mạnh tính hữu dụng trong các vòng lặp viết mã dài.

Lợi ích hiệu quả: Ưu thế chi phí và tốc độ
Giảm 30% token suy nghĩ nghe có vẻ trừu tượng cho đến khi đưa vào sản xuất. Ít token suy luận thường đồng nghĩa độ trễ thấp hơn, chi phí thấp hơn và ít khả năng mô hình lang thang qua các bước nội bộ không cần thiết trong nhiệm vụ dài. Moonshot cho biết K2.7 Code cải thiện hiệu quả trong khi vẫn tăng cường hoàn tất nhiệm vụ, và Cloudflare đặc biệt xem đó là lợi thế chi phí cho khối lượng công việc nặng về suy luận.
Sự kết hợp này quan trọng trong tác tử viết mã vì nhiệm vụ kỹ thuật phần mềm hiếm khi “một lần là xong”. Chúng bao gồm đọc codebase, thực hiện thay đổi, xác minh, xử lý ngoại lệ và lặp lại. Một mô hình tiết kiệm token hơn và giỏi hoàn tất nhiệm vụ tầm dài có thể cải thiện đáng kể năng suất đội ngũ hơn một mô hình chỉ mạnh ở câu trả lời ngắn. Đây là suy luận dựa trên điểm chuẩn và tuyên bố về quy trình của Moonshot, nhưng phù hợp trực tiếp với cách mô hình được định vị.
Kimi K2.7 Code giá bao nhiêu?
Gói thành viên Kimi Code của Moonshot bao gồm K2.7 Code và bắt đầu từ $19/tháng, theo trang tài nguyên chính thức. Đó là con đường sản phẩm hướng tới người dùng. Với sử dụng API, giá phụ thuộc vào nơi bạn truy cập mô hình. So với Claude Opus (~$5–25 / M) hoặc mức giá mô hình tiên tiến tương tự, K2.7 Code mang lại giá trị tốt hơn tới 5–12 lần cho khối lượng viết mã. Tự lưu trữ còn giảm chi phí hơn cho nhu cầu khối lượng lớn.
Trên CometAPI, Kimi K2.7 Code được niêm yết ở mức $0.76 per million input tokens và $3.19998 per million output tokens, trong khi giá chính thức là $0.95 per million input tokens và $3.999975 per million output tokens, mà CometAPI trình bày là chiết khấu 20% so với giá chính thức.
Điều đó khiến CometAPI trở nên thú vị cho các nhóm muốn thử nghiệm Kimi K2.7 Code mà không phải quản lý tích hợp nhà cung cấp riêng biệt hoặc trả mức giá niêm yết trực tiếp cao hơn.
Truy cập Kimi K2.7 Code ở đâu
1) Kimi Code
Moonshot cho biết Kimi K2.7 Code hiện là mô hình mặc định trong Kimi Code, với chế độ suy nghĩ được bật theo mặc định. Đây là cách gốc nhất để thử mô hình nếu bạn muốn môi trường viết mã của chính Moonshot.
2) Kimi API / Kimi Platform
Nền tảng mở của Moonshot ghi nhận Kimi K2.7 Code khả dụng qua Kimi API, và nói rằng nền tảng dùng định dạng API của OpenAI. Điều đó giúp dễ đưa vào kiến trúc ứng dụng đã nói chuyện được với API tương thích OpenAI.
3) Hugging Face
Thẻ mô hình chính thức trên Hugging Face xác nhận phát hành trọng số mở, hiển thị tóm tắt mô hình và dữ liệu điểm chuẩn, và nêu rằng kho mã và trọng số được phát hành dưới Giấy phép MIT đã chỉnh sửa. Đây là con đường cho nhà phát triển muốn kiểm tra trọng số, tự triển khai hoặc dùng mô hình trong hệ sinh thái công cụ mở.
4) CometAPI
CometAPI hiện liệt kê Kimi K2.7 Code như một mô hình đã tích hợp và cung cấp định giá theo token, trang mô hình và truy cập API qua cổng hợp nhất. Nền tảng cũng nhấn mạnh tương thích OpenAI và được thiết kế để giảm phân mảnh nhà cung cấp bằng cách đặt nhiều mô hình sau một điểm vào. Nó hỗ trợ cửa sổ ngữ cảnh 256K, đầu vào thị giác, gọi công cụ nhiều lượt và đường dẫn tương thích OpenAI qua /v1/chat/completions. Không cần thay đổi tham số nếu bạn di chuyển từ K2.6.
Khuyến nghị CometAPI: Với hầu hết người dùng, hãy bắt đầu ở đây. Một khóa, trả theo mức sử dụng cho hơn 500 mô hình, dự phòng tự động và mức giá hiệu dụng thấp hơn. Hoàn hảo để thử K2.7 Code bên cạnh Claude, GPT hoặc mô hình mở mà không bị khóa nhà cung cấp. Đăng ký tại Cometapi.com và thay URL cơ sở/tên mô hình trong client OpenAI của bạn.
Mẹo tự lưu trữ: Dùng lượng tử hóa INT4 và song song chuyên gia để tối ưu VRAM/hiệu năng trên GPU doanh nghiệp.
Kimi K2.7 Code so với K2.6 và các mô hình khác
Nếu ngăn xếp hiện tại của bạn đã dùng K2.6, K2.7 Code là nâng cấp hiển nhiên khi chất lượng viết mã và hiệu quả suy luận quan trọng hơn việc giữ nguyên baseline. Moonshot cho biết kiến trúc giống K2.5/K2.6, có thể tái dùng triển khai và hiệu năng điểm chuẩn được cải thiện đáng kể. Cloudflare cũng nói việc dùng API là giống hệt, giúp giảm ma sát di trú.
So với các mô hình tiên phong rộng như GPT-5.5 và Claude Opus 4.8, K2.7 Code chuyên biệt hơn. Bảng điểm chuẩn cho thấy mô hình vẫn cạnh tranh ở tác vụ viết mã và tác tử, nhưng khác biệt thực sự là sự kết hợp giữa truy cập nguồn mở, ngữ cảnh dài và thiết kế tập trung viết mã. Điều đó khiến mô hình đặc biệt hấp dẫn cho các nhóm coi trọng linh hoạt triển khai và kiểm soát chi phí.
Kết luận: Vì sao tích hợp Kimi K2.7 Code qua CometAPI ngay hôm nay
Kimi K2.7 Code đại diện cho hệ sinh thái AI viết mã nguồn mở đang trưởng thành—mạnh mẽ, hiệu quả, dễ tiếp cận và sẵn sàng cho tác tử. Kiến trúc, mức tăng điểm chuẩn và hiệu quả token khiến đây là mô hình đáng thử cho nhà phát triển năm 2026.
CometAPI hạ rào cản hơn nữa với tích hợp liền mạch, giá cạnh tranh và truy cập hợp nhất. Dù tự lưu trữ, dùng API chính thức hay tận dụng nền tảng của CometAPI, K2.7 Code trao quyền cho quy trình viết mã nhanh hơn, đáng tin cậy hơn.
Sẵn sàng dùng thử? Truy cập CometAPI, lấy khóa API của bạn và bắt đầu xây dựng với Kimi K2.7 Code ngay hôm nay. Hãy thử nghiệm, đo điểm chuẩn theo tình huống của bạn và mở rộng với sự tự tin.
Câu hỏi thường gặp
Kimi K2.7 Code có phải nguồn mở không?
Có. Moonshot cho biết cả kho mã và trọng số mô hình được phát hành theo Giấy phép MIT đã chỉnh sửa, và mô hình có trên Hugging Face.
Cửa sổ ngữ cảnh là gì?
Tài liệu của Moonshot liệt kê cửa sổ ngữ cảnh 256K, và thẻ mô hình cùng Cloudflare mô tả là 262,144 hoặc 262.1K token. Về hiệu dụng là cùng một quy mô.
Kimi K2.7 Code có hỗ trợ chế độ không suy nghĩ không?
Không. Moonshot cho biết K2.7 Code chỉ chạy khi bật suy nghĩ. Trong Kimi Code, việc tắt suy nghĩ sẽ quay về K2.6.
Cải tiến lớn nhất so với K2.6 là gì?
Cải tiến lớn nhất được báo cáo là hiệu năng lập trình tầm dài tốt hơn cùng ít hơn khoảng 30% token suy nghĩ. Moonshot cũng báo cáo mức tăng điểm chuẩn +21.8% trên Kimi Code Bench v2, +11.0% trên Program Bench và +31.5% trên MLS Bench Lite.
Tôi có thể dùng nó qua CometAPI không?
Có. CometAPI hiện liệt kê Kimi K2.7 Code như một mô hình đã tích hợp và hiển thị giá theo token, trở thành con đường truy cập tiện lợi cho nhà phát triển muốn một lớp API hợp nhất.
Nó có tốt cho tác tử viết mã AI không?
Có. Tài liệu của Moonshot nhấn mạnh gọi công cụ nhiều bước, suy nghĩ đan xen và quy trình hướng tác tử, trong khi Cloudflare nhấn mạnh gọi công cụ nhiều lượt và đầu ra có cấu trúc.
