Tóm tắt: Moonshot AI ra mắt Kimi K3 vào ngày 16 tháng 7 năm 2026 – mô hình trọng số mở đột phá với 2.8 nghìn tỷ tham số (đầu tiên trong lớp 3T), đa phương thức gốc, ngữ cảnh 1 triệu token và hiệu năng tuyến đầu sánh ngang hoặc vượt các mô hình độc quyền hàng đầu như Claude Fable 5 và GPT-5.6 Sol trong mã hóa, nhiệm vụ tác tử, phát triển frontend và công việc tri thức.
Những điểm chính
- Quy mô & Đổi mới: 2.8T tham số, MoE với 16/896 chuyên gia hoạt động, Kimi Delta Attention (KDA), Attention Residuals – hiệu quả mở rộng ~2.5x so với K2, Kimi K3 - Kimi API Platform
- Hiệu năng: Artificial Analysis Intelligence Index ~57 (top 4, vượt Claude Opus 4.8), dẫn đầu Frontend Code Arena, mạnh trên Terminal-Bench (88.3%), BrowseComp (91.2%), GPQA-Diamond (93.5%). Kém Fable 5/Sol tổng thể nhưng vượt hầu hết mô hình khác; hạng 1 trên Arena.ai Frontend Code Arena (1,679 Elo, vượt Fable 5), bài đăng Arena trên X và Tom's Hardware đưa tin.
- Năng lực: Thị giác/video gốc, ngữ cảnh 1M cho repo/kho mã khổng lồ, mã hóa tác tử, suy luận 3D, chỉnh sửa video, bảng điều khiển nghiên cứu.
- Truy cập: Dùng ngay qua kimi.com, API (mô hình kimi-k3, hướng dẫn truy cập); sẽ sớm mở trọng số. Moonshot tạm dừng đăng ký mới Kimi K3 do nhu cầu tăng đột biến. Tích hợp dễ dàng qua CometAPI.
- Giá trị: Chi phí mỗi tác vụ thấp hơn (~$0.94 trong một số đánh giá), ít từ chối hơn, lý tưởng cho quy trình mã hóa/Thị giác.
Kimi K3 Tech Blog mô tả Kimi K3 là “Open Frontier Intelligence, Kimi K3 đánh dấu thời khắc mang tính bước ngoặt trong dân chủ hóa AI. Khi các phòng thí nghiệm AI Trung Quốc như Moonshot tiếp tục bứt phá dù hạn chế về tính toán, mô hình mở này thách thức sự thống trị của các tiền tuyến đóng từ Mỹ và trao quyền cho nhà phát triển toàn cầu.”
Kimi K3 là gì? Mô hình lớp 3T mở từ Moonshot AI
Moonshot AI, một startup có trụ sở tại Bắc Kinh, ra mắt Kimi K3 vào ngày 16 tháng 7 năm 2026 như mô hình flagship. Đây được định vị rõ ràng là mô hình mở đầu tiên trong lớp khoảng 3 nghìn tỷ tham số, với tổng 2.8 nghìn tỷ tham số trong kiến trúc MoE thưa. Chỉ 16 trên 896 chuyên gia được kích hoạt mỗi token, cân bằng giữa quy mô khổng lồ và hiệu quả.
Điều này kế thừa dòng Kimi K2 (K2.5, K2.6, v.v.), vốn đã gây chú ý trong mã hóa và đa phương thức. K3 giới thiệu các đổi mới kiến trúc: Kimi Delta Attention (KDA) và Attention Residuals (AttnRes), cùng Stable LatentMoE và huấn luyện nhận biết lượng tử hóa (trọng số MXFP4, kích hoạt MXFP8 từ giai đoạn SFT). Những cải tiến này mang lại hiệu quả mở rộng ~2.5x và giải mã nhanh hơn tới 6.3x so với thế hệ trước.
Thông số chính (Kimi K3 Technical Specifications):
- Tham số: Tổng 2.8T (MoE thưa).
- Cửa sổ ngữ cảnh: 1,048,576 token (~1M).
- Phương thức: Hiểu văn bản + hình ảnh + video gốc; xuất ra văn bản.
- Đầu ra tối đa: Mặc định 131k token, có thể lên tới giới hạn ngữ cảnh.
- Lập luận: Mức nỗ lực tối đa mặc định lúc ra mắt; sẽ có chế độ thấp/cao.
- Mở trọng số: Hứa hẹn trước ngày 27 tháng 7 năm 2026 (giấy phép kiểu MIT sửa đổi, theo tiền lệ K2).
K3 nhắm tới các nhiệm vụ dài hạn — không chỉ trả lời nhanh, mà còn hoàn thành các quy trình kỹ thuật, nghiên cứu, hoặc tác tử phức tạp với phản hồi trực quan (“Vision in the Loop”). Demo gồm xây dựng bộ biên dịch GPU tự động (sánh với Triton), thiết kế chip quy trình 45nm, và nghiên cứu thiên văn nhanh.
Nhu cầu đã gây căng thẳng công suất
Đón nhận ban đầu đủ mạnh để tạo áp lực công suất. Moonshot đăng trên X rằng nhu cầu trong 48 giờ trước đã đẩy tới gần giới hạn GPU hiện tại và sẽ tạm dừng đăng ký mới trong khi bổ sung công suất. Business Insider cũng đưa tin về việc tạm dừng này và lưu ý người đăng ký hiện hữu không bị ảnh hưởng.
Điều này quan trọng cho kế hoạch sản xuất. Một mô hình có thể xuất sắc nhưng vẫn gặp ràng buộc khả dụng nếu nhu cầu vượt công suất. Đội ngũ đánh giá Kimi K3 nên tránh phụ thuộc một nhà cung cấp, theo dõi độ trễ và tỷ lệ lỗi, và dùng định tuyến dự phòng qua nhà cung cấp hợp nhất như CometAPI khi có thể.
Các điểm chuẩn mã hóa: Nơi Kimi K3 mạnh nhất
Hồ sơ mã hóa của Kimi K3 là lý do cốt lõi khiến nhà phát triển chú ý. Nó gần ngang GPT-5.6 Sol trên Terminal-Bench 2.1, nhỉnh hơn GPT-5.6 Sol và Claude Fable 5 trên Program Bench, và dẫn GPT-5.6 Sol với khoảng cách đáng kể trên FrontierSWE. Nó cũng vượt các mô hình so sánh trên SWE Marathon trong bảng OpenLM.
Kết quả frontend từ Arena bổ sung tín hiệu thực tế khác. Arena báo Kimi K3 đạt 1679 điểm trên Frontend Code Arena, vượt Claude Fable 5. Điểm chuẩn này quan trọng vì công việc frontend thường được đánh giá theo sở thích của nhà phát triển thay vì chỉ kiểm thử đơn vị. Một trợ lý mã hóa có thể tạo UI sạch, mạch lạc về mặt thị giác từ prompt là rất giá trị cho đội sản phẩm, agency, nhà xây SaaS và công cụ nội bộ.
Bảng xếp hạng tổng thể
- Artificial Analysis AI Leaderboard: Ra mắt ở vị trí #3. Điểm Intelligence Index đặt nó ở mức cạnh tranh (ví dụ ~57.1 trong một số đánh giá).
- Private Long-Horizon Knowledge Work Eval: Elo 1547 (+732 so với K2.6), chỉ sau Fable 5.
Điểm chuẩn mã hóa & tác tử (tự báo cáo & độc lập)
K3 tỏa sáng ở đây, tận dụng quy mô và kiến trúc cho hiệu năng tác tử bền bỉ.
- Frontend Code Arena (Arena.ai): #1 với 1,679 điểm, vượt Fable 5 và GPT-5.6 Sol. Xuất sắc trong ưu tiên mù của nhà phát triển cho web dev.
- DeepSWE: 67.3–67.5 (mạnh, với harness KimiCode).
- Program Bench: #1 ở 77.8.
- SWE Marathon: #1 ở 42.0 (một số harness).
- Terminal-Bench 2.1: Cạnh tranh, gần GPT-5.6 Sol.
Thị giác & đa phương thức
Huấn luyện gốc (không gắn chắp) mang lại kết quả vững:
- MMMU-Pro: 81.6%
- MathVision: Cạnh tranh/cao 90s trong một số báo cáo.
- OmniDocBench: 91.1% (dẫn đầu).
Hỗ trợ ảnh chụp màn hình, sơ đồ, video cho các nhiệm vụ vòng kín như tinh chỉnh UI hoặc phát triển game.
Bảng so sánh: Kimi K3 so với các mô hình dẫn đầu (xấp xỉ/tổng hợp từ báo cáo; Max Effort khi có)
| Điểm chuẩn | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Ghi chú/Nguồn |
|---|---|---|---|---|
| Frontend Code Arena | 1,679 (#1) | Thấp hơn | Thấp hơn | Arena.ai |
| DeepSWE | 67.3–67.5 | Cạnh tranh | - | Moonshot/KimiCode |
| Program Bench | 77.8 (#1) | - | Gần | Vals.ai |
| Intelligence Index (AA) | ~57.1 | ~59.9 | ~58.9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Cao hơn | - | Nội bộ Moonshot |
| Chi phí mỗi tác vụ (Đánh giá) | ~$0.94 | Cao hơn | Cao hơn | Độc lập |
Dữ liệu lấy từ blog kỹ thuật của Moonshot, các bảng xếp hạng độc lập và phân tích. Kết quả có thể thay đổi theo harness/nỗ lực; luôn kiểm chứng bản mới nhất.
K3 cho thấy ít từ chối hơn ở chủ đề nhạy cảm và tính nhất quán mạnh trong luồng tác tử. Kiểm thử độc lập (ví dụ các đánh giá YouTube, Vals AI) xác nhận đây là một trong những mô hình mở mạnh nhất cho mã hóa thực tế.
Kimi K3 có thể làm gì? Năng lực trong mã hóa, thị giác và hơn thế
Mã hóa & kỹ thuật tác tử
K3 duy trì phiên dài với giám sát tối thiểu: điều hướng kho mã khổng lồ, dùng công cụ, gỡ lỗi qua ảnh chụp màn hình (“vision in the loop”).
Ví dụ:
- Tối ưu kernel & phát triển trình biên dịch: Xây MiniTriton (trình biên dịch kiểu Triton) từ đầu, sánh với các stack tối ưu. Tối ưu kernel GPU có sức cạnh tranh với Fable 5.
- Phát triển game: Biến ý tưởng/ảnh/video thành trải nghiệm 3D/đa người chơi có thể chơi, với tinh chỉnh lặp.
- Thiết kế chip: Chạy tự động 48 giờ thiết kế chip mô hình nano.
- Frontend: Dẫn đầu bảng cho ứng dụng web, tác vụ full-stack.
Thị giác & đa phương thức
Khả năng hiểu hình ảnh/video gốc cho phép:
- Chỉnh sửa video: Tự chỉnh teaser từ 56 clip (chọn, cắt, đồng bộ, sửa) – hàng giờ công trong vài phút.
- Suy luận 3D, motion graphics, bảng điều khiển tương tác.
- “Vision in the loop” cho lặp mã qua ảnh màn hình.
Tài liệu API Kimi cho thấy đầu vào hình ảnh qua data URL base64 và video qua tệp tải lên tham chiếu bằng ms://. Họ cũng cảnh báo URL ảnh công khai không được hỗ trợ trong đầu vào vision, nên nhà phát triển nên gửi base64 hoặc tham chiếu tệp đã tải và đặt nội dung message là một mảng các đối tượng. Đây là chi tiết triển khai quan trọng: không tuần tự hóa một message trộn hình và văn bản thành một chuỗi phẳng.
Công việc tri thức & nghiên cứu
Với doanh nghiệp, đây là nơi Kimi K3 có thể giá trị hơn chatbot thông thường. Mô hình được thiết kế cho công việc “tác tử” nơi nó có thể duy trì kế hoạch, gọi công cụ, xử lý kết quả trung gian và tạo hiện vật cuối. Ví dụ gồm báo cáo nghiên cứu thị trường, trợ lý làm sạch dữ liệu, tóm tắt tuân thủ, bảo trì cơ sở tri thức hỗ trợ khách hàng và copilots kỹ thuật nội bộ.
- Tạo báo cáo chuẩn tư vấn, trực quan tương tác, dashboard (ví dụ phân tích ngành ASIC 42 năm từ hàng nghìn nguồn).
- Quy trình khoa học: Tái lập các quan hệ thiên văn, phân tích sóng hấp dẫn với các tác tử phụ.
- Widgets/Dashboard trong Kimi Work cho các chế độ xem bền vững, dựa trên dữ liệu.
K3 nối liền tài liệu với mã thực thi, tạo đầu ra chất lượng công bố một cách hiệu quả.
Kimi K3 so với các mô hình tuyến đầu khác: So sánh thực tiễn
| Mô hình | Phù hợp nhất | Điểm mạnh | Lưu ý | Khuyến nghị CometAPI |
|---|---|---|---|---|
| Kimi K3 | Mã hóa ngữ cảnh dài, công việc tri thức, tác tử, suy luận thị giác | Quy mô 2.8T MoE, ngữ cảnh 1M, điểm chuẩn mã hóa và tác tử mạnh, lộ trình mở trọng số | Áp lực công suất tuần lễ ra mắt, nhạy với lịch sử suy nghĩ, hỗ trợ vision có thể khác theo tuyến | Kiểm thử như mô hình chủ lực cho mã hóa & ngữ cảnh dài |
| GPT-5.6 Sol | Lý luận khó, mã hóa, nghiên cứu, tác vụ sản xuất rộng | Hồ sơ điểm chuẩn rất mạnh và hệ sinh thái công cụ trưởng thành | Giá cao hơn ở nhiều tuyến | Dùng làm đối chứng và mô hình leo thang |
| Claude Fable 5 | Viết, mã hóa, quy trình tác tử, tác vụ ưu tiên con người | UX mạnh và hiệu năng tuyến đầu rộng | Chi phí cao và có thể rơi vào chính sách ở một số tác vụ | So sánh cho tác tử hướng người dùng và tác vụ nhiều viết |
| Claude Opus 4.8 | Lý luận sâu và công việc chuyên nghiệp đáng tin cậy | Hành vi trợ lý cao cấp ổn định | Cũ hơn so với các phát hành flagship mới nhất | Giữ làm dự phòng hoặc baseline so sánh |
| GLM-5.2 | Đánh giá mô hình mở nhạy chi phí | Lựa chọn mô hình mở cạnh tranh | Yếu hơn trong nhiều so sánh với K3 | Bổ sung vào thử nghiệm định tuyến chi phí/hiệu năng |
Cách truy cập Kimi K3: Hướng dẫn từng bước
- Web/App: Truy cập kimi.com hoặc tải ứng dụng Kimi (iOS/Android). Chọn K3 (K3 Max hoặc Swarm Max).
- Kimi Code: Tập trung terminal/IDE cho nhà phát triển. Tuyệt vời cho tác tử mã hóa.
- API Access:
- Base URL: https://api.moonshot.ai/v1
- Model: kimi-k3
- Lấy API key tại platform.moonshot.ai/console.
- Ví dụ SDK tương thích OpenAI (Python):
Python
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Your prompt"}]
)
Hỗ trợ tools, chế độ JSON, bộ đệm ngữ cảnh. Giá: $3 input, $15 output mỗi M token (cache $0.30).
- Aggregators: Dùng CometAPI (cometapi.com) để truy cập hợp nhất Kimi K3 + 500+ mô hình với một key, chi phí thấp hơn (tiết kiệm 20-40%) và chuyển đổi dễ. Hoàn hảo cho sản xuất — tương thích OpenAI thả-vào, độ trễ thấp.
- Self-Hosting: Sau khi phát hành trọng số ngày 27 tháng 7 trên Hugging Face. Kỳ vọng nhu cầu phần cứng nặng (siêu nút, khuyến nghị 64+ bộ tăng tốc). Cộng đồng như vLLM sẽ theo sau.
Khuyến nghị CometAPI: Tích hợp Kimi K3 qua CometAPI để tránh nhiều key/thanh toán. Thử song song Claude/GPT cho A/B, tối ưu chi phí và mở rộng đáng tin cậy. Bảng điều khiển của họ theo dõi sử dụng trên các mô hình — lý tưởng để giám sát thử nghiệm K3. Đăng ký tại cometapi.com để nhận tín dụng miễn phí và truy cập hợp nhất.
Kết luận
Kimi K3 là một trong những lần ra mắt mô hình quan trọng nhất năm 2026 đến nay. Nó kết hợp quy mô khổng lồ, chiến lược mở trọng số nghiêm túc, cửa sổ ngữ cảnh 1M, hiểu thị giác gốc và kết quả điểm chuẩn đưa nó lên gần đỉnh các hệ thống AI mã hóa và tác tử hiện tại. Nó không loại bỏ nhu cầu về GPT, Claude, Gemini, DeepSeek, Qwen hay mô hình khác, nhưng mang đến cho nhà phát triển một lựa chọn đáng tin cậy mới cho các quy trình ngữ cảnh dài khó nhất.
Bắt đầu ngay trên kimi.com hoặc qua CometAPI để tích hợp dễ dàng. Hãy thử nghiệm với thế mạnh mã hóa và thị giác của nó – kết quả tự nói lên tất cả.
