GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
ai-model/Nghiên cứu CometAPI

Kimi K3 là gì: Điểm chuẩn, Khả năng & Hướng dẫn truy cập trong năm 2026

Hướng dẫn Kimi K3: Nó là gì, Điểm chuẩn, Truy cập API, Thị giác, Lập trình và CometAPI

CometAPI
AnnaĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 3, 2026 14 phút đọc
Kimi K3 là gì: Điểm chuẩn, Khả năng & Hướng dẫn truy cập trong năm 2026
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR: Moonshot AI đã phát hành Kimi K3 vào ngày 16 tháng 7 năm 2026 – một mô hình trọng số mở đột phá với 2,8 nghìn tỷ tham số (đầu tiên trong lớp 3T), đa phương thức gốc, ngữ cảnh 1 triệu token và hiệu năng tuyến đầu có thể sánh ngang hoặc vượt các mô hình độc quyền hàng đầu như Claude Fable 5 và GPT-5.6 Sol trong lập trình, tác vụ agent, phát triển frontend và công việc tri thức.

Những điểm chính

  • Quy mô & đổi mới: 2,8T tham số, MoE với 16/896 expert hoạt động, Kimi Delta Attention (KDA), Attention Residuals – hiệu suất mở rộng ~2,5x so với K2, Kimi K3 - Kimi API Platform
  • Hiệu năng: Artificial Analysis Intelligence Index ~57 (top 4, vượt Claude Opus 4.8), dẫn đầu Frontend Code Arena, mạnh trên Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). Kém Fable 5/Sol tổng thể nhưng vượt đa số còn lại; #1 trên Arena.ai Frontend Code Arena (Elo 1.679, vượt Fable 5), bài Arena trên XTom's Hardware đưa tin.
  • Năng lực: Thị giác/video gốc, ngữ cảnh 1M cho kho mã/kho dữ liệu lớn, coding dạng agent, suy luận 3D, chỉnh sửa video, bảng điều khiển nghiên cứu.
  • Truy cập: Dùng ngay qua kimi.com, API (model kimi-k3, hướng dẫn truy cập); trọng số mở sắp có. Moonshot tạm dừng đăng ký mới Kimi K3 do nhu cầu tăng đột biến. Tích hợp dễ dàng qua CometAPI.
  • Giá trị: Chi phí mỗi tác vụ thấp hơn (~$0,94 trong một số đánh giá), ít từ chối hơn, lý tưởng cho quy trình Coding/Thị giác.

Kimi K3 Tech Blog mô tả Kimi K3 là "Open Frontier Intelligence, Kimi K3 đánh dấu một thời khắc then chốt trong dân chủ hóa AI. Khi các phòng thí nghiệm AI Trung Quốc như Moonshot tiếp tục vượt giới hạn bất chấp ràng buộc tính toán, mô hình mở này thách thức sự thống trị của các frontier đóng tại Mỹ và trao quyền cho nhà phát triển toàn cầu."

Kimi K3 là gì? Mô hình lớp 3T mở từ Moonshot AI

Moonshot AI, một startup có trụ sở tại Bắc Kinh, đã ra mắt Kimi K3 vào ngày 16 tháng 7 năm 2026 như mô hình chủ lực. Nó được định vị rõ ràng là mô hình mở đầu tiên trong lớp khoảng 3 nghìn tỷ tham số, với tổng 2,8 nghìn tỷ tham số theo kiến trúc Mixture-of-Experts (MoE) thưa. Chỉ 16 trong số 896 expert được kích hoạt mỗi token, cân bằng giữa quy mô khổng lồ và hiệu suất.

Đây là bước tiếp nối dòng Kimi K2 (K2.5, K2.6, v.v.), vốn đã gây chú ý ở lập trình và đa phương thức. K3 giới thiệu các đổi mới kiến trúc: Kimi Delta Attention (KDA)Attention Residuals (AttnRes), cùng Stable LatentMoE và huấn luyện nhận biết lượng tử hóa (trọng số MXFP4, kích hoạt MXFP8 từ giai đoạn SFT). Những cải tiến này mang lại hiệu suất mở rộng tốt hơn ~2,5x và giải mã nhanh hơn tới 6,3x so với thế hệ trước.

Thông số chính (Kimi K3 Technical Specifications):

  • Tham số: Tổng 2,8T (MoE thưa).
  • Cửa sổ ngữ cảnh: 1.048.576 token (~1M).
  • Đa phương thức: Hiểu văn bản + hình ảnh + video gốc; xuất văn bản.
  • Đầu ra tối đa: Mặc định 131k token, có thể lên tới giới hạn ngữ cảnh.
  • Suy luận: Mặc định nỗ lực tối đa khi ra mắt; các chế độ thấp/cao sẽ bổ sung.
  • Trọng số mở: Hứa hẹn trước ngày 27 tháng 7, 2026 (giấy phép kiểu MIT sửa đổi, theo tiền lệ K2).

K3 nhắm tới các tác vụ dài hạn — không chỉ trả lời nhanh mà còn hoàn tất những công việc kỹ thuật, nghiên cứu hay quy trình agent phức tạp với phản hồi trực quan ("Vision in the Loop"). Demo gồm tự động xây dựng trình biên dịch GPU (cạnh tranh Triton), thiết kế chip tiến trình 45nm và nghiên cứu vật lý thiên văn nhanh.

Nhu cầu đã gây áp lực lên năng lực

Phản hồi ban đầu mạnh mẽ đến mức gây áp lực năng lực. Moonshot đăng trên X rằng nhu cầu trong 48 giờ qua đã gần kịch trần GPU hiện tại và các đăng ký mới sẽ tạm dừng trong lúc bổ sung năng lực. Business Insider cũng đưa tin việc tạm dừng này và lưu ý rằng người đăng ký hiện hữu không bị ảnh hưởng.

Điều này quan trọng cho kế hoạch sản xuất. Một mô hình có thể xuất sắc nhưng vẫn gặp hạn chế khả dụng nếu nhu cầu vượt quá tính toán. Các đội đánh giá Kimi K3 nên tránh phụ thuộc một nhà cung cấp, theo dõi độ trễ và tỉ lệ lỗi, và dùng định tuyến dự phòng qua một lớp thống nhất như CometAPI khi có thể.

Thang đo lập trình: Nơi Kimi K3 mạnh nhất

Hồ sơ lập trình của Kimi K3 là lý do cốt lõi khiến dev chú ý. Nó gần ngang GPT-5.6 Sol trên Terminal-Bench 2.1, nhỉnh hơn GPT-5.6 Sol và Claude Fable 5 trên Program Bench, và dẫn GPT-5.6 Sol với khoảng cách đáng kể trên FrontierSWE. Nó cũng vượt các mô hình so sánh trên SWE Marathon trong bảng OpenLM.

Kết quả frontend của Arena bổ sung một tín hiệu thực tế khác. Arena báo Kimi K3 đạt 1.679 điểm trên Frontend Code Arena, vượt Claude Fable 5. Bài test này quan trọng vì công việc frontend thường được đánh giá theo sở thích của lập trình viên, không chỉ bài kiểm thử. Một trợ lý lập trình có thể tạo UI sạch, mạch lạc từ prompt rất có giá trị cho đội sản phẩm, agency, nhà xây dựng SaaS và công cụ nội bộ.

Bảng xếp hạng tổng thể

  • Artificial Analysis AI Leaderboard: Ra mắt ở #3. Điểm Intelligence Index đặt nó vào nhóm cạnh tranh (ví dụ ~57,1 trong một số đánh giá).
  • Đánh giá công việc tri thức dài hạn riêng: Elo 1547 (+732 so với K2.6), chỉ sau Fable 5.

Thang đo lập trình & agent (tự báo cáo & độc lập)

K3 tỏa sáng ở đây, tận dụng quy mô và kiến trúc cho hiệu suất agent bền vững.

  • Frontend Code Arena (Arena.ai): #1 với 1.679 điểm, vượt Fable 5 và GPT-5.6 Sol. Xuất sắc trong sở thích mù của dev cho web dev.
  • DeepSWE: 67,3–67,5 (mạnh, với harness KimiCode).
  • Program Bench: #1 ở 77,8.
  • SWE Marathon: #1 ở 42,0 (một số harness).
  • Terminal-Bench 2.1: Cạnh tranh, gần GPT-5.6 Sol.

Thị giác & đa phương thức

Huấn luyện gốc (không ghép thêm) cho kết quả chắc chắn:

  • MMMU-Pro: 81,6%
  • MathVision: Cạnh tranh/đầu 90 theo một số báo cáo.
  • OmniDocBench: 91,1% (dẫn đầu).

Hỗ trợ ảnh chụp màn hình, sơ đồ, video cho các tác vụ vòng kín như tinh chỉnh UI hoặc phát triển game.

Bảng so sánh: Kimi K3 vs. các mô hình dẫn đầu (xấp xỉ/tổng hợp từ báo cáo; Max Effort khi có)

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolGhi chú/Nguồn
Frontend Code Arena1.679 (#1)Thấp hơnThấp hơnArena.ai
DeepSWE67,3–67,5Cạnh tranh-Moonshot/KimiCode
Program Bench77,8 (#1)-GầnVals.ai
Intelligence Index (AA)~57,1~59,9~58,9Artificial Analysis
Long-Horizon Elo1547Cao hơn-Internal Moonshot
Cost per Task (Evals)~$0,94Cao hơnCao hơnĐộc lập

Dữ liệu lấy từ blog kỹ thuật của Moonshot, các bảng xếp hạng độc lập và phân tích. Kết quả có thể thay đổi theo harness/nỗ lực; luôn kiểm tra bản mới nhất.

K3 cho thấy ít từ chối hơn ở chủ đề nhạy cảm và độ nhất quán cao trong luồng agent. Kiểm thử độc lập (ví dụ đánh giá trên YouTube, Vals AI) xác nhận đây là một trong những mô hình mở mạnh nhất cho lập trình thực tế.

Kimi K3 có thể làm gì? Năng lực trong lập trình, thị giác và hơn thế nữa

Lập trình & kỹ thuật dạng agent

K3 duy trì phiên làm việc dài với ít giám sát: điều hướng kho mã khổng lồ, dùng công cụ, debug qua ảnh chụp màn hình ("vision in the loop").

Ví dụ:

  • Tối ưu kernel & phát triển trình biên dịch: Xây MiniTriton (trình biên dịch giống Triton) từ đầu, cạnh tranh với stack tối ưu. Tối ưu kernel GPU ở mức cạnh tranh với Fable 5.
  • Phát triển game: Biến ý tưởng/ảnh/video thành trải nghiệm 3D/nhiều người chơi có thể chơi, với tinh chỉnh lặp.
  • Thiết kế chip: Chạy tự động 48 giờ thiết kế một chip mô hình nano.
  • Frontend: Đứng đầu các bảng cho ứng dụng web, tác vụ full-stack.

Thị giác & đa phương thức

Khả năng hiểu ảnh/video gốc cho phép:

  • Chỉnh sửa video: Tự biên tập teaser từ 56 clip (chọn, cắt, đồng bộ, sửa) – hàng giờ việc trong vài phút.
  • Suy luận 3D, motion graphics, bảng điều khiển tương tác.
  • "Vision in the loop" cho lặp code qua ảnh chụp màn hình.

Tài liệu API của Kimi cho thấy nhập ảnh qua data URL base64 và nhập video qua tệp đã tải lên tham chiếu bằng ms://. Họ cũng cảnh báo không hỗ trợ URL ảnh công khai trong đầu vào thị giác, vì vậy dev nên gửi base64 hoặc tham chiếu tệp đã tải và đặt nội dung message là mảng đối tượng. Đây là chi tiết triển khai quan trọng: đừng tuần tự hóa một message trộn ảnh và văn bản thành một chuỗi phẳng.

Công việc tri thức & nghiên cứu

Với doanh nghiệp, đây là nơi Kimi K3 có thể giá trị hơn chatbot thường. Mô hình được thiết kế cho công việc "agentic" nơi nó duy trì kế hoạch, gọi công cụ, xử lý kết quả trung gian và tạo sản phẩm cuối.

  • Tạo báo cáo chuẩn tư vấn, trực quan hóa tương tác, bảng điều khiển (ví dụ phân tích 42 năm ngành ASIC từ hàng nghìn nguồn).
  • Quy trình khoa học: Tái lập quan hệ vật lý thiên văn, phân tích sóng hấp dẫn với các sub-agent.
  • Widget/Bảng điều khiển trong Kimi Work cho góc nhìn dữ liệu bền vững.

K3 nối liền tài liệu tới mã thực thi, tạo đầu ra đạt chất lượng công bố một cách hiệu quả.

Kimi K3 so với các mô hình frontier khác: So sánh thực tiễn

ModelPhù hợp nhấtThế mạnhCần lưu ýKhuyến nghị của CometAPI
Kimi K3Lập trình ngữ cảnh dài, công việc tri thức, agent, suy luận thị giácQuy mô MoE 2,8T, ngữ cảnh 1M, thang đo lập trình và agent mạnh, lộ trình trọng số mởÁp lực năng lực tuần đầu ra mắt, nhạy với lịch sử suy nghĩ, hỗ trợ thị giác tùy tuyến tích hợpThử như mô hình chủ lực cho lập trình/ngữ cảnh dài
GPT-5.6 SolSuy luận khó, lập trình, nghiên cứu, tác vụ sản xuất rộngHồ sơ benchmark rất mạnh và hệ sinh thái công cụ trưởng thànhGiá cao hơn ở nhiều tuyếnDùng làm mô hình so sánh và leo thang
Claude Fable 5Viết, lập trình, luồng agent, tác vụ thiên về sở thích con ngườiUX mạnh và hiệu năng frontier rộngChi phí cao và có thể rơi vào policy fallback trong một số tác vụSo sánh cho agent hướng người dùng và viết nặng
Claude Opus 4.8Suy luận sâu và công việc chuyên nghiệp đáng tin cậyHành vi trợ lý cao cấp ổn địnhCũ hơn so với các bản chủ lực mới nhấtGiữ làm dự phòng hoặc mốc so sánh
GLM-5.2Đánh giá mô hình mở nhạy chi phíLựa chọn mô hình mở cạnh tranhYếu hơn ở một số so sánh với K3 đã liệt kêĐưa vào thử nghiệm định tuyến chi phí/hiệu năng

Cách truy cập Kimi K3: Hướng dẫn từng bước

Cách truy cập Kimi K3

1. Truy cập Kimi K3 qua các sản phẩm Kimi

Cách nhanh nhất cho người không phải dev là qua các sản phẩm tiêu dùng và năng suất của Kimi: web Kimi, ứng dụng, Kimi Work và Kimi Code. Đây là cách nhanh nhất để thử hành vi viết, lập trình, nghiên cứu và hướng UI của mô hình mà không cần tích hợp. Việc tạm dừng đăng ký được báo cáo vào 20/7 nghĩa là khả dụng có thể thay đổi, hãy kiểm tra trang sản phẩm Kimi hiện tại trước khi triển khai cho đội.

2. Truy cập Kimi K3 qua Kimi API Platform

Dev có thể gọi Kimi K3 qua Kimi API Platform sử dụng client kiểu OpenAI. Tài liệu của Moonshot liệt kê:

  • base URL: https://api.moonshot.ai/v1
  • model ID: kimi-k3
  • biến môi trường trong ví dụ: MOONSHOT_API_KEY
  • Yêu cầu SDK Python: OpenAI SDK 1.0 trở lên

Basic Python example:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "Introduce Kimi K3 in one sentence."}
    ],
)

print(completion.choices[0].message.content)

Kimi K3 luôn bật chế độ suy nghĩ và hỗ trợ reasoning_effort các giá trị low, highmax, với max là mặc định. API hỗ trợ streaming, đầu ra có cấu trúc với schema JSON nghiêm ngặt, Partial Mode, gọi công cụ, nạp công cụ động, tự động cache ngữ cảnh và tích hợp công cụ chính thức qua Formula. Tài liệu cũng liệt kê các giới hạn quan trọng: max_completion_tokens mặc định 131.072 và có thể đặt tới 1.048.576; temperature và top-p là cố định; dev nên trả về đầy đủ message assistant trong luồng đa lượt và gọi công cụ; và tìm kiếm web đang được cập nhật, nên chưa khuyến nghị dùng cho sản xuất trong thời gian gần.

3. Truy cập Kimi K3 qua CometAPI

Với nhiều đội, CometAPI là tuyến thực tế nhất vì cung cấp lớp API thống nhất cho nhiều nhà cung cấp. Trang Kimi K3 của CometAPI liệt kê mô hình đã live với:

  • model ID: kimi-k3
  • provider: Moonshot AI
  • context window: lên tới 1.000.000 token
  • giá CometAPI: $2,4 input và $12 output mỗi 1M token
  • giá niêm yết chính thức: $3 input và $15 output mỗi 1M token
  • endpoint: /v1/chat/completions
  • base URL: https://api.cometapi.com/v1

CometAPI Python example:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are a careful software engineering assistant.",
        },
        {
            "role": "user",
            "content": "Review this migration plan and identify the riskiest steps.",
        },
    ],
    max_completion_tokens=1024,
)

print(completion.choices[0].message.content)

Nếu ứng dụng của bạn đã dùng OpenAI SDK, quickstart của CometAPI khuyến nghị chỉ đổi hai thiết lập: đặt base_url thành https://api.cometapi.com/v1 và dùng COMETAPI_KEY thay cho khóa nhà cung cấp trước. Sau đó, truyền model ID của CometAPI trong trường model.

4. Truy cập trọng số mở Kimi K3 sau khi phát hành

Moonshot cho biết sẽ phát hành đầy đủ trọng số Kimi K3 trước ngày 27 tháng 7, 2026. Khi đó, nhà nghiên cứu, đội hạ tầng và người dùng doanh nghiệp nâng cao có thể đánh giá tự triển khai, tối ưu hoặc triển khai riêng tư. Với hầu hết công ty, câu hỏi chính sẽ là kinh tế học: mô hình là mở, nhưng phục vụ một hệ thống MoE 2,8T đòi hỏi hạ tầng GPU đáng kể, kỹ thuật suy luận và giám sát vận hành.

Kết luận

Kimi K3 là một trong những lần ra mắt mô hình quan trọng nhất năm 2026 đến nay. Nó kết hợp quy mô lớn, chiến lược trọng số mở nghiêm túc, cửa sổ ngữ cảnh 1M, hiểu thị giác gốc và kết quả benchmark đưa nó gần đỉnh các hệ thống AI lập trình và agent hiện tại. Nó không xóa nhu cầu về GPT, Claude, Gemini, DeepSeek, Qwen hay các mô hình khác, nhưng cho dev một lựa chọn đáng tin cho các quy trình ngữ cảnh dài khó nhất.

Bắt đầu ngay trên kimi.com hoặc qua CometAPI để tích hợp dễ dàng. Hãy thử nghiệm điểm mạnh về lập trình và thị giác của nó – kết quả sẽ tự nói lên tất cả.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Jul 20, 2026
Cập nhật lần cuối Sep 3, 2026
329 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm