GPT-6.1 Sol are now live on CometAPI →
ai-model/Nghiên cứu CometAPI

MiMo-V2.5 là gì? Thông số kỹ thuật, điểm chuẩn, tính năng, giá và quyền truy cập API

Khám phá các thông số kỹ thuật, kiến trúc, điểm chuẩn chính thức, giá bán, so sánh với MiMo-V2.5-Pro, các trường hợp sử dụng, hạn chế và quyền truy cập CometAPI của Xiaomi MiMo-V2.5.

CometAPI
Deon GoodwinĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Oct 5, 2026 17 phút đọc
MiMo-V2.5 là gì? Thông số kỹ thuật, điểm chuẩn, tính năng, giá và quyền truy cập API
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Mô hình chuẩn V2.5 của Xiaomi kết hợp khả năng hiểu văn bản, hình ảnh, video và âm thanh gốc với cửa sổ ngữ cảnh 1 triệu token, sử dụng công cụ và hiệu suất Mixture-of-Experts thưa. Nó phù hợp hơn khi đầu vào đa phương thức và chi phí cho mỗi tác vụ hoàn tất là quan trọng. Biến thể Pro lớn hơn và mạnh hơn cho lập trình đòi hỏi và công việc tác nhân dài hạn, nhưng tập trung vào đầu vào văn bản và có chi phí khoảng gấp ba lần mỗi token theo mức giá đã công bố của Xiaomi.

Quyết định thực tế rất đơn giản: chọn mô hình chuẩn cho tác nhân đa phương thức, phân tích tài liệu và phương tiện, và tự động hóa khối lượng lớn; chọn Pro khi nút thắt là kỹ thuật phần mềm khó hoặc thực thi tự chủ kéo dài.

Key Takeaways

  • Mô hình chuẩn sử dụng tổng 310B tham số trong khi kích hoạt 15B mỗi token.
  • Nó chấp nhận văn bản, hình ảnh, video và âm thanh, sau đó trả về văn bản.
  • API hỗ trợ ngữ cảnh 1M, đầu ra lên tới 128K, gọi công cụ, tìm kiếm web, streaming, đầu ra có cấu trúc và bộ nhớ đệm ngữ cảnh.
  • Kết quả do nhà phát hành báo cáo gồm 65.8 trên Terminal-Bench 2.0 và 56.1 trên SWE-Bench Pro.
  • Thẻ mô hình MiMo-V2.5-Pro hiện tại của Xiaomi liệt kê 1.02T tổng và 42B tham số kích hoạt. Điểm SWE-Bench Pro do nhà phát hành liệt kê là 56.1 cho MiMo-V2.5 và 57.2 cho Pro; đây là so sánh có ngày tháng, do nhà phát hành báo cáo, không phải đảm bảo cho một quy trình lập trình cụ thể.
  • Theo mức giá hiện tại của Xiaomi, chi phí đầu vào/đầu ra cho chuẩn là $0.14/$0.28 trên mỗi triệu token; Pro là $0.435/$0.87.
  • Cả hai API trong CometAPI được định giá thấp hơn 20% so với cặp giá chính thức không cache.
    Thông tin đã được kiểm tra: September 28, 2026. Giá, điểm chuẩn, giới hạn, khả dụng và định dạng yêu cầu có thể thay đổi. Xiaomi đã thông báo rằng tên model API chính thức mimo-v2.5 và mimo-v2.5-pro sẽ bị loại bỏ lúc 10:00 theo giờ Bắc Kinh vào October 21, 2026, mà không có thay thế tự động. Hãy lập kế hoạch chuyển đổi và xác nhận tuyến hoạt động trước khi triển khai.

Ghi chú vòng đời API: nền tảng API chính thức của Xiaomi dự kiến ngừng hoạt động cả hai ID model V2.5 vào October 21, 2026. Thông báo này liên quan đến nền tảng API của Xiaomi; hãy kiểm tra riêng bất kỳ cổng bên thứ ba nào. Thông báo ngừng hỗ trợ model của Xiaomi

What the Standard Model Is

MiMo-V2.5 là mô hình nền tảng hướng hiệu suất của Xiaomi MiMo cho nhận thức đa phương thức và công việc dạng tác nhân. Nó cung cấp đầu vào văn bản, hình ảnh, video và âm thanh gốc trong một kiến trúc và tạo đầu ra văn bản.

Nhật ký phát hành mô hình của Xiaomi ghi ngày beta công khai của dòng MiMo-V2.5 là April 23, 2026. Trọng số sau đó đã được phát hành theo giấy phép MIT. MiMo-V2.5 có 310B tham số tổng, nhưng chỉ kích hoạt khoảng 15B cho mỗi token; nó sử dụng một nhóm lớn các chuyên gia mà không chạy toàn bộ 310B tham số mỗi lần.

MiMo-V2.5-Pro nhắm đến một khối lượng công việc khác. Đây là mô hình đầu vào văn bản với quy mô nghìn tỷ tham số, được thiết kế cho các tác vụ lập trình, terminal và tác nhân chạy dài khó nhất. Hai biến thể chia sẻ ngữ cảnh tối đa 1M nhưng khác biệt rõ rệt về phương thức, tính toán kích hoạt và giá.

MiMo-V2.5 Specifications and Features

Chi tiết kiến trúc chính thứcGiá trịÝ nghĩa
Kiến trúcMoE thưa (Sparse MoE)Dung lượng chuyên gia lớn với kích hoạt chọn lọc
Tham số tổng/kích hoạt310B / 15BTính toán kích hoạt thấp hơn nhiều so với tổng
Lớp Transformer48: 1 dense + 47 MoEHầu hết lớp dùng chuyên gia được định tuyến
Chuyên gia định tuyến256; 8 kích hoạt mỗi tokenChuyên môn hóa mà không chạy dày 310B
Attention39 lớp SWA + 9 lớp toàn cụcCân bằng hiệu quả cục bộ và luồng dài hạn
Cửa sổ SWA128 tokenGiảm áp lực bộ nhớ đệm ngữ cảnh dài
Ngữ cảnh / đầu ra tối đa1M / 128K tokenHỗ trợ tài liệu dài và vết thực thi mở rộng
Đầu vào / đầu raVăn bản, hình ảnh, video, âm thanh / văn bảnNhận thức gốc trên bốn loại đầu vào
Bộ mã hóa thị giácViT 729M; 28 lớpHiểu hình ảnh và video
Bộ mã hóa âm thanhTransformer 261M; 24 lớpHiểu âm thanh gốc
Multi-Token Prediction3 mô-đun; khoảng 329M tham sốHỗ trợ hiệu suất giải mã suy đoán
Quy mô huấn luyệnKhoảng 48T tokenChu trình huấn luyện văn bản và đa phương thức rộng
Khả năng APICông cụ, web, streaming, đầu ra có cấu trúc, cachingNguyên thủy tác nhân hướng sản xuất
Giấy phépMITCho phép sử dụng và sửa đổi thương mại

Vùng hoạt động bao gồm ngữ cảnh 1M và đầu ra 128K, cộng với giới hạn được công bố là 100 yêu cầu mỗi phút và 10 triệu token mỗi phút. Giới hạn cấp nhà cung cấp có thể khác theo tài khoản và tuyến tích hợp.

MiMo-V2.5 là gì? Thông số kỹ thuật, điểm chuẩn, tính năng, giá và quyền truy cập API

Sơ đồ kiến trúc chính thức của Xiaomi MiMo. Tài sản kiến trúc chính thức.

How MiMo-V2.5 Architecture Works

Chuyên gia thưa: Dung lượng tổng không phải là tính toán kích hoạt

Thực tế hiệu suất trung tâm là thiết kế 310B tổng, 15B kích hoạt. Bộ định tuyến chọn tám trong số 256 chuyên gia cho mỗi token. Điều đó cho mô hình quyền truy cập vào một bể tham số lớn hơn nhiều so với mô hình dày 15B thông thường mà không cần thực thi toàn bộ 310B tham số mỗi lần.

Điều này không làm cho tự lưu trữ trở nên tầm thường. Toàn bộ trọng số vẫn phải được lưu trữ và phân phối, vì vậy dung lượng bộ nhớ, băng thông liên kết, định tuyến chuyên gia và phần mềm phục vụ vẫn là các ràng buộc đáng kể.

Attention lai cho ngữ cảnh dài

Xương sống đan xen attention cửa sổ trượt và attention toàn cục ở tỷ lệ 5:1 giữa SWA và toàn cục. Ba mươi chín lớp cục bộ kiểm soát tăng trưởng bộ nhớ đệm, trong khi chín lớp toàn cục duy trì luồng thông tin khoảng cách xa. Xiaomi báo cáo giảm gần sáu lần bộ nhớ đệm KV so với thiết kế toàn bộ attention toàn cục.

Giới hạn 1M token là dung lượng, không phải đảm bảo độ chính xác. Chất lượng truy xuất, độ trễ, tăng trưởng trạng thái công cụ và attention qua bằng chứng xa vẫn cần đánh giá theo khối lượng công việc cụ thể.

Bộ mã hóa gốc và tính năng tác nhân

Một transformer thị giác 729M tham số xử lý đầu vào hình ảnh và video; một transformer âm thanh 261M tham số xử lý âm thanh. Các projector ánh xạ cả hai luồng vào xương sống ngôn ngữ, cho phép một tác nhân kết hợp ảnh chụp màn hình, đoạn video, track âm thanh, hướng dẫn văn bản và kết quả công cụ.

Ba mô-đun Multi-Token Prediction hỗ trợ giải mã suy đoán và hiệu suất học tăng cường. Mô hình được huấn luyện trên khoảng 48T token, với ngữ cảnh được mở rộng dần đến 1M trong giai đoạn hậu huấn luyện.

Trọng số mở sử dụng giấy phép MIT. Triển khai thương mại được phép, nhưng chi phí hạ tầng và phụ thuộc bên thứ ba vẫn cần rà soát riêng.

MiMo-V2.5 Benchmarks: Coding, Agents, and Multimodal Results

Ghi chú điểm chuẩn:

các số liệu dưới đây do nhà phát hành báo cáo. Chúng là bằng chứng định hướng, không phải đảm bảo cho một kho mã cụ thể, định dạng phương tiện, stack công cụ, mục tiêu độ trễ, hay chính sách an toàn.

Kết quả lập trình và tác nhân

MiMo-V2.5 là gì? Thông số kỹ thuật, điểm chuẩn, tính năng, giá và quyền truy cập API

Biểu đồ điểm chuẩn lập trình và tác nhân chính thức của Xiaomi MiMo.

Điểm chuẩn lập trình chính thứcĐiểm báo cáoTín hiệu quyết định
MiMo Coding Bench71.8Khả năng tác nhân lập trình rộng
Claw-Eval Text62.3Hoàn thành tác nhân văn bản chung
Terminal-Bench 2.065.8Thực thi terminal tương tác
SWE-Bench Pro56.1Kỹ thuật phần mềm thực tế
Claw-Eval Multi-Turn63.2Công việc tác nhân nhiều bước dài
ResearchClawBench16.91Quy trình nghiên cứu tự động

Kết quả: trường hợp mạnh nhất là sử dụng công cụ thực tế hơn là hoàn thành mã biệt lập. Điểm 65.8 trên Terminal-Bench hỗ trợ tác nhân thiên về terminal, trong khi 56.1 trên SWE-Bench Pro gợi ý khả năng ở cấp độ kho mã hữu ích. Điểm nghiên cứu thấp hơn nhiều nhắc nhở cần kiểm thử riêng hành vi thu thập bằng chứng và trích dẫn.

Kết quả đa phương thức

MiMo-V2.5 là gì? Thông số kỹ thuật, điểm chuẩn, tính năng, giá và quyền truy cập API

Biểu đồ điểm chuẩn hình ảnh, video và tác nhân đa phương thức chính thức của Xiaomi MiMo.

Điểm chuẩn đa phương thức chính thứcĐiểm báo cáoNăng lực được kiểm tra
CharXiv RQ81.0Lý luận biểu đồ và tài liệu
MMMU-Pro77.9Lý luận đa phương thức cấp chuyên gia
HR-Bench 4K88.5Hiểu hình ảnh độ phân giải cao
OmniDocBench87.2Hiểu tài liệu
Claw-Eval Multimodal23.8Hoàn thành tác nhân đa phương thức
Video-MME87.7Hiểu video
DailyOmni83.5Lý luận nghe nhìn hàng ngày
VideoHolmes64.0Lý luận video theo thời gian

Kết quả: hiểu tài liệu, hình ảnh độ phân giải cao và video là những điểm mạnh rõ ràng. Điểm tác nhân đa phương thức 23.8 thấp hơn nhiều so với các điểm hiểu nhận thức, vì vậy một hệ thống vừa phải hiểu phương tiện vừa vận hành công cụ đáng tin cậy cần được đánh giá đầu-cuối.

MiMo-V2.5 vs MiMo-V2.5-Pro: Multi-Dimensional Comparison

So sánh kiến trúc chính thứcMiMo-V2.5MiMo-V2.5-Pro
Thông số kỹ thuật chính thức của Pro
Các điểm chuẩn chính thức của Pro
Hệ quả thực tiễn
Tham số tổng310B1.02TPro có dung lượng tổng lớn hơn hơn 3×
Tham số kích hoạt15B42BPro dùng khoảng 2.8× tham số kích hoạt
Lớp / chuyên gia định tuyến48 / 25670 / 384Pro là mục tiêu phục vụ lớn hơn
Trần ngữ cảnh trên thẻ mô hình1M1MCả hai liệt kê tới 1M token; thử truy xuất và độ trễ theo kích thước khối lượng công việc của bạn
Đầu ra tối đa API chính thức128K128KTrang model API hiện tại của Xiaomi liệt kê 128K; giới hạn cụ thể nhà cung cấp có thể khác
Đầu vào gốcVăn bản, hình ảnh, video, âm thanhVăn bảnMiMo-V2.5 là lựa chọn đa phương thức được ghi nhận; hãy xác minh endpoint Pro trước khi gửi media
SWE-Bench Pro56.157.2Pro dẫn trước 1.1 điểm
Terminal-Bench 2.065.868.4Pro dẫn trước 2.6 điểm
Phù hợp chínhTác nhân đa phương thức hiệu quảLập trình phức tạp và tác nhân dài hạnChọn theo khối lượng đã kiểm thử; biên độ ở mức mô hình không chứng minh lợi thế chất lượng chung

Kết quả so sánh: lợi thế điểm chuẩn của Pro là khiêm tốn trên hai bài kiểm tra tác nhân lập trình chung, trong khi biến thể chuẩn bổ sung đầu vào gốc hình ảnh, video và âm thanh và dùng ít tham số kích hoạt hơn nhiều. Pro hợp lý khi các cải thiện nhỏ về hoàn thành tác vụ khó có giá trị hơn đầu vào đa phương thức và chi phí đơn vị thấp.

How Much Do MiMo-V2.5 and MiMo-V2.5-Pro Cost?

Cơ sở giá: May 27, 2026API chuẩn chính thứcAPI Pro chính thứcAPI MiMo-V2.5 trong CometAPIAPI MiMo-V2.5-Pro trong CometAPI
Đầu vào, cache miss / MTok$0.14$0.435$0.112$0.348
Đầu ra / MTok$0.28$0.87$0.224$0.696
Đầu vào, cache hit / MTok$0.0028$0.0036Kiểm tra hóa đơn trực tiếpKiểm tra hóa đơn trực tiếp
Giảm giá vs mức không cache chính thứcBaselineBaseline20%20%

Theo mức giá chính thức, Pro đắt hơn khoảng 3.1× so với chuẩn cho cả đầu vào và đầu ra không cache. Giá nhà cung cấp hiển thị ở trên giảm mỗi cặp không cache 20%, nhưng khoảng cách tương đối giữa hai biến thể về cơ bản không đổi.

Giá mỗi token không phải tổng chi phí. Số lần thử lại công cụ, kích thước ngữ cảnh, độ dài đầu ra, độ trễ, phục hồi tác vụ thất bại và rà soát thủ công quyết định chi phí trên mỗi tác vụ hoàn tất. Hãy chạy mẫu khối lượng công việc đại diện trước khi chọn mô hình sản xuất mặc định.

What Is MiMo-V2.5 Best For?

  • Tác nhân đa phương thức: kết hợp ảnh chụp màn hình, tài liệu, video, âm thanh, hướng dẫn và công cụ trong một quy trình.
  • Phân tích tài liệu dài: xử lý kho mã, hợp đồng, lưu trữ nghiên cứu, nhật ký và lịch sử hỗ trợ.
  • Hiểu phương tiện: tóm tắt video, trích xuất sự kiện, diễn giải biểu đồ và trả lời câu hỏi nghe nhìn.
  • Tác nhân lập trình và terminal: kiểm tra tệp, chạy lệnh, sửa đổi mã và lặp lại trên kết quả kiểm thử.
  • Tự động hóa khối lượng lớn: dùng kích hoạt thưa và giá token thấp hơn cho tác vụ sản xuất lặp lại.

Limitations and Risks

  • Chỉ 15B tham số được kích hoạt mỗi token, nhưng tự lưu trữ vẫn cần hệ thống trọng số 310B đầy đủ.
  • Đầu ra đa phương thức là văn bản; tạo hình ảnh, giọng nói và video cần mô hình khác.
  • Trần ngữ cảnh 1M không đảm bảo độ chính xác truy xuất đồng đều trên toàn cửa sổ.
  • Điểm chuẩn do nhà phát hành có thể không chuyển giao sang công cụ tùy chỉnh, kho mã, prompt, hoặc ràng buộc an toàn.
  • Mức độ phơi bày phương thức của nhà cung cấp có thể khác với đầy đủ khả năng của mô hình trọng số mở.

Cổng sản xuất:

xác thực độ chính xác, hoàn thành gọi công cụ, độ trễ, tiêu thụ token, xử lý phương thức và hành vi dự phòng trên các tác vụ đại diện trước khi đưa lưu lượng.

API Example

Ví dụ Python sau sử dụng endpoint CometAPI tương thích OpenAI và ID mô hình chuẩn. Hãy xác nhận endpoint hiện tại và schema yêu cầu được hỗ trợ trước khi triển khai.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Decision Guide

Tín hiệu khối lượng công việcBắt đầu vớiChuyển khi
Hình ảnh, video hoặc âm thanh là đầu vào hạng nhấtChuẩnKhông chuyển trừ khi tiền xử lý đa phương thức là chấp nhận được
Tài liệu lớn hoặc khối lượng media hỗn hợpChuẩnChỉ dùng Pro nếu lỗi lý luận chi phối chi phí
Kỹ thuật kho mã khóKiểm thử cả haiChọn Pro nếu lợi thế hoàn thành bù được chi phí 3.1×
Quỹ đạo terminal tự động dàiProQuay lại chuẩn nếu không đo được lợi ích
Tự động hóa thường quy khối lượng lớnChuẩnChỉ nâng cấp các tác vụ thất bại hoặc giá trị cao

Định tuyến khuyến nghị:

dùng chuẩn làm mặc định cho công việc đa phương thức và khối lượng lớn, sau đó chỉ định tuyến các tác vụ lập trình đầu-văn bản khó hoặc dài hạn sang Pro. Điều này giữ năng lực đồng thời kiểm soát tổng chi phí.

Conclusion

Mô hình chuẩn không chỉ đơn thuần là một Pro nhỏ hơn. Nó là một điểm tối ưu riêng: đầu vào đa phương thức gốc, ngữ cảnh 1M, điểm chuẩn mạnh hướng công cụ và 15B tham số kích hoạt với giá token thấp hơn nhiều.

Pro là tùy chọn chuyên biệt cho kỹ thuật phần mềm khó và thực thi tự chủ kéo dài. Dung lượng bổ sung của nó tạo ra cải thiện đo được nhưng không phổ quát, vì vậy mẫu triển khai mạnh nhất là định tuyến theo khối lượng công việc thay vì chọn một biến thể cho mọi yêu cầu.

FAQ

Mô hình chuẩn có nguồn mở không?

Trọng số của nó được phát hành theo giấy phép MIT, cho phép sử dụng thương mại, sửa đổi, tinh chỉnh và phân phối lại theo điều khoản giấy phép.

Nó dùng bao nhiêu tham số?

MoE thưa chứa 310B tham số tổng và kích hoạt 15B cho mỗi token. Tham số kích hoạt mô tả tính toán mỗi token, không phải kích thước lưu trữ của toàn bộ mô hình.

Nó có hỗ trợ hình ảnh, video và âm thanh không?

Có. Biến thể chuẩn chấp nhận đầu vào văn bản, hình ảnh, video và âm thanh và trả về văn bản. Biến thể Pro có thông số chính thức liệt kê đầu vào văn bản.

Cửa sổ ngữ cảnh tối đa là bao nhiêu?

Cả hai thẻ mô hình chỉ định cửa sổ ngữ cảnh lên tới 1M token. Trang API hiện tại của Xiaomi liệt kê đầu ra tối đa 128K cho MiMo-V2.5 và MiMo-V2.5-Pro. Giới hạn thực tế có thể khác theo endpoint, nhà cung cấp, tài khoản và định dạng yêu cầu; hãy xác minh tuyến triển khai trước khi dựa vào các trần này.

Trang API Pro chính thức hiện tại xác nhận riêng ngữ cảnh 1M và đầu ra tối đa 128K: Thông số API MiMo-V2.5-Pro

Biến thể nào tốt hơn cho tác nhân lập trình?

Pro báo cáo kết quả cao hơn trên các điểm chuẩn tác nhân lập trình và terminal chung, nhưng biên độ khiêm tốn. Hãy kiểm thử cả hai trên kho mã mục tiêu và chọn dựa trên hoàn thành tác vụ, độ trễ và tổng chi phí.

Biến thể nào tốt hơn cho tác nhân đa phương thức?

Biến thể chuẩn là lựa chọn tự nhiên vì nó chấp nhận đầu vào hình ảnh, video và âm thanh gốc. Pro tập trung vào đầu vào văn bản.

Đội ngũ sản xuất nên chọn như thế nào?

Bắt đầu với chuẩn, đo lỗi và chỉ định tuyến các tác vụ đầu-văn bản khó có lợi từ Pro. So sánh chi phí trên mỗi tác vụ hoàn tất thay vì chỉ giá mỗi token.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Oct 5, 2026
Cập nhật lần cuối Oct 5, 2026
0 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Đọc thêm