Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
guide/Nghiên cứu CometAPI

Cách sử dụng MiMo-V2.5 API Hướng dẫn đầy đủ dành cho nhà phát triển

Tìm hiểu đặc tả API của Xiaomi, điểm chuẩn, giá, yêu cầu đa phương thức, truyền phát dạng luồng, tích hợp Python và các thực tiễn tốt nhất cho môi trường sản xuất.

CometAPI
Deon GoodwinĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Oct 7, 2026 13 phút đọc
Cách sử dụng MiMo-V2.5 API Hướng dẫn đầy đủ dành cho nhà phát triển
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

MiMo-V2.5 API trên CometAPI cung cấp quyền truy cập vào mô hình sparse mixture-of-experts của Xiaomi cho lập trình, hiểu đa phương thức và các tác vụ agent. MiMo-V2.5 API là lựa chọn thực tế mặc định khi dự án cần cửa sổ ngữ cảnh 1 triệu token, đầu vào đa phương thức nguyên bản và chi phí token thấp; MiMo-V2.5 Pro phù hợp hơn khi lập trình khó, suy luận hoặc sử dụng công cụ dài hạn quan trọng hơn giá. Hướng dẫn này cho thấy cách gọi API qua CometAPI, stream phản hồi, cấu trúc yêu cầu đa phương thức, ước tính chi phí và tăng độ bền cho tích hợp sản xuất.

Key Takeaways

  • Mô hình MiMo-V2.5 sử dụng tổng 310B tham số với 15B tham số kích hoạt trên mỗi token và hỗ trợ cửa sổ ngữ cảnh 1M token.
  • Dùng tuyến MiMo-V2.5 cho công việc đa phương thức, phân tích ngữ cảnh lớn và agent nhạy chi phí; chọn MiMo-V2.5 Pro cho các tác vụ lập trình và suy luận khó nhất.
  • Endpoint tương thích OpenAI giúp việc di trú đơn giản, nhưng hệ thống sản xuất vẫn cần timeout, logic retry, ngân sách token và kiểm tra năng lực phía nhà cung cấp.
  • Ở mức giá CometAPI nêu, một yêu cầu với 10.000 token đầu vào và 2.000 token đầu ra có chi phí khoảng $0.001568 trên tuyến MiMo-V2.5.

MiMo-V2.5 Model Overview

Xiaomi giới thiệu mô hình vào ngày 22 tháng 4 năm 2026. MiMo-V2.5 API trên CometAPI cung cấp qua giao diện chat-completions tương thích OpenAI, vì vậy các client hiện có thường chỉ cần thay đổi base URL, API key và định danh model để di trú.

Theo thẻ mô hình chính thức, mô hình kết hợp backbone ngôn ngữ MoE thưa với các bộ mã hóa thị giác và âm thanh chuyên dụng. Nó chấp nhận đầu vào văn bản, hình ảnh, video và âm thanh trong khi tạo đầu ra văn bản. Cửa sổ ngữ cảnh lớn hữu ích cho đánh giá mã ở quy mô repository, tập tài liệu, bản ghi dài và agent nhiều bước.

Thông sốGiá trịÝ nghĩa
Kiến trúcHỗn hợp chuyên gia thưa (MoE)Kích hoạt một phần giới hạn của mạng cho mỗi token.
Tổng tham số310BCung cấp năng lực rộng mà không dùng mọi tham số mỗi token.
Tham số kích hoạt15BHỗ trợ suy luận hiệu quả so với tổng kích thước mô hình.
Cửa sổ ngữ cảnh1,000,000 tokenXử lý repository lớn và bộ tài liệu dài.
Đầu ra tối đaTối đa 128K token qua tuyến hiện tạiHỗ trợ báo cáo dài và sinh mã mở rộng.
Đầu vào gốcVăn bản, hình ảnh, video, âm thanhCho phép quy trình đa phương thức hợp nhất.
Phương thức đầu raVăn bảnPhản hồi được trả về dưới dạng văn bản sinh.
Bộ mã hóa thị giácViT 729M tham sốXử lý nội dung trực quan cho tác vụ hình ảnh và video.
Bộ mã hóa âm thanhTransformer 261M tham sốXử lý lời nói và âm thanh khác.
Giấy phépMITCho phép sử dụng thương mại và nghiên cứu rộng theo điều khoản.

Hình benchmark đa phương thức chính thức dưới đây báo cáo kết quả trên các tác vụ hiểu hình ảnh, agent đa phương thức và hiểu video.

Cách sử dụng MiMo-V2.5 API Hướng dẫn đầy đủ dành cho nhà phát triển

So sánh benchmark đa phương thức chính thức của Xiaomi MiMo‑V2.5

Các tuyến của nhà cung cấp có thể lộ ra tập định dạng media hẹp hơn so với khả năng của mô hình nền. Hãy xác thực chính xác định dạng payload hình ảnh, âm thanh và video với endpoint đang hoạt động trước khi phát hành tính năng đa phương thức.

MiMo-V2.5 Benchmark Performance

Xiaomi báo cáo kết quả mạnh ở lập trình, sử dụng terminal và đánh giá agent đa phương thức. Các con số này hữu ích để định vị mô hình, nhưng không thể thay thế cho thử nghiệm trên prompt, công cụ, mục tiêu độ trễ và điều kiện lỗi của riêng bạn.

BenchmarkĐiểm báo cáoTrọng tâm đánh giá
SWE-Bench Pro56.1Kỹ nghệ phần mềm cấp độ repository
Terminal-Bench 2.065.8Tác vụ agent dựa trên terminal
Claw-Eval General62.1 Pass@3Năng lực agent tổng quát
Claw-Eval Multimodal23.8 Pass@3Tác vụ agent đa phương thức
Claw-Eval Multi-Turn63.2 Pass@3Hành vi agent đa lượt
ResearchClawBench16.91Quy trình agent định hướng nghiên cứu

So sánh lập trình chính thức cho thấy 65.8 trên Terminal-Bench 2.0 và 56.1 trên SWE-Bench Pro, đồng thời đặt mô hình trong so sánh agent lập trình rộng hơn.

Cách sử dụng MiMo-V2.5 API Hướng dẫn đầy đủ dành cho nhà phát triển

So sánh benchmark lập trình chính thức của Xiaomi MiMo‑V2.5

Điều kết quả gợi ý: mô hình đặc biệt hấp dẫn cho các ứng dụng kết hợp mã, công cụ và đa phương tiện. Để quyết định sản xuất có tính quyết định, hãy chạy đánh giá nội bộ đo lường mức độ thành công nhiệm vụ, sử dụng token, độ trễ đầu-cuối, tần suất retry và tỷ lệ hiệu chỉnh của con người.

MiMo-V2.5 vs MiMo-V2.5 Pro: A Multi-Dimensional Comparison

Chiều so sánhMiMo-V2.5MiMo-V2.5-Pro
Tổng tham số310B1.02T
Tham số kích hoạt15B42B
Cửa sổ ngữ cảnh1M token1M token
Thế mạnh chínhTác vụ omnimodal và agent tổng quátAgent phức tạp và lập trình đòi hỏi
Giá đầu vào trên 1M token$0.112$0.348
Giá đầu ra trên 1M token$0.224$0.696
Phù hợp nhấtHệ thống đa phương thức, ngữ cảnh lớn, nhạy chi phíSuy luận khó, lập trình và thực thi dài hạn
Đầu vào API chính thứcVăn bản, hình ảnh, video, âm thanhVăn bản
Đầu ra API chính thứcVăn bảnVăn bản

Kết luận so sánh: bắt đầu với tuyến MiMo-V2.5 khi chi phí, thông lượng hoặc độ bao phủ đa phương thức là tiêu chí chính. Chuyển một số yêu cầu sang MiMo-V2.5 Pro khi đánh giá nội bộ cho thấy lợi ích độ chính xác đáng kể trên các trường hợp lập trình, suy luận hoặc sử dụng công cụ khó. Một router phân tầng thường mang lại cân bằng chi phí/chất lượng tốt hơn so với việc gửi mọi yêu cầu đến MiMo-V2.5 Pro.

How to Call the MiMo-V2.5 API

API tuân theo schema chat-completions quen thuộc. Giữ key trên máy chủ, nạp từ biến môi trường và không bao giờ nhúng vào mã trình duyệt hay di động.

Set the API key

export COMETAPI_KEY="your_api_key_here"

$env:COMETAPI_KEY = "your_api_key_here"


### Send a cURL request

curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'


### Use Python with the OpenAI SDK

import os
from openai import OpenAI

client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)

print(response.choices[0].message.content)


> Không ghi log API key, toàn bộ header ủy quyền hoặc nội dung prompt nhạy cảm. Dùng trình quản lý bí mật trong môi trường sản xuất và xoay vòng thông tin xác thực theo lịch.

## How to Stream MiMo-V2.5 API Responses

Streaming giảm độ trễ cảm nhận cho câu trả lời dài. Dịch vụ trả về các sự kiện gia tăng, SDK phơi bày chúng dưới dạng chunk.

stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)

for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)


Trong dịch vụ web, chuyển tiếp delta bằng Server-Sent Events hoặc WebSocket, xử lý client ngắt kết nối và dừng sinh lên luồng khi người dùng hủy.

## MiMo-V2.5 API Multimodal and Structured Workflows

Đối với tác vụ nhận biết hình ảnh, gửi hướng dẫn văn bản cùng đối tượng hình ảnh trong cùng một tin nhắn người dùng. Biểu diễn media được chấp nhận có thể khác nhau theo tuyến nhà cung cấp, vì vậy hãy coi đây là mẫu payload và xác nhận hỗ trợ hiện tại của tuyến.

{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}


Đối với đầu ra có thể đọc máy, yêu cầu một đối tượng JSON gọn và xác thực nó theo schema của bạn. Không bao giờ giả định JSON sinh ra an toàn chỉ vì nó phân tích cú pháp được.

import json

raw = response.choices[0].message.content
result = json.loads(raw)

required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")


## MiMo-V2.5 API Pricing on CometAPI and Cost Control

| Tuyến                           | Đầu vào trên 1M token | Đầu ra trên 1M token | Ví dụ 100 yêu cầu |
| ------------------------------ | --------------------- | -------------------- | ----------------- |
| MiMo-V2.5                      | $0.112                | $0.224               | $0.1568           |
| MiMo-V2.5 Pro                  | $0.348                | $0.696               | $0.4872           |
| Tham chiếu trả theo mức dùng Xiaomi | $0.14              | $0.28                | $0.1960           |

Ví dụ giả định 100 yêu cầu, mỗi yêu cầu có 10.000 token đầu vào và 2.000 token đầu ra. Theo giả định đó, tuyến MiMo-V2.5 rẻ hơn khoảng 68% so với MiMo-V2.5 Pro. Mức giá [trả theo mức dùng do Xiaomi công bố](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode) là điểm tham chiếu hữu ích, trong khi hóa đơn thực tế nên được xác minh theo giá nhà cung cấp đang hoạt động trước khi triển khai.

MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568

Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872


Kiểm soát chi phí bằng giới hạn đầu ra tối đa, nén prompt, cache ngữ cảnh, phân loại yêu cầu và một router chỉ nâng cấp các tác vụ khó. Theo dõi chi phí trên mỗi nhiệm vụ thành công thay vì chi phí mỗi yêu cầu; một yêu cầu rẻ nhưng thất bại lặp lại có thể đắt hơn tổng thể.

## How to Design Long-Context MiMo-V2.5 API Requests

Cửa sổ 1M token làm cho đầu vào lớn hơn trở nên khả thi, nhưng không loại bỏ đánh đổi về truy xuất và attention. Xây prompt để mô hình có thể nhanh chóng xác định bằng chứng liên quan.

* Đặt nhiệm vụ, hợp đồng đầu ra và tiêu chí quyết định gần phần đầu.
* Tách tài liệu bằng định danh ổn định và phân tách rõ ràng.
* Chỉ đưa vào bằng chứng có thể ảnh hưởng câu trả lời.
* Yêu cầu mô hình trích dẫn định danh tài liệu hoặc tham chiếu dòng trong kết quả.
* Đo độ chính xác khi ngữ cảnh tăng; đừng coi ngữ cảnh tối đa là ngữ cảnh lý tưởng.

> Ngữ cảnh dài làm tăng cả chi phí token và khả năng tài liệu không liên quan gây phân tâm cho mô hình. Truy xuất, tóm tắt và nhắc phân cấp vẫn quan trọng ngay cả khi toàn bộ corpus vừa vặn.

## Production Reliability

### Retry only transient failures

Retry giới hạn tốc độ và lỗi máy chủ tạm thời với backoff lũy thừa và jitter. Không tự động retry xác thực không hợp lệ, payload sai định dạng hoặc lỗi chính sách.

import random
import time

def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())

for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))


### Set operational guardrails

* Dùng timeout kết nối và timeout tổng yêu cầu.
* Gắn idempotency key cho các workflow có tác dụng phụ bên ngoài.
* Ghi lại model ID, độ trễ, token vào và ra, số lần retry và trạng thái cuối.
* Ẩn thông tin nhạy cảm và dữ liệu cá nhân trước khi logging.
* Yêu cầu danh sách trắng công cụ và xác nhận cho hành động hủy hoại.
* Duy trì mô hình hoặc hàng đợi dự phòng cho sự cố nhà cung cấp.

## MiMo-V2.5 API Common Errors and Solutions

| Triệu chứng   | Nguyên nhân có thể                         | Hành động khuyến nghị                                      |
| ------------- | ------------------------------------------ | ---------------------------------------------------------- |
| 401 hoặc 403  | API key thiếu, không hợp lệ, hoặc không được ủy quyền | Xác minh bí mật phía máy chủ và quyền dự án.               |
| 400           | Tin nhắn sai định dạng hoặc media không được hỗ trợ | Xác thực JSON và xác nhận hỗ trợ payload theo tuyến.       |
| 413           | Thân yêu cầu quá lớn                       | Giảm kích thước media hoặc chia nhỏ đầu vào.               |
| 429           | Giới hạn tốc độ hoặc hạn ngạch             | Back off với jitter và giới hạn đồng thời phía client.     |
| 5xx           | Lỗi nhà cung cấp tạm thời                  | Retry trong phạm vi ngân sách hoặc chuyển dự phòng.        |
| Phản hồi chậm | Ngữ cảnh lớn, đầu ra dài, hoặc độ trễ công cụ | Stream đầu ra, giới hạn token và đo hiệu năng từng giai đoạn. |
| JSON không hợp lệ | Lệch khi sinh                         | Xác thực, sửa một lần nếu an toàn, và từ chối lỗi dai dẳng.|

## Conclusion

Mô hình MiMo-V2.5 là điểm khởi đầu mạnh mẽ cho các nhóm cần đầu vào đa phương thức, ngữ cảnh lớn và kiểm soát chi phí tích cực. Pro nên là lộ trình nâng cấp có chủ đích cho các tác vụ mà lợi ích chất lượng đo được biện minh cho giá cao hơn. Bắt đầu với bộ đánh giá nhỏ, gắn công cụ đo cho mọi yêu cầu và chỉ thăng cấp tích hợp sau khi thử nghiệm payload thực, hành vi ngữ cảnh dài, xử lý retry và khôi phục sau lỗi.

## FAQ

### What endpoint should I use?

Dùng `/api.cometapi.com/v1/chat/completions`, hoặc đặt `/api.cometapi.com/v1` làm base URL trong SDK tương thích OpenAI.

### What model identifier should I send?

Dùng `mimo-v2.5` cho tuyến MiMo-V2.5. Xác nhận định danh hiện tại trước khi triển khai nếu tài khoản của bạn dùng alias theo nhà cung cấp.

### When should I choose MiMo-V2.5 Pro?

Chọn MiMo-V2.5 Pro khi đánh giá của bạn cho thấy lợi thế đáng kể trên các tác vụ lập trình, suy luận khó hoặc công cụ chạy dài. Giữ lưu lượng thường nhật hoặc đa phương thức trên tuyến MiMo-V2.5 khi chất lượng của nó là đủ.

### Does a 1M-token context mean I should send everything?

Không. Ngữ cảnh lớn là giới hạn năng lực, không phải mục tiêu thiết kế prompt. Truy xuất và tổ chức bằng chứng có thể ảnh hưởng câu trả lời, rồi đo chất lượng và chi phí khi đầu vào tăng.

### Can I call the API directly from a browser?

Đừng phơi bày API key bí mật trong mã frontend. Gọi nhà cung cấp từ backend và áp dụng xác thực, giới hạn tốc độ, logging và kiểm soát dữ liệu tại đó.

### How do I verify multimodal support?

Kiểm thử payload media chính xác với tuyến nhà cung cấp đang hoạt động. Các phương thức gốc của mô hình không đảm bảo mọi tuyến đều lộ ra mọi định dạng theo cùng một cách.
Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Oct 7, 2026
Cập nhật lần cuối Oct 7, 2026
1 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Đọc thêm