TL;DR
MiMo-V2.5 API ใน CometAPI มอบการเข้าถึงโมเดล sparse mixture-of-experts ของ Xiaomi สำหรับงานโค้ด ความเข้าใจมัลติโมดัล และงานเชิงเอเจนต์ เส้นทาง MiMo-V2.5 เป็นค่าดีฟอลต์ที่ใช้งานได้จริงเมื่อโปรเจกต์ต้องการ context window ขนาด 1 ล้านโทเคน อินพุตมัลติโมดัลแบบเนทีฟ และต้นทุนโทเคนต่ำ; ส่วน MiMo-V2.5 Pro เหมาะกว่าเมื่อการโค้ดที่ยาก การให้เหตุผล หรือการใช้เครื่องมือระยะยาวสำคัญกว่าราคา คู่มือนี้แสดงวิธีเรียก API ผ่าน CometAPI การสตรีมผลลัพธ์ โครงสร้างคำขอมัลติโมดัล การประมาณต้นทุน และการทำให้การผสานรวมพร้อมใช้งานจริงมีความทนทาน
ประเด็นสำคัญ
- โมเดล MiMo-V2.5 ใช้พารามิเตอร์รวม 310B โดยมีพารามิเตอร์ที่ทำงานต่อโทเคน 15B และรองรับ context window ขนาด 1M โทเคน
- ใช้เส้นทาง MiMo-V2.5 สำหรับงานมัลติโมดัล การวิเคราะห์คอนเท็กซ์ใหญ่ และเอเจนต์ที่คำนึงถึงต้นทุน; เลือก MiMo-V2.5 Pro สำหรับงานโค้ดและการให้เหตุผลที่ยาก
- เอ็นด์พอยต์ที่เข้ากันได้กับ OpenAI ทำให้การย้ายทำได้ง่าย แต่ระบบโปรดักชันยังต้องมี timeouts ลอจิกรีทราย งบโทเคน และการตรวจสอบความสามารถฝั่งผู้ให้บริการ
- ที่อัตราของ CometAPI ที่ระบุไว้ คำขอที่มีโทเคนอินพุต 10,000 และโทเคนเอาต์พุต 2,000 มีค่าใช้จ่ายประมาณ $0.001568 บนเส้นทาง MiMo-V2.5
ภาพรวมโมเดล MiMo-V2.5
Xiaomi เปิดตัวโมเดลนี้ เมื่อวันที่ 22 เมษายน 2026 MiMo-V2.5 API ใน CometAPI เปิดเผยผ่านอินเทอร์เฟซ chat-completions ที่เข้ากันได้กับ OpenAI ดังนั้นไคลเอนต์ที่มีอยู่ส่วนใหญ่สามารถย้ายได้โดยการเปลี่ยน base URL คีย์ API และตัวระบุโมเดล
ตาม model card อย่างเป็นทางการ โมเดลนี้ผสมผสานแกนภาษาที่เป็น MoE แบบ sparse เข้ากับตัวเข้ารหัสภาพและเสียงเฉพาะทาง รับอินพุตข้อความ ภาพ วิดีโอ และเสียง ขณะเดียวกันให้เอาต์พุตเป็นข้อความ Context window ขนาดใหญ่มีประโยชน์สำหรับรีวิวโค้ดระดับรีโป ชุดเอกสาร ทรานสคริปต์ยาว และเอเจนต์แบบหลายขั้นตอน
| Specification | Value | Why it matters |
|---|---|---|
| Architecture | Sparse mixture of experts | เปิดใช้งานเฉพาะบางส่วนของเครือข่ายสำหรับแต่ละโทเคน |
| Total parameters | 310B | ให้ขีดความสามารถกว้าง โดยไม่ต้องใช้ทุกพารามิเตอร์ต่อโทเคน |
| Active parameters | 15B | สนับสนุนการอนุมานที่มีประสิทธิภาพเมื่อเทียบกับขนาดโมเดลทั้งหมด |
| Context window | 1,000,000 tokens | รองรับรีโปขนาดใหญ่และชุดเอกสารยาว |
| Maximum output | Up to 128K tokens through the current route | รองรับรายงานยาวและการสร้างโค้ดแบบขยาย |
| Native inputs | Text, image, video, audio | เปิดทางให้เวิร์กโฟลว์มัลติโมดัลแบบรวม |
| Output modality | Text | ส่งคืนการตอบเป็นข้อความที่สร้าง |
| Vision encoder | 729M-parameter ViT | ประมวลผลเนื้อหาภาพสำหรับงานภาพและวิดีโอ |
| Audio encoder | 261M-parameter Transformer | ประมวลผลคำพูดและเสียงประเภทอื่น |
| License | MIT | อนุญาตให้ใช้เชิงพาณิชย์และวิจัยอย่างกว้างตามเงื่อนไขสัญญา |
ภาพผลเกณฑ์มาตรฐานมัลติโมดัลอย่างเป็นทางการด้านล่างรายงานผลในด้านความเข้าใจภาพ เอเจนต์มัลติโมดัล และความเข้าใจวิดีโอ

การเปรียบเทียบเกณฑ์มาตรฐานมัลติโมดัล Xiaomi MiMo-V2.5 อย่างเป็นทางการ
เส้นทางผู้ให้บริการอาจเปิดเผยรูปแบบมีเดียแคบกว่าที่โมเดลรองรับ ตรวจสอบรูปแบบเพย์โหลดของภาพ เสียง และวิดีโอที่แน่นอนกับเอ็นด์พอยต์ที่ใช้งานอยู่ก่อนปล่อยฟีเจอร์มัลติโมดัล
ประสิทธิภาพตามเกณฑ์ทดสอบของ MiMo-V2.5
Xiaomi รายงานผลงานที่แข็งแกร่งในการโค้ด การใช้งานเทอร์มินัล และการประเมินเอเจนต์มัลติโมดัล ตัวเลขเหล่านี้มีประโยชน์สำหรับการวางตำแหน่งโมเดล แต่ไม่สามารถแทนที่การทดสอบกับพรอมป์ต์ เครื่องมือ เป้าหมายเวลาแฝง และเงื่อนไขความล้มเหลวของคุณเองได้
| Benchmark | Reported score | Evaluation focus |
|---|---|---|
| SWE-Bench Pro | 56.1 | วิศวกรรมซอฟต์แวร์ระดับรีโป |
| Terminal-Bench 2.0 | 65.8 | งานเอเจนต์ที่ใช้เทอร์มินัล |
| Claw-Eval General | 62.1 Pass@3 | ความสามารถเอเจนต์ทั่วไป |
| Claw-Eval Multimodal | 23.8 Pass@3 | งานเอเจนต์แบบมัลติโมดัล |
| Claw-Eval Multi-Turn | 63.2 Pass@3 | พฤติกรรมเอเจนต์แบบหลายเทิร์น |
| ResearchClawBench | 16.91 | เวิร์กโฟลว์เอเจนต์เชิงวิจัย |
การเปรียบเทียบการโค้ดอย่างเป็นทางการแสดง 65.8 บน Terminal-Bench 2.0 และ 56.1 บน SWE-Bench Pro พร้อมทั้งวางโมเดลไว้ในภาพรวมการเปรียบเทียบเอเจนต์โค้ดที่กว้างขึ้น

การเปรียบเทียบเกณฑ์มาตรฐานการโค้ด Xiaomi MiMo-V2.5 อย่างเป็นทางการ
สิ่งที่ผลลัพธ์บ่งชี้: โมเดลนี้น่าดึงดูดเป็นพิเศษสำหรับแอปพลิเคชันที่ผสมผสานโค้ด เครื่องมือ และสื่อผสม สำหรับการตัดสินใจแบบกำหนดผลลัพธ์ได้ในโปรดักชัน ให้รันการประเมินภายในที่วัดความสำเร็จของงาน การใช้โทเคน เวลาแฝง end-to-end ความถี่การรีทราย และอัตราการแก้ไขโดยมนุษย์
MiMo-V2.5 เทียบกับ MiMo-V2.5 Pro: การเปรียบเทียบหลายมิติ
| Dimension | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Total parameters | 310B | 1.02T |
| Active parameters | 15B | 42B |
| Context window | 1M tokens | 1M tokens |
| Primary strength | งานเอเจนต์แบบ omnimodal และทั่วไป | เอเจนต์ที่ซับซ้อนและการโค้ดที่ต้องการสูง |
| Input price per 1M tokens | $0.112 | $0.348 |
| Output price per 1M tokens | $0.224 | $0.696 |
| Best fit | ระบบมัลติโมดัล คอนเท็กซ์ใหญ่ และคุมต้นทุน | การให้เหตุผลยาก การโค้ด และการดำเนินการระยะยาว |
| Official API input modalities | Text, image, video, audio | Text |
| Official API output modality | Text | Text |
ผลการเปรียบเทียบ: เริ่มด้วยเส้นทาง MiMo-V2.5 เมื่อปัจจัยการตัดสินใจคือราคา ปริมาณงาน หรือความครอบคลุมมัลติโมดัล ย้ายคำขอที่เลือกไปยัง MiMo-V2.5 Pro เมื่อการประเมินภายในแสดงการเพิ่มความแม่นยำอย่างมีนัยสำคัญในกรณีการโค้ด การให้เหตุผล หรือการใช้เครื่องมือที่ยาก รูตแบบแบ่งชั้นมักให้สมดุลต้นทุน-คุณภาพที่ดีกว่าส่งทุกคำขอไปยัง MiMo-V2.5 Pro
วิธีเรียกใช้ MiMo-V2.5 API
API ใช้สคีมาที่คุ้นเคยของ chat-completions schema เก็บคีย์ไว้บนเซิร์ฟเวอร์ โหลดจากตัวแปรสภาพแวดล้อม และอย่าใส่คีย์ในโค้ดเบราว์เซอร์หรือมือถือ
ตั้งค่า API key
export COMETAPI_KEY="your_api_key_here"
$env:COMETAPI_KEY = "your_api_key_here"
### ส่งคำขอ cURL
curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'
### ใช้ Python กับ OpenAI SDK
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)
print(response.choices[0].message.content)
> อย่าบันทึกคีย์ API ส่วนหัวการยืนยันตัวตนแบบเต็ม หรือเนื้อหาพรอมป์ต์ที่อ่อนไหว ใช้ตัวจัดการความลับในโปรดักชันและหมุนเวียนข้อมูลยืนยันตามกำหนด
## วิธีสตรีมผลลัพธ์ MiMo-V2.5 API
การสตรีมช่วยลดเวลาแฝงที่รับรู้สำหรับคำตอบยาว บริการจะส่งอีเวนต์แบบเพิ่มพูน ซึ่ง SDK จะเปิดเผยเป็นชิ้นข้อมูล
stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
ภายในเว็บเซอร์วิส ให้ส่งต่อ delta ผ่าน Server-Sent Events หรือ WebSocket จัดการกรณีลูกค้าตัดการเชื่อมต่อ และหยุดการสร้างฝั่งต้นน้ำเมื่อผู้ใช้ยกเลิก
## เวิร์กโฟลว์แบบมัลติโมดัลและแบบมีโครงสร้างของ MiMo-V2.5 API
สำหรับงานที่ต้องเข้าใจภาพ ให้ส่งคำสั่งข้อความพร้อมออบเจ็กต์ภาพในข้อความของผู้ใช้เดียวกัน รูปแบบมีเดียที่ยอมรับได้จริงอาจแตกต่างตามเส้นทางผู้ให้บริการ ดังนั้นให้ถือว่านี่เป็นรูปแบบเพย์โหลดและยืนยันการรองรับของเส้นทางปัจจุบัน
{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}
สำหรับเอาต์พุตที่เครื่องอ่านได้ ให้ขอออบเจ็กต์ JSON ที่กะทัดรัดและตรวจสอบความถูกต้องกับสคีมาของคุณเอง อย่าสมมติว่า JSON ที่สร้างปลอดภัยเพียงเพราะสามารถพาร์สได้
import json
raw = response.choices[0].message.content
result = json.loads(raw)
required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")
## ราคา MiMo-V2.5 API บน CometAPI และการควบคุมต้นทุน
| Route | Input per 1M tokens | Output per 1M tokens | 100-request example |
| ------------------------------ | ------------------- | -------------------- | ------------------- |
| MiMo-V2.5 | $0.112 | $0.224 | $0.1568 |
| MiMo-V2.5 Pro | $0.348 | $0.696 | $0.4872 |
| Xiaomi pay-as-you-go reference | $0.14 | $0.28 | $0.1960 |
ตัวอย่างสมมติ 100 คำขอ โดยแต่ละคำขอมีโทเคนอินพุต 10,000 และโทเคนเอาต์พุต 2,000 ภายใต้สมมติฐานดังกล่าว เส้นทาง MiMo-V2.5 มีราคาถูกกว่า MiMo-V2.5 Pro ประมาณ 68% อัตราแบบจ่ายตามการใช้งานที่ [Xiaomi เผยแพร่](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode) เป็นจุดอ้างอิงที่มีประโยชน์ ขณะที่บิลจริงควรยืนยันกับราคาผู้ให้บริการที่ใช้งานก่อนดีพลอย
MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568
Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872
ควบคุมต้นทุนด้วยการจำกัดเอาต์พุตสูงสุด การบีบอัดพรอมป์ต์ การแคชคอนเท็กซ์ การจัดประเภทคำขอ และรูตเตอร์ที่ยกระดับเฉพาะงานที่ยาก ติดตามต้นทุนต่อ “งานที่สำเร็จ” แทนต้นทุนต่อคำขอ; คำขอที่ราคาถูกแต่ล้มเหลวบ่อยอาจแพงกว่าโดยรวม
## วิธีออกแบบคำขอ MiMo-V2.5 API แบบคอนเท็กซ์ยาว
Context window 1M โทเคนทำให้ใส่อินพุตใหญ่ขึ้นได้ แต่ไม่ลบการแลกเปลี่ยนระหว่างการดึงข้อมูลและความสนใจ ออกแบบพรอมป์ต์เพื่อให้โมเดลค้นหาหลักฐานที่เกี่ยวข้องได้รวดเร็ว
* วางงาน ข้อกำหนดเอาต์พุต และเกณฑ์การตัดสินใจไว้ช่วงต้น
* แยกเอกสารด้วยตัวระบุที่เสถียรและตัวคั่นที่ชัดเจน
* ใส่เฉพาะหลักฐานที่มีผลต่อคำตอบ
* ขอให้โมเดลอ้างอิงตัวระบุเอกสารหรือบรรทัดในผลลัพธ์
* วัดความแม่นยำเมื่อคอนเท็กซ์เติบโต; อย่าถือว่าคอนเท็กซ์สูงสุดคือคอนเท็กซ์ที่เหมาะสม
> คอนเท็กซ์ยาวเพิ่มทั้งต้นทุนโทเคนและโอกาสที่วัสดุที่ไม่เกี่ยวข้องจะรบกวนโมเดล การดึงข้อมูล สรุป และพรอมป์ต์แบบลำดับขั้นยังคงสำคัญแม้เมื่อคลังข้อมูลทั้งหมดพอจะใส่ได้
## ความเชื่อถือได้ในโปรดักชัน
### รีทรายเฉพาะความล้มเหลวชั่วคราว
รีทราย rate limit และความล้มเหลวของเซิร์ฟเวอร์ชั่วคราวด้วย exponential backoff และ jitter อย่ารีทรายอัตโนมัติสำหรับการยืนยันตัวตนไม่ถูกต้อง เพย์โหลดไม่ถูกรูป หรือข้อผิดพลาดด้านนโยบาย
import random
import time
def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())
for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))
### ตั้งค่ารั้วป้องกันเชิงปฏิบัติการ
* ใช้ timeouts ทั้งระดับการเชื่อมต่อและระดับคำขอโดยรวม
* แนบ idempotency key กับเวิร์กโฟลว์ที่มีผลข้างเคียงภายนอก
* บันทึก model ID เวลาแฝง โทเคนอินพุตและเอาต์พุต จำนวนรีทราย และสถานะสุดท้าย
* ปิดบังความลับและข้อมูลส่วนบุคคลก่อนทำล็อก
* บังคับรายการอนุญาตเครื่องมือและการยืนยันสำหรับการกระทำที่ทำลายล้าง
* รักษาโมเดลสำรองหรือคิวสำหรับเหตุขัดข้องของผู้ให้บริการ
## ข้อผิดพลาดที่พบบ่อยของ MiMo-V2.5 API และแนวทางแก้ไข
| อาการ | สาเหตุที่น่าจะเป็น | การดำเนินการที่แนะนำ |
| ------------- | ------------------------------------------- | ---------------------------------------------------------- |
| 401 หรือ 403 | คีย์ API ขาด ไม่ถูกต้อง หรือไม่ได้รับอนุญาต | ตรวจสอบความลับฝั่งเซิร์ฟเวอร์และสิทธิ์ของโปรเจกต์ |
| 400 | ข้อความไม่ถูกรูปหรือออบเจ็กต์มีเดียไม่รองรับ | ตรวจสอบ JSON และยืนยันการรองรับเพย์โหลดของเส้นทาง |
| 413 | เนื้อคำขอใหญ่เกินไป | ลดขนาดมีเดียหรือแยกอินพุต |
| 429 | จำกัดอัตราหรือโควตา | back off พร้อม jitter และจำกัด concurrency ฝั่งไคลเอนต์ |
| 5xx | ความล้มเหลวของผู้ให้บริการชั่วคราว | รีทรายภายในงบประมาณที่กำหนดหรือสลับไปยังสำรอง |
| ช้าผิดปกติ | คอนเท็กซ์ใหญ่ เอาต์พุตยาว หรือเครื่องมือช้า | สตรีมเอาต์พุต จำกัดโทเคน และโปรไฟล์ทุกขั้นตอน |
| JSON ไม่ถูกต้อง | การสร้างค่าผันผวน | ตรวจสอบความถูกต้อง ซ่อมครั้งเดียวถ้าปลอดภัย และปฏิเสธกรณีล้มเหลวซ้ำ |
## บทสรุป
โมเดล MiMo-V2.5 เป็นจุดเริ่มต้นที่แข็งแกร่งสำหรับทีมที่ต้องอินพุตแบบมัลติโมดัล คอนเท็กซ์ใหญ่ และคุมต้นทุนอย่างดุดัน Pro ควรเป็นเส้นทางการยกระดับอย่างมีเจตนาสำหรับงานที่การเพิ่มคุณภาพที่วัดได้ชอบธรรมกับราคาที่สูงขึ้น เริ่มด้วยชุดประเมินเล็ก ติดเครื่องมือทุกคำขอ และโปรโมตการผสานรวมหลังจากทดสอบเพย์โหลดจริง พฤติกรรมคอนเท็กซ์ยาว การจัดการรีทราย และการกู้คืนความล้มเหลว
## คำถามที่พบบ่อย
### ควรใช้อะไรเป็นเอ็นด์พอยต์?
ใช้ `/api.cometapi.com/v1/chat/completions` หรือกำหนด `/api.cometapi.com/v1` เป็น base URL ใน SDK ที่เข้ากันได้กับ OpenAI
### ควรส่งตัวระบุโมเดลใด?
ใช้ `mimo-v2.5` สำหรับเส้นทาง MiMo-V2.5 ยืนยันตัวระบุก่อนเปิดใช้งานหากบัญชีของคุณใช้ alias เฉพาะผู้ให้บริการ
### เมื่อใดควรเลือก MiMo-V2.5 Pro?
เลือก MiMo-V2.5 Pro เมื่อการประเมินของคุณแสดงข้อได้เปรียบที่มีนัยสำคัญในงานโค้ด การให้เหตุผล หรือการใช้เครื่องมือที่ยาวนาน เก็บทราฟฟิกทั่วไปหรือมัลติโมดัลไว้บนเส้นทาง MiMo-V2.5 เมื่อคุณภาพเพียงพอ
### Context 1M โทเคนหมายความว่าควรส่งทุกอย่างหรือไม่?
ไม่ Context ขนาดใหญ่เป็นขีดความสามารถ ไม่ใช่เป้าหมายการออกแบบพรอมป์ต์ ดึงและจัดหลักฐานที่มีผลต่อคำตอบ จากนั้นวัดคุณภาพและต้นทุนเมื่ออินพุตเติบโต
### สามารถเรียก API โดยตรงจากเบราว์เซอร์ได้หรือไม่?
อย่าเปิดเผยคีย์ API ลับในโค้ดฝั่งหน้า เรียกผู้ให้บริการจากแบ็กเอนด์ของคุณ และบังคับใช้การยืนยันตัวตน การจำกัดอัตรา การทำล็อก และการควบคุมข้อมูลที่นั่น
### จะยืนยันการรองรับมัลติโมดัลได้อย่างไร?
ทดสอบเพย์โหลดมีเดียที่แน่นอนกับเส้นทางผู้ให้บริการที่ใช้งานอยู่ ความสามารถมัลติโมดัลแบบเนทีฟของโมเดลไม่ได้การันตีว่าเส้นทางทุกตัวจะเปิดเผยทุกรูปแบบในลักษณะเดียวกัน
