ข้อมูลจำเพาะทางเทคนิคของ MiMo-V2.5
| ข้อมูลจำเพาะ | MiMo-V2.5 |
|---|---|
| Model ID | mimo-v2.5 |
| ผู้ให้บริการ | Xiaomi MiMo |
| ประเภทโมเดล | Native omni-modal foundation model |
| สถาปัตยกรรม | Sparse Mixture-of-Experts |
| จำนวนพารามิเตอร์ทั้งหมด | 310B |
| พารามิเตอร์ที่ถูกกระตุ้น | 15B |
| หน้าต่างบริบท | 1M tokens |
| เอาต์พุตสูงสุด | 128K tokens |
| โมดาลิตีอินพุต | Text, Image, Video, Audio |
| เอาต์พุต | Text |
| Vision encoder | 729M-parameter ViT |
| Audio encoder | 261M-parameter Audio Transformer |
| การเรียกใช้เครื่องมือ, การค้นเว็บ, เอาต์พุตแบบมีโครงสร้าง, สตรีมมิง, แคชบริบท | Yes |
| ไลเซนส์ | MIT |
สถาปัตยกรรม 310B/15B มีความสำคัญอย่างยิ่ง โดยเฉพาะอย่างยิ่ง MiMo-V2.5 ไม่ใช่โมเดล 15B ในความหมายทั่วไป; 15B คือจำนวนพารามิเตอร์ที่ถูกกระตุ้นต่อโทเค็น ขณะที่ MoE เต็มรูปแบบมี 310B พารามิเตอร์ โมเดลใช้ routed experts จำนวน 256 ตัว และกระตุ้นผู้เชี่ยวชาญแปดตัวต่อโทเค็น
MiMo-V2.5 คืออะไร?
MiMo-V2.5 คือโมเดลมัลติโมดัลรุ่นถัดไปของ Xiaomi ที่สร้างขึ้นโดยมุ่งเน้นไปที่ การรับรู้แบบ omni-modal และแอปพลิเคชันเชิงเอเจนต์
แตกต่างจาก LLM แบบข้อความล้วนทั่วไป MiMo-V2.5 เข้าใจ รูปภาพ วิดีโอ เสียง และข้อความ ได้โดยกำเนิด Xiaomi จัดวางตำแหน่งไว้สำหรับบริบทยาวและสถานการณ์เอเจนต์มัลติโมดัลที่โมเดลต้องรับรู้ข้อมูล ให้เหตุผล และจากนั้นใช้เครื่องมือหรือดำเนินการ
ยังมีข้อพิจารณาสำคัญสำหรับนักพัฒนาสำหรับเวอร์ชันปัจจุบัน: Xiaomi เลิกใช้งานโมเดล MiMo-V2 รุ่นเก่าเมื่อวันที่ 30 มิถุนายน 2026 และแนะนำให้ย้ายไปยังซีรีส์ V2.5
ดังนั้น mimo-v2.5 จึงเป็น Model ID ที่เกี่ยวข้องสำหรับการผสานรวมใหม่ แทน mimo-v2-pro, mimo-v2-omni หรือ mimo-v2-flash รุ่นเก่า
คุณสมบัติหลักของ MiMo-V2.5 มีอะไรบ้าง?
ความเข้าใจแบบ Omni-Modal โดยกำเนิด
คุณลักษณะนิยามของ MiMo-V2.5 คือการผสานมัลติโมดัลเข้าในโมเดลโดยตรง
โมเดลรับอินพุตได้จาก:
- Text
- Images
- Video
- Audio
สิ่งนี้ทำให้นักพัฒนาสร้างแอปที่ให้เหตุผลข้ามหลายประเภทข้อมูลได้ แทนการประมวลผลแต่ละโมดาลิตีแยกกันแล้วส่งผลลัพธ์ให้ LLM ข้อความ Xiaomi เรียกสิ่งนี้ว่า การรับรู้แบบเต็มโมดาลโดยกำเนิด
ตัวอย่างเชิงปฏิบัติ คือเอเจนต์วิเคราะห์วิดีโอที่รับวิดีโอยาวพร้อมแทร็กเสียงและคำถามเชิงข้อความ จากนั้นระบุเหตุการณ์ อธิบายสิ่งที่เกิดขึ้น และผลิตคำตอบแบบมีโครงสร้าง
หน้าต่างบริบท 1M-Token
MiMo-V2.5 รองรับบริบท 1 million tokens และเอาต์พุตได้สูงสุด 128K tokens
สิ่งนี้ทำให้โมเดลน่าสนใจเป็นพิเศษสำหรับ:
- การวิเคราะห์เอกสารขนาดใหญ่
- ความเข้าใจวิดีโอยาว
- การโค้ดระดับรีโพสิทอรี
- เซสชันวิจัยระยะยาว
- เอเจนต์หลายขั้นตอน
- บทสนทนาต่อเนื่องยาว
- ฐานความรู้ระดับองค์กรขนาดใหญ่
ค่าบริบท 1M ไม่ใช่แค่ตัวเลขทางการตลาด Xiaomi ระบุชัดว่าการติดตามวิดีโอยาว การวิเคราะห์เอกสารยาว และการให้เหตุผลตามลำดับเวลาที่ยาวนานเป็นงานเป้าหมาย
การใช้เครื่องมือแบบเอเจนต์
MiMo-V2.5 รองรับ function calling, web search, structured output และ streaming
ทำให้มีประโยชน์อย่างยิ่งสำหรับแอปเอเจนต์เมื่อเทียบกับโมเดลที่จำกัดเฉพาะการสร้างข้อความ
เวิร์กโฟลว์ทั่วไปอาจเป็น:
Perceive → Reason → Search → Call Tool → Analyze Result → Continue
สิ่งนี้มีประโยชน์อย่างยิ่งสำหรับเอเจนต์วิจัย ผู้ช่วยโค้ด เอเจนต์สนับสนุนลูกค้า และระบบอัตโนมัติแบบมัลติโมดัล
ประสิทธิภาพของ Sparse MoE
MiMo-V2.5 ใช้สถาปัตยกรรม Sparse MoE ขนาด 310B พารามิเตอร์ โดยกระตุ้นเพียง 15B พารามิเตอร์ต่อโทเค็น
แบ็กโบนมี 48 ชั้น รวมถึงชั้น sliding-window-attention 39 ชั้น และชั้น full-attention เก้าชั้น ดีไซน์แบบไฮบริดนี้มีจุดมุ่งหมายเพื่อทำให้บริบทยาวมากๆ จัดการเชิงคำนวณได้มากขึ้น
ข้อแตกต่างสำคัญสำหรับนักพัฒนาคือ จำนวนพารามิเตอร์ที่ถูกกระตุ้นไม่ควรถูกตีความว่าเท่ากับความต้องการหน่วยความจำทั้งหมด การโฮสต์โมเดล 310B ด้วยตนเองยังคงเป็นภาระโครงสร้างพื้นฐานที่ใหญ่
Hybrid Sliding-Window Attention
MiMo-V2.5 ผสาน sliding-window attention เข้ากับ global attention
สถาปัตยกรรมใช้หน้าต่าง SWA ขนาด 128 โทเค็น พร้อมชั้น SWA 39 ชั้น และชั้น full-attention เก้าชั้น
ทางเลือกสถาปัตยกรรมนี้เกี่ยวข้องโดยตรงกับความสามารถบริบท 1M โทเค็นของโมเดล เพราะการคง full attention ทุกชั้นจะทำให้การอนุมานบริบทยาวมีต้นทุนสูงอย่างมาก
Multi-Token Prediction
MiMo-V2.5 มี ชั้น MTP สามชั้น ด้วยพารามิเตอร์ประมาณ 329M การออกแบบ MTP มีจุดประสงค์เพื่อเพิ่มประสิทธิภาพการอนุมานผ่าน speculative decoding และสนับสนุนการฝึก RL ที่มีประสิทธิภาพยิ่งขึ้น
ประสิทธิภาพของ MiMo-V2.5 บน Benchmarks เป็นอย่างไร?
MiMo-V2.5 เผยแพร่ผลเบนช์มาร์กครอบคลุมการโค้ด เอเจนต์เทอร์มินัล เอเจนต์วิจัย และงานเอเจนต์มัลติโมดัล ขณะนี้การ์ดโมเดลบน Hugging Face รายงานผลดังต่อไปนี้:
| เบนช์มาร์ก | MiMo-V2.5 | โฟกัสการประเมิน |
|---|---|---|
| SWE-Bench Pro | 56.1 | วิศวกรรมซอฟต์แวร์ |
| Terminal-Bench 2.0 | 65.8 | งานเทอร์มินัล/เอเจนต์ |
| Claw-Eval General | 62.1 Pass³% | ความสามารถเอเจนต์ทั่วไป |
| Claw-Eval Multimodal | 23.8 Pass³% | ความสามารถเอเจนต์มัลติโมดัล |
| Claw-Eval Multi-Turn | 63.2 Pass³% | เอเจนต์หลายรอบสนทนา |
| ResearchClawBench | 16.91 | งานเอเจนต์ด้านการวิจัย |
ตัวเลขเหล่านี้ต้องตีความอย่างระมัดระวัง
ผล 56.1 บน SWE-Bench Pro บ่งชี้ความสามารถด้านวิศวกรรมซอฟต์แวร์ที่มีนัยสำคัญ ขณะที่ผล 65.8 บน Terminal-Bench 2.0 เกี่ยวข้องอย่างยิ่งสำหรับเอเจนต์ที่โต้ตอบกับเทอร์มินัลและสภาพแวดล้อมพัฒนา
ในขณะเดียวกัน ความแตกต่างระหว่างคะแนน Claw-Eval ทั่วไป (62.1) และคะแนนมัลติโมดัล (23.8) เป็นสัญญาณเตือนที่มีประโยชน์ว่า: ประสิทธิภาพเอเจนต์โดยรวมที่แข็งแกร่งไม่ได้หมายความว่าทำงานได้แข็งแกร่งเท่าๆ กันในทุกงานเอเจนต์มัลติโมดัล
สำหรับการประเมินการใช้งานจริง นักพัฒนาควรทดสอบเวิร์กโหลดของตนเองแทนการพึ่งเพียงตัวเลขบนกระดานจัดอันดับเดียว
MiMo-V2.5 เทียบกับ MiMo-V2.5-Pro อย่างไร?
MiMo-V2.5 และ MiMo-V2.5-Pro อยู่ในเจเนอเรชัน V2.5 เดียวกันแต่มีเป้าหมายการปรับให้เหมาะต่างกัน
| ข้อมูลจำเพาะ | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| พารามิเตอร์รวม | 310B | 1.02T |
| พารามิเตอร์ที่กระตุ้น | 15B | 42B |
| บริบท | 1M | 1M |
| อินพุตมัลติโมดัล | Text/Image/Video/Audio | Agent-focused |
| การวางตำแหน่งหลัก | เอเจนต์แบบ omni-modal | เอเจนต์ซับซ้อน & โค้ด |
| Routed experts | 256 | 384 |
| ผู้เชี่ยวชาญ/โทเค็น | 8 | 8 |
| ชั้น LLM | 48 | 70 |
| ชั้น MTP | 3 | 3 |
ความแตกต่างนั้นตรงไปตรงมา:
เลือก MiMo-V2.5 สำหรับความเข้าใจมัลติโมดัลโดยกำเนิดและเอเจนต์อเนกประสงค์ที่มีประสิทธิภาพ เลือก MiMo-V2.5-Pro สำหรับการให้เหตุผลที่ยากที่สุด การโค้ด และเอเจนต์ระยะยาว
คู่มือคัดเลือกโมเดลของ Xiaomi แนะนำ mimo-v2.5 โดยเฉพาะสำหรับความเข้าใจเนื้อหารูปภาพ เสียง และวิดีโอ ขณะที่แนะนำ mimo-v2.5-pro สำหรับการให้เหตุผลที่ซับซ้อนและการประมวลผลเอกสารยาว
กรณีใช้งานของ MiMo-V2.5
เอเจนต์ AI แบบมัลติโมดัล
MiMo-V2.5 สามารถทำหน้าที่เป็นโมเดลหลักสำหรับเอเจนต์ที่ต้องตรวจสอบเอกสาร รูปภาพ วิดีโอ และเสียงก่อนตัดสินใจดำเนินการ
การวิเคราะห์เอกสารบริบทยาว
บริบท 1M โทเค็นทำให้เหมาะสำหรับการวิเคราะห์:
- คอลเลกชันเอกสารกฎหมายขนาดใหญ่
- เอกสารทางเทคนิค
- แฟ้มวิจัย
- โค้ดเบสขนาดใหญ่
- ฐานความรู้ระดับองค์กร
เอเจนต์ช่วยโค้ด
ผลเบนช์มาร์กด้านเอเจนต์ของโมเดลและความสามารถการใช้เครื่องมือทำให้เหมาะกับผู้ช่วยโค้ดที่ต้องตรวจรีโพสิทอรี ให้เหตุผลเกี่ยวกับบั๊ก เรียกใช้เครื่องมือ และวนแก้ปัญหา
ความเข้าใจวิดีโอ
แทนการถือว่าการสร้างวิดีโอเป็นวัตถุประสงค์หลัก MiMo-V2.5 ใช้วิดีโอเป็น โมดาลิตีอินพุต เพื่อความเข้าใจ
การประยุกต์ที่เป็นไปได้รวมถึง:
- สรุปวิดีโอ
- ตอบคำถามจากวิดีโอยาว
- ค้นหาวิดีโอ
- ตรวจจับเหตุการณ์
- วิเคราะห์วิดีโอการศึกษา
- วิเคราะห์ภาพจากกล้องวงจรปิด
ผู้ช่วยเชิงภาพและเสียง
เนื่องจากโมเดลรับทั้งข้อมูลเสียงและภาพ นักพัฒนาจึงสามารถสร้างผู้ช่วยที่ตีความคำสั่งเสียงร่วมกับบริบทภาพได้
เอเจนต์อัตโนมัติที่ทำงานยาวนาน
การผสมผสานบริบทยาวกับการเทรนแบบเอเจนต์ทำให้ MiMo-V2.5 เหมาะสำหรับเวิร์กโฟลว์ที่โมเดลต้องรักษาสถานะผ่านหลายขั้นตอนกลาง แทนการจบงานในคำตอบเดียว
ข้อจำกัดของ MiMo-V2.5
แม้ MiMo-V2.5 จะมีสเปกน่าประทับใจ แต่ก็มีข้อจำกัดเชิงปฏิบัติที่ควรใส่ใจ
ประการแรก บริบท 1M ไม่ได้หมายความว่าแอปทุกประเภทจะได้ประสิทธิภาพที่เหมาะที่สุดที่หน้าต่างสูงสุด การอนุมานบริบทยาวยังคงเกี่ยวข้องกับข้อจำกัดด้านหน่วยความจำ แบนด์วิดท์ และเวลาแฝง
ประการที่สอง โมเดลนี้เป็นระบบ MoE ขนาดใหญ่มาก แม้จะกระตุ้นเพียง 15B พารามิเตอร์ต่อโทเค็น แต่โมเดลเต็มมีประมาณ 310B พารามิเตอร์ ทำให้การโฮสต์เองต้องการโครงสร้างพื้นฐานมากกว่าการรันโมเดล dense ขนาดเล็ก
ประการที่สาม ประสิทธิภาพเบนช์มาร์กแบบมัลติโมดัลอาจแตกต่างกันมากตามงาน ผล Claw-Eval แสดงคะแนนมัลติโมดัลที่ต่ำกว่าคะแนนทั่วไปมาก ตอกย้ำความจำเป็นในการทดสอบเฉพาะแอปพลิเคชัน
สุดท้าย ระบบนิเวศของโมเดลยังใหม่กว่าเมื่อเทียบกับ GPT, Claude และ Gemini นักพัฒนาควรประเมินเครื่องมือ ความเข้ากันได้กับผู้ให้บริการ พฤติกรรมเอาต์พุตแบบมีโครงสร้าง และความน่าเชื่อถือของการเรียกใช้เครื่องมือก่อนใช้ในระบบสำคัญระดับโปรดักชัน
วิธีใช้ MiMo-V2.5 API บน CometAPI
MiMo-V2.5 เหมาะอย่างยิ่งสำหรับแพลตฟอร์มรวม API เพราะปฏิบัติตามรูปแบบ API ที่เข้ากันได้กับระบบนิเวศ LLM ที่เป็นที่ยอมรับ Xiaomi เองมีการเข้าถึง API ที่เข้ากันได้กับ OpenAI และ Anthropic
ด้วย CometAPI การผสานรวมสามารถทำตามเวิร์กโฟลว์พื้นฐานเดียวกับโมเดลอื่นๆ ที่รองรับ
ขั้นตอนที่ 1: ขอรับคีย์ API ของ CometAPI
สร้างหรือลงชื่อเข้าใช้บัญชี CometAPI ของคุณและรับคีย์ API
import os
COMETAPI_KEY = os.environ["COMETAPI_KEY"]
ขั้นตอนที่ 2: ตั้งค่าโมเดล MiMo-V2.5
ตั้งค่าโมเดลเป็น:
mimo-v2.5
และใช้ API endpoint ที่เข้ากันได้ของ CometAPI
ควรตรวจสอบ endpoint และสคีมาคำขอเทียบกับเอกสาร CometAPI ปัจจุบันก่อนดีพลอย
ขั้นตอนที่ 3: สร้างเวิร์กโฟลว์แบบมัลติโมดัลและเอเจนต์
การใช้งาน mimo-v2.5 ที่น่าสนใจกว่าไม่ใช่เพียงแชตข้อความ นักพัฒนาสามารถผสานการให้เหตุผลแบบมัลติโมดัลเข้ากับเครื่องมือภายนอกเพื่อสร้างเวิร์กโฟลว์เช่น:
User input → image/video/audio understanding → reasoning → tool call → result analysis → next action
สิ่งนี้ทำให้โมเดลน่าดึงดูดเป็นพิเศษสำหรับเอเจนต์วิจัยอัตโนมัติ เอเจนต์ช่วยโค้ด ระบบสนับสนุนลูกค้าแบบมัลติโมดัล และผู้ช่วยองค์กรบริบทยาว
ทำไมจึงใช้ MiMo-V2.5 ผ่าน CometAPI?
MiMo-V2.5 มีประโยชน์อย่างยิ่งในสภาพแวดล้อม API หลายโมเดล เพราะนักพัฒนาอาจต้องการเปรียบเทียบกับ GPT, Claude, Gemini, DeepSeek หรือโมเดลเอเจนต์อื่นๆ โดยไม่ต้องสร้างสแตกโครงสร้างพื้นฐานแยกสำหรับผู้ให้บริการแต่ละราย
CometAPI มีประโยชน์เมื่อแอปของคุณต้องการ:
- เลเยอร์ API แบบรวม
- เข้าถึงตระกูลโมเดล AI หลายแบบ
- การสลับโมเดลง่ายขึ้น
- การจัดการคีย์ API แบบรวมศูนย์
- การเปรียบเทียบโมเดลอย่างรวดเร็ว
- เลเยอร์การผสานรวมเดียวสำหรับงานทดลองและโปรดักชัน
สำหรับทีมที่ประเมิน ประสิทธิภาพเอเจนต์เทียบกับต้นทุนการอนุมาน MiMo-V2.5 ควรค่าแก่การทดสอบควบคู่ไปกับโมเดลเรือธงที่มีราคาแพงกว่า แทนที่จะสันนิษฐานว่าโมเดลเชิงพาณิชย์ที่ใหญ่ที่สุดจะเป็นทางเลือกที่ดีที่สุดโดยอัตโนมัติ