ข้อมูลจำเพาะทาง技术ของ MiMo-V2.5-Pro
| ข้อกำหนด | MiMo-V2.5-Pro |
|---|---|
| รหัสโมเดล | mimo-v2.5-pro |
| ผู้ให้บริการ | Xiaomi MiMo |
| ประเภทโมเดล | โมเดลภาษาขนาดใหญ่เชิงตัวแทน |
| สถาปัตยกรรม | Mixture‑of‑Experts แบบ Sparse |
| จำนวนพารามิเตอร์ทั้งหมด | 1.02T |
| พารามิเตอร์ที่ถูกเปิดใช้งาน | 42B |
| หน้าต่างบริบท | 1M โทเคน |
| ผลลัพธ์ | ข้อความ |
| สถาปัตยกรรม Attention | ไฮบริด SWA + Global Attention |
| โทเคนสำหรับการฝึก | 27T |
| บริบทสูงสุดของโมเดลฐาน | 256K |
| บริบทสูงสุดของรุ่น Pro | 1M |
| สัญญาอนุญาต | MIT |
ความแตกต่างระหว่าง พารามิเตอร์รวม 1.02T กับพารามิเตอร์ที่ทำงานจริง 42B มีความสำคัญ MiMo-V2.5-Pro เป็นโมเดล MoE: แต่ละโทเคนจะกระตุ้นเพียงบางส่วนของพารามิเตอร์ที่มีอยู่ นั่นเปลี่ยนโพรไฟล์การคำนวณขณะแปลความ (inference) ไปอย่างมากเมื่อเทียบกับโมเดลแบบ dense ขนาด 1T พารามิเตอร์ แม้ว่าโมเดลโดยรวมยังคงมีความต้องการด้านหน่วยความจำและการปรับใช้ที่มหาศาล
คุณสมบัติหลักของ MiMo-V2.5-Pro คืออะไร?
1. สถาปัตยกรรม MoE แบบ Sparse ระดับทริลเลียน
MiMo-V2.5-Pro มี พารามิเตอร์รวม 1.02T และพารามิเตอร์ที่ถูกกระตุ้น 42B
สถาปัตยกรรมประกอบด้วย ผู้เชี่ยวชาญแบบกำหนดเส้นทาง (routed experts) 384 ตัว โดยกระตุ้นผู้เชี่ยวชาญ 8 ตัวต่อโทเคน โมเดลมี 70 ชั้น Transformer ประกอบด้วยชั้น dense 1 ชั้นและชั้น MoE 69 ชั้น
สิ่งนี้ทำให้มีศักยภาพในการแทนค่า (representational capacity) มากกว่ารุ่นมาตรฐาน MiMo-V2.5 อย่างมาก ในขณะที่หลีกเลี่ยงต้นทุนการคำนวณจากการกระตุ้นพารามิเตอร์ทั้งหมด 1.02T สำหรับทุกโทเคน
ประเด็นปฏิบัติที่ควรเข้าใจคือ:
MiMo-V2.5-Pro เป็นโมเดลระดับล้านล้านพารามิเตอร์ตามความจุรวม แต่การคำนวณต่อโทเคนถูกกำหนดโดยเส้นทางพารามิเตอร์ที่ทำงานอยู่ 42B
2. บริบทขนาด 1 ล้านโทเคน
โมเดลรองรับบริบทได้สูงสุด 1M โทเคน
นี่คือความสามารถที่สำคัญที่สุดอย่างหนึ่งสำหรับเอเจนต์อัตโนมัติ เพราะเวิร์กโฟลว์ระยะยาวสามารถสะสมสิ่งต่าง ๆ ได้ เช่น:
- ผลลัพธ์จากเครื่องมือ
- ซอร์สโค้ด
- ผลการค้นหา
- เอกสาร
- สถานะการให้เหตุผลระหว่างทาง
- คำสั่งผู้ใช้
- บันทึกการรัน
แทนที่จะต้องสรุปและทิ้งบริบทเก่า ๆ ซ้ำ ๆ เอเจนต์อาจรักษาประวัติการทำงานที่ใหญ่กว่าไว้ได้
การประเมินบริบทยาวของ Xiaomi ทดสอบโมเดลตั้งแต่ 32K ไปจนถึง 1M โทเคนอินพุต
3. ความสนใจแบบ Sliding-Window ผสาน Global
MiMo-V2.5-Pro ใช้อัตราส่วน SWA ต่อ Global Attention ที่ 6:1 พร้อมหน้าต่างเลื่อน 128 โทเคน
สถาปัตยกรรมประกอบด้วย:
- ชั้น SWA 60 ชั้น
- ชั้น Global Attention 10 ชั้น
- หน้าต่าง SWA ขนาด 128 โทเคน
Xiaomi รายงานว่าการออกแบบนี้ลดพื้นที่จัดเก็บ KV‑cache ได้เกือบ 7× ในขณะที่ยังคงประสิทธิภาพบริบทยาวผ่านไบแอสแบบ attention‑sink ที่เรียนรู้ได้
นี่เป็นส่วนที่มีนัยสำคัญทางเทคนิคอย่างยิ่งของโมเดล
หน้าต่างบริบทขนาด 1M มีต้นทุนสูง หากทุกชั้นต้องทำความสนใจแบบเต็มกับลำดับทั้งหมด ความสนใจแบบไฮบริดช่วยลดข้อมูลที่แต่ละชั้นต้องให้ความสนใจแบบทั่วโลก ในขณะเดียวกันยังคงชั้น Global Attention เฉพาะสำหรับความสัมพันธ์ระยะไกล
4. การทำนายหลายโทเคน
MiMo-V2.5-Pro มี โมดูล MTP น้ำหนักเบา 3 โมดูล
การทำนายหลายโทเคนช่วยให้โมเดลทำนายโทเคนอนาคตหลายตัวได้ ในรูปแบบที่สามารถใช้กับการถอดรหัสแบบ speculative และการเร่งความเร็วการอนุมาน
Xiaomi รายงานว่าสถาปัตยกรรม MTP ของตนสามารถ เพิ่มความเร็วการสร้างผลลัพธ์ระหว่างอนุมานได้ถึง 3 เท่า ภายใต้การตั้งค่าการปรับใช้ที่ระบุ
ประเด็นนี้สำคัญเป็นพิเศษสำหรับเอเจนต์ เนื่องจากเอเจนต์อาจสร้างเอาต์พุตระหว่างทางจำนวนมาก การเพิ่มความเร็วในการสร้างโทเคนจึงส่งผลต่อระยะเวลารวมของงานอย่างมีนัยสำคัญ
5. การเรียนรู้แบบเสริมแรงเชิงตัวแทน
กระบวนการ post‑training ของ MiMo-V2.5-Pro ประกอบด้วย:
- การปรับแต่งแบบมีผู้กำกับ
- การเรียนรู้แบบเสริมแรงเชิงตัวแทนขนาดใหญ่
- การกลั่นแบบ Multi‑Teacher แบบ On‑Policy (MOPD)
วัตถุประสงค์การฝึกมุ่งไปที่พฤติกรรมเอเจนต์ที่ซับซ้อน ไม่ใช่เพียงการตอบคำถามเชิงมาตรฐานแบบคงที่เท่านั้น
นี่คือเหตุผลที่การประเมินที่แข็งแกร่งที่สุดของโมเดลนี้กระจุกอยู่รอบ ๆ การเขียนโค้ด ปฏิสัมพันธ์กับเทอร์มินัล การให้เหตุผลบริบทยาว และเบนช์มาร์กด้านเอเจนต์
6. การพรีเทรน 27T โทเคน
MiMo-V2.5-Pro ถูกพรีเทรนบนประมาณ 27 ทริลเลียนโทเคน โดยใช้ความละเอียดผสม FP8 และความยาวลำดับแบบเนทีฟ 32K ก่อนจะรองรับหน้าต่างบริบทขยาย 1M
ขนาดการพรีเทรนรวมกับสถาปัตยกรรม MoE ระดับทริลเลียน ทำให้ MiMo-V2.5-Pro อยู่ในชั้นของโมเดลระดับแนวหน้าปัจจุบัน
MiMo-V2.5-Pro ทำผลงานบนเบนช์มาร์กอย่างไร?
ผลการประเมินที่เผยแพร่มีประโยชน์อย่างยิ่งเพราะรวมทั้งเบนช์มาร์กการให้เหตุผลทั่วไปและการประเมินด้านโค้ด/เอเจนต์เชิงปฏิบัติ
| เบนช์มาร์ก | ผลลัพธ์ของ MiMo-V2.5-Pro | ประเภทการประเมิน |
|---|---|---|
| SWE-Bench Verified | 78.9 | วิศวกรรมซอฟต์แวร์ |
| SWE-Bench Pro | 57.2 | วิศวกรรมซอฟต์แวร์ |
| Terminal-Bench 2.0 | 68.4 | เอเจนต์เทอร์มินัล |
| GSM8K | 99.6 | การให้เหตุผลเชิงคณิตศาสตร์ |
| GPQA Diamond | 66.7 | การให้เหตุผลระดับบัณฑิตศึกษา |
| MMLU-Pro | 68.5 | การให้เหตุผลทั่วไป |
| MMLU | 89.4 | ความรู้ทั่วไป/การให้เหตุผล |
| MMLU-Redux | 92.8 | ความรู้ทั่วไป/การให้เหตุผล |
| HumanEval+ | 75.6 | การสร้างโค้ด |
| MBPP+ | 74.1 | การเขียนโปรแกรม Python |
| LiveCodeBench v6 | 39.6 | การเขียนโค้ดเชิงแข่งขัน |
| ARC-Challenge | 97.2 | การให้เหตุผล |
| AIME 2024/2025 | 37.3 | คณิตศาสตร์การแข่งขัน |
ผลลัพธ์แสดงโปรไฟล์ที่แข็งแกร่งเป็นพิเศษในด้าน วิศวกรรมซอฟต์แวร์และการให้เหตุผลเชิงคณิตศาสตร์ คะแนน 78.9 บน SWE‑Bench Verified และ 68.4 บน Terminal‑Bench 2.0 มีความเกี่ยวข้องอย่างยิ่งสำหรับนักพัฒนาที่สร้างระบบโค้ดอัตโนมัติ
ประสิทธิภาพกับบริบทยาว
ผลลัพธ์บริบทยาวน่าสนใจกว่าเบนช์มาร์กมาตรฐานเสียอีก
บนการประเมิน GraphWalks, MiMo-V2.5-Pro คงประสิทธิภาพที่วัดได้ในความยาวบริบทที่สุดโต่ง:
| บริบท | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi รายงานว่า MiMo-V2-Pro รุ่นก่อนหน้าทรุดลงอย่างรวดเร็วเกิน 128K และได้ 0.00 ที่ 1M ในทั้งสองงานย่อย ขณะที่ V2.5‑Pro ยังคงมีประสิทธิภาพที่ไม่เป็นศูนย์ในบริบทเต็ม 1M
นี่เป็นความแตกต่างที่มีนัยสำคัญ: บริบท 1M ของ MiMo-V2.5-Pro ไม่ใช่เพียงค่าสูงสุดในทฤษฎี; การประเมินบริบทยาวที่เผยแพร่แสดงให้เห็นว่ามีประสิทธิภาพที่ใช้งานได้ลึกเข้าไปในหน้าต่างนั้น
ตัวอย่างเอเจนต์ในโลกจริง
| งาน | ผลที่รายงาน |
|---|---|
| PKU SysY Compiler | 4.3 hours |
| การเรียกใช้เครื่องมือระหว่างงานคอมไพเลอร์ | 672 |
| ผ่านชุดทดสอบของคอมไพเลอร์ | 233/233 |
| ตัวแก้ไขวิดีโอแบบฟูลสแตก | 11.5 hours |
| โค้ดที่สร้างสำหรับตัวแก้ไขวิดีโอ | 8,192 lines |
| การแทรกแซงของมนุษย์ | None reported |
| การเรียกเครื่องมือระยะยาว | Nearly 1,000 |
เหล่านี้เป็นเดโมที่ Xiaomi รายงาน ไม่ใช่คะแนนเบนช์มาร์กมาตรฐาน
MiMo-V2.5-Pro เทียบกับ MiMo-V2.5
สองโมเดลอยู่ในเจเนอเรชันเดียวกันแต่มุ่งเป้าไปที่งานต่างกัน
| ข้อกำหนด | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| จำนวนพารามิเตอร์ทั้งหมด | 310B | 1.02T |
| พารามิเตอร์ที่ทำงานอยู่ | 15B | 42B |
| บริบท | 1M | 1M |
| ชั้น | 48 | 70 |
| ผู้เชี่ยวชาญที่ถูกกำหนดเส้นทาง | 256 | 384 |
| ผู้เชี่ยวชาญต่อโทเคน | 8 | 8 |
| ชั้น Full-attention | 9 | 10 |
| ชั้น SWA | 39 | 60 |
| โฟกัสหลัก | เอเจนต์แบบออมนิโมดัล | เอเจนต์ซับซ้อน/การเขียนโค้ด |
| ความเข้าใจวิดีโอ/เสียง/ภาพ | Yes | เน้นด้านภาษา/เอเจนต์เป็นหลัก |
| ประสิทธิภาพเอเจนต์ระยะยาว | แข็งแกร่ง | เรือธง |
ดังนั้น ตัวเลือกจึงไม่ใช่แค่ “Pro ดีกว่า” อย่างง่าย ๆ
หากแอปพลิเคชันต้องการ ความเข้าใจภาพ วิดีโอ และเสียงแบบเนทีฟ MiMo‑V2.5 จะเหมาะกว่า หากงานมุ่งไปที่ การให้เหตุผลที่ซับซ้อน วิศวกรรมซอฟต์แวร์ ปฏิสัมพันธ์กับเทอร์มินัล และเอเจนต์ระยะยาว MiMo‑V2.5‑Pro จะเหมาะสมกว่า
ข้อจำกัดของ MiMo-V2.5-Pro
1. อินพุตแบบข้อความเท่านั้น
ต่างจาก mimo-v2.5, สเปกอย่างเป็นทางการของรุ่น Pro ระบุอินพุตเป็น ข้อความ ควรหลีกเลี่ยงการทำการตลาดว่าเป็นโมเดลมัลติโมดัลในตระกูล V2.5
2. ความต้องการคอมพิวต์สูงสำหรับการโฮสต์เอง
โมเดลมีประมาณ พารามิเตอร์รวม 1T / พารามิเตอร์ที่ทำงานจริง 42B ทำให้การปรับใช้ภายในมีความต้องการสูงกว่ามากเมื่อเทียบกับโมเดลเปิดขนาดเล็กทั่วไป
3. ประสิทธิภาพของเอเจนต์ขึ้นกับเฟรมเวิร์ก
คำกล่าวอ้างเรื่องการเรียกเครื่องมือเกือบ 1,000 ครั้งของ Xiaomi ผูกกับการใช้เฟรมเวิร์กเอเจนต์ที่เหมาะสมอย่างชัดเจน ตัวโมเดลเพียงอย่างเดียวไม่รับประกันว่าแอปพลิเคชันจะได้ประสิทธิภาพระยะยาวแบบเดียวกัน
4. การจัดการเนื้อหาการให้เหตุผล
แอปเอเจนต์แบบหลายรอบที่ใช้โหมดคิดและการเรียกเครื่องมือต้องเก็บรักษา reasoning_content ให้ถูกต้อง การจัดการไม่ถูกต้องอาจทำให้เกิดข้อผิดพลาดของ API
กรณีใช้งานที่เหมาะสมที่สุด
วิศวกรรมซอฟต์แวร์ขนาดใหญ่
- การย้ายที่เก็บ
- รีแฟกตอริ่ง
- ดีบัก
- สร้างชุดทดสอบ
- พัฒนาคอมไพเลอร์
- พัฒนาแอปพลิเคชันฟูลสแตก
เอเจนต์โค้ดอัตโนมัติ
MiMo‑V2.5‑Pro เหมาะอย่างยิ่งกับเอเจนต์ที่ต้องทำซ้ำอย่างต่อเนื่อง:
ตรวจสอบ → แก้ไข → รัน → ทดสอบ → วินิจฉัย → แก้ไข
การให้เหตุผลกับเอกสารยาว
บริบท 1M ทำให้เหมาะกับ:
- สัญญากฎหมาย
- ข้อมูลจำเพาะทางเทคนิค
- คอลเลกชันงานวิจัยขนาดใหญ่
- เอกสารองค์กร
เอเจนต์ธุรกิจที่ซับซ้อน
การเรียกเครื่องมือ + การค้นเว็บ + เอาต์พุตแบบมีโครงสร้าง สามารถรองรับ:
- เอเจนต์วิจัย
- เอเจนต์ประมวลผลข้อมูล
- ระบบอัตโนมัติเวิร์กโฟลว์ในองค์กร
- ระบบตัดสินใจหลายขั้นตอน
วิธีใช้ API ของ MiMo-V2.5-Pro บน CometAPI
รหัสโมเดล CometAPI ที่เกี่ยวข้องคือ:
mimo-v2.5-pro
สำหรับนักพัฒนา เลเยอร์รวม API มีประโยชน์เป็นพิเศษในการทดสอบ MiMo‑V2.5‑Pro เทียบกับโมเดลให้เหตุผลและเอเจนต์ระดับไฮเอนด์อื่น ๆ โดยไม่ต้องดูแลการเชื่อมต่อผู้ให้บริการแยกกัน
ขั้นตอนที่ 1: รับคีย์ API ของ CometAPI
สร้างหรือเข้าสู่บัญชี CometAPI แล้วรับคีย์ API จากคอนโซล API
ตั้งค่าเป็นตัวแปรสภาพแวดล้อม:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
ขั้นตอนที่ 2: กำหนดค่าไคลเอนต์ API
Xiaomi มี API ที่เข้ากันได้กับทั้งโปรโตคอลของ OpenAI และ Anthropic ทำให้การย้ายใช้งานค่อนข้างตรงไปตรงมา สำหรับการผสานใช้งานจริง ให้ใช้ปลายทาง/สคีมาปัจจุบันของ CometAPI สำหรับ mimo-v2.5-pro โดยเฉพาะหากคุณต้องการความสามารถขั้นสูง เช่น การเรียกเครื่องมือ สตรีมมิง เอาต์พุตแบบมีโครงสร้าง หรือคำขอบริบทยาว
ขั้นตอนที่ 3: เชื่อม MiMo-V2.5-Pro กับเครื่องมือ
เมื่อเชื่อมกับเครื่องมือภายนอก โมเดลจะมีประโยชน์มากขึ้นอย่างมาก
เช่น:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
สถาปัตยกรรมนี้สอดคล้องกับการใช้งานที่ตั้งใจของโมเดลมากกว่าการผสานแบบแชตบอตอย่างง่าย