Технические характеристики MiMo-V2.5-Pro
| Спецификация | MiMo-V2.5-Pro |
|---|---|
| Model ID | mimo-v2.5-pro |
| Провайдер | Xiaomi MiMo |
| Тип модели | Агентно-ориентированная большая языковая модель |
| Архитектура | Разреженная смесь экспертов (MoE) |
| Общее число параметров | 1.02T |
| Активируемые параметры | 42B |
| Окно контекста | 1M токенов |
| Вывод | Текст |
| Архитектура внимания | Гибридная SWA + глобальное внимание |
| Токены обучения | 27T |
| Максимальный контекст базовой модели | 256K |
| Максимальный контекст Pro | 1M |
| Лицензия | MIT |
Различие между 1.02T общих параметров и 42B активных параметров важно. MiMo-V2.5-Pro — это модель MoE: каждый токен активирует только подмножество доступных параметров. Это существенно меняет профиль вычислений при инференсе по сравнению с плотной моделью на 1T параметров, хотя полная модель по‑прежнему предъявляет огромные требования к памяти и развёртыванию.
Каковы основные возможности MiMo-V2.5-Pro?
1. Разреженная архитектура MoE масштаба триллиона
MiMo-V2.5-Pro содержит 1.02T общих параметров и 42B активных параметров.
Её архитектура включает 384 маршрутизируемых эксперта, при этом для каждого токена активируется восемь экспертов. Модель имеет 70 слоёв трансформера, включая один плотный слой и 69 MoE-слоёв.
Это обеспечивает существенно большую представительную способность по сравнению со стандартной MiMo-V2.5, избегая вычислительных затрат на активацию всех 1.02T параметров для каждого токена.
Практический вывод таков:
MiMo-V2.5-Pro — это модель с триллионом параметров по общей ёмкости, но вычисления на токен определяются её траекторией из 42B активных параметров.
2. Контекст в 1 миллион токенов
Модель поддерживает до 1M токенов контекста.
Это одна из важнейших возможностей для автономных агентов, поскольку в длительных рабочих процессах накапливаются:
- Результаты работы инструментов
- Исходный код
- Результаты поиска
- Документация
- Промежуточное состояние рассуждений
- Инструкции пользователя
- Журналы выполнения
Вместо многократного суммирования и отбрасывания старого контекста агент может потенциально хранить гораздо более обширную рабочую историю.
Длинноконтекстная оценка Xiaomi специально тестирует модель в диапазоне от 32K до 1M входных токенов.
3. Гибрид внимания скользящего окна и глобального внимания
MiMo-V2.5-Pro использует соотношение 6:1 между Sliding Window Attention (SWA) и глобальным вниманием, со скользящим окном в 128 токенов.
Архитектура содержит:
- 60 слоёв SWA
- 10 слоёв глобального внимания
- Окно SWA в 128 токенов
Xiaomi сообщает, что такой дизайн снижает хранение KV-кэша почти в 7×, при этом сохраняется производительность на длинном контексте благодаря обучаемому смещению attention-sink.
Это одна из наиболее технически значимых частей модели.
Окно контекста в 1M затратно, если каждый слой выполняет полное внимание по всей последовательности. Гибридное внимание уменьшает объём информации, на которую каждый слой должен глобально обращать внимание, сохраняя при этом выделенные слои глобального внимания для дальнодействующих зависимостей.
4. Прогнозирование нескольких токенов
MiMo-V2.5-Pro содержит три лёгких модуля MTP.
Multi-Token Prediction позволяет модели предсказывать несколько будущих токенов таким образом, что это может быть использовано для спекулятивного декодирования и ускорения инференса.
Xiaomi сообщает, что её архитектура MTP может утраивать скорость генерации при инференсе в описанной конфигурации развёртывания.
Это особенно важно для агентов, поскольку агент может генерировать большие объёмы промежуточного вывода на протяжении длинной траектории. Улучшение скорости генерации токенов может существенно повлиять на общую задержку выполнения задач.
5. Агентное обучение с подкреплением
Пайплайн постобучения MiMo-V2.5-Pro включает:
- Контролируемую донастройку
- Масштабное агентное обучение с подкреплением
- Multi-Teacher On-Policy Distillation (MOPD)
Цель обучения ориентирована именно на сложное агентное поведение, а не только на статические бенчмарки вопросов и ответов.
Поэтому наилучшие оценки модели сосредоточены вокруг программирования, взаимодействия с терминалом, длинноконтекстного рассуждения и агентных бенчмарков.
6. Предобучение на 27T токенов
MiMo-V2.5-Pro была предобучена примерно на 27 триллионах токенов, с использованием смешанной точности FP8 и исходной длины последовательности 32K до добавления поддержки расширенного окна контекста 1M.
Масштаб предобучения в сочетании с архитектурой MoE на триллион параметров прочно относит MiMo-V2.5-Pro к классу передовых моделей.
Как MiMo-V2.5-Pro показывает себя на бенчмарках?
Опубликованные результаты оценки особенно полезны, поскольку включают как общие бенчмарки рассуждений, так и практические оценки кодирования/агентов.
| Бенчмарк | Результат MiMo-V2.5-Pro | Тип оценки |
|---|---|---|
| SWE-Bench Verified | 78.9 | Программная инженерия |
| SWE-Bench Pro | 57.2 | Программная инженерия |
| Terminal-Bench 2.0 | 68.4 | Терминальный агент |
| GSM8K | 99.6 | Математическое рассуждение |
| GPQA Diamond | 66.7 | Рассуждение уровня магистратуры |
| MMLU-Pro | 68.5 | Общее рассуждение |
| MMLU | 89.4 | Общие знания/рассуждение |
| MMLU-Redux | 92.8 | Общие знания/рассуждение |
| HumanEval+ | 75.6 | Генерация кода |
| MBPP+ | 74.1 | Программирование на Python |
| LiveCodeBench v6 | 39.6 | Соревновательное программирование |
| ARC-Challenge | 97.2 | Рассуждение |
| AIME 2024/2025 | 37.3 | Соревновательная математика |
Результаты показывают особенно сильный профиль в программной инженерии и математическом рассуждении. Сообщённые 78.9 на SWE-Bench Verified и 68.4 на Terminal-Bench 2.0 особенно важны для разработчиков, создающих автономные системы программирования.
Производительность на длинном контексте
Результаты для длинного контекста, возможно, даже интереснее стандартных бенчмарков.
На оценке GraphWalks MiMo-V2.5-Pro сохраняет измеримую производительность при экстремальных длинах контекста:
| Контекст | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi сообщает, что предыдущая MiMo-V2-Pro быстро деградирует за пределами 128K и достигает 0.00 на 1M в обеих подзадачах, тогда как V2.5-Pro сохраняет ненулевую производительность на полном окне 1M.
Это существенное отличие: контекст 1M у MiMo-V2.5-Pro — не просто теоретический максимум; опубликованная оценка длинного контекста демонстрирует полезную производительность глубоко внутри этого окна.
Примеры агентов из реального мира
| Задача | Сообщенный результат |
|---|---|
| PKU SysY Compiler | 4.3 часа |
| Вызовы инструментов во время задачи по компилятору | 672 |
| Пройдено тестов компилятора | 233/233 |
| Полнофункциональный видеоредактор | 11.5 часа |
| Сгенерировано кода для видеоредактора | 8,192 строк |
| Вмешательство человека | Не сообщалось |
| Долговременные вызовы инструментов | Почти 1,000 |
Это демонстрации, предоставленные Xiaomi, а не стандартизованные оценки по бенчмаркам.
MiMo-V2.5-Pro vs MiMo-V2.5
Обе модели относятся к одному поколению, но ориентированы на разные задачи.
| Спецификация | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Общее число параметров | 310B | 1.02T |
| Активные параметры | 15B | 42B |
| Контекст | 1M | 1M |
| Слоёв | 48 | 70 |
| Маршрутизируемые эксперты | 256 | 384 |
| Экспертов на токен | 8 | 8 |
| Слоёв с полным вниманием | 9 | 10 |
| Слои SWA | 39 | 60 |
| Основной фокус | Омнимодальные агенты | Сложные агенты/программирование |
| Понимание видео/аудио/изображений | Да | В первую очередь язык/агенты |
| Производительность агентов на длинных горизонтах | Сильная | Флагманская |
Выбор — это не просто «Pro лучше».
Если приложению нужно нативное понимание изображений, видео и аудио, более естественным выбором является MiMo-V2.5. Если рабочая нагрузка сосредоточена на сложном рассуждении, программной инженерии, взаимодействии с терминалом и долго работающих агентах, MiMo-V2.5-Pro подходит лучше.
Ограничения MiMo-V2.5-Pro
1. Ввод только текста
В отличие от mimo-v2.5, официальная спецификация версии Pro указывает Text как входную модальность. Её не следует продвигать как мультимодальную модель в семействе V2.5.
2. Высокие вычислительные требования для самостоятельного размещения
В модели примерно 1T общих параметров / 42B активных параметров, что делает локальное развёртывание значительно более требовательным, чем у обычных небольших открытых моделей.
3. Производительность агента зависит от фреймворка
Заявление Xiaomi о почти 1,000 вызовов инструментов явно связано с использованием соответствующего агентного фреймворка. Одна только модель не гарантирует, что приложение достигнет той же долговременной производительности.
4. Обработка содержимого рассуждений
Многотуровые агентные приложения, использующие режим размышления и вызовы инструментов, должны корректно сохранять reasoning_content. Некорректная обработка может приводить к ошибкам API.
Лучшие варианты использования
Масштабная программная инженерия
- Миграция репозиториев
- Рефакторинг
- Отладка
- Генерация тестов
- Разработка компиляторов
- Разработка полнофункциональных приложений
Автономные агенты для программирования
MiMo-V2.5-Pro особенно хорошо подходит для агентов, которым нужно многократно:
проанализировать → изменить → выполнить → протестировать → диагностировать → изменить
Рассуждение по длинным документам
Его контекст в 1M полезен для:
- Юридических контрактов
- Технических спецификаций
- Крупных массивов исследований
- Корпоративной документации
Сложные бизнес-агенты
Вызов инструментов + веб-поиск + структурированный вывод могут обеспечить:
- Исследовательские агенты
- Агенты обработки данных
- Автоматизацию корпоративных процессов
- Многошаговые системы принятия решений
Как использовать API MiMo-V2.5-Pro на CometAPI
Соответствующий идентификатор модели CometAPI:
mimo-v2.5-pro
Для разработчиков уровень агрегации API особенно полезен, чтобы тестировать MiMo-V2.5-Pro на фоне других высококлассных моделей рассуждений и агентов без поддержки независимых интеграций провайдеров.
Шаг 1: Получите ключ API CometAPI
Создайте или войдите в свой аккаунт CometAPI и получите ключ API в консоли API.
Установите его как переменную окружения:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Шаг 2: Настройте клиент API
Xiaomi предоставляет API, совместимый с протоколами OpenAI и Anthropic, что делает миграцию относительно простой. Для промышленной интеграции используйте текущую конечную точку/схему CometAPI для mimo-v2.5-pro, особенно если вам нужны расширенные функции, такие как вызов инструментов, потоковая передача, структурированные ответы или запросы с длинным контекстом.
Шаг 3: Подключите MiMo-V2.5-Pro к инструментам
Модель становится существенно полезнее при подключении к внешним инструментам.
Например:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
Эта архитектура гораздо ближе соответствует предполагаемому использованию модели, чем простая интеграция чат-бота.