TL;DR
Стандартная модель V2.5 от Xiaomi совмещает нативное понимание текста, изображений, видео и аудио с окном контекста на 1 миллион токенов, использованием инструментов и эффективностью разрежённой смеси экспертов (Sparse MoE). Это лучший выбор, когда важны мультимодальный ввод и стоимость на выполненную задачу. Вариант Pro крупнее и сильнее на сложном кодинге и долгих траекториях агентной работы, но ориентирован на текстовый ввод и стоит примерно в три раза дороже за токен по опубликованным тарифам Xiaomi.
Практическое решение простое: выбирайте стандартную модель для мультимодальных агентов, анализа документов и медиа, а также массовой автоматизации; выбирайте Pro, когда узким местом является сложная разработка ПО или длительное автономное выполнение.
Ключевые выводы
- Стандартная модель использует 310B общих параметров, активируя 15B на токен.
- Принимает текст, изображения, видео и аудио, возвращает текст.
- Её API поддерживает контекст 1M, до 128K вывода, вызовы инструментов, веб-поиск, стриминг, структурированный вывод и кеширование контекста.
- По данным издателя: 65.8 на Terminal-Bench 2.0 и 56.1 на SWE-Bench Pro.
- Текущая карточка модели Xiaomi MiMo-V2.5-Pro указывает 1.02T общих и 42B активных параметров. Опубликованные издателем результаты SWE-Bench Pro: 56.1 для MiMo-V2.5 и 57.2 для Pro; это устаревшие, заявленные издателем сравнения и не являются гарантией для конкретного рабочего процесса по кодированию.
- По текущим тарифам Xiaomi, стандартные вход/выход стоят $0.14/$0.28 за миллион токенов; Pro — $0.435/$0.87.
- Оба API в CometAPI стоят на 20% ниже официальных цен без кеша.
Проверено: 28 сентября 2026. Цены, бенчмарки, лимиты, доступность и форматы запросов могут меняться. Xiaomi объявила, что официальные имена моделей mimo-v2.5 и mimo-v2.5-pro в API будут выведены из эксплуатации в 10:00 по пекинскому времени 21 октября 2026 без автоматической замены. Планируйте миграцию и подтвердите рабочий маршрут до развёртывания.
Примечание о жизненном цикле API: официальная платформа Xiaomi планирует вывести из эксплуатации оба идентификатора моделей V2.5 21 октября 2026. Это уведомление касается платформы API Xiaomi; отдельно проверьте любой сторонний шлюз. Уведомление Xiaomi о выводе модели
Что представляет собой стандартная модель
MiMo-V2.5 — ориентированная на эффективность базовая модель Xiaomi MiMo для мультимодального восприятия и агентной работы. Она предоставляет нативный ввод текста, изображений, видео и аудио в рамках одной архитектуры и выдаёт текстовый вывод.
Журнал релизов модели Xiaomi датирует публичную бету серии MiMo-V2.5 23 апреля 2026. Веса впоследствии были опубликованы под лицензией MIT. MiMo-V2.5 имеет 310B параметров в сумме, но активирует около 15B на каждый токен; она использует большой пул экспертов, не задействуя всех сразу.
MiMo-V2.5-Pro нацелен на другой тип нагрузки. Это триллион-параметрическая модель с текстовым вводом, спроектированная для наиболее сложного кодинга, терминальных задач и длительных агентных траекторий. Обе версии разделяют максимум контекста 1M, но сильно различаются по модальности, активным вычислениям и цене.
Характеристики и возможности MiMo-V2.5
| Официальные сведения об архитектуре | Значение | Почему это важно |
|---|---|---|
| Архитектура | Разрежённая MoE | Большая ёмкость экспертов с селективной активацией |
| Общие / активные параметры | 310B / 15B | Активные вычисления значительно ниже общей ёмкости |
| Слои трансформера | 48: 1 плотный + 47 MoE | Большинство слоёв используют маршрутизируемых экспертов |
| Маршрутизируемые эксперты | 256; 8 активных на токен | Специализация без плотного исполнения всех 310B |
| Внимание | 39 слоёв SWA + 9 глобальных | Баланс локальной эффективности и дальних зависимостей |
| Окно SWA | 128 токенов | Снижает нагрузку на кэш в длинном контексте |
| Контекст / максимум вывода | 1M / 128K токенов | Поддерживает длинные документы и расширенные трассы |
| Ввод / вывод | Текст, изображение, видео, аудио / текст | Нативное восприятие четырёх типов ввода |
| Визуальный энкодер | 729M ViT; 28 слоёв | Понимание изображений и видео |
| Аудио-энкодер | 261M трансформер; 24 слоя | Нативное понимание аудио |
| Multi-Token Prediction | 3 модуля; около 329M параметров | Обеспечивает эффективность спекулятивного декодирования |
| Масштаб обучения | Около 48T токенов | Широкий текстовый и мультимодальный пайплайн |
| Возможности API | Инструменты, веб, стриминг, структурированный вывод, кеширование | Производственные примитивы для агентов |
| Лицензия | MIT | Разрешены коммерческое использование и модификация |
Рабочие возможности включают контекст 1M и вывод 128K, плюс опубликованные лимиты 100 запросов в минуту и 10 миллионов токенов в минуту. Лимиты на стороне провайдера могут отличаться по аккаунту и маршруту интеграции.
Официальная схема архитектуры Xiaomi MiMo. Официальный архитектурный ресурс.
Как устроена архитектура MiMo-V2.5
Разрежённые эксперты: общая ёмкость — это не активные вычисления
Ключевой факт об эффективности — дизайн 310B общих и 15B активных параметров. Маршрутизатор выбирает восемь из 256 экспертов для каждого токена. Это даёт модели доступ к гораздо большему пулу параметров, чем у обычной плотной 15B-модели, без необходимости исполнять все 310B каждый раз.
Это не делает самохостинг тривиальным. Полные веса всё равно нужно хранить и распространять, поэтому ёмкость памяти, пропускная способность межсоединений, маршрутизация экспертов и серверное ПО остаются существенными ограничениями.
Гибридное внимание для длинного контекста
Бэкбон чередует внимание с скользящим окном и глобальное внимание в соотношении 5:1 между SWA и глобальными слоями. Тридцать девять локальных слоёв ограничивают рост кэша, в то время как девять глобальных слоёв сохраняют передачу информации на больших расстояниях. Xiaomi сообщает почти шестикратное сокращение KV-кэша по сравнению с полностью глобальным дизайном.
Максимум 1M токенов — это ёмкость, а не гарантированная точность. Качество извлечения, задержки, рост состояния инструментов и внимание к далёким фрагментам доказательств требуют оценивания под конкретную нагрузку.
Нативные энкодеры и агентные функции
Визуальный трансформер на 729M параметров обрабатывает изображения и видео; аудио-трансформер на 261M параметров обрабатывает аудио. Проекционные модули отображают оба потока в языковой бэкбон, позволяя одному агенту комбинировать скриншот, фрагмент видео, аудиотрек, текстовые инструкции и результаты инструментов.
Три модуля Multi-Token Prediction поддерживают спекулятивное декодирование и эффективность обучения с подкреплением. Модель обучалась на около 48T токенов, причём контекст постепенно расширяли до 1M на этапах посттренинга.
Открытые веса находятся под лицензией MIT. Коммерческое развёртывание разрешено, но стоимость инфраструктуры и сторонние зависимости требуют отдельной проверки.
Бенчмарки MiMo-V2.5: кодинг, агенты и мультимодальные результаты
Примечание о бенчмарках:
приведённые ниже показатели заявлены издателем. Они служат ориентиром, но не гарантируют результат для конкретного репозитория, формата медиа, стека инструментов, целевых задержек или политики безопасности.
Результаты по кодингу и агентам

Официальный график бенчмарков по кодингу и агентам Xiaomi MiMo.
| Официальный бенчмарк по кодингу | Заявленный балл | Сигнал для решения |
|---|---|---|
| MiMo Coding Bench | 71.8 | Широкие возможности кодинг-агента |
| Claw-Eval Text | 62.3 | Общее завершение текстовых агентов |
| Terminal-Bench 2.0 | 65.8 | Интерактивное исполнение в терминале |
| SWE-Bench Pro | 56.1 | Реальная инженерия ПО на репозиториях |
| Claw-Eval Multi-Turn | 63.2 | Более длинная многошаговая работа агента |
| ResearchClawBench | 16.91 | Автономные исследовательские процессы |
Вывод: наибольшая сила — практическое использование инструментов, а не изолированное автодополнение кода. Результат 65.8 на Terminal-Bench поддерживает сценарии терминальных агентов, а 56.1 на SWE-Bench Pro указывает на полезные возможности на уровне репозиториев. Гораздо более низкий исследовательский балл напоминает, что сбор доказательств и цитирование нужно тестировать отдельно.
Мультимодальные результаты

Официальный график бенчмарков по изображению, видео и мультимодальным агентам Xiaomi MiMo.
| Официальный мультимодальный бенчмарк | Заявленный балл | Что проверяется |
|---|---|---|
| CharXiv RQ | 81.0 | Аналитика диаграмм и документов |
| MMMU-Pro | 77.9 | Экспертное мультимодальное рассуждение |
| HR-Bench 4K | 88.5 | Понимание изображений высокого разрешения |
| OmniDocBench | 87.2 | Понимание документов |
| Claw-Eval Multimodal | 23.8 | Завершение задач мультимодальным агентом |
| Video-MME | 87.7 | Понимание видео |
| DailyOmni | 83.5 | Повседневное аудиовизуальное рассуждение |
| VideoHolmes | 64.0 | Темпоральное рассуждение по видео |
Вывод: наиболее сильны понимание документов, изображений высокого разрешения и видео. Балл 23.8 на мультимодальном агенте заметно ниже, чем показатели восприятия, поэтому систему, которая должна и понимать медиа, и надёжно управлять инструментами, следует оценивать end-to-end.
MiMo-V2.5 против MiMo-V2.5-Pro: многомерное сравнение
| Официальное сравнение архитектуры | MiMo-V2.5 | MiMo-V2.5-Pro Official Pro specifications Official Pro benchmarks | Практический вывод |
|---|---|---|---|
| Общие параметры | 310B | 1.02T | Pro имеет более чем 3× общую ёмкость |
| Активируемые параметры | 15B | 42B | Pro использует примерно в 2.8× больше активных параметров |
| Слои / маршрутизируемые эксперты | 48 / 256 | 70 / 384 | Pro — более крупная цель для сервинга |
| Лимит контекста в карточке модели | 1M | 1M | Обе указывают до 1M токенов; тестируйте извлечение и задержки на вашем размере нагрузки |
| Максимальный вывод в офиц. API | 128K | 128K | Обе текущие страницы API Xiaomi указывают 128K; лимиты провайдера могут отличаться |
| Нативный ввод | Текст, изображение, видео, аудио | Текст | MiMo-V2.5 — документированный выбор для мультимодальности; уточните точный endpoint Pro перед отправкой медиа |
| SWE-Bench Pro | 56.1 | 57.2 | Преимущество Pro — 1.1 пункта |
| Terminal-Bench 2.0 | 65.8 | 68.4 | Преимущество Pro — 2.6 пункта |
| Основное назначение | Эффективные мультимодальные агенты | Сложный кодинг и длинные агентные траектории | Выбирайте по проверенной нагрузке; отрыв на уровне модели не доказывает общий качественный перевес |
Результат сравнения: преимущество Pro в бенчмарках скромное по двум общим тестам кодинг-агентов, тогда как стандартный вариант добавляет нативный ввод изображений, видео и аудио и использует значительно меньше активных параметров. Pro оправдан, когда небольшие приросты в сложных задачах ценнее, чем мультимодальный ввод и более низкая удельная стоимость.
Сколько стоят MiMo-V2.5 и MiMo-V2.5-Pro?
| База цен: 27 мая 2026 | Официальный стандартный API | Официальный API Pro | MiMo-V2.5 API в CometAPI | MiMo-V2.5-Pro API в CometAPI |
|---|---|---|---|---|
| Вход, промах кэша / MTok | $0.14 | $0.435 | $0.112 | $0.348 |
| Выход / MTok | $0.28 | $0.87 | $0.224 | $0.696 |
| Вход, попадание кэша / MTok | $0.0028 | $0.0036 | Проверьте текущий биллинг | Проверьте текущий биллинг |
| Скидка к офиц. цене без кэша | Базовая | Базовая | 20% | 20% |
По официальным тарифам, Pro стоит примерно в 3.1× дороже стандартной за вход и выход без кеша. Показанные цены провайдера снижают каждую пару без кеша на 20%, но относительный разрыв между вариантами практически не меняется.
Цена за токен — не полная стоимость. Повторы вызовов инструментов, размер контекста, длина вывода, задержки, восстановление после ошибок и человеческая проверка определяют стоимость за выполненную задачу. Прогоните репрезентативный сэмпл нагрузки перед выбором модели по умолчанию для продакшна.
Для чего лучше всего подходит MiMo-V2.5?
- Мультимодальные агенты: объединять скриншоты, документы, видео, аудио, инструкции и инструменты в одном процессе.
- Анализ длинных документов: обрабатывать репозитории, контракты, исследовательские архивы, логи и истории саппорта.
- Понимание медиа: суммировать видео, извлекать события, интерпретировать диаграммы и отвечать на аудиовизуальные вопросы.
- Кодинг и терминальные агенты: инспектировать файлы, выполнять команды, модифицировать код и итеративно работать с тестами.
- Массовая автоматизация: использовать разрежённую активацию и более низкую стоимость токенов для повторяющихся производственных задач.
Ограничения и риски
- На токен активируется только 15B параметров, но для самохостинга всё равно требуется система с полными весами 310B.
- Мультимодальный вывод — текст; генерация изображений, речи и видео требует других моделей.
- Потолок контекста 1M не гарантирует равномерную точность извлечения по всей длине окна.
- Бенчмарки издателя могут не переноситься на ваши инструменты, репозитории, подсказки или ограничения безопасности.
- Экспонирование модальности на уровне провайдера может отличаться от полной способности базовой открытой модели.
Производственный допуск:
валидируйте точность, завершение вызовов инструментов, задержки, потребление токенов, обработку модальностей и поведение фолбэков на репрезентативных задачах, прежде чем направлять трафик.
Пример API
Следующий пример на Python использует совместимую с OpenAI конечную точку CometAPI и идентификатор стандартной модели. Подтвердите текущий endpoint и поддерживаемую схему запроса перед развёртыванием.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
response = client.chat.completions.create(
model="mimo-v2.5",
max_tokens=256,
messages=[
{
"role": "user",
"content": "Суммируйте основные выводы этого технического отчёта.",
}
],
)
print(response.choices[0].message.content)
Руководство по выбору
| Признаки нагрузки | Начните с | Переключайтесь, когда |
|---|---|---|
| Изображения, видео или аудио — ключевой ввод | Standard | Не переключайтесь, если приемлема предобработка мультимодальности |
| Большой объём документов или смешанных медиа | Standard | Pro только если сбои в рассуждениях доминируют в стоимости |
| Сложная инженерия репозиториев | Тестируйте обе | Выберите Pro, если её прирост окупает 3.1× удельную стоимость |
| Длинные автономные терминальные траектории | Pro | Возвращайтесь к стандартной, если прироста не видно |
| Массовая рутинная автоматизация | Standard | Эскалируйте только упавшие или высокоценные задачи |
Рекомендуемая маршрутизация:
используйте стандартную как дефолт для мультимодальных и массовых задач, а сложные текст-ориентированные или длинные траектории направляйте в Pro. Это сохраняет возможности при контроле общей стоимости.
Заключение
Стандартная модель — это не просто уменьшенная Pro. Это отдельная точка оптимизации: нативный мультимодальный ввод, контекст 1M, сильные бенчмарки по инструментам и 15B активных параметров по гораздо более низкой цене за токен.
Pro — специализированный вариант для сложной разработки ПО и длительного автономного выполнения. Её дополнительная ёмкость даёт измеримый, но не универсальный прирост, поэтому наилучшая схема развёртывания — маршрутизация по типу нагрузки, а не выбор одной версии для каждого запроса.
FAQ
Открыта ли стандартная модель?
Её веса опубликованы под лицензией MIT, допускающей коммерческое использование, модификацию, дообучение и распространение в рамках условий лицензии.
Сколько параметров она использует?
Разрежённая MoE содержит 310B общих параметров и активирует 15B на токен. Активные параметры описывают вычисления на токен, а не размер хранилища для полной модели.
Поддерживает ли она изображения, видео и аудио?
Да. Стандартный вариант принимает текст, изображения, видео и аудио и возвращает текст. В официальной спецификации варианта Pro указан текстовый ввод.
Каково максимальное окно контекста?
Обе карточки модели указывают окно контекста до 1M токенов. Текущие страницы API Xiaomi указывают максимум 128K вывода для MiMo-V2.5 и MiMo-V2.5-Pro. Фактические лимиты могут отличаться по endpoint’у, провайдеру, аккаунту и формату запроса; подтвердите задействованный маршрут перед тем, как полагаться на эти потолки.
Текущая официальная страница API для Pro отдельно подтверждает контекст 1M и максимум 128K вывода: MiMo-V2.5-Pro API specifications
Какой вариант лучше для кодинг-агентов?
Pro показывает более высокие результаты на общих бенчмарках по кодингу и терминалу, но отрыв скромный. Тестируйте обе на целевом репозитории и выбирайте по завершённости задач, задержкам и полной стоимости.
Какой вариант лучше для мультимодальных агентов?
Стандартный вариант — естественный выбор, поскольку он нативно принимает изображение, видео и аудио. Pro ориентирован на текстовый ввод.
Как должна выбирать продакшн-команда?
Начните со стандартной, измеряйте сбои и направляйте только те сложные текст-ориентированные задачи, где Pro даёт пользу. Сравнивайте стоимость за выполненную задачу, а не только цену за токен.
