GPT-6.1 Sol are now live on CometAPI →
ai-model/Исследования CometAPI

Что такое MiMo-V2.5? Характеристики, бенчмарки, возможности, цены и доступ к API

Изучите характеристики Xiaomi MiMo-V2.5, архитектуру, официальные бенчмарки, цены, сравнение с MiMo-V2.5-Pro, сценарии использования, ограничения и доступ к CometAPI.

CometAPI
Deon GoodwinКоманда исследователей AI-моделей и API
Обновлено Oct 5, 2026 12 мин. чтения
Что такое MiMo-V2.5? Характеристики, бенчмарки, возможности, цены и доступ к API
Использовать этот подход

Сделайте первый вызов API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Стандартная модель V2.5 от Xiaomi совмещает нативное понимание текста, изображений, видео и аудио с окном контекста на 1 миллион токенов, использованием инструментов и эффективностью разрежённой смеси экспертов (Sparse MoE). Это лучший выбор, когда важны мультимодальный ввод и стоимость на выполненную задачу. Вариант Pro крупнее и сильнее на сложном кодинге и долгих траекториях агентной работы, но ориентирован на текстовый ввод и стоит примерно в три раза дороже за токен по опубликованным тарифам Xiaomi.

Практическое решение простое: выбирайте стандартную модель для мультимодальных агентов, анализа документов и медиа, а также массовой автоматизации; выбирайте Pro, когда узким местом является сложная разработка ПО или длительное автономное выполнение.

Ключевые выводы

  • Стандартная модель использует 310B общих параметров, активируя 15B на токен.
  • Принимает текст, изображения, видео и аудио, возвращает текст.
  • Её API поддерживает контекст 1M, до 128K вывода, вызовы инструментов, веб-поиск, стриминг, структурированный вывод и кеширование контекста.
  • По данным издателя: 65.8 на Terminal-Bench 2.0 и 56.1 на SWE-Bench Pro.
  • Текущая карточка модели Xiaomi MiMo-V2.5-Pro указывает 1.02T общих и 42B активных параметров. Опубликованные издателем результаты SWE-Bench Pro: 56.1 для MiMo-V2.5 и 57.2 для Pro; это устаревшие, заявленные издателем сравнения и не являются гарантией для конкретного рабочего процесса по кодированию.
  • По текущим тарифам Xiaomi, стандартные вход/выход стоят $0.14/$0.28 за миллион токенов; Pro — $0.435/$0.87.
  • Оба API в CometAPI стоят на 20% ниже официальных цен без кеша.
    Проверено: 28 сентября 2026. Цены, бенчмарки, лимиты, доступность и форматы запросов могут меняться. Xiaomi объявила, что официальные имена моделей mimo-v2.5 и mimo-v2.5-pro в API будут выведены из эксплуатации в 10:00 по пекинскому времени 21 октября 2026 без автоматической замены. Планируйте миграцию и подтвердите рабочий маршрут до развёртывания.

Примечание о жизненном цикле API: официальная платформа Xiaomi планирует вывести из эксплуатации оба идентификатора моделей V2.5 21 октября 2026. Это уведомление касается платформы API Xiaomi; отдельно проверьте любой сторонний шлюз. Уведомление Xiaomi о выводе модели

Что представляет собой стандартная модель

MiMo-V2.5 — ориентированная на эффективность базовая модель Xiaomi MiMo для мультимодального восприятия и агентной работы. Она предоставляет нативный ввод текста, изображений, видео и аудио в рамках одной архитектуры и выдаёт текстовый вывод.

Журнал релизов модели Xiaomi датирует публичную бету серии MiMo-V2.5 23 апреля 2026. Веса впоследствии были опубликованы под лицензией MIT. MiMo-V2.5 имеет 310B параметров в сумме, но активирует около 15B на каждый токен; она использует большой пул экспертов, не задействуя всех сразу.

MiMo-V2.5-Pro нацелен на другой тип нагрузки. Это триллион-параметрическая модель с текстовым вводом, спроектированная для наиболее сложного кодинга, терминальных задач и длительных агентных траекторий. Обе версии разделяют максимум контекста 1M, но сильно различаются по модальности, активным вычислениям и цене.

Характеристики и возможности MiMo-V2.5

Официальные сведения об архитектуреЗначениеПочему это важно
АрхитектураРазрежённая MoEБольшая ёмкость экспертов с селективной активацией
Общие / активные параметры310B / 15BАктивные вычисления значительно ниже общей ёмкости
Слои трансформера48: 1 плотный + 47 MoEБольшинство слоёв используют маршрутизируемых экспертов
Маршрутизируемые эксперты256; 8 активных на токенСпециализация без плотного исполнения всех 310B
Внимание39 слоёв SWA + 9 глобальныхБаланс локальной эффективности и дальних зависимостей
Окно SWA128 токеновСнижает нагрузку на кэш в длинном контексте
Контекст / максимум вывода1M / 128K токеновПоддерживает длинные документы и расширенные трассы
Ввод / выводТекст, изображение, видео, аудио / текстНативное восприятие четырёх типов ввода
Визуальный энкодер729M ViT; 28 слоёвПонимание изображений и видео
Аудио-энкодер261M трансформер; 24 слояНативное понимание аудио
Multi-Token Prediction3 модуля; около 329M параметровОбеспечивает эффективность спекулятивного декодирования
Масштаб обученияОколо 48T токеновШирокий текстовый и мультимодальный пайплайн
Возможности APIИнструменты, веб, стриминг, структурированный вывод, кешированиеПроизводственные примитивы для агентов
ЛицензияMITРазрешены коммерческое использование и модификация

Рабочие возможности включают контекст 1M и вывод 128K, плюс опубликованные лимиты 100 запросов в минуту и 10 миллионов токенов в минуту. Лимиты на стороне провайдера могут отличаться по аккаунту и маршруту интеграции.

Что такое MiMo-V2.5? Характеристики, бенчмарки, возможности, цены и доступ к API

Официальная схема архитектуры Xiaomi MiMo. Официальный архитектурный ресурс.

Как устроена архитектура MiMo-V2.5

Разрежённые эксперты: общая ёмкость — это не активные вычисления

Ключевой факт об эффективности — дизайн 310B общих и 15B активных параметров. Маршрутизатор выбирает восемь из 256 экспертов для каждого токена. Это даёт модели доступ к гораздо большему пулу параметров, чем у обычной плотной 15B-модели, без необходимости исполнять все 310B каждый раз.

Это не делает самохостинг тривиальным. Полные веса всё равно нужно хранить и распространять, поэтому ёмкость памяти, пропускная способность межсоединений, маршрутизация экспертов и серверное ПО остаются существенными ограничениями.

Гибридное внимание для длинного контекста

Бэкбон чередует внимание с скользящим окном и глобальное внимание в соотношении 5:1 между SWA и глобальными слоями. Тридцать девять локальных слоёв ограничивают рост кэша, в то время как девять глобальных слоёв сохраняют передачу информации на больших расстояниях. Xiaomi сообщает почти шестикратное сокращение KV-кэша по сравнению с полностью глобальным дизайном.

Максимум 1M токенов — это ёмкость, а не гарантированная точность. Качество извлечения, задержки, рост состояния инструментов и внимание к далёким фрагментам доказательств требуют оценивания под конкретную нагрузку.

Нативные энкодеры и агентные функции

Визуальный трансформер на 729M параметров обрабатывает изображения и видео; аудио-трансформер на 261M параметров обрабатывает аудио. Проекционные модули отображают оба потока в языковой бэкбон, позволяя одному агенту комбинировать скриншот, фрагмент видео, аудиотрек, текстовые инструкции и результаты инструментов.

Три модуля Multi-Token Prediction поддерживают спекулятивное декодирование и эффективность обучения с подкреплением. Модель обучалась на около 48T токенов, причём контекст постепенно расширяли до 1M на этапах посттренинга.

Открытые веса находятся под лицензией MIT. Коммерческое развёртывание разрешено, но стоимость инфраструктуры и сторонние зависимости требуют отдельной проверки.

Бенчмарки MiMo-V2.5: кодинг, агенты и мультимодальные результаты

Примечание о бенчмарках:

приведённые ниже показатели заявлены издателем. Они служат ориентиром, но не гарантируют результат для конкретного репозитория, формата медиа, стека инструментов, целевых задержек или политики безопасности.

Результаты по кодингу и агентам

Что такое MiMo-V2.5? Характеристики, бенчмарки, возможности, цены и доступ к API

Официальный график бенчмарков по кодингу и агентам Xiaomi MiMo.

Официальный бенчмарк по кодингуЗаявленный баллСигнал для решения
MiMo Coding Bench71.8Широкие возможности кодинг-агента
Claw-Eval Text62.3Общее завершение текстовых агентов
Terminal-Bench 2.065.8Интерактивное исполнение в терминале
SWE-Bench Pro56.1Реальная инженерия ПО на репозиториях
Claw-Eval Multi-Turn63.2Более длинная многошаговая работа агента
ResearchClawBench16.91Автономные исследовательские процессы

Вывод: наибольшая сила — практическое использование инструментов, а не изолированное автодополнение кода. Результат 65.8 на Terminal-Bench поддерживает сценарии терминальных агентов, а 56.1 на SWE-Bench Pro указывает на полезные возможности на уровне репозиториев. Гораздо более низкий исследовательский балл напоминает, что сбор доказательств и цитирование нужно тестировать отдельно.

Мультимодальные результаты

Что такое MiMo-V2.5? Характеристики, бенчмарки, возможности, цены и доступ к API

Официальный график бенчмарков по изображению, видео и мультимодальным агентам Xiaomi MiMo.

Официальный мультимодальный бенчмаркЗаявленный баллЧто проверяется
CharXiv RQ81.0Аналитика диаграмм и документов
MMMU-Pro77.9Экспертное мультимодальное рассуждение
HR-Bench 4K88.5Понимание изображений высокого разрешения
OmniDocBench87.2Понимание документов
Claw-Eval Multimodal23.8Завершение задач мультимодальным агентом
Video-MME87.7Понимание видео
DailyOmni83.5Повседневное аудиовизуальное рассуждение
VideoHolmes64.0Темпоральное рассуждение по видео

Вывод: наиболее сильны понимание документов, изображений высокого разрешения и видео. Балл 23.8 на мультимодальном агенте заметно ниже, чем показатели восприятия, поэтому систему, которая должна и понимать медиа, и надёжно управлять инструментами, следует оценивать end-to-end.

MiMo-V2.5 против MiMo-V2.5-Pro: многомерное сравнение

Официальное сравнение архитектурыMiMo-V2.5MiMo-V2.5-Pro
Official Pro specifications
Official Pro benchmarks
Практический вывод
Общие параметры310B1.02TPro имеет более чем 3× общую ёмкость
Активируемые параметры15B42BPro использует примерно в 2.8× больше активных параметров
Слои / маршрутизируемые эксперты48 / 25670 / 384Pro — более крупная цель для сервинга
Лимит контекста в карточке модели1M1MОбе указывают до 1M токенов; тестируйте извлечение и задержки на вашем размере нагрузки
Максимальный вывод в офиц. API128K128KОбе текущие страницы API Xiaomi указывают 128K; лимиты провайдера могут отличаться
Нативный вводТекст, изображение, видео, аудиоТекстMiMo-V2.5 — документированный выбор для мультимодальности; уточните точный endpoint Pro перед отправкой медиа
SWE-Bench Pro56.157.2Преимущество Pro — 1.1 пункта
Terminal-Bench 2.065.868.4Преимущество Pro — 2.6 пункта
Основное назначениеЭффективные мультимодальные агентыСложный кодинг и длинные агентные траекторииВыбирайте по проверенной нагрузке; отрыв на уровне модели не доказывает общий качественный перевес

Результат сравнения: преимущество Pro в бенчмарках скромное по двум общим тестам кодинг-агентов, тогда как стандартный вариант добавляет нативный ввод изображений, видео и аудио и использует значительно меньше активных параметров. Pro оправдан, когда небольшие приросты в сложных задачах ценнее, чем мультимодальный ввод и более низкая удельная стоимость.

Сколько стоят MiMo-V2.5 и MiMo-V2.5-Pro?

База цен: 27 мая 2026Официальный стандартный APIОфициальный API ProMiMo-V2.5 API в CometAPIMiMo-V2.5-Pro API в CometAPI
Вход, промах кэша / MTok$0.14$0.435$0.112$0.348
Выход / MTok$0.28$0.87$0.224$0.696
Вход, попадание кэша / MTok$0.0028$0.0036Проверьте текущий биллингПроверьте текущий биллинг
Скидка к офиц. цене без кэшаБазоваяБазовая20%20%

По официальным тарифам, Pro стоит примерно в 3.1× дороже стандартной за вход и выход без кеша. Показанные цены провайдера снижают каждую пару без кеша на 20%, но относительный разрыв между вариантами практически не меняется.

Цена за токен — не полная стоимость. Повторы вызовов инструментов, размер контекста, длина вывода, задержки, восстановление после ошибок и человеческая проверка определяют стоимость за выполненную задачу. Прогоните репрезентативный сэмпл нагрузки перед выбором модели по умолчанию для продакшна.

Для чего лучше всего подходит MiMo-V2.5?

  • Мультимодальные агенты: объединять скриншоты, документы, видео, аудио, инструкции и инструменты в одном процессе.
  • Анализ длинных документов: обрабатывать репозитории, контракты, исследовательские архивы, логи и истории саппорта.
  • Понимание медиа: суммировать видео, извлекать события, интерпретировать диаграммы и отвечать на аудиовизуальные вопросы.
  • Кодинг и терминальные агенты: инспектировать файлы, выполнять команды, модифицировать код и итеративно работать с тестами.
  • Массовая автоматизация: использовать разрежённую активацию и более низкую стоимость токенов для повторяющихся производственных задач.

Ограничения и риски

  • На токен активируется только 15B параметров, но для самохостинга всё равно требуется система с полными весами 310B.
  • Мультимодальный вывод — текст; генерация изображений, речи и видео требует других моделей.
  • Потолок контекста 1M не гарантирует равномерную точность извлечения по всей длине окна.
  • Бенчмарки издателя могут не переноситься на ваши инструменты, репозитории, подсказки или ограничения безопасности.
  • Экспонирование модальности на уровне провайдера может отличаться от полной способности базовой открытой модели.

Производственный допуск:

валидируйте точность, завершение вызовов инструментов, задержки, потребление токенов, обработку модальностей и поведение фолбэков на репрезентативных задачах, прежде чем направлять трафик.

Пример API

Следующий пример на Python использует совместимую с OpenAI конечную точку CometAPI и идентификатор стандартной модели. Подтвердите текущий endpoint и поддерживаемую схему запроса перед развёртыванием.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Суммируйте основные выводы этого технического отчёта.",
        }
    ],
)

print(response.choices[0].message.content)

Руководство по выбору

Признаки нагрузкиНачните сПереключайтесь, когда
Изображения, видео или аудио — ключевой вводStandardНе переключайтесь, если приемлема предобработка мультимодальности
Большой объём документов или смешанных медиаStandardPro только если сбои в рассуждениях доминируют в стоимости
Сложная инженерия репозиториевТестируйте обеВыберите Pro, если её прирост окупает 3.1× удельную стоимость
Длинные автономные терминальные траекторииProВозвращайтесь к стандартной, если прироста не видно
Массовая рутинная автоматизацияStandardЭскалируйте только упавшие или высокоценные задачи

Рекомендуемая маршрутизация:

используйте стандартную как дефолт для мультимодальных и массовых задач, а сложные текст-ориентированные или длинные траектории направляйте в Pro. Это сохраняет возможности при контроле общей стоимости.

Заключение

Стандартная модель — это не просто уменьшенная Pro. Это отдельная точка оптимизации: нативный мультимодальный ввод, контекст 1M, сильные бенчмарки по инструментам и 15B активных параметров по гораздо более низкой цене за токен.

Pro — специализированный вариант для сложной разработки ПО и длительного автономного выполнения. Её дополнительная ёмкость даёт измеримый, но не универсальный прирост, поэтому наилучшая схема развёртывания — маршрутизация по типу нагрузки, а не выбор одной версии для каждого запроса.

FAQ

Открыта ли стандартная модель?

Её веса опубликованы под лицензией MIT, допускающей коммерческое использование, модификацию, дообучение и распространение в рамках условий лицензии.

Сколько параметров она использует?

Разрежённая MoE содержит 310B общих параметров и активирует 15B на токен. Активные параметры описывают вычисления на токен, а не размер хранилища для полной модели.

Поддерживает ли она изображения, видео и аудио?

Да. Стандартный вариант принимает текст, изображения, видео и аудио и возвращает текст. В официальной спецификации варианта Pro указан текстовый ввод.

Каково максимальное окно контекста?

Обе карточки модели указывают окно контекста до 1M токенов. Текущие страницы API Xiaomi указывают максимум 128K вывода для MiMo-V2.5 и MiMo-V2.5-Pro. Фактические лимиты могут отличаться по endpoint’у, провайдеру, аккаунту и формату запроса; подтвердите задействованный маршрут перед тем, как полагаться на эти потолки.

Текущая официальная страница API для Pro отдельно подтверждает контекст 1M и максимум 128K вывода: MiMo-V2.5-Pro API specifications

Какой вариант лучше для кодинг-агентов?

Pro показывает более высокие результаты на общих бенчмарках по кодингу и терминалу, но отрыв скромный. Тестируйте обе на целевом репозитории и выбирайте по завершённости задач, задержкам и полной стоимости.

Какой вариант лучше для мультимодальных агентов?

Стандартный вариант — естественный выбор, поскольку он нативно принимает изображение, видео и аудио. Pro ориентирован на текстовый ввод.

Как должна выбирать продакшн-команда?

Начните со стандартной, измеряйте сбои и направляйте только те сложные текст-ориентированные задачи, где Pro даёт пользу. Сравнивайте стоимость за выполненную задачу, а не только цену за токен.

Продолжить обучение

Свяжите эту статью со следующим решением.

Посмотреть все темы
Опубликовано Oct 5, 2026
Последнее обновление Oct 5, 2026
0 просмотров
Проверено на ясность, указание источников и актуальную терминологию API.

Читать далее