TL;DR
API MiMo‑V2.5 в CometAPI предоставляет доступ к разреженной модели типа mixture-of-experts от Xiaomi для задач программирования, мультимодального понимания и агентных нагрузок. Маршрут MiMo‑V2.5 — практичный выбор, когда проекту нужен контекст на 1 миллион токенов, нативный мультимодальный ввод и низкая стоимость токенов; MiMo‑V2.5 Pro лучше подходит, когда сложное кодирование, рассуждение или долгосрочное использование инструментов важнее цены. В этом руководстве показано, как вызывать API через CometAPI, использовать стриминг ответов, строить мультимодальные запросы, оценивать стоимость и укреплять продакшен‑интеграцию.
Ключевые выводы
- Модель MiMo‑V2.5 использует 310B общих параметров с 15B активных параметров на токен и поддерживает контекстное окно на 1M токенов.
- Используйте маршрут MiMo‑V2.5 для мультимодальных задач, анализа с большим контекстом и бюджетных агентов; выберите MiMo‑V2.5 Pro для самых сложных задач программирования и рассуждения.
- Совместимая с OpenAI конечная точка упрощает миграцию, но в продакшене всё равно нужны таймауты, ретраи, бюджеты токенов и проверка возможностей на стороне провайдера.
- По указанным тарифам CometAPI запрос с 10,000 входных токенов и 2,000 выходных токенов обойдётся примерно в $0.001568 на маршруте MiMo‑V2.5.
Обзор модели MiMo‑V2.5
Xiaomi представила модель 22 апреля 2026 года. API MiMo‑V2.5 в CometAPI предоставляет её через совместимый с OpenAI интерфейс chat-completions, поэтому существующие клиенты обычно могут мигрировать, изменив базовый URL, ключ API и идентификатор модели.
Согласно официальной карточке модели, модель сочетает языковую основу на базе разреженной MoE со специализированными энкодерами для зрения и аудио. Она принимает на вход текст, изображения, видео и аудио, а на выходе генерирует текст. Большое контекстное окно полезно для ревью кода на уровне репозитория, наборов документов, длинных транскриптов и многошаговых агентов.
| Спецификация | Значение | Почему это важно |
|---|---|---|
| Архитектура | Sparse mixture of experts | Активирует ограниченную часть сети для каждого токена. |
| Всего параметров | 310B | Обеспечивает широкую ёмкость без использования всех параметров. |
| Активных параметров | 15B | Поддерживает эффективный инференс относительно общего размера. |
| Контекстное окно | 1,000,000 tokens | Обрабатывает большие репозитории и длинные коллекции документов. |
| Максимальный вывод | Up to 128K tokens through the current route | Поддерживает длинные отчёты и расширенную генерацию кода. |
| Нативные входы | Text, image, video, audio | Позволяет строить единые мультимодальные процессы. |
| Модальность вывода | Text | Ответы возвращаются в виде сгенерированного текста. |
| Визуальный энкодер | 729M-parameter ViT | Обрабатывает визуальный контент для задач с изображениями/видео. |
| Аудиоэнкодер | 261M-parameter Transformer | Обрабатывает речь и другой аудиоконтент. |
| Лицензия | MIT | Разрешает широкое коммерческое и исследовательское использование. |
Официальное изображение ниже показывает результаты по задачам понимания изображений, мультимодальных агентов и понимания видео.

Официальное сравнение мультимодальных бенчмарков Xiaomi MiMo‑V2.5
Маршруты провайдеров могут поддерживать более узкий набор медиаформатов, чем базовая модель. Перед выпуском мультимодальной функции проверьте точные форматы изображений, аудио и видео, поддерживаемые активной конечной точкой.
Производительность MiMo‑V2.5 в бенчмарках
Xiaomi сообщает высокие результаты в задачах кодирования, работы в терминале и мультимодальных агентов. Эти цифры полезны для позиционирования модели, но не заменяют тесты на ваших собственных промптах, инструментах, целевых задержках и сценариях отказов.
| Бенчмарк | Сообщённый результат | Фокус оценки |
|---|---|---|
| SWE-Bench Pro | 56.1 | Инжиниринг ПО на уровне репозитория |
| Terminal-Bench 2.0 | 65.8 | Агентные задачи в терминале |
| Claw-Eval General | 62.1 Pass@3 | Общая агентная способность |
| Claw-Eval Multimodal | 23.8 Pass@3 | Мультимодальные агентные задачи |
| Claw-Eval Multi-Turn | 63.2 Pass@3 | Многоходовое поведение агента |
| ResearchClawBench | 16.91 | Исследовательские агентные процессы |
Официальное сравнение по кодированию показывает 65.8 на Terminal‑Bench 2.0 и 56.1 на SWE‑Bench Pro, а также позиционирует модель в более широком сравнении кодирующих агентов.

Официальное сравнение бенчмарков по кодированию Xiaomi MiMo‑V2.5
Что подсказывают результаты: модель особенно привлекательна для приложений, которые объединяют код, инструменты и смешанные медиа. Для детерминированных продакшен‑решений проведите внутреннюю оценку, измеряющую успех задач, использование токенов, сквозную задержку, частоту ретраев и долю ручных исправлений.
MiMo‑V2.5 vs MiMo‑V2.5 Pro: многомерное сравнение
| Измерение | MiMo‑V2.5 | MiMo‑V2.5‑Pro |
|---|---|---|
| Всего параметров | 310B | 1.02T |
| Активных параметров | 15B | 42B |
| Контекстное окно | 1M tokens | 1M tokens |
| Основная сила | Омнимодальные и общие агентные нагрузки | Сложные агенты и требовательное кодирование |
| Цена входа за 1M токенов | $0.112 | $0.348 |
| Цена выхода за 1M токенов | $0.224 | $0.696 |
| Лучшее применение | Мультимодальные, большой контекст, чувствительность к цене | Жёсткое рассуждение, кодирование и длинные цепочки действий |
| Официальные входные модальности API | Text, image, video, audio | Text |
| Официальная выходная модальность API | Text | Text |
Результат сравнения: начинайте с маршрута MiMo‑V2.5, когда решение определяется стоимостью, пропускной способностью или покрытием по мультимодальности. Переводите отдельные запросы на MiMo‑V2.5 Pro, если внутренние оценки показывают ощутимый прирост точности в сложных задачах кодирования, рассуждения или использования инструментов. Многоуровневый роутер часто обеспечивает лучший баланс цена/качество, чем отправка каждого запроса на MiMo‑V2.5 Pro.
Как вызывать API MiMo‑V2.5
API следует знакомой схеме chat-completions. Храните ключ на сервере, подгружайте его из переменной окружения и никогда не встраивайте в браузерный или мобильный код.
Установите ключ API
export COMETAPI_KEY="your_api_key_here"
$env:COMETAPI_KEY = "your_api_key_here"
### Отправьте запрос через cURL
curl https://api.cometapi.com/v1/chat/completions
-H "Authorization: Bearer $COMETAPI_KEY"
-H "Content-Type: application/json"
-d '{
"model": "mimo-v2.5",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Explain the bug and propose a minimal patch."}
],
"temperature": 0.2
}'
### Используйте Python с SDK OpenAI
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="mimo-v2.5",
messages=[
{"role": "system", "content": "You are a precise engineering assistant."},
{"role": "user", "content": "Review this migration plan for hidden risks."},
],
temperature=0.2,
)
print(response.choices[0].message.content)
> Не логируйте ключи API, полные заголовки авторизации или чувствительное содержимое промптов. В продакшене используйте менеджер секретов и регулярно ротируйте учётные данные.
## Как стримить ответы API MiMo‑V2.5
Стриминг снижает воспринимаемую задержку для длинных ответов. Сервис возвращает инкрементальные события, которые SDK отдаёт чанками.
stream = client.chat.completions.create(
model="mimo-v2.5",
messages=[{"role": "user", "content": "Draft a safe database migration checklist."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
В веб‑сервисе пересылайте дельты через Server‑Sent Events или WebSocket, обрабатывайте отключения клиента и останавливайте генерацию на апстриме при отмене со стороны пользователя.
## Мультимодальные и структурированные сценарии API MiMo‑V2.5
Для задач с анализом изображения отправляйте текстовую инструкцию плюс объект изображения в одном сообщении пользователя. Точный поддерживаемый формат медиа может различаться в зависимости от маршрута провайдера, поэтому воспринимайте это как шаблон полезной нагрузки и подтверждайте поддержку на активном маршруте.
{
"model": "mimo-v2.5",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Extract the visible error and suggest the next diagnostic step."},
{"type": "image_url", "image_url": {"url": "https://example.com/error.png"}}
]
}
]
}
Для машинно‑читаемого вывода запросите компактный JSON‑объект и валидируйте его по вашей схеме. Никогда не предполагайте, что сгенерированный JSON безопасен только потому, что он парсится.
import json
raw = response.choices[0].message.content
result = json.loads(raw)
required = {"summary", "risks", "next_action"}
missing = required - result.keys()
if missing:
raise ValueError(f"Missing fields: {sorted(missing)}")
## Тарифы API MiMo‑V2.5 в CometAPI и контроль стоимости
| Маршрут | Вход за 1M токенов | Выход за 1M токенов | Пример для 100 запросов |
| ----------------------------- | ------------------ | ------------------- | ----------------------- |
| MiMo‑V2.5 | $0.112 | $0.224 | $0.1568 |
| MiMo‑V2.5 Pro | $0.348 | $0.696 | $0.4872 |
| Референс Xiaomi pay‑as‑you‑go | $0.14 | $0.28 | $0.1960 |
В примере предполагается 100 запросов, каждый с 10,000 входных токенов и 2,000 выходных токенов. При таких допущениях маршрут MiMo‑V2.5 примерно на 68% дешевле MiMo‑V2.5 Pro. Опубликованные [тарифы Xiaomi по модели pay‑as‑you‑go](https://platform.xiaomimimo.com/docs/zh-CN/integration/roocode) служат полезной точкой отсчёта, тогда как фактические счета следует сверять с активной ценой у провайдера перед развёртыванием.
MiMo-V2.5 input: 100 × 10,000 / 1,000,000 × $0.112 = $0.1120
MiMo-V2.5 output: 100 × 2,000 / 1,000,000 × $0.224 = $0.0448
MiMo-V2.5 total: $0.1568
Pro input: 100 × 10,000 / 1,000,000 × $0.348 = $0.3480
Pro output: 100 × 2,000 / 1,000,000 × $0.696 = $0.1392
Pro total: $0.4872
Контролируйте расходы ограничениями на максимальный вывод, сжатием промптов, кэшированием контекста, классификацией запросов и роутером, который эскалирует только сложные задачи. Отслеживайте стоимость на успешную задачу, а не на запрос; более дешёвый запрос, который часто проваливается, может оказаться дороже в итоге.
## Как проектировать запросы к MiMo‑V2.5 с длинным контекстом
Окно в 1M токенов расширяет возможные входы, но не снимает компромиссы поиска и внимания. Стройте промпт так, чтобы модель быстро находила релевантные доказательства.
* Разместите задачу, контракт на вывод и критерии решений в начале.
* Разделяйте документы стабильными идентификаторами и понятными разделителями.
* Включайте только те доказательства, которые могут повлиять на ответ.
* Попросите модель ссылаться на идентификаторы документов или номера строк в результате.
* Измеряйте точность по мере роста контекста; не считайте максимальный контекст идеальным.
> Длинный контекст увеличивает и стоимость токенов, и риск того, что нерелевантный материал отвлечёт модель. Извлечение, суммирование и иерархическое промпт‑проектирование остаются важными, даже если весь корпус помещается.
## Надёжность в продакшене
### Повторяйте только при временных сбоях
Повторяйте при лимитах скорости и временных сбоях сервера с экспоненциальной задержкой и джиттером. Не повторяйте автоматически при невалидной аутентификации, некорректной полезной нагрузке или политических ошибках.
import random
import time
def delay_for(attempt: int) -> float:
return min(30.0, (2 ** attempt) + random.random())
for attempt in range(5):
try:
result = call_model()
break
except TransientAPIError:
if attempt == 4:
raise
time.sleep(delay_for(attempt))
### Установите операционные ограничители
* Используйте таймауты соединения и общего запроса.
* Присваивайте идемпотентные ключи рабочим процессам с внешними побочными эффектами.
* Записывайте идентификатор модели, задержку, входные и выходные токены, число ретраев и финальный статус.
* Удаляйте секреты и персональные данные перед логированием.
* Требуйте allowlist инструментов и подтверждение для деструктивных действий.
* Держите запасную модель или очередь на случай отключения провайдера.
## Типовые ошибки API MiMo‑V2.5 и решения
| Симптом | Вероятная причина | Рекомендованное действие |
| ------------- | --------------------------------------------- | ---------------------------------------------------------------- |
| 401 или 403 | Отсутствует, недействителен или неавторизован ключ API | Проверьте серверный секрет и права проекта. |
| 400 | Неверно сформированные сообщения или неподдерживаемый медиаобъект | Проверьте JSON и подтвердите поддержку полезной нагрузки для маршрута. |
| 413 | Слишком большой запрос | Уменьшите размер медиа или разделите вход. |
| 429 | Лимит скорости или квоты | Бэк‑офф с джиттером и клиентские ограничения параллелизма. |
| 5xx | Временный сбой провайдера | Повтор в разумных пределах или переключение. |
| Медленный ответ | Большой контекст, длинный вывод или задержка инструментов | Стримьте вывод, ограничивайте токены и профилируйте каждый этап. |
| Невалидный JSON | Дрифт генерации | Валидируйте, безопасно чините один раз и отклоняйте повторные сбои. |
## Выводы
MiMo‑V2.5 — лучший отправной вариант для команд, которым нужны мультимодальный ввод, большой контекст и жёсткий контроль стоимости. Pro должен быть осознанным путём эскалации для задач, где измеримый прирост качества оправдывает более высокую цену. Начните с небольшого набора оценивания, инструментируйте каждый запрос и продвигайте интеграцию только после тестов на реальных payload’ах, долгом контексте, обработке ретраев и восстановлении после сбоев.
## FAQ
### Какую конечную точку использовать?
Используйте `/api.cometapi.com/v1/chat/completions` или задайте `/api.cometapi.com/v1` как базовый URL в совместимом с OpenAI SDK.
### Какой идентификатор модели указывать?
Используйте `mimo-v2.5` для маршрута MiMo‑V2.5. Перед запуском подтвердите актуальный идентификатор, если в вашей учётной записи используется псевдоним провайдера.
### Когда выбирать MiMo‑V2.5 Pro?
Выбирайте MiMo‑V2.5 Pro, когда ваши оценки показывают существенное преимущество в сложных задачах кодирования, рассуждения или долгих цепочках использования инструментов. Оставляйте рутинный или мультимодальный трафик на маршруте MiMo‑V2.5, если его качества достаточно.
### Означает ли контекст в 1M токенов, что нужно отправлять всё?
Нет. Большой контекст — это предельная ёмкость, а не цель промпта. Извлекайте и упорядочивайте только те доказательства, которые могут повлиять на ответ, затем измеряйте качество и стоимость по мере роста входа.
### Можно ли вызывать API прямо из браузера?
Не раскрывайте секретный ключ API во фронтенд‑коде. Вызывайте провайдера с бэкенда и применяйте там аутентификацию, лимиты, логирование и контроль данных.
### Как проверить поддержку мультимодальности?
Протестируйте точную медиа‑полезную нагрузку на активном маршруте провайдера. Нативные модальности базовой модели не гарантируют, что каждый маршрут одинаково поддерживает все форматы.
