Especificaciones técnicas de MiMo-V2.5
| Especificación | MiMo-V2.5 |
|---|---|
| Model ID | mimo-v2.5 |
| Proveedor | Xiaomi MiMo |
| Tipo de modelo | Modelo base nativo omnimodal |
| Arquitectura | Mezcla dispersa de expertos (MoE) |
| Parámetros totales | 310B |
| Parámetros activados | 15B |
| Ventana de contexto | 1M tokens |
| Salida máxima | 128K tokens |
| Modalidades de entrada | Texto, Imagen, Video, Audio |
| Salida | Texto |
| Codificador de visión | ViT con 729M parámetros |
| Codificador de audio | Transformer de audio con 261M parámetros |
| Llamada a herramientas, búsqueda web, salida estructurada, streaming, caché de contexto | Sí |
| Licencia | MIT |
La arquitectura 310B/15B es especialmente importante. MiMo-V2.5 no es un modelo de 15B en el sentido convencional; 15B es el número de parámetros activados por token, mientras que el MoE completo contiene 310B parámetros. El modelo usa 256 expertos enrutados y activa ocho expertos por token.
¿Qué es MiMo-V2.5?
MiMo-V2.5 es el modelo multimodal de próxima generación de Xiaomi, diseñado específicamente para la percepción omnimodal y aplicaciones agénticas.
A diferencia de un LLM convencional solo de texto, MiMo-V2.5 entiende de forma nativa imágenes, videos, audio y texto. Xiaomi lo posiciona para escenarios de agentes de largo contexto y multimodales, en los que el modelo necesita percibir información, razonar sobre ella y posteriormente usar herramientas o realizar acciones.
Hay también una consideración importante de la versión actual para desarrolladores: Xiaomi descontinuó los modelos MiMo-V2 anteriores el 30 de junio de 2026, recomendando la migración a la serie V2.5.
Esto convierte a mimo-v2.5 en el ID de modelo pertinente para nuevas integraciones, en lugar de los anteriores mimo-v2-pro, mimo-v2-omni o mimo-v2-flash.
¿Cuáles son las principales características de MiMo-V2.5?
Comprensión omnimodal nativa
La característica definitoria de MiMo-V2.5 es que la multimodalidad está integrada directamente en el modelo.
Acepta:
- Texto
- Imágenes
- Video
- Audio
Esto permite a los desarrolladores crear aplicaciones que razonan a través de múltiples tipos de información en lugar de procesar cada modalidad por separado y pasar los resultados a un LLM de texto. Xiaomi describe esto como percepción omnimodal nativa.
Un ejemplo práctico es un agente de análisis de video que recibe un video largo junto con una pista de audio y una pregunta textual, luego identifica eventos, explica lo que sucedió y produce una respuesta estructurada.
Ventana de contexto de 1M tokens
MiMo-V2.5 admite 1 millón de tokens de contexto y hasta 128K tokens de salida.
Esto hace que el modelo sea particularmente interesante para:
- Análisis de documentos extensos
- Comprensión de videos largos
- Programación a nivel de repositorio
- Sesiones de investigación prolongadas
- Agentes de múltiples pasos
- Conversaciones extendidas
- Grandes bases de conocimiento empresariales
El contexto de 1M no es meramente una cifra de marketing. Xiaomi identifica específicamente el seguimiento de videos largos, el análisis de documentos extensos y el razonamiento temporal prolongado como cargas de trabajo objetivo.
Uso agéntico de herramientas
MiMo-V2.5 admite llamadas a funciones, búsqueda web, salida estructurada y streaming.
Esto lo hace sustancialmente más útil para aplicaciones de agentes que un modelo limitado a la generación de texto.
Un flujo de trabajo típico puede ser:
Percibir → Razonar → Buscar → Llamar herramienta → Analizar resultado → Continuar
Esto es particularmente útil para agentes de investigación, asistentes de programación, agentes de soporte al cliente y automatización multimodal.
Eficiencia MoE dispersa
MiMo-V2.5 utiliza una arquitectura MoE dispersa de 310B parámetros con solo 15B parámetros activados por token.
Su columna vertebral contiene 48 capas, incluyendo 39 capas de atención de ventana deslizante y nueve capas de atención completa. El diseño híbrido pretende hacer que el contexto muy largo sea más manejable computacionalmente.
La distinción importante para los desarrolladores es que el recuento de parámetros activados no debe interpretarse como requisitos totales de memoria. El autoalojamiento de un modelo de 310B parámetros sigue siendo una tarea de infraestructura considerable.
Atención híbrida de ventana deslizante
MiMo-V2.5 combina atención de ventana deslizante con atención global.
Su arquitectura usa una ventana SWA de 128 tokens, con 39 capas SWA y nueve capas de atención completa.
Esta elección arquitectónica es particularmente relevante para la capacidad de contexto de 1M tokens del modelo, porque mantener atención completa en todas las capas haría la inferencia de contexto largo significativamente más costosa.
Predicción multitoken
MiMo-V2.5 incluye tres capas MTP con aproximadamente 329M parámetros. El diseño MTP está destinado a mejorar la eficiencia de la inferencia mediante decodificación especulativa y a admitir un entrenamiento de aprendizaje por refuerzo más eficiente.
¿Cómo rinde MiMo-V2.5 en benchmarks?
MiMo-V2.5 ha publicado resultados de benchmarks que abarcan codificación, agentes de terminal, agentes de investigación y tareas de agentes multimodales. La model card actual en Hugging Face reporta los siguientes resultados:
| Benchmark | MiMo-V2.5 | Enfoque de evaluación |
|---|---|---|
| SWE-Bench Pro | 56.1 | Ingeniería de software |
| Terminal-Bench 2.0 | 65.8 | Tareas de terminal/agente |
| Claw-Eval General | 62.1 Pass³% | Capacidad general de agente |
| Claw-Eval Multimodal | 23.8 Pass³% | Capacidad de agente multimodal |
| Claw-Eval Multi-Turn | 63.2 Pass³% | Agentes multi-turno |
| ResearchClawBench | 16.91 | Tareas de agente de investigación |
Estas cifras deben interpretarse con cautela.
El resultado de 56.1 en SWE-Bench Pro indica una capacidad significativa en ingeniería de software, mientras que el 65.8 en Terminal-Bench 2.0 es particularmente relevante para agentes que interactúan con terminales y entornos de desarrollo.
Al mismo tiempo, la diferencia entre la puntuación general de Claw-Eval (62.1) y la puntuación multimodal (23.8) es una advertencia útil: un rendimiento general fuerte de agente no significa automáticamente un rendimiento igualmente fuerte en cada tarea de agente multimodal.
Para la evaluación en producción, los desarrolladores deberían probar su propia carga de trabajo en lugar de confiar en un único número de leaderboard.
¿Cómo se compara MiMo-V2.5 con MiMo-V2.5-Pro?
MiMo-V2.5 y MiMo-V2.5-Pro pertenecen a la misma generación V2.5 pero tienen diferentes objetivos de optimización.
| Especificación | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| Parámetros totales | 310B | 1.02T |
| Parámetros activados | 15B | 42B |
| Contexto | 1M | 1M |
| Entrada multimodal | Texto/Imagen/Video/Audio | Enfocado en agentes |
| Posicionamiento principal | Agentes omnimodales | Agentes complejos y programación |
| Expertos enrutados | 256 | 384 |
| Expertos/token | 8 | 8 |
| Capas LLM | 48 | 70 |
| Capas MTP | 3 | 3 |
La distinción es sencilla:
Elige MiMo-V2.5 para comprensión multimodal nativa y agentes eficientes de propósito general. Elige MiMo-V2.5-Pro para los trabajos más difíciles de razonamiento, programación y cargas de agentes de largo horizonte.
La guía de selección de modelos de Xiaomi recomienda mimo-v2.5 específicamente para comprender contenido de imagen, audio y video, mientras que recomienda mimo-v2.5-pro para razonamiento complejo y procesamiento de documentos largos.
Casos de uso de MiMo-V2.5
Agentes de IA multimodales
MiMo-V2.5 puede servir como el modelo central para agentes que necesitan inspeccionar documentos, imágenes, videos y audio antes de decidir qué acción tomar.
Análisis de documentos de largo contexto
La ventana de contexto de 1M lo hace adecuado para analizar:
- Grandes colecciones de documentos legales
- Documentación técnica
- Archivos de investigación
- Grandes bases de código
- Bases de conocimiento empresariales
Agentes de programación
Los benchmarks de agentes del modelo y sus capacidades de uso de herramientas lo hacen adecuado para asistentes de programación que necesitan inspeccionar repositorios, razonar sobre errores, ejecutar herramientas e iterar soluciones.
Comprensión de video
En lugar de tratar la generación de video como su propósito principal, MiMo-V2.5 utiliza el video como modalidad de entrada para comprensión.
Las aplicaciones potenciales incluyen:
- Resumen de videos
- Preguntas y respuestas sobre videos largos
- Búsqueda de videos
- Detección de eventos
- Análisis de videos educativos
- Análisis de grabaciones de seguridad
Asistentes audiovisuales
Dado que el modelo acepta tanto información de audio como visual, los desarrolladores pueden crear asistentes capaces de interpretar instrucciones habladas junto con contexto visual.
Agentes autónomos de larga duración
La combinación de contexto largo y entrenamiento agéntico hace que MiMo-V2.5 sea adecuado para flujos de trabajo donde el modelo debe mantener estado a lo largo de muchos pasos intermedios en lugar de completar una tarea en una sola respuesta.
Limitaciones de MiMo-V2.5
Las especificaciones de MiMo-V2.5 son impresionantes, pero conviene prestar atención a varias limitaciones prácticas.
En primer lugar, 1M de contexto no significa que toda aplicación vaya a lograr un rendimiento óptimo en la ventana máxima. La inferencia de largo contexto aún implica consideraciones significativas de memoria, ancho de banda y latencia.
En segundo lugar, el modelo es un sistema MoE muy grande. Aunque solo se activan 15B parámetros por token, el modelo completo contiene aproximadamente 310B parámetros, lo que hace que el autoalojamiento sea considerablemente más exigente que ejecutar un modelo denso pequeño.
En tercer lugar, el rendimiento en benchmarks multimodales puede variar significativamente según la tarea. Los resultados de Claw-Eval muestran una puntuación multimodal mucho más baja que la puntuación general de agente, lo que refuerza la necesidad de pruebas específicas por aplicación.
Por último, el ecosistema del modelo es aún más nuevo que los ecosistemas maduros en torno a GPT, Claude y Gemini. Por lo tanto, los desarrolladores deben evaluar las herramientas, la compatibilidad con proveedores, el comportamiento de la salida estructurada y la fiabilidad de las llamadas a herramientas antes de utilizarlo en sistemas de producción de misión crítica.
Cómo usar la API de MiMo-V2.5 en CometAPI
MiMo-V2.5 es particularmente adecuado para una plataforma de agregación de API porque sigue patrones de API compatibles con ecosistemas LLM establecidos. La propia Xiaomi proporciona acceso API compatible con OpenAI y Anthropic.
Con CometAPI, la integración puede seguir el mismo flujo de trabajo básico utilizado para otros modelos compatibles.
Paso 1: Obtener una clave de API de CometAPI
Crea o inicia sesión en tu cuenta de CometAPI y obtén tu clave de API.
import os
COMETAPI_KEY = os.environ["COMETAPI_KEY"]
Paso 2: Configurar el modelo MiMo-V2.5
Establece el modelo en:
mimo-v2.5
y utiliza el endpoint de API compatible de CometAPI.
El endpoint exacto y el esquema de solicitud deben verificarse con la documentación actual del modelo/API de CometAPI antes del despliegue.
Paso 3: Crear flujos de trabajo multimodales y de agentes
El uso más interesante de mimo-v2.5 no es un simple chat de texto. Los desarrolladores pueden combinar su razonamiento multimodal con herramientas externas para crear flujos de trabajo como:
Entrada del usuario → comprensión de imagen/video/audio → razonamiento → llamada a herramienta → análisis del resultado → siguiente acción
Esto hace que el modelo sea particularmente atractivo para agentes de investigación autónomos, agentes de programación, sistemas de soporte al cliente multimodales y asistentes empresariales de largo contexto.
¿Por qué usar MiMo-V2.5 a través de CometAPI?
MiMo-V2.5 es especialmente útil en un entorno de API multimodelo porque los desarrolladores pueden querer compararlo con GPT, Claude, Gemini, DeepSeek u otros modelos de agentes sin construir una pila de infraestructura separada para cada proveedor.
CometAPI puede ser útil cuando tu aplicación necesita:
- Una capa de API unificada
- Acceso a múltiples familias de modelos de IA
- Cambio de modelo más sencillo
- Gestión centralizada de claves de API
- Comparación rápida de modelos
- Una única capa de integración para experimentación y producción
Para equipos que evalúan el rendimiento de agentes frente al costo de inferencia, MiMo-V2.5 vale la pena probarlo junto con los modelos insignia más costosos, en lugar de asumir que el modelo propietario más grande será automáticamente la mejor opción.