GPT-6.1 Sol are now live on CometAPI →
ai-model/Investigación de CometAPI

¿Qué es MiMo-V2.5? Especificaciones, pruebas comparativas, características, precios y acceso a la API

Explora las especificaciones de Xiaomi MiMo‑V2.5, la arquitectura, los benchmarks oficiales, los precios, la comparación con MiMo‑V2.5‑Pro, los casos de uso, las limitaciones y el acceso a CometAPI.

CometAPI
Deon GoodwinEquipo de investigación de modelos de IA y API
Actualizado Oct 5, 2026 14 min de lectura
¿Qué es MiMo-V2.5? Especificaciones, pruebas comparativas, características, precios y acceso a la API
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

El modelo estándar V2.5 de Xiaomi combina comprensión nativa de texto, imágenes, video y audio con una ventana de contexto de 1 millón de tokens, uso de herramientas y eficiencia de Mixture-of-Experts disperso. Es la mejor opción cuando importan la entrada multimodal y el costo por tarea completada. La variante Pro es más grande y sólida para trabajos exigentes de programación y agentes de largo horizonte, pero se centra en entrada de texto y cuesta aproximadamente el triple por token según las tarifas publicadas por Xiaomi.

La decisión práctica es sencilla: elige el modelo estándar para agentes multimodales, análisis de documentos y medios, y automatización de alto volumen; elige Pro cuando el cuello de botella sea ingeniería de software difícil o ejecución autónoma sostenida.

Key Takeaways

  • El modelo estándar usa 310B parámetros totales y activa 15B por token.
  • Acepta texto, imágenes, video y audio, y devuelve texto.
  • Su API admite contexto de 1M, hasta 128K de salida, llamadas a herramientas, búsqueda web, streaming, salida estructurada y caché de contexto.
  • Resultados informados por el publicador incluyen 65.8 en Terminal-Bench 2.0 y 56.1 en SWE-Bench Pro.
  • La model card actual de Xiaomi para MiMo-V2.5-Pro lista 1.02T parámetros totales y 42B activos. Las puntuaciones de SWE-Bench Pro listadas por el publicador son 56.1 para MiMo-V2.5 y 57.2 para Pro; son comparaciones con fecha, informadas por el publicador, no una garantía para un flujo de trabajo de programación específico.
  • A las tarifas actuales de Xiaomi, los costos de entrada/salida del estándar son $0.14/$0.28 por millón de tokens; Pro cuesta $0.435/$0.87.
  • Ambas APIs en CometAPI tienen un precio 20% por debajo del par oficial sin caché.
    Información verificada: September 28, 2026. Los precios, benchmarks, límites, disponibilidad y formatos de solicitud pueden cambiar. Xiaomi ha anunciado que los nombres de modelo oficiales mimo-v2.5 y mimo-v2.5-pro de su API serán desaprobados a las 10:00 hora de Beijing el October 21, 2026, sin reemplazo automático. Planifica la migración y confirma la ruta activa antes del despliegue.

Nota sobre el ciclo de vida de la API: la plataforma oficial de Xiaomi planea retirar ambos IDs de modelos V2.5 el October 21, 2026. Este aviso concierne a la plataforma de API de Xiaomi; verifica cualquier gateway de terceros por separado. Aviso de desaprobación de modelos de Xiaomi

What the Standard Model Is

MiMo-V2.5 es el modelo base de Xiaomi MiMo orientado a la eficiencia para percepción multimodal y trabajo de agentes. Proporciona entrada nativa de texto, imágenes, video y audio dentro de una única arquitectura y produce salida de texto.

El registro de lanzamientos del modelo de Xiaomi fecha la beta pública de la serie MiMo-V2.5 al April 23, 2026. Los pesos se publicaron posteriormente bajo la licencia MIT. MiMo-V2.5 tiene 310B parámetros en total, pero activa solo unos 15B por token; usa un gran conjunto de especialistas sin ejecutarlos todos a la vez.

MiMo-V2.5-Pro apunta a una carga de trabajo diferente. Es un modelo de un billón de parámetros, con entrada de texto, diseñado para las tareas más difíciles de programación, terminal y agentes de larga duración. Las dos variantes comparten un contexto máximo de 1M pero difieren marcadamente en modalidad, cómputo activo y precio.

MiMo-V2.5 Specifications and Features

Official architecture detailsValueWhy it matters
ArchitectureSparse MoEGran capacidad de expertos con activación selectiva
Total / active parameters310B / 15BEl cómputo activo está muy por debajo de la capacidad total
Transformer layers48: 1 dense + 47 MoELa mayoría de capas usan expertos enrutados
Routed experts256; 8 active per tokenEspecialización sin ejecutar densamente 310B
Attention39 SWA + 9 global layersEquilibra eficiencia local y flujo a largo alcance
SWA window128 tokensReduce la presión de caché en contextos largos
Context / maximum output1M / 128K tokensAdmite documentos largos y trazas extendidas
Input / outputText, image, video, audio / textPercepción nativa en cuatro tipos de entrada
Vision encoder729M ViT; 28 layersComprensión de imágenes y video
Audio encoder261M transformer; 24 layersComprensión nativa de audio
Multi-Token Prediction3 modules; about 329M parametersAdmite eficiencia de decodificación especulativa
Training scaleAbout 48T tokensAmplia canalización de entrenamiento textual y multimodal
API capabilitiesTools, web, streaming, structured output, cachingPrimitivas de agente orientadas a producción
LicenseMITSe permite uso y modificación comercial

El entorno operativo incluye contexto de 1M y salida de 128K, además de límites publicados de 100 solicitudes por minuto y 10 millones de tokens por minuto. Los límites a nivel de proveedor pueden diferir por cuenta y ruta de integración.

¿Qué es MiMo-V2.5? Especificaciones, pruebas comparativas, características, precios y acceso a la API

Diagrama oficial de arquitectura de Xiaomi MiMo. Recurso oficial de arquitectura.

How MiMo-V2.5 Architecture Works

Sparse Experts: Total Capacity Is Not Active Compute

El hecho central de eficiencia es el diseño de 310B totales y 15B activos. El enrutador selecciona ocho de 256 expertos para cada token. Eso le da al modelo acceso a un conjunto de parámetros mucho mayor que un modelo denso convencional de 15B sin ejecutar todos los 310B parámetros cada vez.

Esto no hace trivial el autoalojamiento. Los pesos completos aún deben almacenarse y distribuirse, por lo que la capacidad de memoria, el ancho de banda de interconexión, el enrutamiento de expertos y el software de servicio siguen siendo limitaciones materiales.

Hybrid Attention for Long Context

El tronco intercala atención de ventana deslizante y global en una relación SWA:global de 5:1. Treinta y nueve capas locales controlan el crecimiento de la caché, mientras que nueve capas globales preservan el flujo de información a larga distancia. Xiaomi reporta casi una reducción de seis veces en la caché KV frente a un diseño totalmente global.

Un máximo de 1M tokens es capacidad, no precisión garantizada. La calidad de recuperación, la latencia, el crecimiento del estado de herramientas y la atención sobre evidencia distante aún requieren evaluación específica por carga de trabajo.

Native Encoders and Agent Features

Un transformador de visión de 729M parámetros maneja entradas de imágenes y video; un transformador de audio de 261M parámetros maneja audio. Los proyectores mapean ambos flujos al tronco de lenguaje, permitiendo que un único agente combine una captura de pantalla, un segmento de video, una pista de audio, instrucciones de texto y resultados de herramientas.

Tres módulos de predicción de múltiples tokens admiten decodificación especulativa y eficiencia de aprendizaje por refuerzo. El modelo fue entrenado en alrededor de 48T tokens, con el contexto ampliado progresivamente a 1M durante el posentrenamiento.

Los pesos abiertos usan una licencia MIT. Se permite el despliegue comercial, pero el costo de infraestructura y las dependencias de terceros aún requieren revisión separada.

MiMo-V2.5 Benchmarks: Coding, Agents, and Multimodal Results

Nota de benchmark:

las cifras a continuación son informadas por el publicador. Son evidencia direccional, no una garantía para un repositorio específico, formato de medios, pila de herramientas, objetivo de latencia o política de seguridad.

Coding and Agent Results

¿Qué es MiMo-V2.5? Especificaciones, pruebas comparativas, características, precios y acceso a la API

Gráfico oficial de benchmarks de programación y agentes de Xiaomi MiMo.

Official coding benchmarkReported scoreDecision signal
MiMo Coding Bench71.8Capacidad amplia de agentes de programación
Claw-Eval Text62.3Compleción general de agentes de texto
Terminal-Bench 2.065.8Ejecución interactiva en terminal
SWE-Bench Pro56.1Ingeniería de software en el mundo real
Claw-Eval Multi-Turn63.2Trabajo de agentes multietapa más largo
ResearchClawBench16.91Flujos de trabajo de investigación autónomos

Resultado: el caso más sólido es el uso práctico de herramientas más que la simple finalización de código. Un resultado de 65.8 en Terminal-Bench respalda agentes orientados a terminal, mientras que 56.1 en SWE-Bench Pro sugiere capacidad útil a nivel de repositorio. La puntuación de investigación mucho más baja recuerda que se debe probar por separado la recopilación de evidencia y el comportamiento de citación.

Multimodal Results

¿Qué es MiMo-V2.5? Especificaciones, pruebas comparativas, características, precios y acceso a la API

Gráfico oficial de benchmarks de imagen, video y agentes multimodales de Xiaomi MiMo.

Official multimodal benchmarkReported scoreCapability tested
CharXiv RQ81.0Razonamiento sobre gráficos y documentos
MMMU-Pro77.9Razonamiento multimodal a nivel experto
HR-Bench 4K88.5Comprensión de imágenes de alta resolución
OmniDocBench87.2Comprensión de documentos
Claw-Eval Multimodal23.8Compleción de agentes multimodales
Video-MME87.7Comprensión de video
DailyOmni83.5Razonamiento audiovisual cotidiano
VideoHolmes64.0Razonamiento temporal en video

Resultado: las fortalezas más claras son la comprensión de documentos, imágenes de alta resolución y video. La puntuación de 23.8 en agentes multimodales es mucho más baja que las de percepción, por lo que un sistema que deba tanto entender medios como operar herramientas de forma fiable debe evaluarse de extremo a extremo.

MiMo-V2.5 vs MiMo-V2.5-Pro: Multi-Dimensional Comparison

Official architecture comparisonMiMo-V2.5MiMo-V2.5-Pro
Official Pro specifications
Official Pro benchmarks
Practical implication
Total parameters310B1.02TPro tiene más de 3× la capacidad total
Activated parameters15B42BPro usa ~2.8× más parámetros activos
Layers / routed experts48 / 25670 / 384Pro es un objetivo de servicio más grande
Model-card context ceiling1M1MAmbos listan hasta 1M tokens; prueba recuperación y latencia al tamaño de tu carga
Official API maximum output128K128KLas páginas actuales de la API de Xiaomi listan 128K; los límites específicos pueden variar
Native inputText, image, video, audioTextMiMo-V2.5 es la opción multimodal documentada; verifica el endpoint Pro exacto antes de enviar medios
SWE-Bench Pro56.157.2Pro lidera por 1.1 puntos
Terminal-Bench 2.065.868.4Pro lidera por 2.6 puntos
Primary fitEfficient multimodal agentsComplex coding and long-horizon agentsElige según la carga probada; los márgenes a nivel de modelo no prueban una ventaja general

Resultado de la comparación: la ventaja de Pro en benchmarks compartidos de agentes de programación es modesta, mientras que la variante estándar añade entrada nativa de imagen, video y audio y usa muchos menos parámetros activos. Pro se justifica cuando pequeñas ganancias en tareas difíciles valen más que la entrada multimodal y el menor costo unitario.

How Much Do MiMo-V2.5 and MiMo-V2.5-Pro Cost?

Price basis: May 27, 2026Official standard APIOfficial Pro APIMiMo-V2.5 API in CometAPIMiMo-V2.5-Pro API in CometAPI
Input, cache miss / MTok$0.14$0.435$0.112$0.348
Output / MTok$0.28$0.87$0.224$0.696
Input, cache hit / MTok$0.0028$0.0036Check live billingCheck live billing
Discount vs official uncached rateBaselineBaseline20%20%

A tarifas oficiales, Pro cuesta alrededor de 3.1× más que el estándar tanto para entrada como salida sin caché. Los precios del proveedor mostrados arriba reducen cada par sin caché en 20%, pero la brecha relativa entre variantes permanece esencialmente igual.

El precio por token no es el costo total. Reintentos de herramientas, tamaño de contexto, longitud de salida, latencia, recuperación de tareas fallidas y revisión humana determinan el costo por tarea completada. Ejecuta una muestra de carga representativa antes de seleccionar un modelo de producción por defecto.

What Is MiMo-V2.5 Best For?

  • Agentes multimodales: combina capturas de pantalla, documentos, video, audio, instrucciones y herramientas en un solo flujo.
  • Análisis de documentos largos: procesa repositorios, contratos, archivos de investigación, registros y historiales de soporte.
  • Comprensión de medios: resume videos, extrae eventos, interpreta gráficos y responde preguntas audiovisuales.
  • Agentes de programación y terminal: inspecciona archivos, ejecuta comandos, modifica código e itera sobre resultados de pruebas.
  • Automatización de alto volumen: usa activación dispersa y precios de tokens más bajos para tareas de producción repetidas.

Limitations and Risks

  • Solo 15B parámetros se activan por token, pero el autoalojamiento aún requiere el sistema completo de 310B pesos.
  • La salida multimodal es texto; la generación de imágenes, voz y video requiere otros modelos.
  • Un techo de contexto de 1M no garantiza precisión uniforme en toda la ventana.
  • Los benchmarks del publicador pueden no transferirse a herramientas, repositorios, prompts o restricciones de seguridad personalizados.
  • La exposición de modalidades por parte del proveedor puede diferir de la capacidad completa del modelo de pesos abiertos subyacente.

Puerta de producción:

valida precisión, finalización de llamadas a herramientas, latencia, consumo de tokens, manejo de modalidades y comportamiento de fallback en tareas representativas antes de comprometer tráfico.

API Example

El siguiente ejemplo en Python usa un endpoint de CometAPI compatible con OpenAI y el ID del modelo estándar. Confirma el endpoint actual y el esquema de solicitud admitido antes del despliegue.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "Summarize the main findings in this technical report.",
        }
    ],
)

print(response.choices[0].message.content)

Decision Guide

Workload signalStart withSwitch when
Images, video, or audio are first-class inputsStandardNo cambies salvo que el preprocesamiento multimodal sea aceptable
Large document or mixed-media volumeStandardPro solo si los fallos de razonamiento dominan el costo
Difficult repository engineeringTest bothElige Pro si su ganancia en finalización compensa el costo unitario 3.1×
Long autonomous terminal trajectoriesProVuelve al estándar si las ganancias no son medibles
High-volume routine automationStandardEscala solo tareas fallidas o de alto valor

Recomendación de enrutamiento:
usa el estándar como predeterminado para trabajo multimodal y de alto volumen, y enruta solo las tareas difíciles orientadas a texto o de largo horizonte a Pro. Esto preserva la capacidad mientras controla el costo total.

Conclusion

El modelo estándar no es simplemente un Pro más pequeño. Es un punto de optimización distinto: entrada multimodal nativa, contexto de 1M, sólidos benchmarks orientados a herramientas y 15B parámetros activos a un precio por token mucho más bajo.

Pro es la opción especialista para ingeniería de software difícil y ejecución autónoma sostenida. Su capacidad adicional produce ganancias medibles pero no universales, por lo que el patrón de despliegue más sólido es el enrutamiento basado en carga de trabajo en lugar de seleccionar una variante para cada solicitud.

FAQ

Is the standard model open source?

Sus pesos se publican bajo la licencia MIT, lo que permite uso comercial, modificación, fine-tuning y redistribución sujetos a los términos de la licencia.

How many parameters does it use?

El MoE disperso contiene 310B parámetros totales y activa 15B por token. Los parámetros activos describen el cómputo por token, no el tamaño de almacenamiento del modelo completo.

Does it support images, video, and audio?

Sí. La variante estándar acepta texto, imágenes, video y audio y devuelve texto. La especificación oficial de la variante Pro lista entrada de texto.

What is the maximum context window?

Ambas model cards especifican una ventana de contexto de hasta 1M tokens. Las páginas actuales de la API de Xiaomi listan una salida máxima de 128K para MiMo-V2.5 y MiMo-V2.5-Pro. Los límites utilizables reales pueden variar según el endpoint, proveedor, cuenta y formato de solicitud; verifica la ruta desplegada antes de depender de esos techos.

La página actual de la API oficial de Pro confirma por separado el contexto de 1M y una salida máxima de 128K: MiMo-V2.5-Pro API specifications

Which variant is better for coding agents?

Pro reporta resultados más altos en benchmarks compartidos de programación y terminal, pero el margen es modesto. Prueba ambos en el repositorio objetivo y elige según finalización de tareas, latencia y costo total.

Which variant is better for multimodal agents?

La variante estándar es la elección natural porque acepta nativamente entrada de imágenes, video y audio. Pro se centra en entrada de texto.

How should a production team choose?

Comienza con el estándar, mide fallos y enruta solo las tareas difíciles orientadas a texto que se beneficien de Pro. Compara el costo por tarea completada en lugar del precio por token únicamente.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Oct 5, 2026
Última actualización Oct 5, 2026
0 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

Leer Más