TLDR El 27 de septiembre de 2026, MiniMax lanzó de forma discreta pero oficial M3.1-Flash-Preview dentro de MiniMax Code (y vía Token Plan). Es un modelo de programación multimodal de vanguardia con una ventana de contexto completa de 1M de tokens, compatibilidad nativa con entrada de texto/imagen/video y un nuevo control de esfuerzo de razonamiento de cinco niveles (low → max). Posicionado explícitamente para los flujos de trabajo de desarrollo cotidianos—desde la corrección de errores hasta la implementación, las pruebas y la entrega—, prioriza la velocidad y la rentabilidad manteniendo el pensamiento siempre activado.
La disponibilidad está actualmente limitada a Token Plan + MiniMax Code (con soporte de API mediante Subscription Key); aún no se han publicado precios públicos completos ni pesos abiertos. CometAPI ya expone el modelo (minimax-m3.1-flash-preview) a tarifas competitivas, lo que facilita un acceso unificado.
Puntos clave
- Contexto de 1M tokens + multimodalidad nativa — Maneja grandes bases de código, sesiones largas de agentes, documentos, imágenes y video en una sola ventana.
- Esfuerzo de razonamiento en cinco niveles (low / medium / high / xhigh / max; predeterminado: max) — Permite intercambiar latencia y uso de tokens por una deliberación más profunda bajo demanda. El pensamiento no se puede desactivar.
- Enfoque en la programación cotidiana — Optimizado explícitamente para el ciclo cerrado de localización de errores → implementación → pruebas → entrega dentro de MiniMax Code.
- Limitaciones de la vista previa — Confirmado en MiniMax Code y Token Plan; las llamadas a la API requieren una Subscription Key. No se anunciaron al lanzamiento tarjeta de modelo independiente, benchmarks públicos, pesos abiertos ni precios de pago por uso autónomos.
- Recomendación de CometAPI — Acceso mediante un único endpoint compatible con OpenAI (ID del modelo: minimax-m3.1-flash-preview) con precios con descuento, ideal para equipos que ya usan el catálogo de más de 500 modelos de CometAPI.
¿Qué es MiniMax M3.1-Flash-Preview?
MiniMax M3.1-Flash-Preview es la incorporación más reciente a la serie M de modelos de lenguaje grande de MiniMax. La documentación oficial lo describe como un “modelo de programación multimodal de frontera con ventana de contexto de 1M y profundidad de razonamiento ajustable”. Fue detectado primero por desarrolladores en el selector de modelos de MiniMax Code y confirmado formalmente por la cuenta oficial @MiniMaxAgent en X el 27 de septiembre de 2026:
“El último modelo de texto de MiniMax, M3.1-Flash-Preview, debutó hoy en MiniMax Code. Diseñado para el desarrollo cotidiano, es rápido, confiable y listo para trabajo real, desde arreglos rápidos de errores hasta funciones completas.”
A diferencia de un modelo de chat general, está diseñado específicamente para ingeniería de software y flujos de trabajo agentic. La comunicación de producto de MiniMax enfatiza tareas reales de desarrolladores: arreglos rápidos de errores, implementación de funciones, manejo de casos límite, pruebas de regresión y verificación de cambios. La designación “Flash” señala un foco en la velocidad y la practicidad diaria en relación con el buque insignia MiniMax-M3, manteniendo a la vez el gran contexto y las fortalezas de programación de la familia M3.
El modelo admite:
- Hasta 1,000,000 tokens de contexto — adecuado para repositorios completos, documentos largos y sesiones de agentes multi-paso.
- Entradas multimodales nativas (texto, imágenes y video).
- Razonamiento agentic, invocación de herramientas y ejecución de tareas estructurada.
- Pensamiento profundo siempre activo que puede ajustarse mediante un control de esfuerzo de cinco niveles.
El contenido de pensamiento se devuelve por separado (como reasoning_content en modo compatible con OpenAI o bloques de thinking en modo compatible con Anthropic), manteniendo la respuesta final limpia para su visualización o uso posterior.
Contexto de 1M tokens + orientación a la programación
La especificación técnica destacada es la ventana de contexto de 1,000,000 tokens. Esto coincide con MiniMax-M3 y es mucho mayor que la de la mayoría de modelos de programación competidores. La documentación oficial destaca su idoneidad para:
- Repositorios de código completos
- Sesiones de agentes largas y multi-paso
- Documentos y bases de conocimiento extensos
- Entradas multimodales (texto + imágenes + video) dentro del mismo contexto
Esta capacidad de contexto largo, combinada con multimodalidad nativa, habilita flujos de trabajo que antes requerían una gestión de contexto pesada o sistemas de recuperación externos. Los desarrolladores pueden mantener grandes bases de código, maquetas de diseño, capturas de pantalla de errores y documentación relacionada en una única conversación activa.
El modelo está optimizado explícitamente para escenarios de Agente y programación: invocación de herramientas, salida estructurada y tareas de ingeniería multi-turno. Las cifras de velocidad de salida de modelos relacionados (M3 ≈ 100+ TPS, M2.7-highspeed ≈ 100 TPS) sugieren que las variantes Flash apuntan al extremo superior del espectro de latencia/throughput, aunque no se han publicado números exactos de TPS para M3.1-Flash-Preview.
Esfuerzo de razonamiento en cinco niveles
Una de las novedades más prácticas es la profundidad de razonamiento ajustable controlada por el parámetro effort (compatible con Anthropic) o reasoning_effort (compatible con OpenAI). Los cinco niveles son:
| Level | Typical Use Case | Trade-off |
|---|---|---|
| low | Correcciones simples de sintaxis, consultas rápidas | Menor latencia y uso de tokens |
| medium | Refactorizaciones rutinarias, funciones pequeñas | Equilibrado |
| high | Lógica compleja, cambios en múltiples archivos | Análisis más profundo |
| xhigh | Depuración difícil, decisiones arquitectónicas | Mayor cómputo y latencia |
| max | Problemas de máxima importancia o ambiguos (predeterminado) | Deliberación máxima |
El pensamiento está siempre activado en M3.1-Flash-Preview; intentar desactivarlo devuelve un error 400. Los niveles más altos generan más tokens de razonamiento interno e incrementan la latencia, dando a los desarrolladores un control granular que era menos fino en modelos anteriores de la serie M.
En MiniMax Code, el control aparece como un simple deslizador o selector; vía API se envía en el cuerpo de la solicitud. Este diseño refleja la creciente tendencia del sector a exponer diales de “presupuesto de razonamiento” para ajustar el comportamiento del modelo a la dificultad de la tarea y a las restricciones de coste.
Flujo de trabajo de desarrollo cotidiano
MiniMax posiciona M3.1-Flash-Preview claramente dentro del ciclo diario de los desarrolladores, más que como un modelo puro de investigación o de agentes de largo horizonte. El mensaje oficial y la colocación de producto enfatizan una experiencia de bucle cerrado dentro de MiniMax Code, Arreglo de errores → Implementación → Pruebas → Entrega:
- Localización de errores — Pega trazas de pila, capturas de pantalla de errores o secciones de código relevantes; el modelo puede razonar sobre un gran contexto para identificar causas raíz.
- Implementación — Genera o edita código en múltiples archivos conservando el contexto a nivel de proyecto.
- Pruebas y verificación — Sugiere o escribe pruebas, ejecuta comprobaciones de regresión y analiza el impacto.
- Entrega — Produce diffs limpios, mensajes de commit o documentación lista para revisión.
La combinación de contexto de 1M, entrada multimodal (p. ej., capturas de UI con fallos) y esfuerzo ajustable hace que el modelo sea especialmente efectivo para las tareas frecuentes y sensibles a la latencia que dominan la mayoría de los días de ingeniería. Las promociones por tiempo limitado que acompañan el lanzamiento (créditos dobles por check-in diario del 28 de septiembre al 7 de octubre UTC+8 y reinicios de cuota de Token Plan) fomentan aún más las pruebas en entornos reales.
Disponibilidad actual y limitaciones de la vista previa
Confirmado a finales de septiembre de 2026:
- Seleccionable dentro de MiniMax Code (selector de modelos junto a M3, M2.7, etc.).
- Disponible vía Token Plan / Subscription Key.
- Documentado en las páginas oficiales de referencia de la API de MiniMax con ejemplos compatibles con OpenAI y Anthropic.
- Profundidad de pensamiento controlable mediante
reasoning_efforto campos equivalentes. - Actividad promocional: reinicios de cuota de Token Plan y puntos dobles de check-in (del 28 de septiembre al 7 de octubre) utilizables en el nuevo modelo.
Ruta de API confirmada: La documentación oficial lista el nombre del modelo MiniMax-M3.1-Flash-Preview y proporciona endpoints compatibles con Anthropic (https://api.minimax.io/anthropic) y OpenAI (https://api.minimax.io/v1). Se requiere una Subscription Key (Token Plan). Los parámetros de ejemplo incluyen output_config.effort o reasoning_effort. El contenido de pensamiento se devuelve por separado (bloques thinking o reasoning_content).
Aún limitado o sin confirmar:
- Conjunto completo e independiente de benchmarks públicos y tarjeta de modelo con recuento de parámetros.
- Página de precios de pago por uso independiente con la misma transparencia que MiniMax-M3.
- Pesos abiertos (no anunciados para esta vista previa).
El estado de vista previa implica que funciones, cuotas y precios pueden cambiar. Los desarrolladores deben tratar el rendimiento actual como indicativo y no definitivo.
Cómo acceder a MiniMax M3.1-Flash-Preview
1. Dentro de MiniMax Code (lo más fácil para uso interactivo)
Descarga o abre MiniMax Code (aplicaciones de escritorio disponibles para macOS y Windows). Selecciona M3.1-Flash-Preview en el selector de modelos y ajusta el nivel de razonamiento. Las promociones de check-in diario pueden duplicar los créditos gratuitos hasta principios de octubre de 2026.
2. API oficial de MiniMax (Token Plan)
- Obtén una Subscription Key desde la consola de MiniMax.
- Usa el SDK de Anthropic o OpenAI cambiando
base_urly estableciendomodel="MiniMax-M3.1-Flash-Preview". - Pasa el nivel de esfuerzo deseado.
3. Vía CometAPI (recomendado para equipos multi-modelo)
CometAPI ya lista minimax-m3.1-flash-preview en su catálogo (con 20% de descuento visible en el momento de escribir esto). Dado que CometAPI expone un endpoint compatible con OpenAI (https://api.cometapi.com/v1), las bases de código existentes solo requieren cambiar base_url y la clave de API. Es especialmente conveniente para equipos que ya enrutan GPT, Claude, Gemini, MiniMax-M3 y otros modelos mediante una sola clave y desean observabilidad, facturación y lógica de respaldo consistentes.
Ejemplo (Python / OpenAI SDK vía CometAPI):
from openai import OpenAI
client = OpenAI(
api_key="YOUR_COMETAPI_KEY",
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="minimax-m3.1-flash-preview",
messages=[{"role": "user", "content": "Refactoriza esta función para mayor claridad..."}],
# reasoning_effort o equivalente puede estar soportado según el mapeo de la pasarela
)
El catálogo unificado de CometAPI también incluye MiniMax-M3, la serie M2.7 y los nuevos modelos de video H3, lo que permite alternar sin fricciones entre generación de texto y multimodal bajo una única relación de facturación.
