TLDR MiniMax M3 combine une fenêtre de contexte de 1 000 000 tokens, une compréhension native texte‑image‑vidéo, d’excellentes performances en code et en agent, ainsi que le MiniMax Sparse Attention (MSA). Les développeurs peuvent appeler MiniMax M3 via la passerelle compatible OpenAI de CometAPI à https://api.cometapi.com/v1 avec l’ID de modèle minimax-m3.
Ce guide couvre les spécifications du modèle, les données de benchmark officielles, la configuration de l’API, le streaming, les contrôles de raisonnement, les requêtes multimodales, l’appel d’outils, la tarification et les comparaisons avec d’autres API de pointe 2026.
Points clés
- MiniMax M3 prend en charge jusqu’à 1M de tokens de contexte, permettant du codage à l’échelle d’un dépôt et des sessions d’agent longue durée.
- Le modèle est nativement multimodal dès la première étape d’entraînement et accepte en entrée du texte, des images et des vidéos.
- Son architecture MiniMax Sparse Attention est conçue pour rendre le contexte d’un million de tokens plus praticable en termes de calcul. Les résultats officiels incluent 59.0% sur SWE‑Bench Pro et 66.0% sur Terminal‑Bench 2.1, avec de solides scores d’agent et d’usage d’outils.
- L’API compatible OpenAI de MiniMax prend en charge la pensée adaptative ou désactivée, le streaming, les outils et reasoning_split.
- Sur CometAPI, l’ID de modèle actuel est minimax-m3 et l’endpoint principal est /v1/chat/completions.
Qu’est‑ce que MiniMax M3 ?
MiniMax M3 est conçu autour de trois charges de travail qui définissent de plus en plus les modèles de pointe pour développeurs : l’ingénierie logicielle à grande échelle, l’exécution d’agents autonomes et le raisonnement multimodal long-contexte. MiniMax décrit M3 comme un modèle atteignant des performances de pointe sur les tâches de codage et d’agent tout en combinant contexte 1M, multimodalité native et MSA. Le résultat pratique est un modèle moins axé sur des tours de chat isolés que sur des workflows qui accumulent fichiers, résultats d’outils, captures d’écran, modifications de code et états de raisonnement au fil du temps.
M3 est disponible via l’écosystème API de MiniMax et via l’endpoint MiniMax M3 de CometAPI. Pour les développeurs qui utilisent déjà le SDK OpenAI, la voie CometAPI conserve la forme familière Chat Completions tout en facilitant la comparaison de M3 avec les modèles d’Anthropic, Google, Moonshot AI et d’autres fournisseurs.
Spécifications techniques de MiniMax M3
| Specification | MiniMax M3 |
|---|---|
| Provider | MiniMax |
| Official release | June 1, 2026 |
| CometAPI model ID | minimax-m3 |
| Official API model ID | MiniMax-M3 |
| Architecture | MiniMax Sparse Attention (MSA) |
| Context window | Up to 1,000,000 tokens; MiniMax model page notes a guaranteed minimum of 512K |
| Input modalities | Text, image, video |
| Output | Text |
| Reasoning control | thinking.type = adaptive or disabled |
| Tool calling | Supported |
| Streaming | Supported |
| OpenAI-compatible API | Supported |
| CometAPI endpoint | POST /v1/chat/completions |
Les chiffres de contexte et de modalités ci‑dessus sont confirmés dans la documentation API MiniMax, tandis que l’architecture du modèle et son positionnement proviennent de l’annonce officielle M3.
Qu’est‑ce qui distingue MiniMax M3 ?
MiniMax Sparse Attention et contexte 1M
Une fenêtre de contexte d’un million de tokens n’est utile que si l’architecture de service peut la traiter à un coût et une vitesse acceptables. M3 aborde ce problème avec MiniMax Sparse Attention (MSA), qui commence par identifier les blocs KV pertinents, puis effectue une attention clairsemée sur des régions sélectionnées au lieu d’appliquer partout une attention quadratique complète.
MiniMax indique qu’à une longueur de contexte de 1M, M3 utilise environ 1/20 du calcul par token de la génération précédente, avec plus de 9x de pré-remplissage plus rapide et plus de 15x de décodage plus rapide. Ce sont des résultats d’ingénierie rapportés par le fournisseur, plutôt que des mesures de service tierces, mais ils expliquent pourquoi le MSA est central dans la conception long-contexte de M3.

Figure 1. Architecture MiniMax Sparse Attention. Source : Annonce officielle de M3 par MiniMax
Multimodalité native
MiniMax indique que M3 a suivi un entraînement à modalités mixtes dès le départ, plutôt que d’ajouter une couche vision séparée après le pré‑entraînement texte. Dans l’API compatible OpenAI, M3 accepte des parties de contenu texte, image et vidéo. Les images peuvent être fournies avec image_url et les vidéos avec video_url ; les formats d’image pris en charge incluent JPEG, PNG, GIF et WEBP, tandis que les formats vidéo pris en charge incluent MP4, AVI, MOV et MKV.
Pour les développeurs, cela rend un seul modèle utilisable pour des tâches telles que le débogage à partir de captures d’écran, l’interprétation de graphiques, la revue d’UI, l’analyse de documents techniques et la compréhension de vidéos, sans devoir router chaque entrée visuelle via un modèle séparé.
Workflows de codage et d’agents
Le positionnement public le plus fort de M3 n’est pas le chat générique. MiniMax met l’accent sur la correction de bugs, le développement front‑end et back‑end, l’exécution terminal, l’optimisation des performances, l’invocation d’outils et la collaboration sur des horizons longs. Le jeu de benchmarks officiel M3 met donc l’accent sur des benchmarks d’ingénierie logicielle et d’agents plutôt que sur de simples tests académiques de QA.
| Benchmark | Ce que ça teste | MiniMax M3 |
|---|---|---|
| SWE-Bench Pro | Ingénierie logicielle réelle | 59.0% |
| Terminal-Bench 2.1 | Tâches d’agent basées sur terminal | 66.0% |
| SWE-fficiency | Efficacité en ingénierie logicielle | 34.8% |
| KernelBench Hard | Optimisation de kernels GPU | 28.8% |
| MCP Atlas | Capacité d’agent MCP / usage d’outils | 74.2% |
| BrowseComp | Navigation autonome et récupération | 83.5 |
| PostTrainBench | Workflow autonome post‑entraînement | 0.37 |
Pensée configurable
Dans l’API compatible OpenAI de MiniMax, M3 prend en charge un contrôle explicite du raisonnement : la pensée (thinking) peut être réglée sur adaptive ou disabled. Si le champ est omis sur l’endpoint compatible OpenAI de MiniMax, la pensée est activée par défaut. Pour les intégrations en production, définir le champ explicitement est plus sûr car cela facilite la reproduction de la latence et du comportement entre environnements.
Performances d’agent à long horizon
MiniMax a également publié deux études de cas longue durée illustrant l’importance de la conception de contexte de M3. Dans une tâche de reproduction d’article, M3 a fonctionné de manière autonome pendant près de 12 heures, produisant 18 commits et 23 figures expérimentales tout en reproduisant les expériences centrales d’un ICLR 2025 Outstanding Paper. La tâche nécessitait de lire des figures et des formules, d’éditer du code, de suivre des expériences et de conserver un long historique d’exécution.
Dans un exercice séparé d’optimisation de kernels CUDA, MiniMax rapporte 147 soumissions de benchmark et 1 959 appels d’outils sur environ 24 heures, avec une utilisation de crête du matériel Hopper FP8 passant de 7.6% à 71.3%, équivalant à une accélération rapportée de 9.4x. Ce sont des démonstrations contrôlées plutôt que des garanties pour chaque agent de production, mais elles illustrent le cas d’usage visé : des boucles d’outils persistantes où les progrès peuvent n’arriver qu’après de nombreuses itérations.

Pourquoi utiliser l’API MiniMax M3 via CometAPI ?
CometAPI expose M3 via le même environnement API général utilisé pour des centaines d’autres modèles. Cela compte lorsqu’une équipe veut comparer plusieurs fournisseurs, conserver une surface de facturation unique, ou maintenir des routes de repli sans reconstruire l’application autour de chaque SDK spécifique fournisseur.
- Intégration compatible OpenAI : les clients SDK OpenAI existants peuvent être réutilisés en changeant l’URL de base, la clé API et l’ID de modèle.
- Une seule clé pour plusieurs fournisseurs de modèles, facilitant les tests A/B et les routes de repli.
- Suivi centralisé de l’utilisation et des coûts par modèle au lieu de tableaux de bord séparés chez chaque fournisseur.
- Changement de modèle rapide quand une charge de travail nécessite un autre équilibre entre qualité, latence, prise en charge de la modalité ou prix.
La page MiniMax M3 sur CometAPI liste actuellement l’ID de modèle minimax-m3, POST /v1/chat/completions et des exemples de SDK OpenAI.
Comment utiliser l’API MiniMax M3 avec CometAPI
Étape 1 : Créer un compte CometAPI et obtenir une clé API
Créez ou connectez‑vous à votre compte CometAPI, puis générez un jeton API depuis la console des jetons. Stockez le jeton dans une variable d’environnement plutôt que de l’ajouter au contrôle de version.
export COMETAPI_KEY="your-key-here"
Étape 2 : Configurer le client OpenAI
L’URL de base compatible OpenAI de CometAPI est :
https://api.cometapi.com/v1
Installez le SDK OpenAI et pointez le client vers CometAPI :
pip install openai
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
Étape 3 : Faire votre première requête MiniMax M3
Utilisez l’ID de modèle minimax-m3 de CometAPI. Une requête cURL minimale ressemble à ceci :
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-m3",
"messages": [
{
"role": "system",
"content": "You are a precise software engineering assistant."
},
{
"role": "user",
"content": "Review this migration plan and list three high-risk failure modes."
}
],
"max_completion_tokens": 1200,
"reasoning_split": true
}'
Python :
completion = client.chat.completions.create(
model="minimax-m3",
messages=[
{"role": "system", "content": "You are a precise technical assistant."},
{"role": "user", "content": "Explain how sparse attention helps long-context coding agents."},
],
max_completion_tokens=1200,
extra_body={"reasoning_split": True},
)
print(completion.choices[0].message.content)
La page M3 en direct sur CometAPI utilise le même schéma reasoning_split dans son exemple Python. Ce commutateur modifie la façon dont le contenu de raisonnement est renvoyé ; il n’active ni ne désactive la pensée en soi.
Étape 4 : Activer le streaming
Le streaming est utile pour les interfaces de chat, les assistants de codage et les longues complétions, car les utilisateurs voient la sortie au fur et à mesure. La documentation compatible OpenAI de MiniMax confirme la prise en charge du streaming pour M3.
stream = client.chat.completions.create(
model="minimax-m3",
messages=[{"role": "user", "content": "Create a phased plan for migrating a monolith to services."}],
stream=True,
max_completion_tokens=3000,
)
for chunk in stream:
delta = chunk.choices[0].delta
if delta.content:
print(delta.content, end="", flush=True)
Étape 5 : Activer ou désactiver la pensée
MiniMax définit des modes de pensée adaptative et désactivée pour M3. Utilisez la pensée adaptative pour le codage difficile, la planification et les tâches d’agent ; désactivez‑la pour l’extraction simple, la classification ou les réponses sensibles à la latence. Lorsque vous utilisez des champs spécifiques au fournisseur via un routeur compatible OpenAI, validez‑les dans le playground CometAPI avant la production car le comportement de passage peut évoluer.
# Deeper reasoning
completion = client.chat.completions.create(
model="minimax-m3",
messages=[{"role": "user", "content": "Find the root cause of this distributed transaction failure."}],
extra_body={"thinking": {"type": "adaptive"}},
)
# Faster direct answer
completion = client.chat.completions.create(
model="minimax-m3",
messages=[{"role": "user", "content": "Extract the invoice number from this text."}],
extra_body={"thinking": {"type": "disabled"}},
)
Étape 6 : Utiliser une entrée image
L’API compatible OpenAI de M3 accepte les parties de contenu image_url. Le même schéma de contenu typé est la manière naturelle d’envoyer des captures d’écran, diagrammes ou graphiques via une route de type OpenAI.
response = client.chat.completions.create(
model="minimax-m3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Review this dashboard screenshot and identify the likely UI problems."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/dashboard.png",
"detail": "default"
}
}
]
}]
)
MiniMax documente la prise en charge de JPEG, PNG, GIF et WEBP, avec des niveaux de détail d’image low, default ou high. Le fournisseur publie également des limites de taille de requête ; vérifiez donc les dernières limites de l’API multimodale avant d’envoyer de gros assets.
Étape 7 : Utiliser une entrée vidéo
M3 prend également en charge les parties de contenu video_url. MiniMax documente MP4, AVI, MOV et MKV, et prend en charge des vidéos plus volumineuses via son Files API.
response = client.chat.completions.create(
model="minimax-m3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Summarize the workflow in this product demo and list every visible error state."},
{
"type": "video_url",
"video_url": {"url": "mm_file://your_file_id", "detail": "default"}
}
]
}]
)
Si votre application route des requêtes multimodales via CometAPI, confirmez le transport de fichier exact pris en charge par la route M3 active ; l’identifiant provider-natif mm_file:// appartient au workflow Files de MiniMax.
Étape 8 : Ajouter des appels de fonctions et d’outils
MiniMax M3 prend en charge les définitions d’outils dans l’API compatible OpenAI. Un agent de production doit exécuter l’outil demandé, ajouter le message complet d’appel d’outil de l’assistant à l’historique de conversation, puis renvoyer le résultat de l’outil au modèle. MiniMax avertit explicitement que la conservation de la réponse complète est importante pour la continuité du raisonnement.
tools = [{
"type": "function",
"function": {
"name": "get_build_status",
"description": "Get the current CI build status for a repository.",
"parameters": {
"type": "object",
"properties": {
"repo": {"type": "string"},
"branch": {"type": "string"}
},
"required": ["repo", "branch"]
}
}
}]
response = client.chat.completions.create(
model="minimax-m3",
messages=[{"role": "user", "content": "Check whether the main branch of acme/payments is passing CI."}],
tools=tools,
)
Étape 9 : Utiliser le long contexte et le caching d’invite judicieusement
Une fenêtre de contexte de 1M de tokens ne signifie pas que chaque requête devrait en contenir 1M. N’emballez que les fichiers, journaux, documents et sorties d’outil pertinents pour la tâche. Le prompt caching automatique de MiniMax peut réduire le coût et le temps de traitement lorsque des préfixes répétés tels que des invites système, des listes d’outils ou un historique de conversation réapparaissent entre les requêtes.
Pour des agents à l’échelle d’un dépôt, un bon schéma consiste à conserver un résumé de projet stable et un schéma d’outils, à ne récupérer que les fichiers pertinents pour l’étape en cours, et à compresser périodiquement l’historique obsolète plutôt que de laisser la session croître sans limite.
Paramètres importants de l’API MiniMax M3
| Parameter | Purpose | Notes |
|---|---|---|
| model | Model identifier | minimax-m3 on CometAPI; MiniMax-M3 direct |
| messages | Conversation and tool history | Required for Chat Completions |
| max_completion_tokens | Generation length limit | Preferred over legacy max_tokens for new integrations |
| temperature | Sampling randomness | 0-2; MiniMax default 1 |
| top_p | Nucleus sampling | 0-1; MiniMax M3 default 0.95 |
| thinking | Reasoning behavior | adaptive or disabled |
| reasoning_split | Reasoning output format | Separates reasoning fields when enabled |
| stream | Incremental output | Use for interactive applications |
| stream_options.include_usage | Streaming usage metadata | Useful for cost monitoring |
| tools | Function definitions | Use for agent workflows |
| service_tier | Admission priority | standard or priority on MiniMax direct API |
| image_url | Image content part | JPEG, PNG, GIF, WEBP |
| video_url | Video content part | MP4, AVI, MOV, MKV |
Les définitions de paramètres ci‑dessus suivent la référence API compatible OpenAI actuelle de MiniMax. Certains champs spécifiques au fournisseur peuvent nécessiter une prise en charge de passage lorsqu’ils sont routés via un agrégateur ; testez donc les champs non standard contre l’endpoint CometAPI en vigueur avant le déploiement.
API officielle MiniMax vs CometAPI
| Item | MiniMax Official | CometAPI |
|---|---|---|
| Model ID | MiniMax-M3 | minimax-m3 |
| OpenAI-compatible | Yes | Yes |
| Anthropic-compatible | Yes; MiniMax recommends it for advanced features | CometAPI article focuses on OpenAI-compatible routing |
| Base URL | https://api.minimax.io/v1 | https://api.cometapi.com/v1 |
| Primary advantage | Direct provider feature access | One key and common routing across many providers |
| Best for | Teams standardized on MiniMax-native behavior | Teams comparing or operating multiple model vendors |
MiniMax prend officiellement en charge les invocations compatibles Anthropic et compatibles OpenAI. La route Anthropic directe est recommandée par MiniMax pour des comportements de pensée avancés ; la page du modèle M3 de CometAPI met actuellement l’accent sur l’intégration de type OpenAI via /v1/chat/completions.
Tarification de l’API MiniMax M3
La tarification mérite un traitement attentif car le tarif direct effectif chez MiniMax et le tarif affiché sur la comparaison CometAPI ne sont actuellement pas les mêmes. Au 10 août 2026, CometAPI liste M3 à $0.48/M en entrée et $1.92/M en sortie. La même page CometAPI compare ces tarifs au prix catalogue MiniMax de $0.60/M en entrée et $2.40/M en sortie.
Cependant, la page de tarification à l’usage actuelle de MiniMax affiche une remise permanente de 50% sur le trafic standard M3 : pour les requêtes avec au plus 512K tokens en entrée, le prix direct effectif est $0.30/M en entrée, $1.20/M en sortie, et $0.06/M par lecture du cache. Au‑dessus de 512K en entrée, les tarifs directs remisés sont $0.60/M en entrée, $2.40/M en sortie, et $0.12/M par lecture du cache.
| Route / Tier | Input | Output | Pricing Note |
|---|---|---|---|
| CometAPI M3 | $0.48/M | $1.92/M | Unified multi-model route |
| MiniMax direct, <=512K input | $0.30/M | $1.20/M | Current discounted standard rate |
| MiniMax direct, >512K input | $0.60/M | $2.40/M | Current discounted long-input tier |
Cela signifie que CometAPI est actuellement en dessous du prix catalogue MiniMax, mais pas en dessous du tarif direct remisé <=512K du fournisseur. Pour des déploiements à gros volume, comparez les prix en direct plutôt que de vous fier à une affirmation fixe « 20% moins cher ». La tarification peut évoluer indépendamment sur chaque plateforme.
Exemple de coût
Au tarif M3 actuel de CometAPI, une requête avec 100 000 tokens en entrée et 5 000 tokens en sortie coûterait approximativement :
| Input: 0.10 x $0.48 = $0.048 Output: 0.005 x $1.92 = $0.0096 Total: $0.0576 |
|---|
La même requête peut coûter moins cher en direct chez MiniMax si elle est éligible au palier remisé <=512K du fournisseur, mais les équipes multi‑modèles peuvent tout de même valoriser la simplicité opérationnelle d’une passerelle unifiée.
MiniMax M3 vs Claude Sonnet 5 vs Gemini 3.6 Flash vs Kimi K3
Les quatre modèles ciblent des charges de travail d’agents et de codage, et tous offrent de très grandes fenêtres de contexte. Leurs différences sont plus visibles dans la prise en charge des modalités, les contrôles de raisonnement, les écosystèmes fournisseurs et la tarification CometAPI actuelle. La documentation officielle confirme une fenêtre de contexte 1M pour Claude Sonnet 5, une API multimodale à large contexte pour Gemini 3.6 Flash, et un flagship Kimi K3 à 1M tokens.
| Model | Context | Input | Reasoning | Best Fit | CometAPI Input / Output per M |
|---|---|---|---|---|---|
| MiniMax M3 | 1M | Text, image, video | Adaptive or disabled | Coding agents, long context, multimodal workflows | $0.48 / $1.92 |
| Claude Sonnet 5 | 1M | Text, image, documents | Adaptive thinking; effort control | Coding agents, professional work, tool use | $1.60 / $8.00 |
| Gemini 3.6 Flash | ~1.05M | Text, image, video, audio, PDF | Thinking levels | Fast multimodal agents, Google tools | $1.20 / $6.00 |
| Kimi K3 | 1M | Text + native visual understanding | Always reasons; reasoning_effort controls depth | Long-horizon coding and knowledge work | $2.40 / $12.00 |
Les prix par token actuels dans le tableau sont tirés des pages modèles en direct pour MiniMax M3, Claude Sonnet 5, Gemini 3.6 Flash, et Kimi K3.
Figure 4. Comparaison actuelle des prix par token sur CometAPI, vérifiée le 10 août 2026. Sources des pages modèles : M3, Gemini 3.6 Flash, Claude Sonnet 5, et Kimi K3.
Quel modèle choisir ?
- MiniMax M3 si votre priorité est un prix par token bas sur CometAPI, le contexte 1M, la compréhension native image/vidéo, et des agents de codage ou d’outils longue durée.
- Claude Sonnet 5 si vous privilégiez des agents de codage soignés, le travail de connaissance professionnel et des workflows d’outils matures à la manière d’Anthropic.
- Gemini 3.6 Flash lorsque la multimodalité, des boucles d’agent rapides, les outils Google, les entrées audio/PDF et le débit comptent le plus.
- Kimi K3 lorsque la charge de travail se concentre sur le codage à long horizon, le travail de connaissance approfondi et un modèle qui raisonne en permanence avec une fenêtre de contexte 1M.
Ne sélectionnez pas uniquement sur la base d’un benchmark ou du prix du token. Constituez un petit set d’évaluation à partir de votre propre dépôt, de vos documents, de vos appels d’outils et de vos cas d’échec, puis comparez le taux de tâches réussies, la latence, le total de tokens, les retries et le temps de correction humaine.
Bonnes pratiques pour l’API MiniMax M3
- Définissez explicitement la pensée. Utilisez adaptive pour les travaux réellement difficiles et disabled pour les tâches simples où la latence compte. Des réglages explicites sont plus faciles à benchmarker et à reproduire.
- Utilisez la fenêtre 1M de manière sélective. Une grande fenêtre de contexte est un plafond de capacité, pas une cible. Récupérez et compressez avant d’envoyer de grands dépôts ou collections de documents.
- Préservez l’historique des appels d’outils. Pour l’appel de fonctions multi‑tours, conservez la réponse complète de l’assistant et les objets d’appel d’outils afin de ne pas briser la continuité du raisonnement.
- Streamez les longues réponses. Le streaming améliore la latence perçue pour le code, la recherche et les applications d’agent même si le temps total de complétion est inchangé.
- Exploitez le cache pour les contextes répétés. Les invites système stables, les schémas d’outils et l’historique répété sont de bons candidats pour le prompt caching lorsque la route active le prend en charge.
- Mesurez le coût par tâche réussie. Le prix du token compte, mais les retries, les boucles d’outils, les longues traces de raisonnement et la reprise après échec dominent souvent l’économie finale d’un agent.
- Retestez les paramètres spécifiques au fournisseur. Les passerelles compatibles OpenAI peuvent différer sur la manière de faire passer des champs non standard. Validez thinking, reasoning_split, les charges multimodales et le comportement des outils avant la production.
Conclusion
MiniMax M3 est une excellente option API pour les développeurs qui ont besoin de codage, d’exécution agentique, de compréhension visuelle native et d’un très long contexte dans un seul modèle. Sa cohérence technique est inhabituelle : MSA répond au défi de servir un contexte 1M, l’entraînement multimodal natif élargit la surface d’entrée, et le jeu de benchmarks public est centré sur les charges d’ingénierie logicielle et d’usage d’outils qui intéressent réellement les développeurs.
Pour la plupart des utilisateurs de CometAPI, le point de départ le plus rapide est simple : créez une clé, définissez l’URL de base sur https://api.cometapi.com/v1, appelez le modèle minimax-m3, et évaluez‑le sur vos tâches de production réelles. Décidez ensuite s’il faut activer une pensée plus profonde, ajouter de l’entrée multimodale ou construire une boucle d’outils. Comme la tarification et le comportement des routes peuvent changer, revérifiez la page M3 en direct de CometAPI et la documentation de l’API MiniMax avant le déploiement final en production.
