Kurzfassung Am 27. September 2026 hat MiniMax leise, aber offiziell M3.1-Flash-Preview in MiniMax Code (und über den Token Plan) eingeführt. Es ist ein fortschrittliches multimodales Coding-Modell mit einem vollständigen 1‑Million‑Token‑Kontextfenster, nativer Unterstützung für Text-/Bild-/Videoeingaben und einer neuen fünfstufigen Steuerung des Reasoning-Aufwands (low → max). Explizit für alltägliche Entwicklungs-Workflows positioniert—von Bugfixing über Implementierung und Tests bis zur Auslieferung—priorisiert es Geschwindigkeit und Kosteneffizienz bei stets aktiviertem Thinking.
Die Verfügbarkeit ist derzeit auf Token Plan + MiniMax Code (mit API-Unterstützung via Subscription Key) beschränkt; vollständige öffentliche Preise und offene Gewichte sind noch nicht veröffentlicht. CometAPI stellt das Modell (minimax-m3.1-flash-preview) bereits zu wettbewerbsfähigen Konditionen bereit und erleichtert so den einheitlichen Zugriff.
Zentrale Erkenntnisse
- 1M-Token-Kontext + native Multimodalität — Handhabt große Codebasen, lange Agent-Sitzungen, Dokumente, Bilder und Videos in einem Fenster.
- Fünfstufiger Reasoning-Aufwand (low / medium / high / xhigh / max, Standard max) — Latenz und Tokenverbrauch gegen tiefere Abwägung nach Bedarf tauschen. Thinking kann nicht deaktiviert werden.
- Fokus auf alltägliches Coding — Explizit für den geschlossenen Loop von Buglokalisierung → Implementierung → Test → Auslieferung in MiniMax Code optimiert.
- Vorschau-Einschränkungen — Bestätigt in MiniMax Code und Token Plan; API-Aufrufe erfordern einen Subscription Key. Keine eigenständige Modellkarte, öffentlichen Benchmarks, offenen Gewichte oder eigenständige Pay-as-you-go-Preise zum Start angekündigt.
- CometAPI-Empfehlung — Zugriff über einen OpenAI-kompatiblen Endpunkt (Modell-ID: minimax-m3.1-flash-preview) mit rabattierten Preisen, ideal für Teams, die bereits CometAPIs Katalog mit 500+ Modellen nutzen.
Was ist MiniMax M3.1-Flash-Preview?
MiniMax M3.1-Flash-Preview ist der jüngste Zugang zur M‑Serie großer Sprachmodelle von MiniMax. Die offizielle Dokumentation beschreibt es als ein „Frontier‑Modell für multimodales Coding mit 1M‑Kontextfenster und einstellbarer Denktiefe“. Es wurde zuerst von Entwicklern im Modellwähler von MiniMax Code entdeckt und am 27. September 2026 vom offiziellen @MiniMaxAgent‑Account auf X formell bestätigt:
„MiniMax’ neuestes Textmodell, M3.1-Flash-Preview, debütiert heute auf MiniMax Code. Entwickelt für den Alltag in der Entwicklung, ist es schnell, zuverlässig und bereit für echte Arbeit – von schnellen Bugfixes bis hin zu vollständigen Features.“
Im Gegensatz zu einem allgemeinen Chat-Modell ist es speziell für Software Engineering und agentenbasierte Workflows gebaut. MiniMax’ Produktbotschaften betonen reale Entwickleraufgaben: schnelle Bugfixes, Feature-Implementierung, Randfallbehandlung, Regressionstests und Änderungsvalidierung. Die Bezeichnung „Flash“ signalisiert den Fokus auf Geschwindigkeit und Alltagspraktikabilität gegenüber dem schwergewichtigeren MiniMax‑M3‑Flaggschiff, während es dennoch den großen Kontext und die Coding‑Stärken der M3‑Familie erbt.
Das Modell unterstützt:
- Bis zu 1.000.000 Tokens Kontext — geeignet für ganze Codebasen, lange Dokumente und mehrstufige Agent-Sitzungen.
- Native multimodale Eingaben (Text, Bilder und Video).
- Agentenbasiertes Reasoning, Tool-Aufrufe und strukturierte Aufgabenausführung.
- Immer eingeschaltetes Deep Thinking, das über einen fünfstufigen Aufwandregler angepasst werden kann.
Thinking-Inhalte werden separat zurückgegeben (als reasoning_content im OpenAI-kompatiblen Modus oder als Thinking-Blöcke im Anthropic-kompatiblen Modus), wodurch die finale Antwort für Anzeige oder Downstream-Nutzung sauber bleibt.
1M-Token-Kontext + Coding-Ausrichtung
Die herausragende technische Spezifikation ist das 1,000,000‑Token‑Kontextfenster. Das entspricht MiniMax‑M3 und ist deutlich größer als bei den meisten konkurrierenden Coding‑Modellen. Offizielle Dokumente heben die Eignung hervor für:
- Ganze Code-Repositories
- Lange mehrstufige Agent-Sitzungen
- Große Dokumente und Wissensbasen
- Multimodale Eingaben (Text + Bilder + Video) innerhalb desselben Kontexts
Diese Langkontext-Fähigkeit ermöglicht zusammen mit nativer Multimodalität Workflows, die zuvor aufwendiges Kontextmanagement oder externe Retrieval-Systeme erforderten. Entwickler können große Codebasen, Design-Mockups, Fehlerscreenshots und zugehörige Dokumentation in einem einzigen Gespräch präsent halten.
Das Modell ist explizit für Agent- und Coding‑Szenarien optimiert: Tool‑Aufrufe, strukturierte Ausgaben und mehrstufige Engineering‑Tasks. Output‑Geschwindigkeiten verwandter Modelle (M3 ≈ 100+ TPS, M2.7‑highspeed ≈ 100 TPS) legen nahe, dass Flash‑Varianten das obere Ende des Latenz-/Durchsatzspektrums anpeilen, auch wenn genaue TPS‑Zahlen für M3.1‑Flash‑Preview selbst noch nicht veröffentlicht wurden.
Fünfstufiger Reasoning-Aufwand
Eines der praktischsten neuen Features ist die einstellbare Denktiefe, gesteuert über den Parameter effort (Anthropic‑kompatibel) bzw. reasoning_effort (OpenAI‑kompatibel). Die fünf Stufen sind:
| Level | Typischer Anwendungsfall | Abwägung |
|---|---|---|
| low | Einfache Syntaxfixes, schnelle Nachschlagen | Niedrigste Latenz & Tokenverbrauch |
| medium | Routinemäßige Refactorings, kleine Features | Ausgewogen |
| high | Komplexe Logik, Änderungen über mehrere Dateien | Tiefere Analyse |
| xhigh | Schwieriges Debugging, Architekturentscheidungen | Höherer Compute & Latenz |
| max | Höchstrisiko- oder mehrdeutige Probleme (Standard) | Maximale Abwägung |
Thinking ist bei M3.1‑Flash‑Preview immer aktiviert; der Versuch, es zu deaktivieren, führt zu einem 400‑Fehler. Höhere Aufwandstufen erzeugen mehr interne Reasoning‑Tokens und erhöhen die Latenz, wodurch Entwickler eine feinere Kontrolle erhalten, die bei früheren M‑Serien‑Modellen weniger granular war.
In MiniMax Code erscheint die Steuerung als einfacher Schieberegler oder Selektor; via API wird sie im Request‑Body übergeben. Dieses Design spiegelt den Branchentrend wider, „Reasoning‑Budget“-Regler offenzulegen, damit Nutzer das Modellverhalten an Aufgabenschwierigkeit und Kosten anpassen können.
Alltäglicher Entwicklungs-Workflow
MiniMax positioniert M3.1‑Flash‑Preview klar im täglichen Entwickler‑Loop statt als reines Forschungs- oder Langhorizont‑Agentenmodell. Die offiziellen Botschaften und die Produktplatzierung betonen ein Closed‑Loop‑Erlebnis in MiniMax Code, Bugfixing → Implementierung → Test → Auslieferung:
- Buglokalisierung — Stacktraces, Fehlerscreenshots oder relevante Codestellen einfügen; das Modell kann über großen Kontext die Ursachen identifizieren.
- Implementierung — Code über mehrere Dateien hinweg generieren oder bearbeiten, wobei der projektweite Kontext erhalten bleibt.
- Test & Verifikation — Tests vorschlagen oder schreiben, Regressionen prüfen und Auswirkungen analysieren.
- Auslieferung — Saubere Diffs, Commit‑Nachrichten oder Dokumentation zur Review erzeugen.
Die Kombination aus 1M‑Kontext, multimodaler Eingabe (z. B. Screenshots fehlerhafter UIs) und einstellbarem Aufwand macht das Modell besonders effektiv für die hochfrequenten, latenzsensiblen Aufgaben, die den Entwickleralltag dominieren. Begleitende zeitlich begrenzte Aktionen zum Launch (doppelte tägliche Check‑in‑Credits vom 28. September bis 7. Oktober UTC+8 und Token‑Plan‑Kontingent‑Resets) fördern zusätzlich Tests in realen Szenarien.
Aktuelle Verfügbarkeit und Einschränkungen der Vorschau
Bestätigt Ende September 2026:
- In MiniMax Code auswählbar (Modellwähler neben M3, M2.7 etc.).
- Verfügbar über Token Plan / Subscription Key.
- In den offiziellen MiniMax‑API‑Referenzen mit OpenAI‑ und Anthropic‑kompatiblen Beispielen dokumentiert.
- Denktiefe steuerbar über
reasoning_effortoder gleichwertige Felder. - Promotion: Token‑Plan‑Kontingent‑Resets und doppelte Check‑in‑Punkte (28. September – 7. Oktober) nutzbar für das neue Modell.
Bestätigter API‑Pfad: Offizielle Docs listen den Modellnamen MiniMax-M3.1-Flash-Preview und bieten sowohl den Anthropic‑kompatiblen (https://api.minimax.io/anthropic) als auch den OpenAI‑kompatiblen (https://api.minimax.io/v1) Endpunkt. Ein Subscription Key (Token Plan) ist erforderlich. Beispielparameter umfassen output_config.effort oder reasoning_effort. Thinking‑Inhalte werden getrennt zurückgegeben (thinking‑Blöcke oder reasoning_content).
Noch eingeschränkt oder unbestätigt:
- Vollständige unabhängige öffentliche Benchmark‑Suite und Modellkarte mit Parameteranzahl.
- Eigenständige Pay‑as‑you‑go‑Preisseite mit der Transparenz von MiniMax‑M3.
- Offene Gewichte (für diese Vorschau nicht angekündigt).
Der Vorschau‑Status bedeutet, dass Funktionen, Kontingente und Preise noch Änderungen unterliegen können. Entwickler sollten die aktuelle Performance als indikativ und nicht final betrachten.
Zugriff auf MiniMax M3.1-Flash-Preview
1. In MiniMax Code (am einfachsten für die interaktive Nutzung)
MiniMax Code herunterladen oder öffnen (Desktop‑Apps für macOS und Windows verfügbar). M3.1‑Flash‑Preview im Modellwähler auswählen und die Denktiefe einstellen. Tägliche Check‑in‑Aktionen können kostenlose Credits bis Anfang Oktober 2026 verdoppeln.
2. Offizielle MiniMax‑API (Token Plan)
- Einen Subscription Key in der MiniMax‑Konsole beziehen.
- Entweder das Anthropic‑ oder OpenAI‑SDK verwenden, indem
base_urlgeändert undmodel="MiniMax-M3.1-Flash-Preview"gesetzt wird. - Die gewünschte Aufwandstufe übergeben.
3. Über CometAPI (empfohlen für Teams mit mehreren Modellen)
CometAPI führt minimax-m3.1-flash-preview bereits im Katalog (zum Zeitpunkt der Erstellung mit 20 % Rabatt sichtbar). Da CometAPI einen OpenAI‑kompatiblen Endpunkt (https://api.cometapi.com/v1) anbietet, erfordern bestehende Codebasen nur eine Änderung von base_url und API‑Key. Das ist besonders praktisch für Teams, die GPT, Claude, Gemini, MiniMax‑M3 und andere Modelle bereits über einen einzigen Key routen und konsistente Observability, Abrechnung und Fallback‑Logik wünschen.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_COMETAPI_KEY",
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="minimax-m3.1-flash-preview",
messages=[{"role": "user", "content": "Refactor this function for clarity..."}],
# reasoning_effort or equivalent may be supported depending on gateway mapping
)
CometAPIs einheitlicher Katalog umfasst außerdem MiniMax‑M3, die M2.7‑Serie und die neuen H3‑Videomodelle, sodass nahtlose Wechsel zwischen Text und multimodaler Generierung unter einer Abrechnungsbeziehung möglich sind.
