FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-model/CometAPI Research

Was ist MiniMax M3

Erkunden Sie die Spezifikationen von MiniMax M3, den 1M-Token-Kontext, Sparse Attention, multimodale Fähigkeiten, Benchmark-Leistung, API-Preisgestaltung und Modellvergleiche.

CometAPI
AnnaForschungsteam für KI-Modelle und API
Aktualisiert Aug 18, 2026 17 Min. Lesezeit
Was ist MiniMax M3
Dieses Muster verwenden

Den ersten API-Aufruf ausführen.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

MiniMax M3 ist MiniMaxs Frontier-Modell für Coding, agentische Arbeit, Langkontext-Schlussfolgern und multimodales Verständnis. Es wurde am 1. Juni 2026 offiziell veröffentlicht und vereint drei Fähigkeiten, die MiniMax als Kern des Releases hervorgehoben hat: ein Kontextfenster von bis zu 1M Token, native Bild-/Videoverarbeitung und langfristige Agentenausführung.

Das Open-Weight-Modell verfügt über rund 428 Milliarden Gesamtparameter und rund 23 Milliarden aktivierte Parameter. Das bedeutet, dass nur etwa 5,4 % der offengelegten Parameterkapazität bei einem typischen Token aktiv sind, was erklärt, wie ein sehr großes Modell in der Inferenz praktikabel bleibt. M3 führt außerdem MiniMax Sparse Attention (MSA) ein, ein blockweises Sparse-Attention-Design für Millionentoken-Kontexte.

Für Entwickler ist M3 über die MiniMax-API und als Open-Weight-Distribution verfügbar, außerdem über CometAPI für Teams, die eine einheitliche Schnittstelle für MiniMax und andere Anbieter wünschen.

Key Takeaways

  • MiniMax hat M3 am 1. Juni 2026 veröffentlicht, ein Frontier-Modell mit Fokus auf Coding, Agenten, langen Kontext und Multimodalität.
  • Das Open-Weight-Release nennt ~428B Gesamtparameter und ~23B aktivierte Parameter.
  • M3 unterstützt bis zu 1M Token Kontext; MiniMax beschreibt 512K als garantierte Mindeststufe für die API.
  • MiniMax Sparse Attention ersetzt volle globale Attention durch Blockselektion und exakte Sparse-Attention über ausgewählte Kontextbereiche.
  • M3 wurde von Anfang an mit gemischten Modalitäten trainiert und unterstützt Text-, Bild- und Videoeingaben.
  • Offizielle Launch-Benchmarks umfassen 59.0 % SWE-Bench Pro, 66.0 % Terminal-Bench 2.1, 83.5 BrowseComp und 75.2 OSWorld-Verified.
  • MiniMax demonstrierte nahezu 12 Stunden autonome Paper-Reproduktion und etwa 24 Stunden CUDA-Kernel-Optimierung mit 1.959 Tool-Aufrufen.
  • Die API unterstützt konfigurierbares Reasoning sowie Text, Bild, Video, Funktions-Tools, Standard-/Priority-Servicestufen und Long-Context-Pricing.

What Is MiniMax M3?

MiniMax M3 ist der Nachfolger der M2-Generation und stellt eine größere architektonische Veränderung als ein normales Punkt-Update dar. MiniMax M2.7 war bereits auf reale Softwareentwicklung, Büroproduktivität und Agent-Workflows ausgerichtet, aber M3 fügt eine neue Sparse-Attention-Architektur, natives multimodales Pretraining und ein millionentokenstarkes Kontextziel hinzu.

M3 als frontier-multimodales Coding-Modell mit einem 1M-Kontextfenster. Das offizielle Open-Weight-Repository liefert die wichtigsten Skalenzahlen: etwa 428B Parameter insgesamt und 23B aktiviert. Der zugehörige MSA-Technikbericht beschreibt die Architektur als in einem Mixture-of-Experts-Setting arbeitend, was zur offengelegten Gesamt- versus Aktiv-Parameteraufteilung passt.

Das macht M3 weniger interessant als „ein größeres M2.7“ und mehr als ein Konvergenzmodell. Es vereint Repository-großen Kontext, Coding, multimodale Wahrnehmung, computerorientierte Agenten und lokale/offene Bereitstellung in einem System. MiniMax hat diese Kombination ausdrücklich als Hauptdifferenzierungsmerkmal des Releases gerahmt, statt zu behaupten, dass M3 jeden Benchmark gewinnt.

MiniMax M3 Specifications

SpecificationMiniMax M3
Release dateJune 1, 2026
Model size~428B total parameters; ~23B activated
ArchitectureSparse Mixture-of-Experts with MiniMax Sparse Attention (MSA)
Context windowUp to 1M tokens; API guaranteed minimum 512K
Input modalitiesText, image, video
OutputText
Reasoning controlThinking on/adaptive or disabled through API parameters
Maximum generationRecommended 128K; API docs allow up to 512K max_completion_tokens
Tool useFunction tools; agent-oriented workflows
WeightsOpen-weight release on Hugging Face / GitHub instructions

Kontext, Modalität und API-Verhalten oben sind in MiniMax’ offizieller Modell- und API-Dokumentation dokumentiert; die Parameterwerte und Links zur lokalen Bereitstellung stammen aus dem offiziellen M3-Repository.

From MiniMax M2.7 to M3

DimensionMiniMax M2.7MiniMax M3
Context window204,800 tokensUp to 1M tokens
Native image/video inputNo; M2.x text/tool workflowsYes; text + image + video
Attention directionConventional M2-series servingMSA sparse attention
Thinking controlReasoning cannot be fully disabled in M2.xThinking can be disabled for lower latency
Primary positioningCoding, tool calling, office/agent workflowsCoding + agents + multimodality + million-token context
Open-weight emphasisM2.7 open model ecosystemM3 weights + dedicated MSA implementation

MiniMax’ API-Dokumentation listet M2.7 mit einer 204.800-Token-Kontextstufe, während M3 in die Millionentoken-Klasse wechselt. Der größere Unterschied ist qualitativer Natur: M3 akzeptiert Bild- und Videoeingaben direkt, während die M2.x-API weiterhin text- und toolorientiert ist.

What Is New in MiniMax M3?

A 428B Model with About 23B Parameters Active

Das öffentliche M3-Repository gibt an, dass das Modell ~428B Gesamtparameter und ~23B aktivierte Parameter hat. Praktisch bedeutet der offengelegte aktive Anteil etwa 5,4 %. Das ist der grundlegende Reiz einer spärlichen Expert-Architektur: Die Gesamtkapazität kann sehr groß sein, während der Rechenpfad pro Token nur einen Bruchteil des Modells berührt.

Die Parameteranzahl allein bestimmt nicht die Qualität, und „428B“ sollte nicht so verstanden werden, dass 428B dichte Parameter für jedes Token ausgewertet werden. Nützlicher ist die Interpretation, dass M3 über einen großen Pool an Modellkapazität verfügt, gepaart mit bedingter Aktivierung und einem Attention-System, das die Kosten von Langkontext beherrschbar hält.

MiniMax Sparse Attention: Making 1M Context Practical

Die zentrale architektonische Änderung ist MiniMax Sparse Attention (MSA). Volle Softmax-Attention wächst quadratisch mit der Sequenzlänge, was teuer wird, wenn Agenten-Historien, Code-Repositories, Tool-Logs, Bilder und lange Dokumente sich zu Hunderttausenden Token aufsummieren.

MSA ergänzt einen leichten Index-Branch, der Key-Value-Blöcke bewertet und für jede Grouped-Query-Attention-Gruppe eine Top-k-Teilmenge auswählt. Der Hauptzweig führt dann exakte block-sparse Attention nur auf diesen ausgewählten Blöcken aus. MiniMax’ technischer Bericht beschreibt dies als hardwareorientiertes Design, das die Qualität bewahren soll, während der Anteil des Kontexts reduziert wird, der mit voller Attention verarbeitet werden muss.

Was ist MiniMax M3

Abbildung 1. MiniMax Sparse Attention (MSA) Architektur. Quelle: Offizielle MSA-Abbildung von MiniMax

Bei 1M Kontext berichtet MiniMax, dass M3 etwa 1/20 des Pro-Token-Computes der vorherigen Generation nutzt und mehr als 9× Prefill- und mehr als 15× Decoding-Speedup gegenüber M2 liefert. Das separate MSA-Paper berichtet zusätzliche kontrollierte Experimente an einem 109B-MoE-Testmodell; diese Paperzahlen sollten daher nicht mit den Produktionszahlen M3-vs.-M2 verwechselt werden.

Dieser Unterschied ist wichtig. Das Paper validiert den Attention-Mechanismus in einem Forschungskontext; die M3-Launch-Zahlen beschreiben das Produktionsmodell. Beide Ergebnisse weisen in die gleiche Richtung, sind aber nicht derselbe Benchmark.

Native Multimodality from Step 0

M3 wird nicht als Textmodell präsentiert, dem am Ende ein separater visueller Adapter hinzugefügt wurde. MiniMax sagt, es habe gemischte Modalitäten von Anfang an durchlaufen und seine Pretraining-Datenpipeline neu aufgebaut, um interleavte multimodale Daten zu erhöhen.

Die Produktions-API unterstützt Text-, Bild- und Videoeingaben. Das ist für Coding und Agentenarbeit wichtig, weil viele reale Aufgaben nicht rein textbasiert sind: Debugging kann einen Screenshot erfordern, Frontend-Arbeit den Vergleich mit einem Referenzbild, Forschung umfasst oft Plots und Gleichungen, und Computer-Use-Agenten arbeiten über visuelle Oberflächen.

Eine nützliche Denkweise zu M3s Multimodalität ist daher nicht „es kann ein Bild beschreiben“, sondern „der visuelle Zustand kann im selben langlaufenden Reasoning-Loop bleiben wie Code, Toolausgaben, Dokumente und Nutzerfeedback“.

Interactive Coding and Agent Training

MiniMax argumentiert, dass klassische Coding-Benchmarks zu Single-Turn sind, um die reale Entwicklerarbeit abzubilden. Für M3 wurde ein interaktiver Nutzersimulator aufgebaut, der das Modell Anforderungen klären, Lösungen diskutieren, feedbackbasiert korrigieren, Aufgaben wechseln und mehrstufig an Projekten iterieren lässt.

Ziel ist es, von passiver Instruktionsausführung zur Zusammenarbeit zu gelangen. Ein effektiver Coding-Agent muss eine Aufgabe zerlegen, Tools aufrufen, Fehler interpretieren, einen Plan überarbeiten, frühe Entscheidungen bewahren und nach der ersten plausiblen Antwort weitermachen können. M3s langer Kontext und toolorientiertes Training sind genau um diesen Loop herum konzipiert.

Long-Horizon Autonomous Execution

MiniMax’ überzeugendste M3-Demonstrationen sind keine Chat-Beispiele. Es sind langlaufende Aufgaben, in denen das Modell Zustand halten und nach wiederholtem Tool-Feedback weiter verbessern muss.

TaskAutonomous runtimeEvidence of persistenceReported result
ICLR paper reproductionNearly 12 hours18 commits; 23 experimental figuresCore experiments reproduced
FP8 GEMM kernel optimization~24 hours147 benchmark submissions; 1,959 tool calls7.6% → 71.3% peak utilization; 9.4× speedup
PostTrainBench model training12-hour task windowData synthesis → training → evaluation → iterationScore 0.37; behind Opus 4.7 and GPT-5.5, ahead of other models in MiniMax report

In der Paper-Reproduktionsaufgabe lief M3 fast 12 Stunden und produzierte 18 Commits plus 23 Experiment-Grafiken. Die Aufgabe kombinierte Paper-Lektüre, Diagramm-/Formelverständnis, Code-Erstellung, Experimente und iterative Interpretation.

Was ist MiniMax M3

Abbildung 2. M3s autonome Paper-Reproduktions-Trajektorie über rund 12 Stunden. Quelle: Offizielle M3-Demonstration von MiniMax

In der CUDA-Optimierungsaufgabe absolvierte M3 147 Benchmark-Einreichungen und 1.959 Tool-Aufrufe über rund 24 Stunden und steigerte letztlich die gemeldete Hopper-FP8-Peakauslastung von 7.6 % auf 71.3 % für ein 9.4× Speedup ohne menschliches Eingreifen. Bemerkenswert ist nicht nur der finale Speedup; MiniMax sagt, die beste Lösung des Modells erschien bei der 145. Einreichung, nach mehreren Plateaus.

Benchmark Performance of MiniMax M3

MiniMax’ Launch-Benchmark-Chart vergleicht M3 mit Claude Opus 4.7, GPT-5.5 und Gemini 3.1 Pro über Coding-, Terminal-, Browsing-, Office-, Tool-Use- und Computer-Use-Aufgaben. Das sind die nützlichsten direkten Vergleiche, weil sie im selben M3-Release-Paket veröffentlicht wurden.

MiniMax M3

Abbildung 3. MiniMax’ offizieller M3-Launch-Benchmark-Vergleich. Quelle: Offizielles Benchmark-Bild von MiniMax

BenchmarkMiniMax M3Claude Opus 4.7GPT-5.5Gemini 3.1 Pro
SWE-Bench Pro59.064.358.654.2
Terminal-Bench 2.166.066.178.270.0
VIBE V250.155.850.528.0
SVG-Bench63.762.358.259.2
KernelBench Hard28.830.720.918.6
BrowseComp83.579.384.485.9
GDPval rubrics74.779.880.657.8
BankerToolBench76.181.375.067.0
MCP Atlas74.277.075.369.2
OSWorld-Verified75.282.878.776.2

Alle Werte in dieser Tabelle sind aus MiniMax’ offizieller M3-Launch-Grafik übertragen. Sie sollten als vom Anbieter gemeldete Launch-Ergebnisse gelesen werden, nicht als eine neue, unabhängig von CometAPI durchgeführte Wiederholung.

What the Benchmark Results Actually Show

Erstens ist M3 in der Softwareentwicklung wirklich konkurrenzfähig. Bei SWE-Bench Pro erzielt es 59.0, über den von MiniMax gemeldeten 58.6 und 54.2 für GPT-5.5 und Gemini 3.1 Pro, aber unter Claude Opus 4.7 mit 64.3. KernelBench Hard zeigt ein ähnliches Bild: M3 mit 28.8 liegt nahe bei Opus 4.7 mit 30.7 und deutlich über den beiden anderen Werten in MiniMax’ Chart.

Zweitens ist Terminal-Ausführung nicht M3s stärkstes relatives Ergebnis. Terminal-Bench 2.1 platziert M3 bei 66.0, im Wesentlichen gleichauf mit Opus 4.7 bei 66.1, aber deutlich hinter GPT-5.5 bei 78.2 und Gemini 3.1 Pro bei 70.0.

Drittens ist M3 stark, aber nicht dominant bei Informationsbeschaffung. BrowseComp liegt bei 83.5: höher als Opus 4.7 mit 79.3, aber leicht unter GPT-5.5 mit 84.4 und Gemini 3.1 Pro mit 85.9. MCP Atlas mit 74.2 liegt ebenfalls nahe bei GPT-5.5 mit 75.3 und Opus 4.7 mit 77.0.

Viertens gibt die Launch-Grafik M3 ein besonders gutes Ergebnis bei SVG-Bench: 63.7 gegenüber 62.3 für Opus 4.7, 58.2 für GPT-5.5 und 59.2 für Gemini 3.1 Pro. Das passt zum übergreifenden M3-Design: natives visuelles Verständnis soll direkt an Coding- und Agent-Workflows teilnehmen, statt eine separate Vision-Funktion zu bleiben.

Die Gesamtaussage ist daher nuancierter als „M3 schlägt Closed-Modelle“. M3 betritt bei vielen agentischen Aufgaben das gleiche Leistungsband, gewinnt ausgewählte Evaluierungen und verliert andere. Sein Differenzierungsmerkmal ist, was diese Werte begleitet: offene Gewichte, multimodales Training, ein millionentokenstarkes Kontextdesign und aggressive Serving-Ökonomie.

MiniMax M3 vs Claude Opus 5 vs GPT-5.6 Sol vs Gemini 3.7 Flash

MiniMax M3 wurde in einen schnelllebigen Markt eingeführt, und sein ursprüngliches Vergleichsset ist nicht mehr der nützlichste Bezugspunkt. Relevanter ist der Vergleich mit Claude Opus 5, GPT-5.6 Sol und Gemini 3.7 Flash — neueren Closed-Modellen für Coding, Agenten und multimodale Arbeit. Da diese Modelle nicht unter einem identischen Harness evaluiert werden, betont die Tabelle dokumentierte Fähigkeiten und verwendet Benchmark-Zahlen nur dort, wo die Metrik direkt berichtet ist.

DimensionMiniMax M3Claude Opus 5GPT-5.6 SolGemini 3.7 Flash
WeightsOpen weightClosedClosedClosed / hosted API
Public parameter count~428B total / ~23B activeNot disclosedNot disclosedNot disclosed
Context windowUp to 1M1M1,050,0001M
Input modalitiesText, image, videoText, image, PDFText, imageText, image, video, audio, PDF
Coding / agent focusCoding + long-horizon agents + multimodalityComplex agentic coding + enterprise workFrontier coding + tool-heavy professional agentsFast agentic coding + multimodal workflows
Computer / tool useFunction tools + MiniMax Code + computer useServer/client tools + computer useWeb/file search, shell, computer use, MCPFunction calling, search, computer use
Terminal-Bench 2.1*66.0Not reported in Opus 5 launch88.885.8
Representative coding signal*SWE-Bench Pro 59.0Frontier-Bench v0.1: SOTA in Anthropic reportDeepSWE v1.1 72.7DeepSWE v1.1 65.3
Best reason to chooseOpen weights + low cost + 1M multimodal contextJudgment + long-horizon autonomyRaw coding/terminal performance + broad tool stackSpeed/cost + native multimodality

Diese Benchmark-Zahlen stammen aus unterschiedlichen Evaluierungspaketen der Anbieter und sollten nicht als eine einzige synchronisierte Rangliste verstanden werden. M3s Terminal-Bench-2.1-Wert von 66.0 stammt aus MiniMax’ Release-Evaluierung; OpenAI berichtet 88.8 für GPT-5.6 Sol, während Google 85.8 für Gemini 3.7 Flash angibt. Anthropics Opus-5-Launch betont Frontier-Bench, GDPval-AA, AutomationBench und OSWorld 2.0, statt ein direkt vergleichbares Terminal-Bench-2.1-Ergebnis zu veröffentlichen. Für die Modellauswahl sollten Kandidaten unter einem einheitlichen Harness auf der eigenen Arbeitslast gebenchmarkt werden, statt bereichsübergreifende Launch-Zahlen als permanente Rangliste zu behandeln.

Where MiniMax M3 Has the Clearest Advantage

Der klarste Vorteil von M3 ist die Bereitstellungswahl. Weder Benchmark-Chart noch Parameteranzahl allein erklären, warum Entwickler sich für das Modell interessieren könnten. M3 kombiniert offene Gewichte mit einer Kontextlänge und einem multimodalen Fähigkeitsspektrum, das üblicherweise gehosteten Frontier-Systemen vorbehalten ist. Das macht es attraktiv, wenn Teams lokale Bereitstellung, Anbieterunabhängigkeit, spezialisierte Serving-Setups oder tiefgehende Kontrolle über den Inferenz-Stack benötigen.

Sein zweiter Vorteil ist die Langkontext-Kostenarchitektur. MSA ist explizit darauf ausgelegt, den Attention-Compute im Millionentoken-Maßstab vor dem Explodieren zu bewahren. Das macht 1M-Token-Anfragen nicht absolut billig — KV-Cache, Expert-Ausführung und multimodale Eingaben kosten weiterhin Ressourcen —, aber es verändert die Skalierungskurve im Vergleich zu voller Attention.

Where Closed Models Still Lead

Dasselbe offizielle Benchmark-Chart zeigt, warum M3 nicht als automatischer Ersatz für jedes geschlossene Frontier-Modell präsentiert werden sollte. Claude Opus 4.7 hat stärkere Ergebnisse bei SWE-Bench Pro, KernelBench Hard, GDPval, BankerToolBench, MCP Atlas und OSWorld-Verified in MiniMax’ eigenem Vergleich. GPT-5.5 ist bei Terminal-Bench 2.1 deutlich stärker und führt GDPval an. Gemini 3.1 Pro liegt bei BrowseComp leicht vorn.

Für Produktionsteams bieten Closed-Plattformen oft auch reife Safety-Kontrollen, gehostete Tools, Observability, Durchsatzgarantien und Integrationen, die wichtiger sind als Open Weights. M3 ist am überzeugendsten, wenn Bereitstellungs- und Kostenvorteile Teil der Anforderungen sind, nicht wenn die Benchmark-Platzierung das einzige Kriterium ist.

MiniMax M3 API Pricing

MiniMax nutzt derzeit zwei Standard-Kontext-Preisstufen. Die offizielle Preisseite zeigt einen „permanenten 50%-Rabatt“ von $0.30/M Input und $1.20/M Output für Anfragen mit bis zu 512K Input-Token. Anfragen über 512K werden mit $0.60/M Input und $2.40/M Output angezeigt. Priority-Service ist mit dem 1,5-fachen der Standardstufe bepreist.

Route / tierInput price per 1M tokensOutput price per 1M tokensContext note
MiniMax official Standard (current discounted rate)$0.30$1.20≤512K input
MiniMax official Standard long-context$0.60$2.40>512K input
MiniMax official Priority (discounted rate)$0.45$1.80≤512K input; priority admission
CometAPI MiniMax-M3 page$0.48$1.92Unified gateway pricing shown by CometAPI

*CometAPI’s MiniMax-M3 liegt bei $0.48/M Input und $1.92/M Output und vergleicht dies mit MiniMax’ nicht rabattiertem Listenpreis von $0.60/$2.40. Da MiniMax’ eigene Plattform derzeit einen separaten 50%-Rabatt für die Standardstufe anzeigt, sollten Entwickler die tatsächlich geltende Live-Rate vergleichen, die abgerechnet wird, statt sich nur auf einen prozentualen Schlagwortrabatt zu verlassen.

Der Grund, CometAPI in diesem Szenario zu nutzen, ist daher nicht zwingend der niedrigste direkte Aktionspreis in jedem Moment. Der Wert liegt in einer einheitlichen API- und Abrechnungsschicht, wenn eine Anwendung zwischen M3 und anderen Anbietern routen muss, ohne separate Integrationen zu pflegen.

What Can MiniMax M3 Do?

Coding and Repository-Scale Engineering

Der offensichtlichste Anwendungsfall von M3 ist Softwareentwicklung über große Repositories. Ein 1M-Kontext kann weitaus mehr Code, Dokumentation, Testausgaben, Issue-Historie und Agentenstatus aufnehmen als das 204.8K-Fenster der vorherigen M2-Generation. In der Praxis ermöglicht das Workflows wie mehrdateiige Feature-Implementierung, Repository-weite Refactorings, Bug-Diagnose, Testreparatur, Build-/Terminal-Schleifen, Pull-Request-Review und Performance-Optimierung.

Der Schlüssel ist Persistenz. Ein Repository-Skalen-Coding-Agent ist nur nützlich, wenn er die ursprünglichen Anforderungen behalten kann, während er Toolausgaben und Überarbeitungen akkumuliert. Die 12-Stunden- und CUDA-Demonstrationen deuten darauf hin, dass M3 darauf ausgelegt ist, nach Zwischenfehlschlägen weiterzuarbeiten, statt jeden Toolaufruf als separate Kurzaufgabe zu behandeln.

Autonomous Research and Experimentation

Das Paper-Reproduktionsbeispiel ist eine gute Vorlage für Research-Agenten. M3 kann ein Paper lesen, Abbildungen inspizieren, über Formeln schlussfolgern, Code generieren, Experimente durchführen, bewerten, ob Ergebnisse Erwartungen entsprechen, und die Implementierung kontinuierlich verfeinern. Die Fähigkeit, Papertext, Code und Experiment-Logs in einem langen Kontext zu halten, reduziert den Anteil an Zustand, der zusammengefasst oder extern rekonstruiert werden muss.

Deshalb ist auch PostTrainBench relevant. MiniMax bat M3, Trainingsdaten zu synthetisieren, Basismodelle zu trainieren, sie zu evaluieren und ohne menschliches Eingreifen zu iterieren. M3 landete nicht auf Platz eins — es lag in MiniMax’ Bericht hinter Opus 4.7 und GPT-5.5 —, aber das Experiment demonstriert eine Form von Forschungsautomatisierung, die komplexer ist als gewöhnliches Question Answering.

Multimodal Technical Analysis

Da M3 Bilder und Videos nativ akzeptiert, können technische Workflows visuelle Evidenz mit Text und Code kombinieren. Beispiele umfassen den Vergleich einer Frontend-Implementierung mit einem Screenshot, die Analyse von Plots in einem Paper, die Inspektion des UI-Zustands während Computer-Use, das Extrahieren von Informationen aus Diagrammen oder die Kombination von Video-Beobachtungen mit einem langen Wartungslog.

MiniMax’ OpenAI-kompatible API-Dokumentation unterstützt explizit image_url- und video_url-Content-Teile für M3, einschließlich hochgeladener Dateien für größere Videos. Damit ist multimodale Eingabe eine entwicklerseitige API-Funktion und nicht nur eine Produktdemo.

Computer and Office Automation

MiniMax Code ist als Agenten-Harness um M3 herum konzipiert. Das Unternehmen sagt, sein Agent Team könne komplexe Aufgaben in mehrstufige, parallele Workflows aufteilen und eine Producer- + Verifier-Schleife für Reflexion und Korrektur nutzen. M3s native Multimodalität ermöglicht zudem Computer-Use-Workflows, die sich über Anwendungen, Dateien, Tabellenkalkulationen und Desktop-Oberflächen bewegen.

Ein offizielles Beispiel ist die Anweisung, einen lokalen ERP-Client zu öffnen und Rechnungsinformationen aus einer Excel-Tabelle im Batch einzugeben. Die wichtige Fähigkeit ist der anwendungsübergreifende Zustand: Der Agent muss die Tabelle verstehen, die Oberfläche bedienen, die Zuordnung zwischen Feldern bewahren und sich erholen, wenn sich das UI ändert oder eine Aktion fehlschlägt.

Long-Context Document and Knowledge Work

Ein 1M-Kontextfenster ist nicht nur für Code nützlich. Es kann große Sammlungen von Verträgen, Richtlinien, technischen Spezifikationen, wissenschaftlichen Arbeiten, Incident-Reports oder Kundendatensätzen in einem einzigen Arbeitskontext unterstützen. Der Vorteil ist nicht einfach „mehr Seiten“; es ist die Fähigkeit, über weit entfernte Evidenzen zu schlussfolgern und zugleich eine lange Agenten-Historie zu bewahren.

Es bleibt jedoch eine praktische Vorsicht: Maximale Kontextkapazität garantiert keine perfekte Erinnerung an jeder Position, und sehr große Prompts erhöhen Latenz und Kosten. Langer Kontext sollte mit Retrieval, Caching, strukturierter Erinnerung oder Aufgaben-Segmentierung kombiniert werden, wenn diese Ansätze die Zuverlässigkeit verbessern.

Final Verdict: Is MiniMax M3 a Frontier Model?

Ja — aber das stärkste Argument für dieses Label ist nicht, dass M3 jede Tabelle anführt. Tut es nicht.

Was MiniMax M3 verändert, ist der Trade-off. Es bietet wettbewerbsfähige Frontier-Performance zur Launch-Zeit und zugleich offene Gewichte, ein millionentokenstarkes Sparse-Attention-Design, natives Text-Bild-Video-Training, langhorizontiges Agentenverhalten und deutlich niedrigere Per-Token-API-Preise als die geschlossenen Flaggschiffmodelle im ursprünglichen Vergleichsset.

SEO-Informationen

Suggested URL: /blog/minimax-m3-specs-benchmarks-pricing

Description: Entdecken Sie MiniMax M3s Spezifikationen, 1M-Token-Kontext, Sparse Attention, multimodale Fähigkeiten, Benchmark-Leistung, API-Preise, Anwendungsfälle und Modellvergleiche.

Keywords: MiniMax M3, MiniMax M3 specs, MiniMax M3 benchmarks, MiniMax M3 API pricing, MiniMax Sparse Attention, 1M-token context window, multimodal coding model, open-weight AI model, long-horizon AI agents, MiniMax M3 vs GPT-5.5

Weiterlernen

Diesen Artikel mit der nächsten Entscheidung verknüpfen.

Alle Themen anzeigen
Veröffentlicht am Aug 18, 2026
Zuletzt aktualisiert Aug 18, 2026
0 Aufrufe
Auf Klarheit, Quellenangabe und aktuelle API-Terminologie geprüft.

Bereit, die KI-Entwicklungskosten um 20 % zu senken?

In wenigen Minuten kostenlos starten. Inklusive kostenlosem Testguthaben. Keine Kreditkarte erforderlich.

Mehr lesen