TL;DR
MiniMax M3 — передовая модель MiniMax для программирования, агентных рабочих процессов, рассуждений с длинным контекстом и мультимодального понимания. Она была официально выпущена 1 июня 2026 года и сочетает три ключевые возможности, на которых MiniMax сделал акцент: контекстное окно до 1M токенов, нативное понимание изображений/видео и длительное автономное выполнение агентных задач.
Модель с открытыми весами имеет около 428 миллиардов параметров всего и около 23 миллиардов активируемых параметров. Это означает, что лишь примерно 5,4% заявленной емкости параметров активны на типичном токене, что помогает объяснить, как очень большая модель может оставаться практичной на этапе инференса. M3 также представляет MiniMax Sparse Attention (MSA) — блочно-разреженную схему внимания, созданную для контекстов на миллионы токенов.
Для разработчиков M3 доступна через API MiniMax и в формате открытых весов, а также через CometAPI для команд, которым нужен единый интерфейс для MiniMax и других провайдеров моделей.
Key Takeaways
- MiniMax выпустила M3 1 июня 2026 года как передовую модель, ориентированную на программирование, агентов, длинный контекст и мультимодальность.
- В релизе с открытыми весами раскрыты ~428B параметров всего и ~23B активируемых параметров.
- M3 поддерживает до 1M токенов контекста, при этом MiniMax описывает 512K как гарантированный минимальный уровень для API.
- MiniMax Sparse Attention заменяет полное глобальное внимание выбором блоков и точным разреженным вниманием по выбранным областям контекста.
- M3 обучалась [смешанными модальностями с Шага 0] и поддерживает ввод текста, изображений и видео.
- Официальные метрики запуска включают 59.0% SWE-Bench Pro, 66.0% Terminal-Bench 2.1, 83.5 BrowseComp и 75.2 OSWorld-Verified.
- MiniMax продемонстрировала почти 12 часов автономного воспроизведения статьи и примерно 24 часа оптимизации CUDA-ядра с 1 959 вызовами инструментов.
- API поддерживает настраиваемое рассуждение и текст, изображения, видео, инструменты-функции, стандартные/приоритетные уровни обслуживания и тарификацию для длинного контекста.
What Is MiniMax M3?
MiniMax M3 — преемник поколения M2 и представляет собой более крупный архитектурный сдвиг, чем обычное минорное обновление. MiniMax M2.7 уже был ориентирован на реальные задачи в разработке ПО, офисную продуктивность и агентные рабочие процессы, но M3 добавляет новую архитектуру разреженного внимания, нативное мультимодальное предобучение и цель в виде контекста на миллион токенов.
M3 — это передовая мультимодальная модель для программирования с контекстным окном 1M. Официальный репозиторий с открытыми весами приводит наиболее важные масштабы: примерно 428B параметров всего и 23B активируемых. Связанный технический отчет по MSA также описывает архитектуру как работающую в конфигурации Mixture-of-Experts, что соответствует раскрытому соотношению общих и активируемых параметров.
Это делает M3 менее интересной как «более крупную M2.7» и более интересной как конвергентную модель. Она объединяет контекст на уровне репозитория, программирование, мультимодальное восприятие, ориентированных на компьютер агентов и локальное/открытое развертывание в одной системе. MiniMax прямо обозначила это сочетание в качестве ключевого отличия релиза, а не заявляла, что M3 выигрывает каждый бенчмарк.
MiniMax M3 Specifications
| Specification | MiniMax M3 |
|---|---|
| Release date | June 1, 2026 |
| Model size | ~428B total parameters; ~23B activated |
| Architecture | Sparse Mixture-of-Experts with MiniMax Sparse Attention (MSA) |
| Context window | Up to 1M tokens; API guaranteed minimum 512K |
| Input modalities | Text, image, video |
| Output | Text |
| Reasoning control | Thinking on/adaptive or disabled through API parameters |
| Maximum generation | Recommended 128K; API docs allow up to 512K max_completion_tokens |
| Tool use | Function tools; agent-oriented workflows |
| Weights | Open-weight release on Hugging Face / GitHub instructions |
Контекст, модальности и поведение API выше задокументированы в официальной документации модели и API; цифры по параметрам и ссылки для локального развёртывания взяты из официального репозитория M3.
From MiniMax M2.7 to M3
| Dimension | MiniMax M2.7 | MiniMax M3 |
|---|---|---|
| Context window | 204,800 tokens | Up to 1M tokens |
| Native image/video input | No; M2.x text/tool workflows | Yes; text + image + video |
| Attention direction | Conventional M2-series serving | MSA sparse attention |
| Thinking control | Reasoning cannot be fully disabled in M2.x | Thinking can be disabled for lower latency |
| Primary positioning | Coding, tool calling, office/agent workflows | Coding + agents + multimodality + million-token context |
| Open-weight emphasis | M2.7 open model ecosystem | M3 weights + dedicated MSA implementation |
API-документация MiniMax перечисляет M2.7 с уровнем контекста 204 800 токенов, тогда как M3 переходит в класс на миллион токенов. Более важное отличие — качественное: M3 напрямую принимает визуальные и видео-входы, тогда как API серии M2.x остается ориентированным на текст и инструменты.
What Is New in MiniMax M3?
A 428B Model with About 23B Parameters Active
Публичный репозиторий M3 утверждает, что модель имеет ~428B параметров всего и ~23B активируемых. На практике раскрытая активная доля составляет около 5,4%. В этом и состоит базовое преимущество архитектуры из экспертов: общая емкость может быть очень большой, в то время как вычислительный путь для конкретного токена затрагивает лишь часть модели.
Одного лишь числа параметров недостаточно, чтобы определять качество, и «428B» не следует понимать как 428B плотных параметров, вычисляемых для каждого токена. Более полезная интерпретация: у M3 большой пул емкости, сочетающийся с условной активацией и системой внимания, призванной удерживать стоимость длинного контекста под контролем.
MiniMax Sparse Attention: Making 1M Context Practical
Ключевое архитектурное изменение — MiniMax Sparse Attention (MSA). Полное softmax-внимание растет квадратично с длиной последовательности, что становится дорого, когда истории агентов, репозитории кода, логи инструментов, изображения и длинные документы накапливаются до сотен тысяч токенов.
MSA добавляет легкую индексную ветвь (Index Branch), которая оценивает блоки ключ-значение и выбирает Top-k подмножество для каждой группы в механизме grouped-query attention. Основная ветвь затем выполняет точное блочно-разреженное внимание только по выбранным блокам. Технический отчет MiniMax описывает это как аппаратно-ориентированную конструкцию, призванную сохранить качество, одновременно уменьшая объем контекста, требующего полного внимания.

Рисунок 1. Архитектура MiniMax Sparse Attention (MSA). Источник: официальная схема MSA от MiniMax
При контексте 1M MiniMax сообщает, что M3 использует примерно 1/20 вычислений на токен по сравнению с предыдущим поколением и обеспечивает более чем 9× ускорение префилла и более чем 15× ускорение декодирования по сравнению с M2. Отдельная статья про MSA приводит дополнительные контролируемые эксперименты на тестовой MoE-модели 109B, поэтому эти данные не следует путать с производственными цифрами M3 против M2.
Это различие важно. Статья валидирует механизм внимания в исследовательской настройке; числа запуска M3 описывают производственную модель. Направление у обоих результатов одно, но это не один и тот же бенчмарк.
Native Multimodality from Step 0
M3 не позиционируется как текстовая модель с добавленным в конце отдельным визуальным адаптером. MiniMax заявляет, что она прошла мультимодальное обучение, начиная с Шага 0 и переработала конвейер предобучения данных, чтобы увеличить объем мультимодальных интерливов.
Производственный API поддерживает ввод текста, изображений и видео. Это важно для программирования и агентной работы, потому что многие реальные задачи не являются сугубо текстовыми: отладка может требовать скриншота, фронтенд — сравнения с эталонным изображением, исследования — графики и формулы, а агенты, управляющие компьютером, работают через визуальные интерфейсы.
Полезный способ думать о мультимодальности M3 — не «он может описать картинку», а «визуальное состояние может оставаться внутри того же длительного цикла рассуждений, что и код, вывод инструментов, документы и обратная связь пользователя».
Interactive Coding and Agent Training
MiniMax утверждает, что классические бенчмарки по программированию слишком одношаговые, чтобы отражать реальную работу разработчиков. Для M3 компания построила интерактивный симулятор пользователя, который подвергает модель уточнению требований, обсуждению решений, корректировке по обратной связи, переключению задач и многораундовой итерации проекта.
Цель — перейти от пассивного исполнения инструкций к сотрудничеству. Эффективный агент-программист должен уметь декомпозировать задачу, вызывать инструменты, интерпретировать сбои, корректировать план, сохранять ранее принятые решения и продолжать после первого правдоподобного ответа. Длинный контекст и ориентированная на инструменты подготовка M3 построены именно вокруг этого цикла.
Long-Horizon Autonomous Execution
Самые убедительные демонстрации M3 — не примеры чата. Это длительные задачи, в которых модель должна поддерживать состояние и продолжать улучшать результат после повторяющейся обратной связи от инструментов.
| Task | Autonomous runtime | Evidence of persistence | Reported result |
|---|---|---|---|
| ICLR paper reproduction | Nearly 12 hours | 18 commits; 23 experimental figures | Core experiments reproduced |
| FP8 GEMM kernel optimization | ~24 hours | 147 benchmark submissions; 1,959 tool calls | 7.6% → 71.3% peak utilization; 9.4× speedup |
| PostTrainBench model training | 12-hour task window | Data synthesis → training → evaluation → iteration | Score 0.37; behind Opus 4.7 and GPT-5.5, ahead of other models in MiniMax report |
В задаче воспроизведения статьи M3 работала почти 12 часов и сделала 18 коммитов плюс 23 экспериментальные фигуры. Задача сочетала чтение статьи, понимание графиков/формул, написание кода, эксперименты и итеративную интерпретацию.
.png)
Рисунок 2. Траектория автономного воспроизведения статьи M3 примерно за 12 часов. Источник: официальная демонстрация M3 от MiniMax
В задаче оптимизации CUDA M3 выполнила 147 отправок бенчмарка и 1 959 вызовов инструментов примерно за 24 часа, в итоге увеличив заявленную пиковую утилизацию Hopper FP8 с 7,6% до 71,3%, что дало 9,4× ускорение без вмешательства человека. Примечателен не только финальный прирост; MiniMax отмечает, что наилучшее решение модель выдала на 145-й попытке после ряда плато.
Benchmark Performance of MiniMax M3
Диаграмма бенчмарков запуска MiniMax сравнивает M3 с Claude Opus 4.7, GPT-5.5, и Gemini 3.1 Pro в задачах программирования, терминала, веб-сёрфинга, офисной работы, использования инструментов и работы на компьютере. Это наиболее полезные прямые сравнения, поскольку они опубликованы в том же релизном пакете M3.

Рисунок 3. Официальное сравнение бенчмарков запуска M3 от MiniMax. Источник: официальный бенчмарк-изображение MiniMax
| Benchmark | MiniMax M3 | Claude Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-Bench Pro | 59.0 | 64.3 | 58.6 | 54.2 |
| Terminal-Bench 2.1 | 66.0 | 66.1 | 78.2 | 70.0 |
| VIBE V2 | 50.1 | 55.8 | 50.5 | 28.0 |
| SVG-Bench | 63.7 | 62.3 | 58.2 | 59.2 |
| KernelBench Hard | 28.8 | 30.7 | 20.9 | 18.6 |
| BrowseComp | 83.5 | 79.3 | 84.4 | 85.9 |
| GDPval rubrics | 74.7 | 79.8 | 80.6 | 57.8 |
| BankerToolBench | 76.1 | 81.3 | 75.0 | 67.0 |
| MCP Atlas | 74.2 | 77.0 | 75.3 | 69.2 |
| OSWorld-Verified | 75.2 | 82.8 | 78.7 | 76.2 |
Все оценки в этой таблице переписаны из официальной диаграммы запуска M3 от MiniMax. Их следует рассматривать как результаты, заявленные поставщиком на запуске, а не как новый независимый повтор, выполненный CometAPI.
What the Benchmark Results Actually Show
Во-первых, M3 действительно конкурентоспособна в инженерии ПО. На SWE-Bench Pro она набирает 59,0 — выше значений 58,6 и 54,2, которые MiniMax приводит для GPT-5.5 и Gemini 3.1 Pro, но ниже, чем у Claude Opus 4.7 с 64,3. KernelBench Hard дает схожую картину: M3 с 28,8 близка к Opus 4.7 с 30,7 и существенно выше двух других значений в диаграмме MiniMax.
Во-вторых, исполнение в терминале — не сильнейшая относительная сторона M3. Terminal-Bench 2.1 ставит M3 на 66,0 — фактически наравне с Opus 4.7 (66,1), но заметно ниже GPT-5.5 (78,2) и Gemini 3.1 Pro (70,0).
В-третьих, M3 сильна, но не доминирует в сборе информации. BrowseComp — 83,5: выше, чем 79,3 у Opus 4.7, но немного ниже GPT-5.5 (84,4) и Gemini 3.1 Pro (85,9). MCP Atlas с 74,2 также близок к 75,3 у GPT-5.5 и 77,0 у Opus 4.7.
В-четвертых, диаграмма запуска дает M3 особенно хороший результат на SVG-Bench: 63,7 против 62,3 у Opus 4.7, 58,2 у GPT-5.5 и 59,2 у Gemini 3.1 Pro. Это соответствует более широкой концепции M3: нативное визуальное понимание должно напрямую участвовать в рабочих процессах программирования и агентов, а не оставаться отдельной визион-функцией.
Общий вывод, таким образом, более тонкий, чем «M3 обгоняет закрытые модели». M3 входит в тот же диапазон производительности по многим агентным задачам, выигрывает некоторые оценки и проигрывает другие. Ее отличает сопутствующий набор возможностей: открытые веса, мультимодальная подготовка, дизайн на миллион токенов и агрессивная экономика сервинга.
MiniMax M3 vs Claude Opus 5 vs GPT-5.6 Sol vs Gemini 3.7 Flash
MiniMax M3 вышла на быстро меняющийся рынок, и её изначальный набор сравнений больше не является самым полезным ориентиром. Более релевантное сравнение текущего поколения — Claude Opus 5, GPT-5.6 Sol и Gemini 3.7 Flash: более новые закрытые модели, ориентированные на программирование, агентов и мультимодальную работу. Поскольку эти модели не оценены в одном идентичном стенде, таблица акцентирует документированные возможности и использует цифры бенчмарков только там, где метрика напрямую опубликована.
| Dimension | MiniMax M3 | Claude Opus 5 | GPT-5.6 Sol | Gemini 3.7 Flash |
|---|---|---|---|---|
| Weights | Open weight | Closed | Closed | Closed / hosted API |
| Public parameter count | ~428B total / ~23B active | Not disclosed | Not disclosed | Not disclosed |
| Context window | Up to 1M | 1M | 1,050,000 | 1M |
| Input modalities | Text, image, video | Text, image, PDF | Text, image | Text, image, video, audio, PDF |
| Coding / agent focus | Coding + long-horizon agents + multimodality | Complex agentic coding + enterprise work | Frontier coding + tool-heavy professional agents | Fast agentic coding + multimodal workflows |
| Computer / tool use | Function tools + MiniMax Code + computer use | Server/client tools + computer use | Web/file search, shell, computer use, MCP | Function calling, search, computer use |
| Terminal-Bench 2.1* | 66.0 | Not reported in Opus 5 launch | 88.8 | 85.8 |
| Representative coding signal* | SWE-Bench Pro 59.0 | Frontier-Bench v0.1: SOTA in Anthropic report | DeepSWE v1.1 72.7 | DeepSWE v1.1 65.3 |
| Best reason to choose | Open weights + low cost + 1M multimodal context | Judgment + long-horizon autonomy | Raw coding/terminal performance + broad tool stack | Speed/cost + native multimodality |
Эти цифры по бенчмаркам получены из пакетов оценок разных провайдеров и не должны читаться как единый синхронизированный рейтинг. 66,0 в Terminal-Bench 2.1 у M3 — из релизной оценки MiniMax; OpenAI сообщает 88,8 для GPT-5.6 Sol, а Google — 85,8 для Gemini 3.7 Flash. Запуск Anthropic Opus 5 делает акцент на Frontier-Bench, GDPval-AA, AutomationBench и OSWorld 2.0, вместо публикации напрямую сопоставимого результата Terminal-Bench 2.1. Для выбора модели следует бенчмаркировать кандидатов в одном стенде на своей нагрузке, а не воспринимать кросс-провайдерские стартовые цифры как постоянный рейтинг.
Where MiniMax M3 Has the Clearest Advantage
Самое очевидное преимущество M3 — выбор развертывания. Таблица бенчмарков и число параметров сами по себе не объясняют, почему разработчикам может быть важна эта модель. M3 сочетает открытые веса с длиной контекста и мультимодальными возможностями, обычно характерными для хостинговых передовых систем. Это делает её привлекательной там, где командам нужны локальное развертывание, независимость от провайдера, специализированный сервинг или глубокий контроль над стеком инференса.
Второе преимущество — архитектура стоимости длинного контекста. MSA специально разработан, чтобы предотвратить взрыв вычислений внимания на масштабе миллиона токенов. Это не делает запросы на 1M токенов дешевыми в абсолютном выражении — KV-кэш, выполнение экспертов и мультимодальные входы всё ещё требуют ресурсов — но меняет кривую масштабирования по сравнению с полным вниманием.
Where Closed Models Still Lead
Та же официальная диаграмма бенчмарков показывает, почему M3 не следует представлять как автоматическую замену каждой закрытой передовой модели. Claude Opus 4.7 имеет более сильные результаты на SWE-Bench Pro, KernelBench Hard, GDPval, BankerToolBench, MCP Atlas и OSWorld-Verified в сравнении MiniMax. GPT-5.5 намного сильнее на Terminal-Bench 2.1 и лидирует на GDPval. Gemini 3.1 Pro немного лидирует на BrowseComp.
Для продакшн-команд закрытые платформы также могут предоставлять зрелые механизмы безопасности, хостинговые инструменты, наблюдаемость, гарантии пропускной способности и интеграции, которые важнее открытых весов. M3 становится наиболее убедительной, когда преимущества развертывания и стоимости входят в требования, а не когда единственным критерием является место в рейтинге.
MiniMax M3 API Pricing
MiniMax сейчас использует два стандартных уровня цен по контексту. На официальной странице цен указана «постоянная скидка 50%» — $0.30/M на ввод и $1.20/M на вывод для запросов с входом ≤512K токенов. Запросы свыше 512K показаны как $0.60/M на ввод и $2.40/M на вывод. Приоритетное обслуживание стоит 1,5× стандартного уровня.
| Route / tier | Input price per 1M tokens | Output price per 1M tokens | Context note |
|---|---|---|---|
| MiniMax official Standard (current discounted rate) | $0.30 | $1.20 | ≤512K input |
| MiniMax official Standard long-context | $0.60 | $2.40 | >512K input |
| MiniMax official Priority (discounted rate) | $0.45 | $1.80 | ≤512K input; priority admission |
| CometAPI MiniMax-M3 page | $0.48 | $1.92 | Unified gateway pricing shown by CometAPI |
*MiniMax-M3 на CometAPI стоит $0.48/M на ввод и $1.92/M на вывод и сравнивается с незадисконтированным прайсом MiniMax $0.60/$2.40. Поскольку собственная платформа MiniMax сейчас показывает отдельную 50%-скидку на стандартный уровень, разработчикам следует сравнивать фактическую текущую ставку биллинга, а не полагаться лишь на заголовочный процент скидки.
Причина использовать CometAPI в этой ситуации — не обязательно самая низкая промо-цена в каждый момент времени. Его ценность — это единый слой API и биллинга, когда приложению нужно маршрутизировать запросы между M3 и другими провайдерами без поддержки отдельных интеграций.
What Can MiniMax M3 Do?
Coding and Repository-Scale Engineering
Самый очевидный кейс M3 — разработка ПО на уровне больших репозиториев. Контекст на миллион токенов может вместить гораздо больше кода, документации, вывода тестов, истории задач и состояния агента, чем окно 204,8K в предыдущем поколении M2. На практике это позволяет такие процессы, как реализация функций по множеству файлов, рефакторинг на уровне репозитория, диагностика багов, ремонт тестов, циклы сборки/терминала, ревью pull request и оптимизация производительности.
Ключ — устойчивость во времени. Агент-программист на уровне репозитория полезен только если он может сохранить исходные требования, одновременно накапливая вывод инструментов и правки. Демонстрации на 12 часов и с CUDA предполагают, что M3 спроектирована продолжать работу после промежуточных неудач, а не рассматривать каждый вызов инструмента как отдельную короткую задачу.
Autonomous Research and Experimentation
Пример с воспроизведением статьи — хороший шаблон для исследовательских агентов. M3 может прочитать статью, проанализировать графики, рассуждать о формулах, сгенерировать код, запустить эксперименты, оценить соответствие результатов ожиданиям и продолжать совершенствовать реализацию. Способность держать текст статьи, код и журналы экспериментов в одном длинном контексте уменьшает объем состояния, которое нужно суммировать или восстанавливать внешне.
Это также причина, по которой релевантен PostTrainBench. MiniMax попросила M3 синтезировать тренировочные данные, обучить базовые модели, оценить их и итеративно улучшать без участия человека. M3 не заняла первое место — она уступила Opus 4.7 и GPT-5.5 в отчете MiniMax — но эксперимент демонстрирует форму автоматизации исследований, более сложную, чем обычный вопрос-ответ.
Multimodal Technical Analysis
Поскольку M3 нативно принимает изображения и видео, технические рабочие процессы могут комбинировать визуальные свидетельства с текстом и кодом. Примеры: сравнение фронтенд-реализации со скриншотом, анализ графиков в научной статье, инспекция состояния UI во время работы на компьютере, извлечение информации из диаграмм или сочетание видео-наблюдений с длинным журналом обслуживания.
Совместимый с OpenAI API MiniMax явным образом поддерживает части контента image_url и video_url для M3, включая загружаемые файлы для больших видео. Это делает мультимодальный ввод разработческим API-функционалом, а не только продуктовой демонстрацией.
Computer and Office Automation
MiniMax Code разработан как каркас агента вокруг M3. Компания говорит, что Agent Team может разбивать сложные задачи на многоэтапные параллельные потоки и использовать петлю Producer + Verifier для рефлексии и исправлений. Нативная мультимодальность M3 также позволяет сценарии работы на компьютере, которые переходят между приложениями, файлами, таблицами и интерфейсами рабочего стола.
Один из официальных примеров — инструкция открыть локальный клиент ERP и пакетно внести информацию о счетах из Excel-таблицы. Важная способность — кросс-приложенческое состояние: агенту нужно понимать таблицу, управлять интерфейсом, сохранять сопоставление полей и восстанавливаться, если UI изменится или действие завершится неудачей.
Long-Context Document and Knowledge Work
Контекстное окно 1M полезно не только для кода. Оно поддерживает большие коллекции контрактов, политик, технических спецификаций, научных статей, отчетов по инцидентам или клиентских записей в одном рабочем контексте. Преимущество — не просто «больше страниц»; это возможность рассуждать на основе удаленных фрагментов, сохраняя длинную историю агента.
Есть и практическое предупреждение: максимальная емкость контекста не гарантирует идеальное запоминание каждой позиции, а очень большие подсказки увеличивают задержку и стоимость. Длинный контекст следует сочетать с извлечением (retrieval), кэшированием, структурной памятью или сегментацией задач, когда эти подходы повышают надежность.
Final Verdict: Is MiniMax M3 a Frontier Model?
Да — но сильнейший аргумент в пользу такого ярлыка не в том, что M3 лидирует во всех таблицах. Это не так.
То, что меняет MiniMax M3, — это компромисс. Она предлагает конкурентный для своего времени уровень передовой производительности, при этом предоставляя открытые веса, разреженное внимание с контекстом на миллион токенов, нативное обучение текст-изображение-видео, поведение агента с длинным горизонтом и гораздо более низкую стоимость API на токен по сравнению с закрытыми флагманами из первоначального набора сравнения.
SEO信息
Suggested URL: /blog/minimax-m3-specs-benchmarks-pricing
Description: Изучите характеристики MiniMax M3, контекст на 1M токенов, разреженное внимание, мультимодальные возможности, результаты бенчмарков, цены API, варианты использования и сравнения моделей.
Keywords: MiniMax M3, характеристики MiniMax M3, бенчмарки MiniMax M3, цены MiniMax M3 API, MiniMax Sparse Attention, контекстное окно на 1M токенов, мультимодальная модель для кодинга, модель ИИ с открытыми весами, агент ИИ с длинным горизонтом, MiniMax M3 vs GPT-5.5
