TLDR MiniMax M3 объединяет контекстное окно на 1 000 000 токенов, нативное понимание текста, изображений и видео, сильные возможности в программировании и агентной работе, а также MiniMax Sparse Attention (MSA). Разработчики могут вызывать MiniMax M3 через совместимый с OpenAI шлюз CometAPI по адресу https://api.cometapi.com/v1 с идентификатором модели minimax-m3.
В этом руководстве рассмотрены спецификации модели, официальные данные бенчмарков, настройка API, стриминг, управление рассуждением, мультимодальные запросы, вызов инструментов, цены и сравнение с другими передовыми API 2026 года.
Ключевые выводы
- MiniMax M3 поддерживает до 1 млн токенов контекста, что позволяет работать на уровне целых репозиториев и вести долгие сессии агентов.
- Модель изначально мультимодальна с нулевого шага обучения и принимает текст, изображения и видео.
- Архитектура MiniMax Sparse Attention разработана для того, чтобы миллион-токенный контекст был вычислительно практичным. Официальные результаты включают 59,0% на SWE-Bench Pro и 66,0% на Terminal-Bench 2.1, а также высокие показатели по агентным задачам и использованию инструментов.
- OpenAI-совместимый API MiniMax поддерживает adaptive или disabled thinking, стриминг, инструменты и reasoning_split.
- В CometAPI текущий идентификатор модели — minimax-m3, основной эндпоинт — /v1/chat/completions.
Что такое MiniMax M3?
MiniMax M3 разработана вокруг трех нагрузок, которые все больше определяют передовые модели для разработчиков: крупномасштабная разработка ПО, автономное выполнение агентами и мультимодальное рассуждение на длинном контексте. MiniMax описывает M3 как модель, достигающую передового уровня в задачах программирования и работы агентов, объединяя контекст на 1 млн токенов, нативную мультимодальность и MSA. Практический результат — модель ориентирована не на изолированные ходы чата, а на рабочие процессы, где со временем накапливаются файлы, результаты инструментов, скриншоты, изменения кода и состояние рассуждения.
M3 доступна через собственную экосистему API MiniMax и через эндпоинт MiniMax M3 на CometAPI. Для разработчиков, уже использующих OpenAI SDK, маршрут через CometAPI сохраняет знакомую форму Chat Completions и облегчает сравнение M3 с моделями от Anthropic, Google, Moonshot AI и других поставщиков.
Технические характеристики MiniMax M3
| Характеристика | MiniMax M3 |
|---|---|
| Поставщик | MiniMax |
| Официальный релиз | 1 июня 2026 |
| Идентификатор в CometAPI | minimax-m3 |
| Официальный ID в API | MiniMax-M3 |
| Архитектура | MiniMax Sparse Attention (MSA) |
| Контекстное окно | До 1 000 000 токенов; страница модели MiniMax гарантирует минимум 512K |
| Входные модальности | Текст, изображения, видео |
| Вывод | Текст |
| Управление рассуждением | thinking.type = adaptive или disabled |
| Вызов инструментов | Поддерживается |
| Стриминг | Поддерживается |
| Совместимый с OpenAI API | Поддерживается |
| Эндпоинт CometAPI | POST /v1/chat/completions |
Показатели по контексту и модальностям подтверждены в документации API MiniMax, а архитектура модели и позиционирование релиза взяты из официального релиза M3.
Чем MiniMax M3 отличается?
MiniMax Sparse Attention и контекст на 1 млн токенов
Контекстное окно в миллион токенов полезно только если серверная архитектура способна обрабатывать его с приемлемой скоростью и стоимостью. M3 решает эту проблему с помощью MiniMax Sparse Attention (MSA), которая сначала выявляет релевантные KV-блоки, а затем выполняет разреженное внимание по выбранным областям вместо применения полной квадратичной схемы везде.
MiniMax сообщает, что при длине контекста 1 млн M3 использует около 1/20 вычислений на токен по сравнению с предыдущим поколением, с более чем 9-кратным ускорением префилла и более чем 15-кратным ускорением декодирования. Это результаты, заявленные вендором, а не замеры сторонних систем, но они объясняют, почему MSA является ключевой для дизайна M3 на длинном контексте.

Рисунок 1. Архитектура MiniMax Sparse Attention. Источник: официальный релиз M3 от MiniMax
Нативная мультимодальность
MiniMax заявляет, что M3 прошла смешанное мультимодальное обучение с нулевого шага, а не добавляла отдельный визуальный слой после предобучения на тексте. В OpenAI-совместимом API M3 принимает части контента текста, изображений и видео. Изображения можно отправлять через image_url, а видео — через video_url; поддерживаемые форматы изображений: JPEG, PNG, GIF и WEBP, видео: MP4, AVI, MOV и MKV.
Для разработчиков это делает одну модель пригодной для задач вроде отладки по скриншотам, интерпретации графиков, ревью UI, анализа технической документации и понимания видео без необходимости направлять каждый визуальный ввод через отдельную модель.
Программирование и агентные рабочие процессы
Самое сильное публичное позиционирование M3 — не общий чат. MiniMax делает акцент на исправлении ошибок, фронтенд- и бэкенд-разработке, выполнении команд в терминале, оптимизации производительности, вызове инструментов и долгосрочном сотрудничестве. Поэтому официальный набор бенчмарков M3 подчеркивает инженерные и агентные тесты, а не академические QA.
| Бенчмарк | Что тестирует | MiniMax M3 |
|---|---|---|
| SWE-Bench Pro | Реальная разработка программного обеспечения | 59,0% |
| Terminal-Bench 2.1 | Агентные задачи на терминале | 66,0% |
| SWE-fficiency | Эффективность разработки ПО | 34,8% |
| KernelBench Hard | Оптимизация GPU-ядра | 28,8% |
| MCP Atlas | Возможности агента MCP / tool-use | 74,2% |
| BrowseComp | Автономный браузинг и поиск | 83,5 |
| PostTrainBench | Автономный пост-тренировочный процесс | 0,37 |
Настраиваемое рассуждение
В OpenAI-совместимом API MiniMax M3 поддерживает явное управление рассуждением: thinking может быть установлен в adaptive или disabled. Если поле опущено на совместимом с OpenAI эндпоинте MiniMax, thinking включен по умолчанию. Для продакшн-интеграций безопаснее задавать поле явно — так легче воспроизводить задержку и поведение в разных окружениях.
Производительность агентов на длинных горизонтах
MiniMax также опубликовала два долгих кейса, показывающих, почему дизайн контекста M3 важен. В задаче воспроизведения научной работы M3 работала автономно почти 12 часов, выполнив 18 коммитов и создав 23 экспериментальные фигуры, воспроизводя основные эксперименты статьи, получившей Outstanding Paper на ICLR 2025. Задача требовала чтения рисунков и формул, редактирования кода, отслеживания экспериментов и удержания длинной истории выполнения.
В отдельном упражнении по оптимизации CUDA-ядра MiniMax сообщает о 147 отправках бенчмарков и 1 959 вызовах инструментов за примерно 24 часа, при этом пиковая загрузка Hopper FP8 увеличилась с 7,6% до 71,3%, что эквивалентно заявленному 9,4-кратному ускорению. Это контролируемые демонстрации, а не гарантии для каждого продакшн-агента, но они иллюстрируют задуманный сценарий: устойчивые циклы инструментов, где прогресс может появиться только после многих итераций.

Почему стоит использовать API MiniMax M3 через CometAPI?
CometAPI предоставляет доступ к M3 через ту же общую среду API, которая используется для сотен других моделей. Это важно, когда команде нужно сравнивать нескольких поставщиков, вести единый биллинг или поддерживать маршруты отказоустойчивости без перестройки приложения под каждый специфический SDK.
- Совместимая с OpenAI интеграция: существующие клиенты OpenAI SDK можно переиспользовать, изменив base URL, ключ API и идентификатор модели.
- Один ключ для нескольких поставщиков моделей — проще проводить A/B-тесты и реализовывать маршрутизацию фолбэков.
- Централизованный учет использования и отслеживание стоимости на уровне модели вместо отдельных панелей провайдеров.
- Быстрая смена модели, когда нагрузке нужен иной баланс качества, задержки, поддержки модальностей или цены.
Живая страница MiniMax M3 на CometAPI сейчас указывает идентификатор модели minimax-m3, POST /v1/chat/completions и примеры для OpenAI SDK.
Как использовать API MiniMax M3 с CometAPI
Шаг 1: Создайте аккаунт CometAPI и получите ключ API
Создайте или войдите в свой аккаунт CometAPI, затем сгенерируйте токен API в консоли токенов. Храните токен в переменной окружения, а не коммитьте в репозиторий.
export COMETAPI_KEY="your-key-here"
Шаг 2: Настройте клиент OpenAI
Базовый URL совместимого с OpenAI CometAPI:
https://api.cometapi.com/v1
Установите OpenAI SDK и направьте клиент на CometAPI:
pip install openai
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
Шаг 3: Выполните свой первый запрос к MiniMax M3
Используйте идентификатор модели minimax-m3 в CometAPI. Минимальный запрос cURL выглядит так:
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-m3",
"messages": [
{
"role": "system",
"content": "You are a precise software engineering assistant."
},
{
"role": "user",
"content": "Review this migration plan and list three high-risk failure modes."
}
],
"max_completion_tokens": 1200,
"reasoning_split": true
}'
Python:
completion = client.chat.completions.create(
model="minimax-m3",
messages=[
{"role": "system", "content": "You are a precise technical assistant."},
{"role": "user", "content": "Explain how sparse attention helps long-context coding agents."},
],
max_completion_tokens=1200,
extra_body={"reasoning_split": True},
)
print(completion.choices[0].message.content)
Живая страница M3 CometAPI использует тот же паттерн reasoning_split в своем примере на Python. Этот переключатель меняет формат возврата контента рассуждения; сам по себе он не включает и не отключает thinking.
Шаг 4: Включите стриминг
Стриминг полезен для чат-интерфейсов, ассистентов для кодинга и длинных ответов, потому что пользователи видят вывод по мере прихода. Документация MiniMax, совместимая с OpenAI, подтверждает поддержку стриминга для M3.
stream = client.chat.completions.create(
model="minimax-m3",
messages=[{"role": "user", "content": "Create a phased plan for migrating a monolith to services."}],
stream=True,
max_completion_tokens=3000,
)
for chunk in stream:
delta = chunk.choices[0].delta
if delta.content:
print(delta.content, end="", flush=True)
Шаг 5: Включайте или отключайте thinking
MiniMax определяет режимы thinking для M3: adaptive и disabled. Используйте adaptive для сложных задач программирования, планирования и работы агентов; отключайте для простых задач извлечения, классификации или когда критична задержка. При использовании полей, специфичных для провайдера, через совместимый с OpenAI роутер, валидируйте их в песочнице CometAPI перед продакшном, так как поведение проброса может меняться.
# Более глубокое рассуждение
completion = client.chat.completions.create(
model="minimax-m3",
messages=[{"role": "user", "content": "Find the root cause of this distributed transaction failure."}],
extra_body={"thinking": {"type": "adaptive"}},
)
# Более быстрый прямой ответ
completion = client.chat.completions.create(
model="minimax-m3",
messages=[{"role": "user", "content": "Extract the invoice number from this text."}],
extra_body={"thinking": {"type": "disabled"}},
)
Шаг 6: Используйте ввод изображений
OpenAI-совместимый API M3 принимает части контента image_url. Тот же паттерн типизированного контента — естественный способ отправлять скриншоты, схемы или графики через маршрут в стиле OpenAI.
response = client.chat.completions.create(
model="minimax-m3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Review this dashboard screenshot and identify the likely UI problems."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/dashboard.png",
"detail": "default"
}
}
]
}]
)
MiniMax документирует поддержку JPEG, PNG, GIF и WEBP с уровнями детализации изображения low, default или high. Провайдер также публикует ограничения на размер запроса, поэтому проверьте актуальные лимиты мультимодального API перед отправкой крупных объектов.
Шаг 7: Используйте ввод видео
M3 также поддерживает части контента video_url. MiniMax документирует MP4, AVI, MOV и MKV, а также поддерживает крупные видео через Files API.
response = client.chat.completions.create(
model="minimax-m3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Summarize the workflow in this product demo and list every visible error state."},
{
"type": "video_url",
"video_url": {"url": "mm_file://your_file_id", "detail": "default"}
}
]
}]
)
Если ваше приложение направляет мультимодальные запросы через CometAPI, подтвердите точный способ передачи файлов, поддерживаемый активным маршрутом M3; нативный идентификатор mm_file:// относится к файловому workflow MiniMax.
Шаг 8: Добавьте вызов функций и инструментов
MiniMax M3 поддерживает описания инструментов в OpenAI-совместимом API. Продукционный агент должен выполнить запрошенный инструмент, добавить полное сообщение assistant с вызовом инструмента в историю диалога, затем вернуть результат инструмента модели. MiniMax явно предупреждает, что сохранение полного ответа важно для непрерывности рассуждения.
tools = [{
"type": "function",
"function": {
"name": "get_build_status",
"description": "Get the current CI build status for a repository.",
"parameters": {
"type": "object",
"properties": {
"repo": {"type": "string"},
"branch": {"type": "string"}
},
"required": ["repo", "branch"]
}
}
}]
response = client.chat.completions.create(
model="minimax-m3",
messages=[{"role": "user", "content": "Check whether the main branch of acme/payments is passing CI."}],
tools=tools,
)
Шаг 9: Разумно используйте длинный контекст и кэширование промптов
Контекстное окно на 1 млн токенов не означает, что каждый запрос должен содержать 1 млн токенов. Упаковывайте только файлы, логи, документы и вывод инструментов, релевантные текущей задаче. Автоматическое кэширование промптов MiniMax может снижать стоимость и время обработки, когда повторяются префиксы вроде системных промптов, списков инструментов или истории диалога.
Для агентных сценариев уровня репозитория хороший паттерн — держать стабильное описание проекта и схему инструментов, извлекать только файлы, релевантные текущему шагу, и периодически сжимать устаревшую историю, вместо того чтобы давать сессии расти без ограничений.
Важные параметры API MiniMax M3
| Параметр | Назначение | Примечания |
|---|---|---|
| model | Идентификатор модели | minimax-m3 на CometAPI; MiniMax-M3 напрямую |
| messages | История диалога и инструментов | Обязателен для Chat Completions |
| max_completion_tokens | Ограничение длины генерации | Предпочтителен вместо legacy max_tokens для новых интеграций |
| temperature | Случайность выборки | 0–2; дефолт MiniMax — 1 |
| top_p | Nucleus sampling | 0–1; дефолт MiniMax M3 — 0,95 |
| thinking | Поведение рассуждения | adaptive или disabled |
| reasoning_split | Формат вывода рассуждения | Разделяет поля рассуждения при включении |
| stream | Инкрементальный вывод | Используйте для интерактивных приложений |
| stream_options.include_usage | Метаданные использования в стриме | Полезно для мониторинга стоимости |
| tools | Описания функций | Используйте для агентных workflows |
| service_tier | Приоритет доступа | standard или priority в прямом API MiniMax |
| image_url | Часть контента изображений | JPEG, PNG, GIF, WEBP |
| video_url | Часть контента видео | MP4, AVI, MOV, MKV |
Определения параметров выше соответствуют текущей ссылочной документации OpenAI-совместимого API MiniMax. Некоторые специфичные для провайдера поля могут требовать проброса при маршрутизации через агрегатор, поэтому тестируйте нестандартные поля на текущем эндпоинте CometAPI перед релизом.
Официальный API MiniMax vs CometAPI
| Пункт | Официальный MiniMax | CometAPI |
|---|---|---|
| Идентификатор модели | MiniMax-M3 | minimax-m3 |
| Совместимость с OpenAI | Да | Да |
| Совместимость с Anthropic | Да; MiniMax рекомендует для продвинутых возможностей | Статья CometAPI фокусируется на маршруте, совместимом с OpenAI |
| Базовый URL | https://api.minimax.io/v1 | https://api.cometapi.com/v1 |
| Основное преимущество | Прямой доступ к фичам провайдера | Один ключ и общая маршрутизация для многих провайдеров |
| Лучше всего подходит | Команды, стандартизированные на нативном поведении MiniMax | Команды, сравнивающие или использующие несколько поставщиков |
MiniMax официально поддерживает вызовы, совместимые с Anthropic и OpenAI. Прямой маршрут Anthropic MiniMax рекомендует для продвинутого поведения thinking; страница модели M3 CometAPI в настоящий момент акцентирует интеграцию в стиле OpenAI — /v1/chat/completions.
Цены API MiniMax M3
Цены требуют внимательного подхода, поскольку эффективная прямую ставка MiniMax и список на сравнительной странице CometAPI сейчас не совпадают. По состоянию на 10 августа 2026 CometAPI указывает M3 по $0,48/M вход и $1,92/M выход. Та же страница сравнивает эти ставки с прайс-листом MiniMax: $0,60/M вход и $2,40/M выход.
Однако текущая страница MiniMax с оплатой по факту (pay-as-you-go) показывает постоянную скидку 50% на стандартный трафик M3: для запросов с не более чем 512K входных токенов эффективная прямая цена — $0,30/M вход, $1,20/M выход и $0,06/M чтение из кеша. Выше 512K входа — скидочные прямые ставки $0,60/M вход, $2,40/M выход и $0,12/M чтение из кеша.
| Маршрут / Тариф | Вход | Выход | Примечание по цене |
|---|---|---|---|
| CometAPI M3 | $0,48/M | $1,92/M | Унифицированный маршрут под разные модели |
| MiniMax напрямую, ≤512K вход | $0,30/M | $1,20/M | Текущая скидочная стандартная ставка |
| MiniMax напрямую, >512K вход | $0,60/M | $2,40/M | Текущий скидочный тариф для длинного входа |
Это означает, что CometAPI в настоящее время ниже номинального прайс-листа MiniMax, но не ниже скидочной прямой ставки провайдера ≤512K. Для крупных развертываний сравнивайте живые цены, а не полагайтесь на фиксированное утверждение «на 20% дешевле». Цены могут независимо меняться на каждой платформе.
Пример стоимости
При текущей ставке M3 на CometAPI запрос со 100 000 входных токенов и 5 000 выходных токенов будет стоить примерно:
| Вход: 0,10 × $0,48 = $0,048 Выход: 0,005 × $1,92 = $0,0096 Итого: $0,0576 |
|---|
Тот же запрос может стоить дешевле напрямую у MiniMax, если подпадает под текущий скидочный тариф ≤512K, но команды, работающие с несколькими моделями, все равно могут ценить операционную простоту единого шлюза.
MiniMax M3 vs Claude Sonnet 5 vs Gemini 3.6 Flash vs Kimi K3
Все четыре модели нацелены на агентные и кодинговые задачи и предоставляют очень большие окна контекста. Различия заметнее в поддержке модальностей, управлении рассуждением, экосистемах поставщиков и текущих ценах на CometAPI. Официальная документация подтверждает окно контекста 1 млн для Claude Sonnet 5, крупноконтекстный мультимодальный API для Gemini 3.6 Flash и флагманский Kimi K3 на 1 млн токенов.
| Модель | Контекст | Вход | Рассуждение | Лучшее применение | CometAPI вход / выход за M |
|---|---|---|---|---|---|
| MiniMax M3 | 1M | Текст, изображения, видео | adaptive или disabled | Кодинговые агенты, длинный контекст, мультимодальные workflows | $0,48 / $1,92 |
| Claude Sonnet 5 | 1M | Текст, изображения, документы | Adaptive thinking; управление усилием | Кодинговые агенты, профессиональная работа, инструменты Anthropic | $1,60 / $8,00 |
| Gemini 3.6 Flash | ~1,05M | Текст, изображения, видео, аудио, PDF | Уровни thinking | Быстрые мультимодальные агенты, инструменты Google | $1,20 / $6,00 |
| Kimi K3 | 1M | Текст + нативное визуальное понимание | Всегда рассуждает; reasoning_effort управляет глубиной | Долгосрочное программирование и работа с знаниями | $2,40 / $12,00 |
Текущие цены на токены CometAPI в таблице взяты с живых страниц моделей MiniMax M3, Claude Sonnet 5, Gemini 3.6 Flash и Kimi K3.
Рисунок 4. Текущее сравнение цен на токены CometAPI, проверено 10 августа 2026. Источники страниц моделей: M3, Gemini 3.6 Flash, Claude Sonnet 5*** и*** Kimi K3.
Какую модель выбрать?
- MiniMax M3, если для вас приоритет — низкая цена токенов в CometAPI, контекст 1M, нативное понимание изображений/видео и долгие сессии агентов для программирования или использования инструментов.
- Claude Sonnet 5, когда вы цените отточенных кодинговых агентов, профессиональную работу с знаниями и зрелые workflows инструментов в стиле Anthropic.
- Gemini 3.6 Flash, когда важны мультимодальность, быстрые циклы агентов, нативные инструменты Google, аудио/PDF входы и пропускная способность.
- Kimi K3, когда нагрузка сосредоточена на долгосрочном программировании, глубокой работе с знаниями и модели, которая всегда рассуждает при контексте 1M.
Не выбирайте исключительно по одному бенчмарку или цене токена. Постройте небольшой набор оценок из своего репозитория, документов, вызовов инструментов и кейсов отказов, затем сравните долю успешно решенных задач, задержку, суммарные токены, ретраи и время человеческой корректировки.
Рекомендации по использованию API MiniMax M3
- Явно задавайте thinking. Используйте adaptive для действительно сложной работы и disabled — для простых задач, где важна задержка. Явные настройки проще бенчмаркить и воспроизводить.
- Используйте окно 1M избирательно. Большой контекст — потолок емкости, а не целевой размер. Извлекайте и сжимайте перед отправкой больших репозиториев или коллекций документов.
- Сохраняйте историю вызовов инструментов. Для многотурового вызова функций храните полный ответ assistant и объекты вызова инструментов, чтобы не нарушать непрерывность рассуждения.
- Стримьте длинные ответы. Стриминг улучшает воспринимаемую задержку для программирования, исследований и агентных приложений, даже если общее время завершения не меняется.
- Используйте кэширование повторяющегося контекста. Стабильные системные промпты, схемы инструментов и повторяющаяся история — хорошие кандидаты для кэширования промптов при поддержке активного маршрута.
- Измеряйте стоимость на успешную задачу. Цена токена важна, но ретраи, циклы инструментов, длинные трассы рассуждения и восстановление после ошибок часто доминируют в итоговой экономике агента.
- Перепроверяйте специфичные для провайдера параметры. Совместимые с OpenAI шлюзы могут отличаться пробросом нестандартных полей. Валидируйте thinking, reasoning_split, мультимодальные payloads и поведение инструментов перед продакшном.
Заключение
MiniMax M3 — сильный вариант API для разработчиков, которым нужны программирование, агентное исполнение, нативное визуальное понимание и очень длинный контекст в одной модели. Ее техническая история необычно цельная: MSA решает задачу сервинга контекста 1M, нативная мультимодальность расширяет поверхность ввода, а публичный набор бенчмарков фокусируется на инженерных и инструментальных задачах, которые действительно важны для разработчиков.
Для большинства пользователей CometAPI быстрый старт прост: создайте ключ, установите базовый URL https://api.cometapi.com/v1, вызывайте модель minimax-m3 и бенчмарките ее на своих реальных продакшн-задачах. Затем решите, включать ли более глубокое рассуждение, добавлять мультимодальный ввод или строить цикл инструментов. Поскольку цены и поведение маршрутов могут меняться, перед финальным релизом перепроверьте живую страницу M3 на CometAPI и документацию MiniMax API.
