TLDR 27 сентября 2026 года MiniMax тихо, но официально запустила M3.1-Flash-Preview в составе MiniMax Code (и через Token Plan). Это передовая мультимодальная модель для программирования с полноценным контекстным окном на 1 млн токенов, нативной поддержкой ввода текста/изображений/видео и новым пятиуровневым контролем усилий рассуждения (low → max). Явно позиционируется для повседневных рабочих процессов разработки — от исправления багов до реализации, тестирования и доставки — с приоритетом на скорость и экономичность при постоянно активном мышлении.
Доступность пока ограничена Token Plan и MiniMax Code (с поддержкой API через Subscription Key); полные публичные цены и открытые веса пока не опубликованы. CometAPI уже предоставляет модель (minimax-m3.1-flash-preview) по конкурентным ставкам, что упрощает унифицированный доступ.
Ключевые выводы
- 1M-token контекст + нативная мультимодальность — Обрабатывает большие кодовые базы, длинные сессии агентов, документы, изображения и видео в одном окне.
- Пятиуровневые усилия рассуждения (low / medium / high / xhigh / max, по умолчанию max) — Обмен задержкой и затратой токенов на более глубокие рассуждения по мере необходимости. Мышление отключить нельзя.
- Фокус на повседневной разработке — Явно оптимизирована под замкнутый цикл: локализация бага → реализация → тестирование → доставка внутри MiniMax Code.
- Ограничения превью — Подтверждена в MiniMax Code и Token Plan; вызовы API требуют Subscription Key. Независимая карточка модели, публичные бенчмарки, открытые веса и отдельное pay-as-you-go ценообразование на старте не объявлены.
- Рекомендация CometAPI — Доступ через единый OpenAI-совместимый endpoint (ID модели: minimax-m3.1-flash-preview) со скидочным тарифом, удобно для команд, уже использующих каталог из 500+ моделей CometAPI.
Что такое MiniMax M3.1-Flash-Preview?
MiniMax M3.1-Flash-Preview — новейшая модель серии M от MiniMax. Официальная документация описывает ее как «передовую мультимодальную модель для программирования с 1M контекстом и настраиваемой глубиной мышления». Впервые замечена разработчиками в выборе моделей MiniMax Code и официально подтверждена аккаунтом @MiniMaxAgent в X 27 сентября 2026 года:
«Последняя текстовая модель MiniMax, M3.1-Flash-Preview, дебютирует сегодня в MiniMax Code. Создана для повседневной разработки: быстрая, надежная и готовая к реальной работе — от быстрых исправлений багов до полноценных фич.»
В отличие от универсальной чат-модели, она специально создана для задач программной инженерии и агентных рабочих процессов. Продуктовые сообщения MiniMax подчеркивают реальные задачи разработчиков: быстрые исправления багов, реализация фич, работа с крайними кейсами, регрессионное тестирование и проверка изменений. Обозначение «Flash» сигнализирует о фокусе на скорости и повседневной практичности по сравнению с более тяжелой MiniMax-M3, при этом сохраняются большой контекст и сильные стороны семейства M3 в кодинге.
Модель поддерживает:
- До 1,000,000 токенов контекста — подходит для целых кодовых репозиториев, длинных документов и многошаговых сессий агентов.
- Нативный мультимодальный ввод (текст, изображения и видео).
- Агентное рассуждение, вызов инструментов и структурированное выполнение задач.
- Всегда включенное глубокое мышление, настраиваемое через пятиуровневый ползунок усилий.
Содержимое размышлений возвращается отдельно (как reasoning_content в режиме, совместимом с OpenAI, или в виде блоков размышлений в режиме, совместимом с Anthropic), сохраняя финальный ответ чистым для отображения или последующего использования.
1M-Token контекст + ориентация на кодирование
Ключевая техническая характеристика — контекстное окно на 1,000,000 токенов. Это соответствует MiniMax-M3 и значительно больше, чем у большинства конкурирующих моделей для программирования. Официальная документация подчеркивает его пригодность для:
- Целых кодовых репозиториев
- Длинных многошаговых сессий агентов
- Больших документов и баз знаний
- Мультимодального ввода (текст + изображения + видео) в рамках одного контекста
Эта возможность работы с длинным контекстом в сочетании с нативной мультимодальностью позволяет реализовать рабочие процессы, которые ранее требовали сложного управления контекстом или внешних систем поиска. Разработчики могут держать большие кодовые базы, макеты дизайна, скриншоты ошибок и связанную документацию в одном разговоре.
Модель явно оптимизирована под агентные и кодовые сценарии: вызов инструментов, структурированный вывод и многотуровые инженерные задачи. Показатели скорости вывода для родственных моделей (M3 ≈ 100+ TPS, M2.7-highspeed ≈ 100 TPS) намекают, что версии Flash нацелены на верхний диапазон по латентности/пропускной способности, хотя точные значения TPS для самой M3.1-Flash-Preview пока не опубликованы.
Пятиуровневые усилия рассуждения
Одна из самых практичных новинок — настраиваемая глубина мышления, управляемая параметром effort (Anthropic-совместимый) или reasoning_effort (OpenAI-совместимый). Пять уровней:
| Уровень | Типичный сценарий | Компромисс |
|---|---|---|
| low | Простые синтаксические фиксы, быстрые запросы | Минимальная задержка и токены |
| medium | Рутинные рефакторинги, небольшие фичи | Баланс |
| high | Сложная логика, изменения в нескольких файлах | Более глубокий анализ |
| xhigh | Сложная отладка, архитектурные решения | Больше вычислений и задержки |
| max | Наиболее критичные или неоднозначные задачи (по умолчанию) | Максимальная проработка |
Мышление для M3.1-Flash-Preview всегда включено; попытка отключить его приводит к ошибке 400. Более высокие уровни увеличивают объем внутренних токенов рассуждения и латентность, давая разработчикам тонкий контроль, который был менее детальным в ранних моделях серии M.
В MiniMax Code этот контроль представлен простым ползунком или селектором; через API он передается в теле запроса. Такой дизайн отражает растущую отраслевую тенденцию к предоставлению «крутилок бюджетов на рассуждение», чтобы пользователи могли соотносить поведение модели со сложностью задач и ограничениями по стоимости.
Повседневный рабочий цикл разработки
MiniMax позиционирует M3.1-Flash-Preview строго в рамках ежедневного цикла разработчика, а не как чисто исследовательскую или долгоживущую агент-модель. Официальные сообщения и размещение в продукте подчеркивают замкнутый опыт в MiniMax Code, Bug Fixing → Implementation → Testing → Delivery:
- Локализация бага — Вставьте трассировки стека, скриншоты ошибок или релевантные участки кода; модель способна рассуждать над большим контекстом, чтобы выявить корень проблемы.
- Реализация — Генерирует или редактирует код в нескольких файлах, удерживая контекст проекта целиком.
- Тестирование и проверка — Предлагает или пишет тесты, проводит регрессионные проверки и анализирует влияние изменений.
- Доставка — Формирует чистые диффы, сообщения коммитов или документацию, готовую к ревью.
Комбинация 1M контекста, мультимодального ввода (например, скриншотов падающих UI) и регулируемых усилий делает модель особенно эффективной для высокочастотных, чувствительных к задержкам задач, которые доминируют в повседневной инженерной работе. Сопровождающие запуск краткосрочные акции (двойные ежедневные бонусы за чекин с 28 сентября по 7 октября UTC+8 и сброс квот Token Plan) побуждают к практическому тестированию.
Текущая доступность и ограничения превью
Подтверждено на конец сентября 2026 года:
- Доступна для выбора внутри MiniMax Code (в списке моделей рядом с M3, M2.7 и др.).
- Доступна через Token Plan / Subscription Key.
- Задокументирована на официальных страницах справки MiniMax с OpenAI-совместимыми и Anthropic-совместимыми примерами.
- Глубина мышления управляется через
reasoning_effortили эквивалентные поля. - Промо-активности: сброс квот Token Plan и двойные очки чекина (28 сентября – 7 октября) применимы к новой модели.
Подтвержденный путь API: Официальная документация перечисляет имя модели MiniMax-M3.1-Flash-Preview и приводит оба endpoint’а: Anthropic-совместимый (https://api.minimax.io/anthropic) и OpenAI-совместимый (https://api.minimax.io/v1). Требуется Subscription Key (Token Plan). Среди примеров параметров — output_config.effort или reasoning_effort. Содержимое мышления возвращается отдельно (thinking-блоки или reasoning_content).
По-прежнему ограничено или не подтверждено:
- Полный независимый набор публичных бенчмарков и карточка модели с количеством параметров.
- Отдельная страница с pay-as-you-go тарифами с прозрачностью, аналогичной MiniMax-M3.
- Открытые веса (не анонсированы для этой Preview).
Статус превью означает, что функции, квоты и цены могут меняться. Разработчикам стоит считать текущую производительность ориентировочной, а не финальной.
Как получить доступ к MiniMax M3.1-Flash-Preview
1. Внутри MiniMax Code (проще всего для интерактивной работы)
Скачайте или откройте MiniMax Code (десктопные приложения доступны для macOS и Windows). Выберите M3.1-Flash-Preview в списке моделей и настройте уровень усилий рассуждения. Ежедневные чекины временно удваивают бесплатные кредиты до начала октября 2026 года.
2. Официальный API MiniMax (Token Plan)
- Получите Subscription Key в консоли MiniMax.
- Используйте SDK Anthropic или OpenAI, изменив
base_urlи установивmodel="MiniMax-M3.1-Flash-Preview". - Передайте желаемый уровень усилий.
3. Через CometAPI (рекомендуется для команд с несколькими моделями)
CometAPI уже добавил minimax-m3.1-flash-preview в свой каталог (на момент написания видна скидка 20%). Поскольку CometAPI предоставляет OpenAI-совместимый endpoint (https://api.cometapi.com/v1), существующим кодовым базам достаточно изменить base_url и ключ API. Это особенно удобно для команд, которые уже направляют GPT, Claude, Gemini, MiniMax-M3 и другие модели через единый ключ и хотят получить единые наблюдаемость, биллинг и логику резервирования.
Пример (Python / OpenAI SDK через CometAPI):
from openai import OpenAI
client = OpenAI(
api_key="YOUR_COMETAPI_KEY",
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="minimax-m3.1-flash-preview",
messages=[{"role": "user", "content": "Refactor this function for clarity..."}],
# reasoning_effort or equivalent may be supported depending on gateway mapping
)
Единый каталог CometAPI также включает MiniMax-M3, серию M2.7 и новые видеомодели H3, позволяя бесшовно переключаться между текстовой и мультимодальной генерацией в рамках одного биллинга.
