TLDR 27 września 2026 MiniMax po cichu, ale oficjalnie uruchomił M3.1-Flash-Preview w MiniMax Code (oraz poprzez Token Plan). To czołowy multimodalny model do programowania z pełnym kontekstem na 1 milion tokenów, natywną obsługą wejść tekst/obraz/wideo oraz nową pięciopoziomową kontrolą wysiłku rozumowania (low → max). Model jest wyraźnie pozycjonowany pod codzienne przepływy pracy deweloperskiej—od naprawy błędów po implementację, testy i dostarczenie—priorytetyzując szybkość i opłacalność, przy zawsze włączonym trybie myślenia.
Dostępność jest obecnie ograniczona do Token Plan + MiniMax Code (z obsługą API przez Subscription Key); pełny publiczny cennik i otwarte wagi nie zostały jeszcze opublikowane. CometAPI już udostępnia model (minimax-m3.1-flash-preview) w konkurencyjnych stawkach, ułatwiając zunifikowany dostęp.
Kluczowe wnioski
- Kontekst 1M tokenów + natywna multimodalność — Obsługuje duże bazy kodu, długie sesje agentów, dokumenty, obrazy i wideo w jednym oknie.
- Pięciopoziomowy wysiłek rozumowania (low / medium / high / xhigh / max, domyślnie max) — Wymiana latencji i użycia tokenów na głębsze rozważania na żądanie. Myślenie nie może być wyłączone.
- Skupienie na codziennym programowaniu — Wyraźnie zoptymalizowany do zamkniętej pętli lokalizacja błędu → implementacja → testowanie → dostarczenie w MiniMax Code.
- Ograniczenia wersji Preview — Potwierdzony w MiniMax Code i Token Plan; wywołania API wymagają Subscription Key. Na starcie nie ogłoszono niezależnej karty modelu, publicznych benchmarków, otwartych wag ani samodzielnego cennika pay-as-you-go.
- Rekomendacja CometAPI — Dostęp przez pojedynczy OpenAI-compatible endpoint (model ID: minimax-m3.1-flash-preview) z obniżonymi cenami, idealny dla zespołów już korzystających z katalogu 500+ modeli CometAPI.
Czym jest MiniMax M3.1-Flash-Preview?
MiniMax M3.1-Flash-Preview to najnowsza pozycja w serii modeli językowych MiniMax M. Oficjalna dokumentacja opisuje go jako „Frontier multimodal coding model with 1M context window and tunable thinking depth.” Po raz pierwszy został zauważony przez deweloperów w selektorze modeli MiniMax Code i formalnie potwierdzony przez oficjalne konto @MiniMaxAgent na X 27 września 2026:
„MiniMax’s latest text model, M3.1-Flash-Preview, debuts today on MiniMax Code. Built for everyday development, it’s fast, reliable, and ready for real work, from quick bug fixes to full features.”
W odróżnieniu od ogólnego modelu czatowego, jest zaprojektowany specjalnie do inżynierii oprogramowania i agentowych przepływów pracy. Komunikaty produktowe MiniMax podkreślają zadania deweloperów w realnym świecie: szybkie naprawy błędów, implementację funkcji, obsługę przypadków brzegowych, testy regresyjne oraz weryfikację zmian. Oznaczenie „Flash” wskazuje na nacisk na szybkość i codzienną praktyczność względem cięższego MiniMax-M3, przy jednoczesnym dziedziczeniu dużego kontekstu i mocnych stron w kodowaniu rodziny M3.
Model obsługuje:
- Do 1,000,000 tokenów kontekstu — odpowiednie dla całych baz kodu, długich dokumentów i wieloetapowych sesji agentów.
- Natywne wejścia multimodalne (tekst, obrazy i wideo).
- Agentowe rozumowanie, wywoływanie narzędzi i strukturyzowane wykonywanie zadań.
- Zawsze włączone głębokie myślenie, które można regulować za pomocą pięciopoziomowego suwaka wysiłku.
Zawartość myślenia jest zwracana oddzielnie (jako reasoning_content w trybie OpenAI-compatible lub bloki thinking w trybie Anthropic-compatible), utrzymując końcową odpowiedź w czystej formie do wyświetlenia lub dalszego wykorzystania.
Kontekst 1M tokenów + ukierunkowanie na programowanie
Wyróżniająca się specyfikacja techniczna to okno kontekstu 1,000,000 tokenów. Pokrywa się to z MiniMax-M3 i jest znacznie większe niż w większości konkurencyjnych modeli do kodowania. Oficjalna dokumentacja podkreśla jego przydatność dla:
- Całych repozytoriów kodu
- Długich, wieloetapowych sesji agentów
- Dużych dokumentów i baz wiedzy
- Wejść multimodalnych (tekst + obrazy + wideo) w ramach tego samego kontekstu
Ta zdolność długiego kontekstu, w połączeniu z natywną multimodalnością, umożliwia przepływy pracy, które wcześniej wymagały rozbudowanego zarządzania kontekstem lub zewnętrznych systemów wyszukiwania. Deweloperzy mogą utrzymywać duże bazy kodu, makiety projektów, zrzuty ekranu błędów i powiązaną dokumentację w jednej rozmowie.
Model jest wyraźnie zoptymalizowany pod scenariusze agentowe i kodowe: wywoływanie narzędzi, ustrukturyzowane wyjścia i wieloetapowe zadania inżynierskie. Dane o szybkości wyjścia dla pokrewnych modeli (M3 ≈ 100+ TPS, M2.7-highspeed ≈ 100 TPS) sugerują, że warianty Flash celują w wyższy poziom w spektrum latencja/przepustowość, choć dokładne liczby TPS dla M3.1-Flash-Preview nie zostały opublikowane.
Pięciopoziomowy wysiłek rozumowania
Jedną z najbardziej praktycznych nowości jest regulowana głębokość myślenia kontrolowana parametrem effort (Anthropic-compatible) lub reasoning_effort (OpenAI-compatible). Pięć poziomów to:
| Level | Typowy przypadek użycia | Kompromis |
|---|---|---|
| low | Proste poprawki składni, szybkie wyszukiwania | Najniższa latencja i zużycie tokenów |
| medium | Rutynowe refaktoryzacje, małe funkcje | Zrównoważone |
| high | Złożona logika, zmiany w wielu plikach | Głębsza analiza |
| xhigh | Trudne debugowanie, decyzje architektoniczne | Wyższa moc obliczeniowa i latencja |
| max | Najwyższa stawka lub niejednoznaczne problemy (domyślne) | Maksymalne rozważanie |
Myślenie jest zawsze włączone dla M3.1-Flash-Preview; próba jego wyłączenia zwraca błąd 400. Wyższe poziomy effort generują więcej wewnętrznych tokenów rozumowania i zwiększają latencję, dając deweloperom precyzyjną kontrolę, która była mniej szczegółowa w wcześniejszych modelach serii M.
W MiniMax Code kontrola pojawia się jako prosty suwak lub selektor; przez API przekazywana jest w treści żądania. Ten projekt odzwierciedla rosnący trend w branży polegający na udostępnianiu „pokręteł budżetu rozumowania”, aby użytkownicy mogli dopasować zachowanie modelu do trudności zadania i ograniczeń kosztowych.
Codzienny przepływ pracy programistycznej
MiniMax pozycjonuje M3.1-Flash-Preview bezpośrednio w codziennej pętli dewelopera, a nie jako czysto badawczy model czy długohoryzontowy agent. Oficjalne komunikaty i pozycjonowanie produktu podkreślają doświadczenie zamkniętej pętli w MiniMax Code, Naprawa błędów → Implementacja → Testowanie → Dostarczenie:
- Lokalizacja błędu — Wklejaj ślady stosu, zrzuty ekranu błędów lub odpowiednie sekcje kodu; model potrafi analizować duży kontekst, by zidentyfikować przyczyny.
- Implementacja — Generuj lub edytuj kod w wielu plikach, zachowując kontekst całego projektu.
- Testowanie i weryfikacja — Proponuj lub pisz testy, uruchamiaj kontrole regresji i analizuj wpływ.
- Dostarczenie — Twórz czyste diffy, komunikaty commitów lub dokumentację gotową do przeglądu.
Połączenie 1M kontekstu, wejść multimodalnych (np. zrzuty ekranów nieudanych interfejsów) i regulowanego effort czyni model szczególnie skutecznym w wysokoczęstotliwościowych, wrażliwych na latencję zadaniach dominujących w większości dni inżynierskich. Ograniczone czasowo promocje towarzyszące premierze (podwojone dzienne kredyty za check-in w dniach 28 września–7 października UTC+8 i reset limitów Token Plan) dodatkowo zachęcają do testów w realnych warunkach.
Aktualna dostępność i ograniczenia wersji Preview
Potwierdzone na koniec września 2026:
- Możliwość wyboru w MiniMax Code (selektor modeli obok M3, M2.7 itd.).
- Dostępne przez Token Plan / Subscription Key.
- Udokumentowane w oficjalnych stronach referencyjnych API MiniMax z przykładami OpenAI-compatible i Anthropic-compatible.
- Głębokość myślenia kontrolowana przez
reasoning_effortlub pola równoważne. - Aktywność promocyjna: Resety limitów Token Plan i podwójne punkty za check-in (28 września – 7 października) możliwe do użycia w nowym modelu.
Potwierdzona ścieżka API: Oficjalna dokumentacja wymienia nazwę modelu MiniMax-M3.1-Flash-Preview i podaje zarówno endpoint Anthropic-compatible (https://api.minimax.io/anthropic), jak i OpenAI-compatible (https://api.minimax.io/v1). Wymagany jest Subscription Key (Token Plan). Przykładowe parametry obejmują output_config.effort lub reasoning_effort. Zawartość myślenia zwracana jest oddzielnie (bloki thinking lub reasoning_content).
Wciąż ograniczone lub niepotwierdzone:
- Pełny niezależny publiczny zestaw benchmarków i karta modelu z liczbą parametrów.
- Samodzielna strona cennika pay-as-you-go o transparentności na poziomie MiniMax-M3.
- Otwarte wagi (nie ogłoszono dla tej wersji Preview).
Status Preview oznacza, że funkcje, limity i ceny mogą się zmieniać. Deweloperzy powinni traktować obecną wydajność jako wskaźnikową, a nie finalną.
Jak uzyskać dostęp do MiniMax M3.1-Flash-Preview
1. W MiniMax Code (najłatwiejsze do interaktywnego użycia)
Pobierz lub otwórz MiniMax Code (aplikacje desktopowe dostępne na macOS i Windows). Wybierz M3.1-Flash-Preview z selektora modeli i dostosuj poziom reasoning. Promocje dziennych check-inów mogą podwajać darmowe kredyty do początku października 2026.
2. Oficjalne API MiniMax (Token Plan)
- Uzyskaj Subscription Key z konsoli MiniMax.
- Użyj SDK Anthropic lub OpenAI, zmieniając
base_urli ustawiającmodel="MiniMax-M3.1-Flash-Preview". - Przekaż żądany poziom effort.
3. Przez CometAPI (rekomendowane dla zespołów multi-model)
CometAPI już wymienia minimax-m3.1-flash-preview w swoim katalogu (z widoczną w momencie pisania zniżką 20%). Ponieważ CometAPI udostępnia OpenAI-compatible endpoint (https://api.cometapi.com/v1), istniejące bazy kodu wymagają jedynie zmiany base_url i klucza API. To szczególnie wygodne dla zespołów, które już kierują GPT, Claude, Gemini, MiniMax-M3 i inne modele przez jeden klucz, chcąc zachować spójność obserwowalności, rozliczeń i logiki fallback.
Przykład (Python / OpenAI SDK przez CometAPI):
from openai import OpenAI
client = OpenAI(
api_key="YOUR_COMETAPI_KEY",
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="minimax-m3.1-flash-preview",
messages=[{"role": "user", "content": "Refactor this function for clarity..."}],
# reasoning_effort or equivalent may be supported depending on gateway mapping
)
Zunifikowany katalog CometAPI obejmuje także MiniMax-M3, serię M2.7 oraz nowe modele wideo H3, co pozwala na płynne przełączanie między generowaniem tekstowym i multimodalnym w ramach jednego rozliczenia.
