TLDR Il 27 settembre 2026, MiniMax ha lanciato in modo discreto ma ufficiale M3.1-Flash-Preview all’interno di MiniMax Code (e tramite Token Plan). È un modello di coding multimodale d’avanguardia con una finestra di contesto completa da 1 milione di token, supporto nativo per input di testo/immagine/video e un nuovo controllo dello sforzo di ragionamento a cinque livelli (low → max). Progettato esplicitamente per i flussi di lavoro di sviluppo quotidiani—dalla correzione dei bug all’implementazione, ai test e alla consegna—dà priorità a velocità ed efficienza dei costi mantenendo il thinking sempre attivo.
La disponibilità è attualmente limitata a Token Plan + MiniMax Code (con supporto API tramite Subscription Key); prezzi pubblici completi e pesi open non sono ancora stati pubblicati. CometAPI espone già il modello (minimax-m3.1-flash-preview) a tariffe competitive, rendendo l’accesso unificato semplice.
Punti chiave
- Contesto da 1M di token + multimodalità nativa — Gestisce grandi codebase, lunghe sessioni di agenti, documenti, immagini e video in un’unica finestra.
- Sforzo di ragionamento su cinque livelli (low / medium / high / xhigh / max, predefinito max) — Scambia latenza e uso di token per una deliberazione più profonda su richiesta. Il pensiero non può essere disattivato.
- Focus sul coding quotidiano — Ottimizzato esplicitamente per il ciclo chiuso localizzazione bug → implementazione → test → consegna all’interno di MiniMax Code.
- Limitazioni della Preview — Confermato in MiniMax Code e Token Plan; le chiamate API richiedono una Subscription Key. Al lancio non sono stati annunciati model card indipendente, benchmark pubblici, pesi open o prezzi standalone pay-as-you-go.
- Raccomandazione CometAPI — Accesso tramite un singolo endpoint compatibile con OpenAI (ID modello: minimax-m3.1-flash-preview) con prezzi scontati, ideale per team che già utilizzano il catalogo di oltre 500 modelli di CometAPI.
Che cos’è MiniMax M3.1-Flash-Preview?
MiniMax M3.1-Flash-Preview è l’ultima novità della serie M di large language model di MiniMax. La documentazione ufficiale lo descrive come un “modello di coding multimodale d’avanguardia con finestra di contesto da 1M e profondità di thinking regolabile.” È stato avvistato per la prima volta dagli sviluppatori nel selettore modelli di MiniMax Code e confermato ufficialmente dall’account ufficiale @MiniMaxAgent su X il 27 settembre 2026:
“Il nuovo modello di testo di MiniMax, M3.1-Flash-Preview, debutta oggi su MiniMax Code. Progettato per lo sviluppo di tutti i giorni, è veloce, affidabile e pronto per il lavoro reale, dai rapidi bug fix fino alle funzionalità complete.”
A differenza di un modello di chat generico, è costruito appositamente per l’ingegneria del software e i workflow agentici. La messaggistica del prodotto MiniMax enfatizza i compiti reali degli sviluppatori: correzioni rapide di bug, implementazione di funzionalità, gestione dei casi limite, test di regressione e verifica delle modifiche. La dicitura “Flash” segnala un focus su velocità e praticità quotidiana rispetto al più pesante MiniMax-M3 di riferimento, pur ereditando la grande finestra di contesto e i punti di forza nel coding della famiglia M3.
Il modello supporta:
- Fino a 1.000.000 di token di contesto — adatto a intere codebase, documenti lunghi e sessioni multi-step di agenti.
- Input multimodali nativi (testo, immagini e video).
- Ragionamento agentico, chiamata di strumenti e esecuzione strutturata dei task.
- Pensiero profondo sempre attivo, regolabile tramite uno slider di sforzo a cinque livelli.
Il contenuto di thinking viene restituito separatamente (come reasoning_content in modalità compatibile con OpenAI o come blocchi di ragionamento in modalità compatibile con Anthropic), mantenendo la risposta finale pulita per la visualizzazione o l’uso a valle.
Contesto da 1M di token + orientamento al coding
La specifica tecnica distintiva è la finestra di contesto da 1.000.000 di token. È in linea con MiniMax-M3 ed è molto più ampia rispetto alla maggior parte dei modelli di coding concorrenti. I documenti ufficiali ne evidenziano l’idoneità per:
- Interi repository di codice
- Lunghe sessioni multi-step di agenti
- Documenti e basi di conoscenza di grandi dimensioni
- Input multimodali (testo + immagini + video) nello stesso contesto
Questa capacità di lungo contesto, combinata con la multimodalità nativa, abilita workflow che prima richiedevano una pesante gestione del contesto o sistemi di retrieval esterni. Gli sviluppatori possono mantenere codebase estese, mockup di design, screenshot di errori e documentazione correlata attivi in un’unica conversazione.
Il modello è esplicitamente ottimizzato per scenari agent e di coding: tool calling, output strutturato e task ingegneristici multi-turn. Le velocità di output di modelli correlati (M3 ≈ 100+ TPS, M2.7-highspeed ≈ 100 TPS) suggeriscono che le varianti Flash mirano alla fascia alta dello spettro latenza/throughput, sebbene i numeri TPS esatti per M3.1-Flash-Preview non siano stati pubblicati.
Sforzo di ragionamento a cinque livelli
Una delle novità più pratiche è la profondità di thinking regolabile controllata dal parametro effort (compatibile Anthropic) o reasoning_effort (compatibile OpenAI). I cinque livelli sono:
| Livello | Caso d’uso tipico | Compromesso |
|---|---|---|
| low | Semplici correzioni di sintassi, ricerche rapide | Latenza e token minimi |
| medium | Refactor di routine, piccole funzionalità | Bilanciato |
| high | Logica complessa, modifiche multi-file | Analisi più profonda |
| xhigh | Debug difficile, decisioni architetturali | Maggior calcolo e latenza |
| max | Problemi critici o ambigui (predefinito) | Deliberazione massima |
Il thinking è sempre attivo per M3.1-Flash-Preview; tentare di disattivarlo restituisce un errore 400. Livelli di sforzo più alti producono più token di ragionamento interni e aumentano la latenza, offrendo agli sviluppatori un controllo fine che era meno granulare nei precedenti modelli della serie M.
In MiniMax Code il controllo appare come un semplice slider o selettore; via API viene passato nel body della richiesta. Questo design riflette la tendenza emergente del settore a esporre manopole di “budget di ragionamento” per allineare il comportamento del modello alla difficoltà del compito e ai vincoli di costo.
Flusso di sviluppo quotidiano
MiniMax colloca M3.1-Flash-Preview pienamente nel loop quotidiano degli sviluppatori, più che come modello di ricerca o agente a lungo orizzonte. La messaggistica ufficiale e il posizionamento del prodotto enfatizzano un’esperienza a ciclo chiuso all’interno di MiniMax Code, Bug Fixing → Implementazione → Test → Consegna:
- Localizzazione del bug — Incolla stack trace, screenshot di errore o sezioni di codice rilevanti; il modello può ragionare su ampi contesti per identificare le cause radice.
- Implementazione — Genera o modifica codice su più file mantenendo il contesto a livello di progetto.
- Test e verifica — Suggerisce o scrive test, esegue controlli di regressione e analizza l’impatto.
- Consegna — Produce diff puliti, messaggi di commit o documentazione pronta per la revisione.
La combinazione di contesto da 1M, input multimodali (ad es. screenshot di UI con errore) e sforzo regolabile rende il modello particolarmente efficace per i compiti ad alta frequenza e sensibili alla latenza che dominano le giornate di ingegneria. Promozioni a tempo limitato che accompagnano il lancio (raddoppio dei crediti di check-in giornalieri dal 28 settembre al 7 ottobre UTC+8 e reset delle quote del Token Plan) incoraggiano ulteriormente i test nel mondo reale.
Disponibilità attuale e limitazioni della Preview
Confermato a fine settembre 2026:
- Selezionabile all’interno di MiniMax Code (selettore modelli insieme a M3, M2.7, ecc.).
- Disponibile tramite Token Plan / Subscription Key.
- Documentato nelle pagine ufficiali di riferimento API MiniMax con esempi compatibili con OpenAI e Anthropic.
- Profondità di thinking controllabile tramite
reasoning_efforto campi equivalenti. - Attività promozionali: reset delle quote del Token Plan e punti di check-in raddoppiati (28 settembre – 7 ottobre) utilizzabili sul nuovo modello.
Percorso API confermato: I documenti ufficiali elencano il nome del modello MiniMax-M3.1-Flash-Preview e forniscono endpoint sia compatibile con Anthropic (https://api.minimax.io/anthropic) sia compatibile con OpenAI (https://api.minimax.io/v1). È richiesta una Subscription Key (Token Plan). Parametri di esempio includono output_config.effort o reasoning_effort. Il contenuto di thinking viene restituito separatamente (blocchi di thinking o reasoning_content).
Ancora limitato o non confermato:
- Suite completa e indipendente di benchmark pubblici e model card con conteggio dei parametri.
- Pagina di prezzi standalone pay-as-you-go con la stessa trasparenza di MiniMax-M3.
- Pesi open (non annunciati per questa Preview).
Lo stato di Preview implica che funzionalità, quote e prezzi possano ancora cambiare. Gli sviluppatori dovrebbero considerare le prestazioni attuali come indicative e non definitive.
Come accedere a MiniMax M3.1-Flash-Preview
1. All’interno di MiniMax Code (il più semplice per uso interattivo)
Scarica o apri MiniMax Code (app desktop disponibili per macOS e Windows). Seleziona M3.1-Flash-Preview dal selettore modelli e regola il livello di reasoning. Le promozioni di check-in giornaliero possono raddoppiare i crediti gratuiti fino ai primi di ottobre 2026.
2. API ufficiale MiniMax (Token Plan)
- Ottieni una Subscription Key dalla console MiniMax.
- Usa l’SDK Anthropic o OpenAI cambiando il
base_urle impostandomodel="MiniMax-M3.1-Flash-Preview". - Passa il livello di sforzo desiderato.
3. Tramite CometAPI (consigliato per team multi-modello)
CometAPI elenca già minimax-m3.1-flash-preview nel suo catalogo (con sconto del 20% visibile al momento della stesura). Poiché CometAPI espone un endpoint compatibile con OpenAI (https://api.cometapi.com/v1), i codebase esistenti richiedono solo la modifica di base_url e della chiave API. È particolarmente comodo per i team che già instradano GPT, Claude, Gemini, MiniMax-M3 e altri modelli tramite una singola chiave e desiderano osservabilità, fatturazione e logiche di fallback coerenti.
Esempio (Python / OpenAI SDK tramite CometAPI):
from openai import OpenAI
client = OpenAI(
api_key="YOUR_COMETAPI_KEY",
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="minimax-m3.1-flash-preview",
messages=[{"role": "user", "content": "Esegui il refactoring di questa funzione per maggiore chiarezza..."}],
# reasoning_effort o equivalente potrebbe essere supportato a seconda della mappatura del gateway
)
Il catalogo unificato di CometAPI include anche MiniMax-M3, la serie M2.7 e i nuovi modelli video H3, consentendo di passare senza soluzione di continuità tra generazione testuale e multimodale sotto un’unica relazione di fatturazione.
