DeepSeek V4.1 Flash sostituisce la breve fase beta con una release di produzione basata su calcolo asimmetrico, multimodalità nativa, benchmark per agent più solidi e prezzi API nettamente inferiori.
TL;DR
DeepSeek V4.1 Flash è ora un’API ufficiale e un modello a pesi aperti, non un endpoint beta a scadenza. DeepSeek afferma che si tratta di un modello Mixture-of-Experts da 552B di parametri che utilizza una nuova architettura Causal-Encoder-Decoder. Solo 8B parametri sono attivati durante l’elaborazione dell’input, mentre 16B sono attivati durante la generazione dell’output. Questo design asimmetrico mira a spendere meno calcolo su prompt lunghi senza indebolire la fase autoregressiva di generazione.
Il nome del modello API in produzione è deepseek-flash. Supporta una finestra di contesto da 1M token, fino a 384K token di output, modalità thinking e non-thinking, output JSON, chiamate a strumenti, la Responses API, l’API compatibile con Anthropic e input visivi nativi. La tabella ufficiale dei benchmark di DeepSeek mostra progressi significativi rispetto a V4 Flash 0731 e V4 Pro 0813 in compiti di coding, agent, cybersecurity e multimodali.
Il cambio di prezzo è altrettanto importante. Nelle ore di punta, V4.1 Flash costa $0.006 per milione di token di input con hit di cache, $0.30 per milione di token di input con miss di cache e $1.20 per milione di token di output. Le tariffe fuori punta sono la metà.
Punti chiave
- DeepSeek V4.1 Flash è un modello rilasciato con pesi aperti; l’identificatore temporaneo
deepseek-v4.1-flash-expires-on-0910non è più il riferimento di produzione corretto. - Il design MoE da 552B attiva 8B parametri per l’input e 16B per l’output, creando un profilo di efficienza diverso dall’architettura da 284B totali/13B attivi di V4 Flash.
- La multimodalità nativa fa parte del modello principale anziché di un ramo Vision Exp separato.
- Il confronto ufficiale mostra V4.1 Flash avanti rispetto a V4 Pro 0813 nella maggior parte dei benchmark selezionati per agent e coding, sebbene non guidi ogni benchmark di conoscenza o terminale rispetto a ogni concorrente di frontiera.
- La cache KV globale scende a 890 byte per token, circa 3.9 volte più piccola di V4 Flash e pressappoco un quarto della sua precedente impronta.
- I prezzi API nelle ore di punta sono $0.006 per input con hit di cache, $0.30 per input con miss di cache e $1.20 per output per milione di token; le tariffe fuori punta sono inferiori del 50%.
Che cos’è DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash è il modello foundation di DeepSeek di settembre 2026 focalizzato sull’efficienza per reasoning, coding, agent e comprensione multimodale. L’annuncio ufficiale lo descrive come un modello MoE da 552B parametri che migliora le capacità riducendo al contempo la quantità di calcolo e memoria necessari per l’elaborazione dell’input.
Il cambiamento chiave è architetturale. Il precedente V4 Flash utilizzava un unico budget di parametri attivi per l’intera inferenza. V4.1 Flash separa i carichi di input e output: 8B parametri sono attivi quando si codifica il prompt e 16B sono attivi mentre si genera la risposta. DeepSeek definisce questo design Causal-Encoder-Decoder.
| Data | Stato | Model ID |
|---|---|---|
| 8 set | Beta limitata | deepseek-v4.1-flash-expires-on-0910 |
| 10 set | Release di produzione | deepseek-flash |
Specifiche di DeepSeek V4.1 Flash:
| Specifica | DeepSeek V4.1 Flash |
|---|---|
| Stato del rilascio | API ufficiale e modello a pesi aperti |
| Architettura | Mixture-of-Experts con struttura Causal-Encoder-Decoder |
| Parametri totali | 552B |
| Parametri attivati | 8B per l’input; 16B per l’output |
| Finestra di contesto | 1M token |
| Output massimo | 384K token |
| Modalità di input | Testo e immagini |
| Modalità di output | Testo |
| Nome modello API di produzione | deepseek-flash |
| Modalità di thinking | Thinking e non-thinking |
| Funzionalità API | Output JSON, chiamate a strumenti, Responses API, Anthropic API, completamento del prefisso, completamento FIM |
| Pesi aperti | Rilasciati su Hugging Face |
Come funziona DeepSeek V4.1 Flash: Causal-Encoder-Decoder
I modelli linguistici tradizionali solo-decoder utilizzano sostanzialmente lo stesso grande stack sia per l’elaborazione del prompt sia per la generazione dei token. DeepSeek V4.1 Flash assegna capacità attiva diversa a queste fasi.
Durante la fase di input, il modello elabora il prompt con un’impronta attiva da 8B. Questa fase può esaminare in modo efficiente il contesto di testo o immagine fornito, poiché la risposta completa non è stata ancora generata. Durante la fase di output, il modello attiva 16B parametri e continua la generazione causale token per token. Il design quindi risparmia calcolo nella codifica del prompt mantenendo al contempo maggiore capacità attiva per il reasoning e la generazione della risposta.
DeepSeek non ha pubblicato ogni dettaglio implementativo nell’annuncio, quindi la descrizione più sicura è funzionale: l’architettura è asimmetrica, le fasi di input e output utilizzano budget di parametri attivi diversi e il sistema risultante riduce memoria e costo di inferenza.
Riduzione della cache KV
L’effetto sulla memoria è misurabile. DeepSeek riporta 890 byte di cache KV globale per token per V4.1 Flash, contro 3.514 byte per V4 Flash, 48.068 byte per V3.2 e 389.120 byte per V1. La cifra di V4.1 è circa 3.9 volte più piccola rispetto a V4 Flash.
Per agent con contesti lunghi, questo conta oltre il singolo benchmark. Una cache KV più piccola riduce la pressione sulla memoria ad alta banda (HBM) mentre una richiesta è attiva e abbassa la quantità di stato che deve essere spostata su storage più lento. DeepSeek afferma che V4.1 Flash necessita di circa un quarto dell’HBM e un ottavo della capacità SSD richieste dal modello precedente per carichi di cache comparabili.
Funzionalità di DeepSeek V4.1 Flash
Input multimodale nativo
V4.1 Flash accetta immagini come parte dell’API del modello principale. Ciò sostituisce la precedente divisione tra il V4 Flash solo testo e l’endpoint sperimentale V4 Flash Vision. Gli sviluppatori possono ora creare flussi di lavoro di comprensione di documenti, analisi di grafici, interpretazione di screenshot e agent visivi sulla stessa famiglia di modelli di produzione.
Reasoning su contesti lunghi
La specifica ufficiale dell’API mantiene una finestra di contesto da 1M token e consente fino a 384K token di output. Questo rende il modello adatto a coding su scala repository, analisi multi-documento, sessioni agent di lunga durata e flussi di lavoro che devono preservare una lunga cronologia degli strumenti.
Funzionalità API di produzione
Il modello supporta modalità thinking e non-thinking, output JSON strutturato, chiamate a strumenti, la Responses API, un’interfaccia compatibile con Anthropic, il completamento del prefisso in chat e il completamento FIM in modalità non-thinking. Queste capacità rendono V4.1 Flash un sostituto diretto in produzione per molti carichi di lavoro di agent e coding di V4 Flash.
Pesi aperti
DeepSeek ha rilasciato i pesi di V4.1 Flash e un rapporto tecnico. Il rilascio migliora la riproducibilità, ma il modello resta estremamente grande: l’annuncio di DeepSeek chiede alle organizzazioni interessate a grandi deployment di pianificare approssimativamente 2,000 GPU più un cluster di storage.
Prestazioni benchmark di DeepSeek V4.1 Flash
I risultati ufficiali modificano la precedente valutazione secondo cui V4.1 non aveva evidenze di benchmark. DeepSeek ora fornisce una tabella ampia che copre conoscenza, matematica, coding, agent da terminale, cybersecurity, automazione e compiti multimodali per agent.

| Benchmark | DeepSeek V4.1 Flash | V4 Pro 0813 | V4 Flash 0731 |
|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | 89.9 |
| Codeforces rating | 3471 | 3348 | 3289 |
| MathArena Apex | 65.6 | 65.3 | 58.6 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 82.7 |
| DeepSWE v1.1 | 74.2 | 62.7 | 54.4 |
| NL2Repo-Bench | 65.4 | 61.5 | 54.2 |
| CyberGym | 88.1 | 83.3 | 76.7 |
| Automation-Bench | 54.8 | 43.2 | 37.7 |
Su questa vista selezionata di otto benchmark, V4.1 Flash supera V4 Pro 0813 in sette test e supera V4 Flash 0731 in tutti e otto. I guadagni maggiori si vedono nell’ingegneria del software e negli agent: DeepSWE sale di 11.5 punti rispetto a V4 Pro e di 19.8 rispetto a V4 Flash, mentre Automation-Bench migliora rispettivamente di 11.6 e 17.1 punti.
I risultati vanno comunque interpretati con attenzione. V4.1 Flash è sotto V4 Pro su GPQA Diamond e il grafico ufficiale completo mostra che Claude Opus 5 e GPT-5.6 Sol rimangono avanti su Terminal-Bench 3.0. Una conclusione utile è che V4.1 Flash migliora in modo sostanziale l’equilibrio tra efficienza e capacità di DeepSeek; la tabella dei benchmark non prova una leadership universale su ogni compito.
Prezzi API di DeepSeek V4.1 Flash
DeepSeek utilizza fatturazione in fascia di punta e fuori punta. Le ore di punta sono 01:00–04:00 e 06:00–10:00 UTC, dal lunedì al venerdì; tutti gli altri periodi, inclusi i weekend, usano la tariffa fuori punta. La documentazione prezzi attuale afferma che i prezzi fuori punta sono la metà di quelli di punta.
| Prezzo per 1M token | V4.1 Flash fuori punta | V4.1 Flash di punta | V4 Pro 0813 fuori punta | V4 Pro 0813 di punta |
|---|---|---|---|---|
| Input con hit di cache | $0.003 | $0.006 | $0.022 | $0.044 |
| Input con miss di cache | $0.15 | $0.30 | $0.66 | $1.32 |
| Output | $0.60 | $1.20 | $1.98 | $3.96 |

I risparmi sono sostanziali. Per un carico con 100 milioni di token di input con miss di cache e 10 milioni di token di output, V4.1 Flash costa circa $21 fuori punta o $42 nelle ore di punta. Lo stesso mix di token alle tariffe pubblicate di V4 Pro 0813 costa circa $85.80 fuori punta o $171.60 nelle ore di punta. In questo esempio, V4.1 Flash è circa il 75.5% meno costoso.
La cache del prompt rafforza il vantaggio per agent che riutilizzano ripetutamente istruzioni di sistema, contesto di repository o documenti. La tariffa per hit di cache di V4.1 è 50 volte inferiore a quella per miss di cache in entrambi i periodi di fatturazione.
DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro
| Dimensione | DeepSeek V4.1 Flash | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|---|
| Parametri totali | 552B | 284B | 1.6T |
| Parametri attivati | 8B input / 16B output | 13B | 49B |
| Focus architetturale | Efficienza asimmetrica input/output | V4 MoE leggero | Massima capacità V4 |
| Visione nativa | Sì | Variante Vision Exp separata | No |
| Finestra di contesto | 1M | 1M | 1M |
| Output massimo | 384K | 384K | 384K |
| Stato API su DeepSeek | Modello di produzione attuale | Ritirato; il nome legacy instrada a V4.1 Flash | Programmato per instradare a V4.1 Flash dal 14 settembre 2026 |
| Miglior impiego | Agent generali, coding, vision, alto throughput | Solo compatibilità di migrazione | Carichi Pro esistenti durante la transizione |
V4.1 Flash è più grande in parametri totali rispetto a V4 Flash ma può essere più economico da servire perché la fase di input attiva solo 8B parametri e utilizza una cache KV molto più piccola. Rispetto a V4 Pro, attiva molti meno parametri pur superando Pro nella maggior parte dei benchmark per agent e coding selezionati sopra.
Accesso all’API e migrazione
Il nome del modello di produzione DeepSeek è deepseek-flash. Le applicazioni esistenti possono mantenere la base URL compatibile con OpenAI https://api.deepseek.com o la base URL compatibile con Anthropic https://api.deepseek.com/anthropic.
- Aggiorna il nome del modello a
deepseek-flash. - Mantieni la base URL di DeepSeek e il metodo di autenticazione esistenti.
- Ri-testa modalità thinking, chiamate a strumenti, input visivi, latenza e utilizzo dei token con prompt di produzione.
- Monitora gli alias legacy:
deepseek-v4-flashedeepseek-v4-flash-vision-expora instradano a V4.1 Flash, mentredeepseek-v4-proè programmato per instradare a V4.1 Flash dal 14 settembre 2026 fino al rilascio futuro di V4.1 Pro.
Per gli utenti CometAPI, la DeepSeek V4.1 API in CometAPI è ora live accanto all’esistente DeepSeek V4 Flash API. Prima di spostare il traffico di produzione, conferma il nome modello finale, i prezzi e la mappatura degli alias nella dashboard di CometAPI, poiché i provider di terze parti possono differire dalla denominazione e dalle tariffe ufficiali dell’API di DeepSeek.
Chi dovrebbe usare DeepSeek V4.1 Flash?
V4.1 Flash è un’ottima scelta per agent di coding, analisi di repository, automazione da terminale, flussi di lavoro documentali multimodali, assistenti a contesto lungo e sistemi ad alto volume che usano strumenti. I suoi guadagni nei benchmark sono concentrati negli stessi carichi di lavoro che traggono maggior vantaggio da memoria di cache inferiore e prezzi dei token più bassi.
I team che già usano V4 Flash dovrebbero trattarlo come un candidato di migrazione diretto. I team che usano V4 Pro dovrebbero testare con attenzione, ma i dati di benchmark e prezzo di DeepSeek rendono ora V4.1 Flash l’opzione predefinita più economica per molti carichi di lavoro di classe Pro.
Il self-hosting è una decisione diversa. I pesi aperti non rendono leggero un modello da 552B. Le organizzazioni dovrebbero confrontare il costo di un ampio deployment di GPU e storage con l’uso dell’API hosted prima di impegnarsi nell’inferenza locale.
Limitazioni e questioni aperte
- I risultati di benchmark provengono dal setup di valutazione ufficiale di DeepSeek; serviranno repliche indipendenti per misurare le prestazioni su diversi harness e ambienti di strumenti.
- Il supporto multimodale nativo è confermato, ma i team applicativi dovrebbero convalidare i formati immagine supportati, il conteggio dei token e il comportamento della visione sull’API live.
- Gli alias dei modelli legacy ora cambiano il modello dietro un nome esistente, il che può alterare gli output senza una modifica al codice applicativo.
- V4.1 Flash riduce i requisiti di infrastruttura rispetto ai modelli DeepSeek precedenti, ma il suo deployment con pesi aperti richiede comunque calcolo e storage notevoli.
- L’endpoint dedicato V4.1 di CometAPI e i prezzi finali dovrebbero essere confermati nella console live prima dell’uso in produzione.
Verdetto finale
DeepSeek V4.1 Flash è un importante aggiornamento di architettura e prodotto. Il modello MoE da 552B combina una fase di input con 8B attivi, una fase di output con 16B attivi, visione nativa, una finestra di contesto da 1M token e una cache KV fortemente compressa. Queste scelte progettuali si traducono in benchmark ufficiali più forti per coding e agent a prezzi API molto più bassi rispetto a V4 Pro 0813.
Il cambiamento più pratico è la consolidazione. V4.1 Flash riunisce testo, visione, reasoning, uso di strumenti e operatività su contesti lunghi in un unico nome di modello di produzione. Per la maggior parte delle nuove integrazioni DeepSeek, deepseek-flash è ora il punto di partenza logico; V4 Pro diventa un termine di confronto per la migrazione anziché la scelta automatica per i lavori difficili.
FAQ
DeepSeek V4.1 Flash è ufficialmente rilasciato?
Sì. È disponibile tramite l’API di DeepSeek con il nome modello deepseek-flash, e DeepSeek ha rilasciato pesi aperti e un rapporto tecnico.
È ancora necessario l’ID del modello beta V4.1 temporaneo?
No. deepseek-v4.1-flash-expires-on-0910 era un identificatore beta di breve durata. Le applicazioni di produzione dovrebbero usare deepseek-flash.
Quanti parametri ha DeepSeek V4.1 Flash?
Il modello ha 552B parametri totali. Attiva 8B parametri durante l’elaborazione dell’input e 16B durante la generazione dell’output.
DeepSeek V4.1 Flash supporta le immagini?
Sì. L’input visivo è nativo del modello di produzione, quindi non è più richiesto un endpoint V4 Flash Vision Exp separato.
V4.1 Flash è migliore di V4 Pro?
È in testa a V4 Pro 0813 nella maggior parte dei confronti pubblicati da DeepSeek su coding, agent, automazione e cybersecurity, ma V4 Pro rimane avanti su GPQA Diamond. I team dovrebbero valutare entrambi sui propri prompt prima della migrazione.
Quanto costa l’API?
Nelle ore di punta, le tariffe per milione di token sono $0.006 per input con hit di cache, $0.30 per input con miss di cache e $1.20 per output. Le tariffe fuori punta sono la metà di questi prezzi.
Cosa succede ai vecchi nomi dei modelli V4?
I nomi legacy deepseek-v4-flash e deepseek-v4-flash-vision-exp instradano a V4.1 Flash. DeepSeek afferma che deepseek-v4-pro instraderà anch’esso a V4.1 Flash dal 14 settembre 2026 fino al rilascio di V4.1 Pro.
Posso usare DeepSeek V4.1 Flash tramite CometAPI?
Sì. CometAPI offre ora un endpoint DeepSeek V4.1 API live. Prima di inviare traffico di produzione, conferma il nome modello esatto, i prezzi e le funzionalità supportate nella console CometAPI, poiché i provider terzi possono utilizzare convenzioni di denominazione o tariffe diverse rispetto all’API ufficiale di DeepSeek.
