GPT-5.6 Luna price down 80%, Terra down 20% →

DeepSeek V4 Flash 0731 & DeepSeek Harness: Guida alla svolta della programmazione agentica (2026)

CometAPI
AnnaAug 9, 2026
DeepSeek V4 Flash 0731 & DeepSeek Harness: Guida alla svolta della programmazione agentica (2026)

TLDR DeepSeek-V4-Flash-0731 (rilasciato il 31 luglio 2026) è la versione ufficiale, pronta per la produzione, del modello Mixture-of-Experts efficiente di DeepSeek (284B totali / 13B attivi, contesto da 1M token). Grazie a un post-training mirato offre miglioramenti notevoli in coding agentico, uso di strumenti e ingegneria del software a più fasi. Supporta nativamente la Responses API e OpenAI Codex. DeepSeek Harness è il framework di agent complementare (la modalità minimale è già stata usata nelle valutazioni ufficiali; il rilascio completo è in arrivo) progettato per trasformare il modello in un agente autonomo affidabile.

Insieme offrono uno dei migliori rapporti costo-prestazioni nell’AI agentica a pesi aperti e accessibile via API ad agosto 2026.

Punti chiave

  • Grande salto agentico grazie al solo post-training: stessa architettura 284B/13B della preview di aprile, ma punteggi molto più alti (es., Terminal Bench 2.1: 82.7 vs 61.8; DeepSWE: 54.4 vs 7.3).
  • Supera DeepSeek-V4-Pro (Preview) su più benchmark agent nonostante molti meno parametri attivati.
  • Competitivo con i migliori modelli proprietari (vicino a Claude Opus 4.8 su diversi task agent) a una frazione del costo.
  • Contesto nativo da 1M, decodifica speculativa (DSpark), tre livelli di sforzo di ragionamento (basso/alto/massimo), licenza MIT, pesi aperti.
  • Supporto ufficiale a Responses API e Codex (CLI, app desktop, estensione VS Code).
  • DeepSeek Harness (la modalità minimale è già usata nelle valutazioni) è il framework agent ufficiale in closed beta; rilascio pubblico atteso a breve. DeepSeek Harness fornisce il livello runtime dell’agente; modello + harness = agente in produzione.
  • Ideale per agent di coding ad alto volume, automazione da terminale, tool use e workflow a lungo contesto.
  • Accedi ai modelli DeepSeek in modo conveniente e con strumenti unificati tramite CometAPI (endpoint compatibile OpenAI, prezzi competitivi, routing multi-modello).

Novità in DeepSeek V4 Flash 0731?

Lo stato di rilascio ufficiale è cambiato

Il cambiamento di prodotto più importante è che DeepSeek V4 Flash 0731 è ora la release ufficiale di DeepSeek V4 Flash sull’API, in beta pubblica. Il changelog del 31 luglio di DeepSeek afferma che gli sviluppatori possono continuare a chiamare lo stesso nome di modello, deepseek-v4-flash, per accedere alla versione più recente. Ciò è importante per la migrazione perché evita un nuovo slug del modello e consente ai team di testare l’aggiornamento dietro la logica di instradamento esistente.

DeepSeek afferma inoltre che l’aggiornamento riguarda solo l’API V4 Flash. L’API V4 Pro e i modelli su app/web non sono stati modificati dal rilascio del 31 luglio, e il rilascio ufficiale di V4 Pro seguirà a breve. In altre parole, non è un aggiornamento completo della famiglia DeepSeek V4. È un aggiornamento mirato della versione Flash.

Architettura invariata, post-training cambiato

L’architettura core resta invariata: un modello Mixture-of-Experts (MoE) con 284 miliardi di parametri totali e solo 13 miliardi attivi per token, un design di attenzione ibrido ottimizzato per il lungo contesto e una finestra di contesto nativa da 1M token. È collegato un modulo di decodifica speculativa (DSpark) per una generazione più rapida. Il modello è solo testo, supporta livelli di sforzo di ragionamento regolabili (low / high / max), tool calling, output strutturato ed è rilasciato sotto la permissiva licenza MIT.

Questa distinzione conta. Molti aggiornamenti di modelli migliorano perché il modello è più grande. Questo aggiornamento è più interessante perché DeepSeek sostiene un grande salto agentico senza aumentare l’impronta parametrica del modello. V4 Flash resta un MoE da 284B totali e 13B attivi, molto più piccolo in inferenza rispetto al design da 1.6T totali e 49B attivi di V4 Pro.

I punteggi di programmazione agentica sono aumentati

La tabella ufficiale di DeepSeek mostra miglioramenti significativi su task di terminale, costruzione di repository, cyber, ingegneria del software, uso di strumenti, automazione e full-stack coding. Il salto assoluto più grande rispetto alla vecchia preview di Flash è su DeepSWE: 54.4 contro 7.3, un aumento di 47.1 punti. Cybergym migliora di 38.0 punti, DSBench-Hard di 33.8 punti e DSBench-FullStack di 31.7 punti.

Ecco perché V4 Flash 0731 viene discusso meno come un normale “modello veloce” e più come un candidato modello predefinito per agent di coding. La proposta di valore non è solo chat economica. È inferenza agent economica, a lungo contesto, compatibile con gli strumenti.

Arriva il supporto a Responses API e Codex

Il changelog del 31 luglio di DeepSeek afferma che la versione ufficiale di V4 Flash supporta nativamente il formato Responses API ed è specificamente adattata per Codex. La guida alla Responses API di DeepSeek afferma che il formato è stato aggiunto per soddisfare la domanda di Codex, utilizza la base URL https://api.deepseek.com e attualmente supporta deepseek-v4-flash.

Questo conta perché i workflow in stile Codex non sono semplici sessioni di chat. Richiedono elementi di input e output strutturati, voci di ragionamento, chiamate a strumenti, operazioni di modifica file, eventi di streaming, rendicontazione dell’uso e integrazione con client di coding agent. Il supporto di DeepSeek non è un clone perfetto di ogni funzionalità della OpenAI Responses API, ma è sufficiente per rendere V4 Flash un candidato plug-and-play molto più pratico per esperimenti con coding agent.

Benchmark delle prestazioni per la versione ufficiale V4-Flash

Avvertenze sui benchmark che gli sviluppatori non dovrebbero ignorare

I risultati ufficiali di valutazione (riportati da DeepSeek sulla model card) mostrano grandi salti rispetto alla preview e, sorprendentemente, rispetto alla versione V4-Pro Preview molto più grande su task centrati sugli agent. Le valutazioni per i benchmark dei code agent hanno utilizzato la modalità minimale di DeepSeek Harness (da rilasciare) al massimo sforzo di ragionamento, temperatura = 1.0, top_p = 0.95.

Questo ha due implicazioni. Primo, il risultato del modello è in parte un risultato modello+harness. Se il tuo runtime di agente ha strumenti diversi, permessi shell, gestione del contesto, retry, regole di patch o gestione degli errori differenti, potresti non ottenere gli stessi punteggi. Secondo, la riproduzione indipendente è limitata finché DeepSeek non rilascerà abbastanza dell’harness e dell’impostazione di valutazione per consentire a team esterni di eseguire test comparabili.

Tabella dei benchmark ufficiali DeepSeek

BenchmarkV4-Flash-0731V4-Flash PreviewV4-Pro PreviewGLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents’ Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7

Su questi nove benchmark, V4 Flash 0731 fa una media di 55.2. La vecchia preview di V4 Flash fa una media di 29.6 e V4-Pro Preview di 34.9. Ciò significa che V4 Flash 0731 è circa 25.6 punti sopra la preview di Flash e 20.3 punti sopra V4-Pro Preview in questa tabella.

Segnali di terze parti

L’ARC Prize riporta V4 Flash 0731 al massimo sforzo con 89.0% su ARC-AGI-1 Semi-Private e 61.4% su ARC-AGI-2 Semi-Private, con costi indicati di $0.02 e $0.04 per task. Non sono benchmark di coding agent, ma supportano la visione più ampia che il modello è competitivo nei compiti di ragionamento quando eseguito a sforzo più alto.

I guadagni sono particolarmente notevoli su DeepSWE (loop da agente per ingegneria del software) e Cybergym. Misurazioni indipendenti (es., Artificial Analysis) riportano cifre Terminal-Bench leggermente inferiori ma comunque forti, intorno al 79%, confermando la direzione del miglioramento e ricordando che i numeri con harness del vendor tendono a essere ottimistici.

Ulteriore contesto da valutazioni V4 precedenti e aggregatori di terze parti mostra prestazioni elevate in conoscenza e coding in modalità di massimo ragionamento (GPQA Diamond ~88–91%, LiveCodeBench alto 80–90 a seconda della fonte). Il post-training 0731 ha sbloccato specificamente l’affidabilità agent che alla preview mancava.

DeepSeek-V4-Flash ora supporta la Responses API e Codex

Un’aggiunta strategicamente importante è il supporto nativo per la Responses API di OpenAI. La documentazione ufficiale di DeepSeek conferma che la Responses API supporta attualmente deepseek-v4-flash (supporto a Pro previsto per inizio agosto 2026). La base URL resta https://api.deepseek.com.

È un grande upgrade dell’esperienza sviluppatore. Prima del supporto a Responses API e Codex, DeepSeek V4 Flash poteva già essere chiamato come modello di testo, ma un coding agent doveva colmare più dettagli d’integrazione da solo. Ora il modello può essere usato all’interno di workflow che si aspettano semantiche in stile Responses.

Cosa include il supporto alla Responses API

La Responses API di DeepSeek crea una risposta modello nel formato della OpenAI Responses API su /responses. La Responses API supporta model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, strumenti, scelta dello strumento, sforzo di ragionamento, formato del testo e report dell’uso. L’API è senza stato, quindi i client devono inviare l’intera cronologia della conversazione per interazioni multi-turno.

I dettagli di compatibilità più importanti sono pratici:

  • deepseek-v4-flash è attualmente l’unico modello supportato per la Responses API.
  • I messaggi developer sono trattati come messaggi system.
  • Sono supportati function tools, streaming, sforzo di ragionamento regolabile e web search lato server.
  • Il tipo di strumento personalizzato è supportato solo per apply_patch, cosa importante per la compatibilità con Codex.
  • Gli input di immagini e file non sono supportati; le parti di input immagine sono sostituite con testo segnaposto.
  • previous_response_id, conversation, store, modalità in background, metadata e alcune funzionalità di gestione del contesto non sono supportate.
  • I parametri non supportati possono essere ignorati in silenzio, quindi i client di produzione dovrebbero testare esplicitamente il comportamento atteso.

Per gli sviluppatori, il punto chiave è che il supporto alla Responses API non è solo un dettaglio sintattico. Permette a DeepSeek V4 Flash di inserirsi in un protocollo usato dai moderni coding agent, specialmente dove le chiamate a funzioni, gli eventi di streaming, gli elementi di ragionamento e l’applicazione di patch devono essere rappresentati in modo coerente.

Design senza stato (il client gestisce la cronologia della conversazione). Esempio (Python):

from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful coding assistant.",
    input="Refactor this Python function for better readability...",
    reasoning={"effort": "max"}
)
print(response.output_text)

Dettagli completi e guida all’integrazione con Codex: DeepSeek API Docs – Responses API e Integrate with Codex.

Cosa significa il supporto a Codex

La guida all’integrazione di DeepSeek afferma che Codex dialoga con i modelli tramite la Responses API, che DeepSeek ora supporta nativamente. Questo abilita l’integrazione diretta con Codex (l’ecosistema di coding agent di OpenAI — CLI, app desktop ChatGPT e estensione IDE Codex per VS Code).

Gli sviluppatori possono configurare un provider personalizzato una volta tramite uno script di setup o modificando ~/.codex/config.toml e un file catalogo modelli. Dopo la configurazione, i client Codex riconoscono DeepSeek-V4-Flash e possono usare le sue capacità di tool-calling, apply_patch, web search e ragionamento.

DeepSeek V4 Flash vs. DeepSeek V4 Pro

AspettoV4-Flash-0731V4-Pro (tipico / Preview)
Parametri totali / attivi284B / 13B~1.6T / 49B
Finestra di contesto1M token1M token
Punti di forzaCoding agentico, terminale, costo, velocitàRagionamento più profondo, conoscenza, compiti più difficili
Vantaggio nei benchmark agentVince sulla suite agent pubblicata 0731Più forte su pura conoscenza e compiti multi-file complessi in valutazioni precedenti
Prezzi API tipici~$0.14 in / $0.28 out (cache molto più basso)Significativamente più alti (storicamente 3–12×)
Ideale perAgent ad alto volume, loop di coding in produzione, app sensibili al costoRicerca di frontiera, massime capacità su singoli compiti
Pesi apertiSì (MIT)Sì (MIT)

Quale dovrebbero usare prima gli sviluppatori?

Sui benchmark agent specifici rilasciati con 0731, il modello Flash più piccolo supera la preview di Pro su tutta la linea. Per il puro recupero di conoscenza o i problemi di ragionamento assolutamente più difficili, Pro mantiene un vantaggio in molte valutazioni indipendenti e precedenti. In pratica, molti team ora predefiniscono Flash per la maggior parte dei carichi agentici e instradano solo i compiti più esigenti a Pro (o ad altri modelli di frontiera).

Questa strategia di instradamento è dove CometAPI può aiutare. Invece di fissare un singolo modello per tutti i carichi, usa CometAPI per centralizzare la selezione del modello, il logging, il tracciamento dei costi e le politiche di fallback. Ad esempio:

  • Usa V4 Flash per la sintesi di repository, la pianificazione del refactoring, le bozze di code review, i test generati, l’estrazione strutturata, il QA a lungo contesto e i loop agent ripetuti.
  • Escala a V4 Pro o a un altro modello premium quando il compito ha alto rischio di business, requisiti ambigui, codice di produzione fragile o tentativi ripetuti falliti.
  • Traccia la metrica finale che conta: correzioni accettate per dollaro, compiti completati per ora o minuti di revisione umana risparmiati.

Che cos’è DeepSeek Harness?

DeepSeek Harness è il framework/runtimes di agent ufficiale che DeepSeek sta costruendo per trasformare i suoi modelli in agent autonomi affidabili. L’azienda formula l’equazione in modo semplice: Modello + Harness = Agente.

Le valutazioni ufficiali di V4-Flash-0731 hanno già utilizzato la “modalità minimale” di DeepSeek Harness. Il prodotto completo è ancora in rollout (recruiting e early testing erano attivi tra fine luglio e inizio agosto 2026). Il team è guidato da Cui Tianyi (background in sistemi di trading quantitativi), e le job description enfatizzano l’integrazione profonda con le funzionalità di DeepSeek-V4 come prefix caching, gestione del lungo contesto, ottimizzazione della KV-cache, chaining degli strumenti, recupero errori e retry automatico.

Harness non è un wrapper generico in stile LangChain. È co-progettato con il modello affinché gestione del contesto, orchestrazione degli strumenti, raccolta delle evidenze e loop di riparazione sfruttino le efficienze specifiche di V4 (attenzione sparsa, caching, modalità di ragionamento). Esistono progetti community e harness di terze parti, ma l’Harness ufficiale punta al massimo accoppiamento modello–runtime.

Quando sarà completamente rilasciato, ci si aspetta che fornisca:

  • Loop strutturati per agent di coding e automazione.
  • Gate di sicurezza e flussi di approvazione.
  • Gestione efficiente del contesto per compiti di lungo orizzonte.
  • Osservabilità e produzione di artefatti.

Fino al rilascio completo, gli sviluppatori possono già ottenere risultati solidi abbinando V4-Flash-0731 a framework di agent esistenti o usando il percorso Responses API + Codex.

Prezzi, disponibilità e adozione pratica

  • Prezzi API ufficiali (approssimativi): $0.14 / 1M token in input (cache miss), ~$0.0028–0.03 su cache hit, $0.28 / 1M token in output. Limiti di concorrenza elevati.
  • Pesi aperti sotto MIT su Hugging Face; versioni GGUF quantizzate ampiamente disponibili per uso locale/self-hosted (richiede molta VRAM—la piena precisione è grande).
  • DSpark (decodifica speculativa) e attenzione ibrida mantengono relativamente efficiente l’inferenza a lungo contesto.
  • Motori di inferenza supportati: vLLM, SGLang e altri con ricette documentate.

Per molti team il percorso di produzione più semplice è un gateway compatibile OpenAI. CometAPI offre accesso unificato ai modelli DeepSeek (inclusa la serie V4) insieme a centinaia di altri modelli tramite un unico endpoint (https://api.cometapi.com/v1). I vantaggi includono routing multi-modello semplificato, prezzi competitivi o scontati rispetto ai provider diretti, analitiche d’uso e la possibilità di passare tra Flash, Pro e altri modelli senza cambiare il codice dell’applicazione. È particolarmente utile per sistemi agentici che possono effettuare fallback o instradare per difficoltà/costo.

Al momento di questo articolo, il DeepSeek V4 Flash di CometAPI riportava un prezzo di input iniziale di $0.12 per 1M token, un prezzo di output di $0.24 per 1M token nella sua tabella di confronto, 100.0% di uptime nelle 24 ore e 2941 ms di risposta osservata. DeepSeek avverte anche che i prezzi complessivi dell’API potrebbero aumentare a breve. Poiché i prezzi dei provider possono cambiare, il linguaggio consigliato per la pubblicazione è: controlla il catalogo live di CometAPI e i prezzi ufficiali di DeepSeek prima di impegnare budget di produzione.

Raccomandazioni pratiche per sviluppatori e team

  1. Inizia con Flash-0731 per il coding agentico — Il rapporto costo/prestazioni è attualmente eccellente per workflow di terminale, repository e multi-strumento. Usa massimo sforzo di ragionamento + loop in stile Harness per i compiti più difficili.
  2. Per l’inferenza locale, scarica da Hugging Face e segui le ricette ufficiali vLLM/SGLang che abilitano DSpark.
  3. Integra tramite Responses API se già usi Codex o vuoi semantiche moderne di tool-calling.
  4. Self-host o usa pesi quantizzati per il massimo controllo dei costi e la privacy dei dati.
  5. Instrada in modo intelligente — Flash per il volume, Pro (o altri modelli grandi) per la coda lunga dei problemi ultra-difficili.
  6. Considera CometAPI per un accesso multi-modello semplificato, specialmente se il tuo stack già mixa DeepSeek con altri provider.

Conclusione

DeepSeek-V4-Flash-0731 rappresenta un momento chiave nell’AI agentica efficiente. Offrendo prestazioni agent di frontiera da un MoE relativamente compatto (13B attivi) tramite post-training mirato, e affiancandolo a un Harness dedicato e a compatibilità API moderna (Responses + Codex), DeepSeek ha ridefinito le aspettative per agent di coding e automazione a costi contenuti.

Che tu faccia self-host dei pesi aperti, chiami l’API ufficiale o instradi tramite un gateway unificato come CometAPI, V4-Flash-0731 + l’ecosistema Harness in evoluzione offre una base ad alte prestazioni e conveniente per la prossima generazione di agenti AI.

Domande frequenti

Che cos’è DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 è la release ufficiale in beta pubblica di DeepSeek V4 Flash sulla DeepSeek API, annunciata nel changelog del 31 luglio 2026. Sostituisce la versione preview mantenendo lo stesso nome di modello, deepseek-v4-flash.

Cosa c’è di nuovo in DeepSeek V4 Flash 0731?

I principali cambiamenti sono prestazioni agentiche più forti nei benchmark, supporto nativo alla Responses API, adattamento a Codex e una build ufficiale di V4 Flash ritrainata. DeepSeek afferma che architettura e dimensioni del modello sono rimaste le stesse della versione preview.

DeepSeek V4 Flash 0731 supporta Codex?

Sì. La guida a Codex di DeepSeek afferma che al momento solo deepseek-v4-flash supporta l’integrazione con Codex. Funziona tramite la Responses API e può essere configurato per la CLI di Codex, l’app desktop di ChatGPT e l’estensione IDE Codex per VS Code.

Che cos’è DeepSeek Harness?

DeepSeek Harness è il framework di agent di DeepSeek per trasformare i modelli linguistici in agent autonomi di coding o workflow. I resoconti pubblici descrivono un harness come il layer che gestisce strumenti, contesto, file, esecuzione di comandi e workflow multi-step. DeepSeek ha usato la modalità minimale dell’Harness nel setup di benchmark di V4 Flash 0731.

Come posso accedere a DeepSeek V4 Flash tramite CometAPI?

Usa l’endpoint compatibile OpenAI di CometAPI con l’ID modello deepseek-v4-flash. La pagina modello di CometAPI fornisce esempi cURL, Python e JavaScript per /v1/chat/completions, oltre a specifiche, prezzi e uptime del modello.

DeepSeek V4 Flash è migliore di DeepSeek V4 Pro?

Nella tabella di benchmark del 31 luglio, V4 Flash 0731 supera V4-Pro Preview su tutti i benchmark agent elencati. Questo non significa che Flash sia sempre migliore di Pro. V4 Pro è più grande e rimane più forte in molti compiti pesanti di conoscenza e ragionamento nella model card. Usa Flash come predefinito per workflow agent sensibili al costo e Pro come percorso di escalation.

66 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più