Specifiche tecniche
| Voce | DeepSeek-V4-Pro |
|---|---|
| Fornitore | DeepSeek |
| Nome del modello API | deepseek-v4-pro |
| URL di base | https://api.deepseek.com e https://api.deepseek.com/anthropic |
| Tipo di input | Testo |
| Tipo di output | Testo, chiamate a strumenti, output di ragionamento |
| Lunghezza del contesto | 1,000,000 token |
| Output massimo | 384,000 token |
| Modalità di ragionamento | Non-thinking, thinking (predefinita) |
| Predefiniti per agent/coding | reasoning_effort può essere impostato su high; le richieste di agent complesse possono usare max |
| Funzionalità supportate | Output JSON, chiamate a strumenti, completamento del prefisso chat (beta), completamento FIM (beta in modalità non-thinking) |
| Rilascio local/open-weights | 1.6T parametri totali, 49B parametri attivati, precisione mista FP4 + FP8 |
| Licenza (scheda del modello) | MIT |
| Scheda modello di riferimento | Anteprima DeepSeek-V4-Pro su Hugging Face |
Che cos'è DeepSeek-V4-Pro?
DeepSeek-V4-Pro è il membro più potente della famiglia di anteprima V4 di DeepSeek. La scheda ufficiale del modello lo descrive come un modello MoE da 1.6T parametri con 49B parametri attivati e una finestra di contesto da un milione di token, pensato per lavori di conoscenza a lungo orizzonte, generazione di codice e attività degli agent. La documentazione API lo espone tramite l’interfaccia standard di chat-completions di DeepSeek e supporta sia lo stile SDK di OpenAI sia quello di Anthropic.
Caratteristiche principali
- Contesto da un milione di token: DeepSeek documenta una lunghezza del contesto di 1M token, che rende il modello adatto a set di documenti molto grandi, repository e sessioni di agent multi‑step.
- Due modalità di ragionamento: l’API supporta modalità non-thinking e thinking; thinking è predefinita e la documentazione nota che richieste di agent complesse come Claude Code o OpenCode possono usare automaticamente lo sforzo
max. - Supporto alle chiamate di strumenti: la modalità thinking di DeepSeek supporta le tool call, importante per agent che necessitano di ricerca, operazioni su file o funzioni esterne.
- Efficienza sul lungo contesto: la scheda del modello indica che V4 usa un design di attenzione ibrido con Compressed Sparse Attention e Heavily Compressed Attention per ridurre il compute sul lungo contesto e il costo della cache KV rispetto a V3.2. citeturn980363view2
- Focus su coding e ragionamento: DeepSeek afferma che la modalità di ragionamento V4-Pro-Max migliora i benchmark di coding e colma buona parte del divario con i modelli chiusi leader nelle attività di ragionamento e agentiche. citeturn980363view2
- Flessibilità SDK: è accessibile tramite le standard chat completions compatibili con OpenAI o tramite l’endpoint compatibile con Anthropic di DeepSeek per workflow orientati agli strumenti.
Prestazioni nei benchmark
La scheda ufficiale del modello DeepSeek riporta i seguenti risultati di valutazione per la famiglia di modelli base e per il set di confronto V4-Pro-Max. Nella tabella dei modelli base, V4-Pro ottiene punteggi più alti di V3.2-Base su diversi benchmark di conoscenza e lungo contesto, inclusi MMLU-Pro (73.5 vs. 65.5), FACTS Parametric (62.6 vs. 27.1) e LongBench-V2 (51.5 vs. 40.2).
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| FACTS Parametric (EM) | 27.1 | 33.9 | 62.6 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
La stessa scheda del modello mostra come V4-Pro-Max rimanga competitivo con i modelli d’avanguardia su attività selezionate. Ad esempio, registra 87.5 su MMLU-Pro, 57.9 su SimpleQA-Verified, 90.1 su GPQA Diamond e 67.9 su Terminal Bench 2.0 nella tabella di confronto pubblicata.
DeepSeek-V4-Pro vs DeepSeek-V4-Flash vs DeepSeek-V3.2
| Modello | Miglior utilizzo | Contesto | Note |
|---|---|---|---|
| DeepSeek-V4-Pro | Ragionamento intensivo, programmazione, agent, documenti di grandi dimensioni | 1M | Modello V4 più grande, 49B parametri attivati, capacità complessiva più forte della serie. citeturn980363view2turn980363view0 |
| DeepSeek-V4-Flash | Più rapido, più leggero per uso generale | 1M | Modello più piccolo 284B/13B, supporta comunque thinking e le chiamate a strumenti. citeturn980363view2turn980363view0 |
| DeepSeek-V3.2 | Baseline long-context di generazione precedente | 128K nelle precedenti API doc; V4 usa un diverso design di contesto da 1M | Utile come punto di riferimento per i guadagni di efficienza; la scheda di V4-Pro riporta grandi riduzioni di FLOPs e cache KV sul lungo contesto rispetto a V3.2. citeturn321011view1turn980363view2 |
Casi d'uso ideali
- Assistenti di programmazione e strumenti di refactoring a livello di repository
- Analisi e sintesi di documenti lunghi
- Agent con uso di strumenti che necessitano di ragionamento multi-turno
- Flussi di supporto tecnico che beneficiano di memoria lunga e output strutturati
- Attività di conoscenza in cinese e multilingue in cui la scheda del modello mostra prestazioni solide
Come accedere e utilizzare l'API Deepseek v4 pro
Passaggio 1: registrati per ottenere la chiave API
Accedi a cometapi.com. Se non sei ancora nostro utente, registrati prima. Entra nella tua CometAPI console. Ottieni la credenziale di accesso (API key) dell’interfaccia. Clicca “Add Token” nel token API nel centro personale, ottieni la chiave token: sk-xxxxx e invia.
Passaggio 2: invia richieste alla Deepseek v4 proAPI
Seleziona l’endpoint “deepseek-v4-pro” per inviare la richiesta API e imposta il body della richiesta. Il metodo e il body della richiesta sono riportati nella documentazione API del nostro sito. Il nostro sito fornisce anche Apifox per comodità. Sostituisci <YOUR_API_KEY> con la tua effettiva chiave CometAPI dal tuo account. Where to call it: Anthropic Messages format and Chat format.
Inserisci la tua domanda o richiesta nel campo content: è ciò a cui il modello risponderà. Elabora la risposta dell’API per ottenere l’output generato.
Passaggio 3: recupera e verifica i risultati
Elabora la risposta dell’API per ottenere l’output generato. Dopo l’elaborazione, l’API risponde con lo stato dell’attività e i dati di output. Abilita funzionalità come streaming, caching dei prompt o gestione del lungo contesto tramite parametri standard.