Especificações técnicas
| Item | DeepSeek-V4-Pro |
|---|---|
| Fornecedor | DeepSeek |
| Nome do modelo da API | deepseek-v4-pro |
| URLs base | https://api.deepseek.com e https://api.deepseek.com/anthropic |
| Tipo de entrada | Texto |
| Tipo de saída | Texto, chamadas de ferramenta, saída de raciocínio |
| Comprimento do contexto | 1.000.000 tokens |
| Saída máxima | 384.000 tokens |
| Modos de raciocínio | Non-thinking, thinking (padrão) |
| Padrões de agente/codificação | reasoning_effort pode ser definido como high; solicitações de agente complexas podem usar max |
| Recursos compatíveis | Saída JSON, Chamadas de ferramentas, Chat Prefix Completion (beta), FIM Completion (beta no modo non-thinking) |
| Lançamento local/pesos abertos | 1,6T de parâmetros totais, 49B de parâmetros ativados, precisão mista FP4 + FP8 |
| Licença (ficha do modelo) | MIT |
| Ficha de modelo de referência | Prévia do DeepSeek-V4-Pro no Hugging Face |
O que é o DeepSeek-V4-Pro?
DeepSeek-V4-Pro é o membro mais robusto da família de prévias V4 da DeepSeek. A ficha oficial do modelo o descreve como um modelo MoE com 1,6T de parâmetros e 49B de parâmetros ativados, com janela de contexto de um milhão de tokens, voltado para trabalhos de conhecimento de longo horizonte, geração de código e tarefas de agentes. A documentação da API o expõe por meio da interface padrão de chat-completions da DeepSeek e oferece suporte aos estilos de SDK da OpenAI e da Anthropic.
Principais recursos
- Contexto de um milhão de tokens: A DeepSeek documenta um comprimento de contexto de 1M tokens, o que torna o modelo adequado para conjuntos de documentos muito grandes, repositórios e sessões de agente em várias etapas.
- Dois modos de raciocínio: A API oferece suporte aos modos non-thinking e thinking; thinking é o padrão, e a documentação observa que solicitações de agente complexas, como Claude Code ou OpenCode, podem usar automaticamente o esforço
max. - Compatível com chamadas de ferramentas: O modo thinking da DeepSeek oferece suporte a chamadas de ferramentas, o que é importante para agentes que precisam de busca, operações de arquivo ou funções externas.
- Eficiência em contexto longo: A ficha do modelo afirma que a V4 usa um design de atenção híbrida com Compressed Sparse Attention e Heavily Compressed Attention para reduzir o custo de computação e de cache KV em contexto longo em relação à V3.2. citeturn980363view2
- Foco em codificação e raciocínio: A DeepSeek afirma que o modo de raciocínio V4-Pro-Max avança os benchmarks de codificação e reduz grande parte da diferença em relação aos principais modelos proprietários em tarefas de raciocínio e agentes. citeturn980363view2
- Flexibilidade de SDK: Pode ser acessado por meio de chat completions compatíveis com OpenAI ou via o endpoint compatível com Anthropic da DeepSeek para fluxos de trabalho orientados a ferramentas.
Desempenho em benchmarks
A ficha oficial do modelo da DeepSeek relata os seguintes resultados de avaliação para a família de modelos base e para o conjunto de comparação V4-Pro-Max. Na tabela do modelo base, V4-Pro obtém pontuações superiores ao V3.2-Base em vários benchmarks de conhecimento e de longo contexto, incluindo MMLU-Pro (73,5 vs. 65,5), FACTS Parametric (62,6 vs. 27,1) e LongBench-V2 (51,5 vs. 40,2).
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| FACTS Parametric (EM) | 27.1 | 33.9 | 62.6 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
A mesma ficha do modelo também mostra que V4-Pro-Max permanece competitivo com os principais modelos de ponta em tarefas selecionadas. Por exemplo, registra 87,5 em MMLU-Pro, 57,9 em SimpleQA-Verified, 90,1 em GPQA Diamond e 67,9 em Terminal Bench 2.0 na tabela de comparação publicada.
DeepSeek-V4-Pro vs DeepSeek-V4-Flash vs DeepSeek-V3.2
| Modelo | Melhor adequação | Contexto | Observações |
|---|---|---|---|
| DeepSeek-V4-Pro | Raciocínio pesado, codificação, agentes, documentos grandes | 1M | Maior modelo da série V4, 49B de parâmetros ativados, maior capacidade geral da série. citeturn980363view2turn980363view0 |
| DeepSeek-V4-Flash | Uso geral mais rápido e leve | 1M | Modelo menor de 284B/13B, ainda oferece suporte a thinking e chamadas de ferramentas. citeturn980363view2turn980363view0 |
| DeepSeek-V3.2 | Baseline de longo contexto da geração anterior | 128K em documentação de API anterior; V4 usa um design diferente de contexto de 1M | Útil como ponto de referência para ganhos de eficiência; a ficha do V4-Pro relata grandes reduções em FLOPs de longo contexto e cache KV em relação ao V3.2. citeturn321011view1turn980363view2 |
Melhores casos de uso
- Assistentes de codificação e ferramentas de refatoração em escala de repositório
- Análise e síntese de documentos longos
- Agentes que usam ferramentas e precisam de raciocínio em múltiplas interações
- Fluxos de trabalho de suporte técnico que se beneficiam de memória longa e saídas estruturadas
- Tarefas de conhecimento em chinês e multilíngues nas quais a ficha do modelo mostra forte desempenho em benchmarks
Como acessar e usar a API do Deepseek v4 pro
Etapa 1: Cadastre-se para obter a chave de API
Faça login em cometapi.com. Se você ainda não é nosso usuário, registre-se primeiro. Acesse seu CometAPI console. Obtenha a chave de API das credenciais de acesso da interface. Clique em “Add Token” no token de API no centro pessoal, obtenha a chave do token: sk-xxxxx e envie.
Etapa 2: Envie solicitações para a API do Deepseek v4 pro
Selecione o endpoint “deepseek-v4-pro” para enviar a solicitação de API e defina o corpo da solicitação. O método e o corpo da solicitação são obtidos na documentação de nossa API no site. Nosso site também fornece teste no Apifox para sua conveniência. Substitua <YOUR_API_KEY> pela sua chave CometAPI real da sua conta. Onde chamar: formato de Anthropic Messages e formato de Chat.
Insira sua pergunta ou solicitação no campo content — é a isso que o modelo responderá. Processe a resposta da API para obter a resposta gerada.
Etapa 3: Recuperar e verificar os resultados
Processe a resposta da API para obter a resposta gerada. Após o processamento, a API responde com o status da tarefa e os dados de saída. Habilite recursos como streaming, cache de prompts ou tratamento de contexto longo por meio de parâmetros padrão.