TLDR: O DeepSeek V4 Pro é o modelo V4 de maior capacidade da DeepSeek para raciocínio, programação, análise de contexto longo e fluxos de trabalho de agentes. É um modelo de mistura de especialistas com 1.6 trilhão de parâmetros totais, 49 bilhões de parâmetros ativos, uma janela de contexto de 1 milhão de tokens e saída máxima de 384.000 tokens, de acordo com o anúncio de lançamento do V4 da DeepSeek e a tabela oficial de preços do modelo.
Os resultados do próprio modelo base da DeepSeek colocam o V4 Pro em 90.1 no MMLU, 73.5 no MMLU-Pro, 76.8 no HumanEval e 51.5 no LongBench-V2. Testes independentes são mais nuançados: a avaliação do U.S. Center for AI Standards and Innovation apontou resultados fortes em matemática e ciências, incluindo 97% no OTIS-AIME-2025 e 90% no GPQA-Diamond, mas desempenho mais fraco em testes de cibersegurança, raciocínio abstrato e engenharia de software mantidos em holdout.
Veredito prático: use o DeepSeek V4 Pro quando tarefas difíceis de codificação, raciocínio ou documentos longos justificarem pagar aproximadamente três vezes as taxas de tokens sem cache do V4 Flash. Comece com o V4 Flash para aplicações de alto volume e encaminhe apenas tarefas difíceis ou com falha para o V4 Pro. Para desenvolvedores que buscam acesso multimodelo simples e econômico, plataformas como a CometAPI oferecem um endpoint unificado compatível com OpenAI para o DeepSeek V4 Pro ao lado de centenas de outros modelos.
Principais pontos
- Arquitetura e escala: 1.6T total / 49B ativos em MoE com Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) híbridos, reduzindo os FLOPs de inferência por token para ~27% e o cache de KV para ~10% dos níveis do DeepSeek-V3.2 anterior em 1M de contexto.
- Contexto e eficiência: Contexto nativo de 1M de tokens e até 384K de tokens máximos de saída, tornando práticos agentes de longo horizonte e análise de codebase completa.
- Benchmarks (V4-Pro-Max): 80.6% no SWE-bench Verified, 93.5% no LiveCodeBench, rating 3206 no Codeforces, 90.1% no GPQA Diamond, fortes pontuações em cenários de agentes (por exemplo, MCPAtlas Public ~73.6). Os preços oficiais da DeepSeek são $0.435/M para tokens de entrada sem cache, $0.003625/M para tokens de entrada com cache e $0.87/M para tokens de saída.
- O modelo é apenas de texto. Uma extensão do Copilot pode fazer proxy de imagens por meio de outro modelo, mas isso não torna o V4 Pro nativamente multimodal.
- A DeepSeek suporta OpenAI Chat Completions, sua implementação Responses API, uma interface compatível com Anthropic, saída JSON, chamadas de ferramentas e controles de “thinking”.
- O CAISI mediu o V4 Pro em 74% no SWE-bench Verified, 90% no GPQA Diamond e 97% no OTIS-AIME-2025, mas apenas 44% no PortBench e 46% no ARC-AGI-2 semi-privado.
Especificações do modelo confirmadas
| Especificação | DeepSeek V4 Pro |
|---|---|
| ID do modelo na API | deepseek-v4-pro |
| Versão documentada atual | DeepSeek-V4-Pro-0813 |
| Tamanho da arquitetura | 1.6T de parâmetros totais; 49B ativos |
| Janela de contexto | 1M tokens |
| Saída máxima | 384K tokens |
| Modalidade de entrada | Texto |
| Raciocínio | Modos com e sem “thinking” |
| Esforço de raciocínio | alto e documentado para a interfacemax oficial |
| Saída estruturada | Suporte a JSON |
| Recursos de agente | Suporte a chamadas de ferramenta e Responses API |
| Compatibilidade de API | OpenAI Chat Completions e API compatível com Anthropic |
| Pesos abertos | Yes |
| Concorrência padrão da conta | 500 solicitações simultâneas do V4 Pro |
O que é o DeepSeek V4 Pro?
O DeepSeek V4 Pro (ID de modelo normalmente deepseek-v4-pro) é o nível de maior capacidade da série DeepSeek-V4, desenvolvido pelo laboratório chinês DeepSeek. Foi lançado pela primeira vez como preview em 24 de abril de 2026, junto com o mais leve DeepSeek-V4-Flash, e passou para disponibilidade geral em meados de agosto de 2026 sob a string de versão DeepSeek-V4-Pro-0813.
Construído como um modelo Mixture-of-Experts, ele ativa apenas uma fração de seus parâmetros totais (49B de 1.6T) por token. Esse design, combinado com inovações arquitetônicas em atenção, oferece inteligência de nível de fronteira mantendo a inferência eficiente—especialmente em comprimentos de contexto extremos. O modelo é apenas de texto (capacidades multimodais permanecem em desenvolvimento), licenciado sob MIT e com pesos abertos disponíveis no Hugging Face.
Posicionamento-chave da DeepSeek: o V4-Pro mira capacidades agentivas aprimoradas, amplo conhecimento de mundo (líder entre modelos abertos, ficando atrás apenas de certas variantes do Gemini) e raciocínio de classe mundial em matemática, STEM e programação que rivaliza com sistemas proprietários de ponta.
Ele suporta dois modos—thinking (chain-of-thought / raciocínio estendido, padrão em muitas configurações) e non-thinking (respostas mais rápidas)—além de níveis configuráveis de esforço de raciocínio (incluindo uma configuração máxima “V4-Pro-Max”). A compatibilidade de API abrange tanto OpenAI Chat Completions quanto o formato Messages da Anthropic, além de chamadas de ferramentas, saída JSON estruturada e recursos beta como fill-in-the-middle (FIM) completion (modo non-thinking) e continuação de prefixo de conversas.
Status de lançamento do DeepSeek V4 Pro
Há várias datas a separar:
- 24 de abril de 2026: a DeepSeek anunciou o V4 Preview, pesos abertos e acesso à API para o V4 Pro e o V4 Flash.
- 24 de julho de 2026: a DeepSeek aposentou os nomes antigos e de API após um período de migração de três meses.
deepseek-chatdeepseek-reasoner - 13 de agosto de 2026: o alias atual aponta para a versão do modelo V4-Pro-0813, de acordo com a tabela de modelos ao vivo da DeepSeek.
deepseek-v4-pro
Como o DeepSeek V4 Pro funciona?
Em sua essência, o V4 Pro é um modelo Mixture-of-Experts (MoE) com 1.6 trilhão de parâmetros totais e 49 bilhões de parâmetros ativados por forward pass. Esse design oferece alta capacidade mantendo os custos de inferência administráveis. Tanto o V4 Pro quanto o V4 Flash suportam janela de contexto de 1 milhão de tokens e até 384.000 tokens de saída máxima. Os modelos são apenas de texto no lançamento (capacidades multimodais foram citadas como em desenvolvimento nos materiais iniciais) e são distribuídos sob a permissiva licença MIT, com pesos abertos no Hugging Face.
As principais inovações arquitetônicas incluem:
- Mecanismo de atenção híbrido: combina Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA). Na configuração de 1M de tokens, o DeepSeek-V4-Pro requer apenas cerca de 27% dos FLOPs de inferência por token e 10% da memória do cache de KV em comparação com o DeepSeek-V3.2. Isso torna rotineiro trabalhar com contextos de um milhão de tokens.
- Manifold-Constrained Hyper-Connections (mHC): aprimora conexões residuais para melhor estabilidade de treinamento e propagação de sinal.
- Otimizador Muon: usado durante o pré-treinamento para convergência mais rápida e maior estabilidade.
- Pré-treinamento em mais de 32 trilhões de tokens de alta qualidade, seguido por um pipeline sofisticado de pós-treinamento (SFT + RL específicos de domínio, depois destilação on-policy).
Essas mudanças permitem o uso rotineiro de contextos de 1M de tokens para tarefas de agentes de longo horizonte, análise de codebase completa ou grandes coleções de documentos sem as penalidades anteriores de memória e computação.
Preços da API do DeepSeek V4 Pro
A DeepSeek cobra separadamente por entrada sem cache, entrada com cache e saída gerada. Os preços são cotados por um milhão de tokens.
| Modelo | Entrada sem cache | Entrada com cache | Saída | Contexto |
|---|---|---|---|---|
| DeepSeek V4 Pro | $0.435 | $0.003625 | $0.87 | 1M tokens |
| DeepSeek V4 Flash | $0.14 | $0.0028 | $0.28 | 1M tokens |
Estas são as tarifas mostradas na página oficial de preços da API da DeepSeek no momento da publicação. A DeepSeek alerta ali que pretende aumentar os preços gerais da API no futuro, mas ainda não divulgou uma nova tarifa definitiva ou data de vigência. Orçamentos de produção devem, portanto, ler preços dinamicamente em vez de fixá-los em projeções de longo prazo.
Exemplos realistas de custos do DeepSeek V4 Pro
A fórmula básica é:
cost = uncached input × $0.435/M + cached input × $0.003625/M + output × $0.87/M
| Carga de trabalho | Suposições de tokens | Custo aproximado do V4 Pro |
|---|---|---|
| Solicitação de código curta | 10,000 de entrada + 2,000 de saída | $0.00609 |
| Análise em nível de repositório | 100,000 de entrada + 20,000 de saída | $0.0609 |
| Análise de documento muito longo | 1M de entrada + 100,000 de saída | $0.522 |
| Análise de documento longo com cache | 1M de entrada com cache + 100,000 de saída | $0.090625 |
| 100,000 chamadas de produção | 20,000 de entrada + 4,000 de saída por chamada | $1,218 |
Para comparação, o cenário final de 100,000 chamadas custaria aproximadamente $392 no V4 Flash, assumindo que toda a entrada é sem cache. Essa é uma diferença de $826, tornando a estratégia de roteamento economicamente importante mesmo quando ambos os modelos parecem baratos por chamada.
Esses exemplos são estimativas de custo de tokens, não orçamentos completos de infraestrutura. Eles excluem novas tentativas, voltas de agente com falha, resultados de ferramentas repetidos, moderação, armazenamento vetorial, APIs de busca, observabilidade e quaisquer taxas cobradas por uma plataforma separada.
Por que o preço de acerto de cache importa
A taxa de entrada com acerto de cache do V4 Pro é cerca de 120 vezes menor que sua taxa de entrada sem cache. As maiores economias ocorrem quando as solicitações usam repetidamente o mesmo prefixo—por exemplo:
- Um prompt de sistema e manual de políticas estáveis
- Um snapshot de repositório compartilhado
- Um esquema de ferramenta padrão
- Um catálogo de produtos longo
- Análise repetida do mesmo contrato ou relatório
Cache não torna a saída gerada mais barata. Um traço de raciocínio longo ou uma conclusão verbosa ainda é cobrado à taxa de saída. Desenvolvedores devem monitorar separadamente o status do cache de entrada e o comprimento da saída, em vez de depender apenas do custo médio por solicitação.
Como acessar o DeepSeek V4 Pro (incluindo via CometAPI)
Métodos de acesso:
- API oficial da DeepSeek (
https://api.deepseek.com) — use o modelodeepseek-v4-pro. - Pesos abertos no Hugging Face para implantação local ou privada.
- Agregadores e plataformas serverless (OpenRouter, Together, DeepInfra, etc.).
Recomendação para usuários da CometAPI: a CometAPI oferece acesso conveniente ao DeepSeek V4 Pro (e V4 Flash) por meio de um único endpoint compatível com OpenAI (https://api.cometapi.com/v1). Você se beneficia de faturamento unificado em mais de 500 modelos, tarifas competitivas (frequentemente com economias em nível de plataforma), painéis de uso em tempo real e zero alterações de código além da URL base e da chave ao migrar dos SDKs da OpenAI. Isso é especialmente útil para desenvolvedores independentes e equipes que desejam fazer A/B test do V4 Pro contra Claude, GPT, Gemini ou outros modelos sem gerenciar várias contas.
Quem deve usar o DeepSeek V4 Pro?
O V4 Pro merece um teste sério para:
- síntese de grandes documentos com citações rastreáveis;
- codificação e revisão de código em escala de repositório;
- agentes de longa duração com contexto repetido;
- assistência em matemática e STEM com verificação;
- geração de relatórios ou documentos estruturados;
- raciocínio de alto volume onde o custo direto por token é um grande limitador;
- equipes interessadas em um caminho eventual de implantação com pesos abertos.
O V4 Flash pode ser uma melhor primeira escolha para tarefas simples de agente, classificação, extração, roteamento ou trabalhos sensíveis à latência. A própria DeepSeek afirma que o Flash se aproxima do Pro em raciocínio e o iguala em avaliações de agentes mais simples ao usar um modelo ativo menor.
O V4 Pro é uma opção padrão mais fraca quando a compreensão nativa de imagens é obrigatória, quando uma política de compras proíbe dependências em status de preview ou quando a organização não pode construir controles de avaliação e verificação. O guia de integração com o GitHub Copilot oficial descreve explicitamente o V4 como apenas texto; o tratamento de imagens nessa extensão é realizado por um modelo proxy separado.
DeepSeek V4 Pro vs V4 Flash
| Fator de decisão | V4 Pro | V4 Flash |
|---|---|---|
| Papel principal | Raciocínio difícil, código, agentes | Alto volume e trabalhos sensíveis à latência |
| Parâmetros total/ativos | 1.6T / 49B | 284B / 13B |
| Contexto | 1M | 1M |
| Saída máxima | 384K | 384K |
| Preço de entrada sem cache | $0.435/M | $0.14/M |
| Preço de saída | $0.87/M | $0.28/M |
| Concorrência | 500 | 2,500 |
| Uso recomendado | Camada de escalonamento | Camada de roteamento padrão |
Uma arquitetura sensata começa com o Flash para extração, sumarização, classificação, chat básico e codificação direta. Escalone para o Pro quando o Flash falhar em um validador, reportar baixa confiança, encontrar uma alteração complexa de repositório ou precisar de planejamento mais profundo.
Essa abordagem reflete um princípio econômico mais amplo: a seleção do modelo deve seguir o valor entregue, não simplesmente a inteligência teórica máxima.
Conclusão e recomendação
O DeepSeek V4 Pro representa um avanço significativo para IA de pesos abertos: capacidade adjacente à fronteira em codificação e raciocínio, contexto prático de um milhão de tokens tornado eficiente por inovação arquitetônica e economia que torna a inteligência de alto nível acessível. A combinação de pesos abertos (MIT), fortes benchmarks de agentes e preços oficiais agressivos solidifica a posição da DeepSeek como uma força importante no cenário de IA de 2026.
Para a maioria dos desenvolvedores e equipes, começar com a API oficial ou um agregador confiável é o caminho mais rápido. A CometAPI se destaca como uma recomendação prática para acesso simplificado—fornecendo o DeepSeek V4 Pro (e Flash) dentro de uma plataforma multimodelo mais ampla que reduz o atrito operacional. Esteja você construindo agentes de codificação, analisando documentos longos ou otimizando custos de inferência, o V4 Pro merece uma avaliação séria.
Fontes e leituras adicionais
- DeepSeek V4 Preview Release: https://api-docs.deepseek.com/news/news260424/
- Preços oficiais da DeepSeek: https://api-docs.deepseek.com/quick_start/pricing
- Hugging Face DeepSeek-V4-Pro: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
- Relatório técnico (arXiv/Hugging Face): artigo do DeepSeek-V4
- Cobertura do Artificial Analysis e relatórios do Intelligence Index
- Avaliações contemporâneas e avaliações independentes (2026)
- Modelos e documentação do DeepSeek na CometAPI: https://www.cometapi.com/ e páginas de modelos relacionadas
Esta visão geral baseia-se em informações publicamente disponíveis em agosto de 2026. Sempre verifique as fontes oficiais mais recentes antes da implantação em produção.
