TL;DR: DeepSeek-V4-Pro-0813 é a versão GA (general-availability) do modelo MoE carro-chefe da DeepSeek com 1,6T de parâmetros (49B ativos). Entrega grandes ganhos em capacidades de agente em relação ao preview de abril de 2026, suporta janela de contexto de 1M tokens, até 384K tokens de saída, três níveis de esforço de raciocínio (baixo/alto/máximo), API OpenAI Responses nativa, chamadas de ferramentas, modo JSON e endpoints compatíveis com OpenAI e Anthropic.
A precificação oficial começa em US$ 0,435 / US$ 0,87 por 1M de tokens de entrada/saída (cache miss), com tarifas de pico/fora de pico a partir de 16 de agosto de 2026. A forma mais fácil e muitas vezes mais econômica de acessá-lo é via o gateway unificado compatível com OpenAI da CometAPI, com tarifas com desconto.
Principais destaques
- DeepSeek-V4-Pro-0813 é a versão GA de produção lançada por volta de 12–13 de agosto de 2026; o ID do modelo permanece
deepseek-v4-pro. - Ganhos significativos em benchmarks de agentes: DeepSWE 62.7, Terminal Bench 2.1 87.9, NL2Repo 61.5, Cybergym 83.3, HLE (c/ ferramentas) 60.0.
- Três modos/níveis de esforço de raciocínio: sem raciocínio + baixo / alto / máximo.
- Conjunto completo de recursos: contexto de 1M, saída máxima de 384K, chamadas de ferramentas, saída JSON, API Responses, formato Anthropic, streaming, saídas estruturadas.
- Preços de pico/fora de pico começam em 16 de agosto de 2026 (UTC); planeje cargas de trabalho de acordo.
- Compatibilidade com o SDK da OpenAI torna a migração trivial.
Este guia abrangente cobre tudo o que os desenvolvedores precisam: o que mudou no release 0813, especificações e preços oficiais, modos de raciocínio, streaming e saídas estruturadas, e um passo a passo de como usar o modelo via CometAPI (recomendado para muitos workloads de produção e multi-modelo). Todas as informações são extraídas da documentação oficial da DeepSeek e de reportagens contemporâneas em 13 de agosto de 2026.
O que é o DeepSeek V4 Pro 0813?
DeepSeek-V4-Pro-0813 é o snapshot de produção de disponibilidade geral do DeepSeek V4 Pro lançado em agosto de 2026.
A DeepSeek anunciou em 13 de agosto que a versão oficial do V4 Pro ficou simultaneamente disponível em seu app, site e API. O anúncio de 13 de agosto da DeepSeek também adiciona compatibilidade nativa com a OpenAI Responses API e três níveis práticos de raciocínio: sem raciocínio, raciocínio de alto esforço e raciocínio de esforço máximo. Importante para desenvolvedores, a DeepSeek afirma que o nome do modelo na API não muda. Os desenvolvedores continuam chamando:
deepseek-v4-pro
A designação 0813 identifica o snapshot de produção, e não um identificador de modelo que os desenvolvedores necessariamente precisem usar na requisição da API.
O modelo é posicionado principalmente para raciocínio avançado, engenharia de software, análise de contexto longo e workloads de agentes. Avaliação independente do Artificial Analysis atualmente reporta um score de Intelligence Index de 53, em comparação com uma mediana de 27 entre seus modelos open-weight comparáveis selecionados. Também reporta aproximadamente 77.6 tokens/segundo de velocidade de saída e 1.71 segundos de time-to-first-token com base em seus testes de API.
Quais mudanças foram feitas na API no V4 Pro 0813?
O identificador principal do modelo e as URLs base permanecem os mesmos, então integrações existentes continuam funcionando sem mudanças de código. As atualizações significativas estão em capacidade, qualidade de pós-treinamento e recursos de suporte.
Principais melhorias de capacidade
Segundo o anúncio oficial de GA do DeepSeek-V4-Pro e o change log:
- Grandes upgrades em capacidades de agente, com ganhos especialmente fortes em workloads de estilo produção.
- Scores de benchmark para o build 0813 incluem:
- HLE (sem / com ferramentas): 42.7 / 60.0
- Terminal Bench 2.1: 87.9
- NL2Repo: 61.5
- Cybergym: 83.3
- DeepSWE: 62.7
- Toolathlon-Verified: 74.1
- Agents’ Last Exam: 25.7
- AutomationBench (Público): 31.8
- DSBench-FullStack: 71.1
- DSBench-Hard: 67.2
Isso representa aumentos substanciais em relação ao preview de abril de 2026 (por exemplo, DeepSWE subiu de forma marcante). O modelo permanece com arquitetura Mixture‑of‑Experts, com 1,6 trilhão de parâmetros totais e aproximadamente 49 bilhões ativados por token.
Novos e aprimorados recursos de API
- Suporte nativo para a OpenAI Responses API, otimizada para Codex com scripts de configuração em um clique.
- Controle mais flexível de esforço de raciocínio: baixo / alto / máximo (anteriormente havia mapeamento mais limitado no Pro).
- Suporte contínuo a modo duplo (raciocínio habilitado por padrão; modo sem raciocínio disponível).
- Total compatibilidade com os formatos OpenAI Chat Completions e Anthropic Messages.
- Saída JSON, chamadas de ferramentas, Chat Prefix Completion (Beta) e FIM Completion (Beta, apenas sem raciocínio).
- Comprimento do contexto permanece 1M tokens; saída máxima é 384K tokens.
- Limite de concorrência para Pro: 500 (Flash: 2.500).
Anúncio de atualização de preços
Preços atuais (em 13 de agosto de 2026) por 1M tokens:
| Modelo | Entrada (Acerto de cache) | Entrada (Falha de cache) | Saída |
|---|---|---|---|
| deepseek-v4-flash | US$ 0,0028 | US$ 0,14 | US$ 0,28 |
| deepseek-v4-pro | US$ 0,003625 | US$ 0,435 | US$ 0,87 |
A partir de 16:00 UTC em 16 de agosto de 2026, entra em vigor a cobrança de pico/fora de pico (fora de pico = metade do pico). Horários de pico: 01:00–04:00 e 06:00–10:00 UTC. Novas tarifas:
| Modelo | Período | Entrada (Acerto de cache) | Entrada (Falha de cache) | Saída |
|---|---|---|---|---|
| deepseek-v4-pro | Fora de pico | US$ 0,022 | US$ 0,66 | US$ 1,98 |
| deepseek-v4-pro | Pico | US$ 0,044 | US$ 1,32 | US$ 3,96 |
A DeepSeek também indicou que aumentos gerais de preço podem seguir; monitore a página oficial de preços.
A documentação de rate limit da DeepSeek define a concorrência padrão do V4 Pro em 500 requisições por conta. Uma conexão conta a partir do envio até a conclusão da resposta, e requisições em excesso recebem respostas HTTP 429. A DeepSeek aceita um para isolamento de agendamento; ele deve corresponder e não ter mais de 512 caracteres. Não deve conter informações pessoais.
Suporte nativo à Responses API
Uma das mudanças mais claras na API é o suporte nativo ao formato OpenAI Responses API.
A DeepSeek diz que a Responses API foi projetada em parte para dar suporte a workflows de agentes de código como o Codex. O endpoint oficial usa:
https://api.deepseek.com
e pode ser acessado com o SDK Python da OpenAI.
Exemplo:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-pro",
instructions="You are an expert software engineer.",
input="Explain how database connection pooling works."
)
print(response.output_text)
A documentação da DeepSeek também oferece suporte a streaming para requisições da Responses API, usando Server-Sent Events semânticos em vez da convenção antiga data: [DONE].
Controles de raciocínio mais flexíveis
O V4 Pro torna o raciocínio configurável em vez de forçar os desenvolvedores a usar um modelo de raciocínio separado.
A documentação da DeepSeek descreve a chave de raciocínio como:
{
"thinking": {
"type": "enabled"
}
}
e o esforço de raciocínio como:
high
max
A configuração padrão de raciocínio é habilitada, com high usado para requisições regulares. Certos workloads complexos de agentes podem usar automaticamente max.
Isso cria três modos práticos para desenvolvedores de aplicativos:
- Sem raciocínio
- Raciocínio — Alto
- Raciocínio — Máximo
Essa distinção é extremamente útil ao projetar aplicações de IA, pois nem toda requisição merece raciocínio máximo.
Um detalhe importante de implementação: no modo de raciocínio, parâmetros como
temperatureetop_pnão afetam a saída do modelo. A DeepSeek documenta explicitamente esse comportamento.
Como usar a API do DeepSeek V4 Pro 0813 com a CometAPI
A CometAPI é útil se você quiser integrar o DeepSeek V4 Pro sem manter integrações de API separadas para cada provedor de IA.
A CometAPI atualmente divulga uma API unificada cobrindo 500+ modelos de IA, com uma camada de API comum e faturamento unificado. Sua documentação de preços afirma que os preços oficiais de modelo são geralmente oferecidos com desconto de 20% em relação à tarifa oficial do provedor.
Aqui está um workflow prático de integração com a CometAPI.
Passo 1: Crie uma conta na CometAPI
Primeiro, crie ou acesse sua conta CometAPI.
Abra o site da CometAPI e acesse o console da API.
A documentação do DeepSeek V4 Pro na CometAPI instrui os usuários a obter um token de API no console da CometAPI.
Passo 2: Crie sua chave de API da CometAPI
Após fazer login, abra a seção de token/chave de API da sua conta e gere uma chave de API.
Armazene-a como uma variável de ambiente em vez de colocá-la diretamente no código do seu aplicativo.
Linux/macOS:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
Windows PowerShell:
$env:COMETAPI_KEY="YOUR_COMETAPI_KEY"
Nunca faça commit de uma chave de API no GitHub, JavaScript do frontend, aplicativos móveis ou arquivos de configuração publicamente acessíveis.
Passo 3: Instale o SDK Python da OpenAI
Como a CometAPI fornece uma interface compatível com OpenAI, você pode usar o cliente Python familiar da OpenAI.
pip install openai
Isso torna a migração especialmente simples para desenvolvedores que já conhecem o formato da API da OpenAI.
Passo 4: Configure a URL base da CometAPI
Crie o cliente assim:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1"
)
O exemplo publicado da CometAPI para o V4 Pro usa essa URL base e o ID de modelo deepseek-v4-pro.
Passo 5: Envie sua primeira requisição ao DeepSeek V4 Pro
Agora envie uma requisição básica:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are an expert technical writer."
},
{
"role": "user",
"content": "Explain the advantages of a 1-million-token context window."
}
]
)
print(response.choices[0].message.content)
Os parâmetros críticos são:
base_url = https://api.cometapi.com/v1
model = deepseek-v4-pro
endpoint = /chat/completions
Três modos de raciocínio explicados
O DeepSeek V4 Pro suporta:
- Modo sem raciocínio — Respostas mais rápidas, sem chain-of-thought explícito. Ideal para Q&A simples ou cenários de alta vazão.
- Modo de raciocínio com esforço baixo / alto — O modelo produz reasoning_content antes da resposta final. Alto é o padrão prático para a maioria dos trabalhos de agentes e de código.
- Esforço máximo — Leva a capacidade de raciocínio do modelo ao limite; recomendado para problemas multietapas complexos. Pode consumir mais tokens e latência.
No formato compatível com OpenAI você controla isso com o objeto thinking e o parâmetro reasoning_effort. A chain-of-thought aparece em message.reasoning_content. Quando ferramentas não são usadas, o raciocínio prévio pode muitas vezes ser omitido do contexto subsequente; quando ferramentas são usadas, o raciocínio completo deve ser repassado.
Alternar entre esforços de raciocínio e modo sem raciocínio
- Sem raciocínio:
"thinking": {"type": "disabled"}(ou equivalente no estilo Anthropicreasoning.effort: "none"). - Raciocínio com esforço:
"reasoning_effort": "low" | "high" | "max"além de"thinking": {"type": "enabled"}.
O padrão é raciocínio habilitado com esforço alto. Use baixo para consultas simples, alto para trabalho típico de agentes e máximo para os problemas de raciocínio mais difíceis ou tarefas de código multietapas.
Streaming de respostas e saídas estruturadas
O streaming é habilitado simplesmente definindo "stream": true. Tanto o conteúdo quanto (quando aplicável) os tokens de raciocínio podem ser transmitidos. Isso é crítico para agentes interativos e aplicações voltadas ao usuário.
As saídas estruturadas / JSON são de primeira classe: use response_format={"type": "json_object"} ou o suporte a esquemas mais avançado disponível via a Responses API e definições de ferramentas. Combinado com chamadas de ferramentas, isso possibilita loops de agente confiáveis que emitem ações legíveis por máquina.
O endpoint da Responses API (/responses) fornece uma superfície mais moderna, alinhada à OpenAI, especialmente útil para workflows no estilo Codex e agora é suportado nativamente para o V4 Pro.
Usar saídas estruturadas / modo JSON
A DeepSeek oferece suporte à saída JSON. Solicite-a via response_format:
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "Return valid JSON only."},
{"role": "user", "content": "Extract the key entities from this text: ..."}
],
response_format={"type": "json_object"},
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
Para controle de esquema mais rígido, combine com chamadas de ferramentas ou use a Responses API quando suportado.
Implementar chamadas de ferramentas (Function Calling)
Defina ferramentas no formato OpenAI. No modo de raciocínio, você deve repassar corretamente o reasoning_content nas rodadas subsequentes quando ferramentas estiverem envolvidas.
Ao interagir com a ferramenta depois, os desenvolvedores devem manter o reasoning_content correspondente ao invocar a ferramenta de mentalidade. Manipulação incorreta pode resultar em erro 400.
Python
tools = [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {
"location": {"type": "string", "description": "City name"}
},
"required": ["location"]
}
}
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "What's the weather in Hangzhou?"}],
tools=tools,
extra_body={"thinking": {"type": "enabled"}, "reasoning_effort": "high"}
)
# Handle tool_calls, execute, append results, and continue the conversation
Veja os guias oficiais de Tool Calls e Thinking Mode para o padrão exato de múltiplas rodadas exigido quando ferramentas são usadas.
Boas práticas para usar a API do DeepSeek V4 Pro 0813
Combine esforço de raciocínio com a tarefa
Não use raciocínio Máximo para uma tarefa que requer apenas classificação.
Uma política simples de roteamento funciona bem:
Simples → Sem raciocínio
Moderado → Alto
Complexo → Máximo
Isso pode reduzir tanto latência quanto custo.
Faça streaming de respostas longas
Se sua aplicação pode levar vários segundos para gerar uma resposta, use:
stream=True
Os usuários geralmente percebem a saída incremental como substancialmente mais rápida do que esperar pela resposta completa.
Valide a saída estruturada
O modo JSON melhora a confiabilidade, mas sua aplicação ainda deve validar o JSON retornado.
Use:
import json
data = json.loads(response_text)
e depois valide os campos obrigatórios antes de gravar no banco de dados ou acionar uma ação externa.
Monitore o uso de tokens
Sempre inspecione:
response.usage
quando disponível.
Na escala do V4 Pro, a contabilização de tokens não é um recurso opcional de analytics. É um mecanismo central de controle de custos.
Separe prompts estáveis e dinâmicos
Para aplicações de contexto longo, mantenha instruções e documentos recorrentes estáveis para maximizar o reaproveitamento de cache.
Mantenha um modelo de fallback
Uma arquitetura de produção prática pode rotear:
Requisição simples
↓
V4 Flash
Requisição complexa
↓
V4 Pro
Requisição muito difícil
↓
V4 Pro com raciocínio máximo
A política exata de roteamento deve ser determinada pelos seus próprios benchmarks.
Erros comuns da API do DeepSeek V4 Pro
Erro: Modelo não encontrado
Verifique se você está usando:
deepseek-v4-pro
em vez de inventar acidentalmente um nome de snapshot de modelo.
A DeepSeek afirma que o nome do modelo na API permanece inalterado para o release de produção 0813.
Erro: Parâmetros de raciocínio inválidos
Para requisições compatíveis com OpenAI, use:
"thinking": {
"type": "enabled"
}
no corpo apropriado da requisição, e use:
reasoning_effort=high
ou:
reasoning_effort=max
A documentação oficial da API da DeepSeek define esses parâmetros.
Erro: Saída JSON malformada
Use:
"response_format": {
"type": "json_object"
}
e instrua explicitamente o modelo no prompt a gerar JSON. A DeepSeek alerta que o modo JSON deve ser acompanhado por uma instrução para produzir JSON.
Erro durante chamadas de ferramenta em múltiplas rodadas
Ao usar o modo de raciocínio com chamadas de ferramentas, preserve o reasoning_content exigido nas requisições subsequentes.
Esse é um detalhe fácil de perder e pode produzir uma resposta 400.
API do DeepSeek V4 Pro 0813: arquitetura recomendada
Para uma aplicação de produção, uma arquitetura inicial robusta se parece com isto:
┌─────────────────────┐
│ Your App │
└──────────┬──────────┘
│
▼
┌─────────────────────┐
│ Routing Layer │
└──────────┬──────────┘
│
┌──────────────┼──────────────┐
▼ ▼ ▼
Non-thinking High Max
│ │ │
└──────────────┼──────────────┘
▼
┌─────────────────────┐
│ CometAPI │
│ deepseek-v4-pro │
└──────────┬──────────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
Streaming Tools JSON Output
│ │ │
└─────────────┼─────────────┘
▼
┌─────────────────────┐
│ Validation / Logs │
└─────────────────────┘
Isso separa a seleção do modelo da lógica da aplicação.
Se outro modelo se tornar mais econômico ou tiver melhor performance em um workload específico, a camada de roteamento pode mudar sem reescrever toda a aplicação.
Conclusão e recomendações
O DeepSeek-V4-Pro-0813 marca a maturação da linha V4 Pro em um carro-chefe pronto para produção, com desempenho agentivo significativamente mais forte, preservando o generoso contexto de 1M e a economia atraente da série. Os desenvolvedores podem começar a usá-lo hoje com praticamente zero custo de migração graças à compatibilidade com OpenAI e Anthropic.
Para a maioria das equipes recomendamos:
- Prototipagem e experimentação multi-modelo na CometAPI.
- Migrar workloads DeepSeek‑only de alto volume ou sensíveis à latência para o endpoint oficial assim que os preços de pico/fora de pico e quaisquer ajustes subsequentes estabilizarem.
- Padrão para modo de raciocínio com
reasoning_effort="high"para tarefas de agente e de código; reservemaxpara os problemas mais difíceis. - Sempre implemente o repasse adequado de
reasoning_contentem chamadas de ferramenta e utilize streaming + saídas estruturadas para aplicações robustas.
Com o release 0813, a DeepSeek entregou um modelo de classe open-weight altamente capaz e econômico, competitivo para workloads sérios de agentes e de contexto longo. Integre via CometAPI ou API oficial e comece a construir. Explore o DeepSeek V4 Pro na CometAPI.
Perguntas frequentes
O DeepSeek V4 Pro 0813 é o mesmo que deepseek-v4-pro?
Sim. O anúncio oficial da DeepSeek diz que o nome do modelo na API permanece inalterado enquanto a versão de produção é atualizada para o V4 Pro 0813.
O DeepSeek V4 Pro suporta janela de contexto de 1M tokens?
Sim. A documentação atual de modelo/preços da DeepSeek lista comprimento de contexto de 1M tokens e saída máxima de 384K.
Quais são os três modos de raciocínio do DeepSeek V4 Pro?
Para design prático de aplicações, são:
- Sem raciocínio
- Raciocínio com esforço alto
- Raciocínio com esforço máximo
A API usa a chave de thinking mais reasoning_effort. A API atual da DeepSeek expõe high e max, enquanto valores de compatibilidade como low e medium mapeiam para high.
Posso fazer streaming de respostas do DeepSeek V4 Pro?
Sim. Streaming é suportado pela Chat Completions API, e transmissões no modo de raciocínio podem incluir deltas de reasoning_content antes do conteúdo normal da resposta.
Posso usar o DeepSeek V4 Pro com a CometAPI?
Sim. A CometAPI atualmente documenta o modelo deepseek-v4-pro via seu endpoint compatível com OpenAI /v1/chat/completions.
Devo usar o DeepSeek V4 Pro ou o V4 Flash?
Use V4 Flash quando vazão, latência e custo forem prioritários. Use V4 Pro para raciocínio difícil, codificação, análise de contexto longo e workloads de agentes.
Uma estratégia híbrida de roteamento geralmente é melhor do que usar o Pro para tudo.
A precificação da API do DeepSeek V4 Pro está mudando?
Sim. A DeepSeek anunciou preços de pico/fora de pico a partir de 17 de agosto de 2026. A documentação oficial lista o V4 Pro a US$ 0,66/M de entrada (cache miss) e US$ 1,98/M de saída durante períodos fora de pico, versus US$ 1,32/M de entrada e US$ 3,96/M de saída durante períodos de pico sob o novo cronograma.
