GPT-5.6 Luna price down 80%, Terra down 20% →

DeepSeek V4 Flash 0731 & DeepSeek Harness: Guia para o avanço do Agentic Coding (2026)

CometAPI
AnnaAug 9, 2026
DeepSeek V4 Flash 0731 & DeepSeek Harness: Guia para o avanço do Agentic Coding (2026)

TLDR DeepSeek-V4-Flash-0731 (lançado em 31 de julho de 2026) é a versão oficial, pronta para produção, do modelo Mixture-of-Experts eficiente da DeepSeek (284B total / 13B ativos, contexto de 1M tokens). Por meio de pós-treinamento direcionado, ele oferece ganhos dramáticos em codificação orientada a agentes, uso de ferramentas e engenharia de software de múltiplas etapas. Oferece suporte nativo ao Responses API e ao OpenAI Codex. DeepSeek Harness é o framework de agentes complementar (modo minimalista já usado nas avaliações oficiais; lançamento completo em breve) projetado para transformar o modelo em um agente autônomo confiável.

Juntos, eles oferecem uma das relações custo-desempenho mais fortes em IA agentic com pesos abertos e acessível por API, em agosto de 2026.

Principais destaques

  • Grande salto agentic via apenas pós-treinamento: Mesma arquitetura 284B/13B do preview de abril, mas pontuações dramaticamente mais altas (ex.: Terminal Bench 2.1: 82.7 vs 61.8; DeepSWE: 54.4 vs 7.3).
  • Supera o DeepSeek-V4-Pro (Preview) em múltiplos benchmarks de agentes apesar de bem menos parâmetros ativados.
  • Competitivo com os principais modelos proprietários (próximo ao Claude Opus 4.8 em várias tarefas de agente) a uma fração do custo.
  • Contexto nativo de 1M, decodificação especulativa (DSpark), três níveis de esforço de raciocínio (low/high/max), licença MIT, pesos abertos.
  • Suporte oficial ao Responses API e ao Codex (CLI, desktop, extensão do VS Code).
  • DeepSeek Harness (modo minimalista já usado nas avaliações) é o framework oficial de agentes em beta fechado; lançamento público esperado em breve. O DeepSeek Harness fornece a camada de runtime do agente; modelo + Harness = agente de produção.
  • Ideal para agentes de codificação em alto volume, automação de terminal, uso de ferramentas e fluxos de trabalho de longo contexto.
  • Acesse os modelos DeepSeek de forma acessível e com ferramentas unificadas via CometAPI (endpoint compatível com OpenAI, preço competitivo, roteamento multi-modelo).

O que há de novo no DeepSeek V4 Flash 0731?

Status de lançamento oficial alterado

A mudança de produto mais importante é que o DeepSeek V4 Flash 0731 é agora o lançamento oficial do DeepSeek V4 Flash na API, em beta público. O registro de alterações de 31 de julho da DeepSeek diz que os desenvolvedores podem continuar chamando o mesmo nome de modelo, deepseek-v4-flash, para acessar a versão mais recente. Isso é importante para migração porque evita um novo slug de modelo e permite que as equipes testem a atualização por trás da lógica de roteamento existente.

A DeepSeek também diz que a atualização apenas atualiza a API do V4 Flash. A API do V4 Pro e os modelos do app/web não foram alterados pelo lançamento de 31 de julho, e a DeepSeek disse que o lançamento oficial do V4 Pro viria em breve. Em outras palavras, isto não é uma atualização completa da família DeepSeek V4. É uma atualização direcionada do Flash.

Arquitetura permaneceu a mesma, pós-treinamento mudou

A arquitetura central permanece inalterada: um modelo Mixture-of-Experts (MoE) com 284 bilhões de parâmetros totais e apenas 13 bilhões ativados por token, um design de atenção híbrida otimizado para contexto longo e uma janela de contexto nativa de 1 milhão de tokens. Um módulo de decodificação especulativa (DSpark) é acoplado para geração mais rápida. O modelo é apenas de texto, suporta níveis ajustáveis de esforço de raciocínio (low / high / max), chamadas de ferramenta, saída estruturada e é lançado sob a licença permissiva MIT.

Essa distinção importa. Muitas atualizações de modelo melhoram porque o modelo é maior. Esta atualização é mais interessante porque a DeepSeek afirma um grande salto agentic sem aumentar a pegada de parâmetros do modelo. O V4 Flash continua sendo um modelo Mixture-of-Experts de 284B no total e 13B ativos, que é muito menor em tempo de inferência do que o design de 1,6T total e 49B ativos do V4 Pro.

As pontuações em codificação orientada a agentes dispararam

A tabela oficial da DeepSeek mostra grandes melhorias em tarefas de terminal, construção de repositórios, ciber, engenharia de software, uso de ferramentas, automação e codificação full-stack. O maior salto absoluto sobre o antigo preview do Flash é no DeepSWE: 54.4 versus 7.3, um aumento de 47,1 pontos. O Cybergym melhora em 38,0 pontos, o DSBench-Hard em 33,8 pontos e o DSBench-FullStack em 31,7 pontos.

É por isso que o V4 Flash 0731 está sendo discutido menos como um "modelo rápido" normal e mais como um candidato a modelo padrão para agentes de codificação. A proposta de valor não é apenas chat barato. É inferência de agente barata, de longo contexto e amigável a ferramentas.

Chegaram o Responses API e o suporte ao Codex

O registro de alterações de 31 de julho da DeepSeek diz que o V4 Flash oficial oferece suporte nativo ao formato do Responses API e é especificamente adaptado para o Codex. O guia do Responses API da DeepSeek diz que o formato foi adicionado para atender à demanda pelo Codex, usa a URL base https://api.deepseek.com e atualmente suporta deepseek-v4-flash.

Isso importa porque fluxos de trabalho no estilo Codex não são sessões de chat simples. Eles precisam de itens de entrada e saída estruturados, itens de raciocínio, chamadas de ferramenta, operações de alteração de arquivos, eventos de streaming, contabilização de uso e integração com clientes de agentes de codificação. O suporte da DeepSeek não é uma cópia perfeita de todos os recursos do OpenAI Responses API, mas é suficiente para tornar o V4 Flash uma alternativa muito mais prática para experimentos com agentes de codificação.

Benchmarks de desempenho para a versão oficial V4-Flash

Alertas sobre benchmarks que os desenvolvedores não devem ignorar

Resultados oficiais de avaliação (relatados pela DeepSeek no model card) mostram grandes saltos em relação ao preview e, notavelmente, em relação ao V4-Pro Preview, muito maior, em tarefas centradas em agentes. As avaliações para benchmarks de agentes de código usaram o modo minimalista do DeepSeek Harness (a ser lançado) com esforço de raciocínio máximo, temperature = 1.0, top_p = 0.95.

Isso tem duas implicações. Primeiro, o resultado do modelo é em parte um resultado de modelo e harness. Se o seu runtime de agente tiver ferramentas diferentes, permissões de shell, gerenciamento de contexto, tentativas adicionais, regras de patch ou tratamento de falhas diferentes, você pode não obter as mesmas pontuações. Segundo, a reprodução independente é limitada até que a DeepSeek lance o suficiente do harness e da configuração de avaliação para que equipes externas executem testes comparáveis.

Tabela oficial de benchmarks da DeepSeek

BenchmarkV4-Flash-0731V4-Flash PreviewV4-Pro PreviewGLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents’ Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7

Nesses nove benchmarks, o V4 Flash 0731 tem média 55.2. O antigo preview do V4 Flash tem média 29.6, e o V4-Pro Preview tem média 34.9. Isso significa que o V4 Flash 0731 está cerca de 25,6 pontos acima do Flash preview e 20,3 pontos acima do V4-Pro Preview nesta tabela.

Sinais de terceiros

O ARC Prize reporta o V4 Flash 0731 no esforço máximo com 89,0% no ARC-AGI-1 Semi-Private e 61,4% no ARC-AGI-2 Semi-Private, com custos listados de $0.02 e $0.04 por tarefa. Estes não são benchmarks de agentes de código, mas sustentam a visão mais ampla de que o modelo é competitivo em tarefas de raciocínio quando executado em esforço superior.

Os ganhos são especialmente impressionantes no DeepSWE (loop de agente de engenharia de software) e no Cybergym. Medidas independentes (por exemplo, Artificial Analysis) reportam números de Terminal-Bench ligeiramente menores, em torno de 79%, confirmando a direção da melhoria enquanto lembram os usuários de que números com harness do fornecedor tendem a ser otimistas.

Contexto adicional de avaliações anteriores do V4 e agregadores de terceiros mostra forte desempenho em conhecimento e codificação no modo de raciocínio máximo (GPQA Diamond ~88–91%, LiveCodeBench na faixa alta de 80–90 dependendo da fonte). O pós-treinamento 0731 especificamente desbloqueou a confiabilidade do agente que faltava no preview.

DeepSeek-V4-Flash agora oferece suporte ao Responses API e ao Codex

Uma adição estrategicamente importante é o suporte nativo ao Responses API da OpenAI. A documentação oficial da DeepSeek confirma que o Responses API atualmente suporta deepseek-v4-flash (suporte ao Pro esperado no início de agosto de 2026). A URL base permanece https://api.deepseek.com.

Isto é uma grande melhoria na experiência do desenvolvedor. Antes do suporte ao Responses API e ao Codex, o DeepSeek V4 Flash já podia ser chamado como um modelo de texto, mas um agente de codificação precisava fazer a ponte de mais detalhes de integração por conta própria. Agora o modelo pode ser usado em fluxos que esperam semântica no estilo Responses.

O que o suporte ao Responses API inclui

O Responses API da DeepSeek cria uma resposta de modelo no formato do OpenAI Responses API em /responses. O Responses API suporta model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, ferramentas, escolha de ferramenta, esforço de raciocínio, formato de texto e relatório de uso. A API é sem estado, então os clientes precisam enviar o histórico completo da conversa para interações de múltiplas voltas.

Os detalhes de compatibilidade mais importantes são práticos:

  • deepseek-v4-flash é atualmente o único modelo suportado para o Responses API.
  • Mensagens developer são tratadas como mensagens system.
  • Ferramentas de função, streaming e esforço de raciocínio ajustável e pesquisa na web do lado do servidor são suportados.
  • O tipo de ferramenta custom é suportado apenas para apply_patch, o que é importante para compatibilidade com o Codex.
  • Entradas de imagem e arquivo não são suportadas; partes de entrada de imagem são substituídas por texto placeholder.
  • previous_response_id, conversation, store, modo em segundo plano, metadados e alguns recursos de gerenciamento de contexto não são suportados.
  • Parâmetros não suportados podem ser silenciosamente ignorados, então clientes de produção devem testar explicitamente o comportamento esperado.

Para desenvolvedores, o ponto-chave é que o suporte ao Responses API não é apenas um detalhe sintático. Ele permite que o DeepSeek V4 Flash se mantenha em uma via de protocolo usada por agentes de codificação modernos, especialmente onde chamadas de função, eventos de streaming, itens de raciocínio e aplicação de patches precisam ser representados de forma consistente.

Design sem estado (o cliente gerencia o histórico da conversa). Exemplo (Python):

from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful coding assistant.",
    input="Refactor this Python function for better readability...",
    reasoning={"effort": "max"}
)
print(response.output_text)

Detalhes completos e guia de integração com o Codex: DeepSeek API Docs – Responses API e Integrate with Codex.

O que significa o suporte ao Codex

O guia de integração da DeepSeek com o Codex diz que o Codex conversa com modelos por meio do Responses API, que a DeepSeek agora suporta nativamente. Isso permite integração direta com o Codex (o ecossistema de agentes de codificação da OpenAI — CLI, app desktop do ChatGPT e extensão do VS Code).

Os desenvolvedores podem configurar um provedor personalizado uma vez via script de setup ou editando ~/.codex/config.toml e um arquivo de catálogo de modelos. Após a configuração, os clientes do Codex reconhecem o DeepSeek-V4-Flash e podem usar suas capacidades de chamadas de ferramenta, apply_patch, pesquisa na web e raciocínio.

DeepSeek V4 Flash vs. DeepSeek V4 Pro

AspectoV4-Flash-0731V4-Pro (típico / Preview)
Parâmetros Total / Ativo284B / 13B~1,6T / 49B
Janela de contexto1M tokens1M tokens
Pontos fortesCodificação agentic, terminal, custo, velocidadeRaciocínio mais profundo, conhecimento, tarefas mais difíceis
Vantagem em benchmarks de agentesVence no conjunto 0731 publicadoMais forte em puro conhecimento e multi-arquivo complexo em avaliações anteriores
Preço típico de API~$0.14 entrada / $0.28 saída (cache muito menor)Significativamente maior (historicamente 3–12×)
Melhor paraAgentes de alto volume, loops de codificação em produção, apps sensíveis a custoPesquisa de fronteira, capacidade máxima em tarefas únicas
Pesos abertosSim (MIT)Sim (MIT)

Qual os desenvolvedores devem usar primeiro?

Nos benchmarks específicos de agentes lançados com 0731, o modelo Flash menor supera o Pro preview em todos os casos. Para recuperação de conhecimento puro ou os problemas de raciocínio absolutamente mais difíceis, o Pro ainda mantém vantagem em muitas avaliações independentes e anteriores. Na prática, muitas equipes agora padronizam o Flash para a maioria das cargas de trabalho agentic e encaminham apenas as tarefas mais exigentes ao Pro (ou a outros modelos de fronteira).

Essa estratégia de roteamento é onde a CometAPI pode ajudar. Em vez de codificar rigidamente um modelo para todas as cargas, use a CometAPI para centralizar seleção de modelos, log, controle de custos e políticas de fallback. Por exemplo:

  • Use V4 Flash para sumarização de repositório, planejamento de refatoração, rascunhos de revisão de código, testes gerados, extração estruturada, QA de longo contexto e loops de agente repetidos.
  • Escale para V4 Pro ou outro modelo premium quando a tarefa tiver alto risco de negócio, requisitos ambíguos, código de produção frágil ou tentativas repetidas fracassadas.
  • Acompanhe a métrica final que importa: correções aceitas por dólar, tarefas bem-sucedidas por hora ou minutos de revisão humana economizados.

O que é o DeepSeek Harness?

DeepSeek Harness é o framework oficial de agentes/camada de runtime que a DeepSeek está construindo para transformar seus modelos em agentes autônomos confiáveis. A empresa formula a equação de forma simples: Model + Harness = Agent.

Avaliações oficiais do V4-Flash-0731 já usaram o “modo minimalista” do DeepSeek Harness. O produto completo ainda está sendo lançado (recrutamento e testes iniciais estavam ativos entre o fim de julho e o início de agosto de 2026). A equipe é liderada por Cui Tianyi (experiência em sistemas de negociação quantitativa), e as descrições de vagas enfatizam integração profunda com recursos do DeepSeek-V4 como cache de prefixo, gerenciamento de contexto longo, otimização de KV-cache, encadeamento de uso de ferramentas, recuperação de erros e tentativas automáticas.

O Harness não é um wrapper genérico no estilo LangChain. Ele está sendo co-projetado com o modelo para que gerenciamento de contexto, orquestração de ferramentas, coleta de evidências e loops de reparo explorem as eficiências específicas do V4 (atenção esparsa, caching, modos de raciocínio). Projetos da comunidade e harnesses de terceiros também existem, mas o Harness oficial busca o acoplamento mais estreito possível entre modelo e runtime.

Quando totalmente lançado, espera-se que forneça:

  • Loops de agente estruturados para codificação e automação.
  • Portas de segurança e fluxos de aprovação.
  • Manuseio eficiente de contexto para tarefas de horizonte longo.
  • Observabilidade e produção de artefatos.

Até o lançamento completo, os desenvolvedores já podem alcançar resultados fortes combinando o V4-Flash-0731 com frameworks de agente existentes ou usando o caminho Responses API + Codex.

Preços, disponibilidade e implantação prática

  • Preços oficiais de API (aproximados): $0.14 / 1M tokens de entrada (cache miss), ~$0.0028–0.03 em cache hit, $0.28 / 1M tokens de saída. Limites de alta concorrência.
  • Pesos abertos sob MIT no Hugging Face; versões GGUF quantizadas amplamente disponíveis para uso local/autohospedado (requer VRAM substancial — precisão total é grande).
  • Decodificação especulativa (DSpark) e atenção híbrida mantêm a inferência de longo contexto relativamente eficiente.
  • Engines de inferência suportados: vLLM, SGLang e outros com receitas documentadas.

Para muitas equipes, o caminho de produção mais fácil é um gateway compatível com OpenAI. A CometAPI oferece acesso unificado a modelos DeepSeek (incluindo a série V4) ao lado de centenas de outros modelos através de um único endpoint (https://api.cometapi.com/v1). Benefícios incluem roteamento simplificado multi-modelo, preços competitivos ou com desconto em relação a provedores diretos, análises de uso e a capacidade de alternar entre Flash, Pro e outros modelos sem alterar o código da aplicação. Isso é particularmente útil para sistemas agentic que podem fazer fallback ou rotear por dificuldade/custo.

No momento deste artigo, o DeepSeek V4 Flash da CometAPI listava um preço inicial de entrada de $0.12 por 1M tokens, um preço de saída de $0.24 por 1M tokens em sua tabela de comparação, 100,0% de uptime em 24 horas e 2941 ms de resposta observada. A DeepSeek também alerta que os preços gerais da API podem subir num futuro próximo. Como os preços dos provedores podem mudar, a linguagem segura de publicação é: verifique o catálogo ao vivo da CometAPI e os preços oficiais da DeepSeek antes de comprometer orçamentos de produção.

Recomendações práticas para desenvolvedores e equipes

  1. Comece com o Flash-0731 para codificação orientada a agentes — A relação custo/desempenho é atualmente excelente para workflows de terminal, repositório e multi-ferramentas. Use esforço de raciocínio máximo + loops ao estilo Harness para as tarefas mais difíceis.
  2. Para inferência local, baixe do Hugging Face e siga as receitas oficiais de vLLM/SGLang que habilitam DSpark.
  3. Integre via Responses API se você já usa o Codex ou deseja semântica moderna de chamadas de ferramenta.
  4. Auto-hospede ou use pesos quantizados para máximo controle de custos e privacidade de dados.
  5. Faça roteamento inteligente — Flash para volume, Pro (ou outros modelos grandes) para a cauda longa de problemas ultra-difíceis.
  6. Considere a CometAPI para acesso multi-modelo simplificado, especialmente se seu stack já mistura DeepSeek com outros provedores.

Conclusão

DeepSeek-V4-Flash-0731 representa um momento crucial na IA agentic eficiente. Ao entregar desempenho de agente competitivo na fronteira a partir de um MoE relativamente compacto (13B ativos) por meio de pós-treinamento focado, e ao pareá-lo com um Harness feito sob medida e compatibilidade de API moderna (Responses + Codex), a DeepSeek redefiniu expectativas para agentes de codificação e automação com boa relação custo-benefício.

Esteja você auto-hospedando os pesos abertos, chamando a API oficial ou roteando por um gateway unificado como a CometAPI, V4-Flash-0731 + o ecossistema Harness em evolução oferece uma base de alto desempenho e custo-efetiva para a próxima geração de agentes de IA.

Perguntas frequentes

O que é o DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 é o lançamento beta público oficial do DeepSeek V4 Flash na API da DeepSeek, anunciado no registro de alterações de 31 de julho de 2026. Ele substitui a versão preview mantendo o mesmo nome de modelo na API, deepseek-v4-flash.

O que há de novo no DeepSeek V4 Flash 0731?

As principais mudanças são desempenho agentic mais forte em benchmarks, suporte nativo ao Responses API, adaptação ao Codex e uma compilação oficial do V4 Flash re-treinada por pós-treinamento. A DeepSeek diz que a arquitetura e o tamanho do modelo permaneceram os mesmos do preview.

O DeepSeek V4 Flash 0731 suporta o Codex?

Sim. O guia da DeepSeek para o Codex diz que apenas deepseek-v4-flash atualmente suporta integração com o Codex. Ele funciona através do Responses API e pode ser configurado para o CLI do Codex, o app desktop do ChatGPT e a extensão do Codex para o VS Code.

O que é o DeepSeek Harness?

DeepSeek Harness é o framework de agentes da DeepSeek para transformar modelos de linguagem em agentes autônomos de codificação ou workflow. Relatos públicos descrevem um harness como a camada que gerencia ferramentas, contexto, arquivos, execução de comandos e workflows de múltiplas etapas. A DeepSeek usou o Harness em modo minimalista na configuração de benchmark do V4 Flash 0731.

Como posso acessar o DeepSeek V4 Flash através da CometAPI?

Use o endpoint compatível com OpenAI da CometAPI com o ID de modelo deepseek-v4-flash. A página do modelo na CometAPI fornece exemplos em cURL, Python e JavaScript para /v1/chat/completions, além de especificações do modelo, preços e informações de uptime.

O DeepSeek V4 Flash é melhor que o DeepSeek V4 Pro?

Para a tabela de 31 de julho, o V4 Flash 0731 supera o V4-Pro Preview nos benchmarks de agentes listados. Isso não significa que o Flash seja sempre melhor que o Pro. O V4 Pro é maior e permanece mais forte em muitas tarefas pesadas de conhecimento e raciocínio difícil no model card. Use o Flash como padrão para workflows agentic sensíveis a custo e o Pro como rota de escalonamento.

54 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais