GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/Pesquisa CometAPI

O que é o DeepSeek V4.1 Flash? Arquitetura, recursos & preços

DeepSeek V4.1 Flash explicado: 552B MoE com Causal-Encoder-Decoder, economias no cache KV, benchmarks, preços da API, visão nativa e comparação entre V4 Flash/V4 Pro.

CometAPI
Mia MarenEquipe de pesquisa de modelos e API de IA
Atualizado Sep 10, 2026 14 min de leitura
O que é o DeepSeek V4.1 Flash? Arquitetura, recursos & preços
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

DeepSeek V4.1 Flash substitui a curta fase beta por um lançamento de produção baseado em computação assimétrica, multimodalidade nativa, benchmarks de agentes mais fortes e preços de API significativamente mais baixos.

TL;DR

DeepSeek V4.1 Flash agora é uma API oficial e um modelo de pesos abertos, não um endpoint beta com expiração. A DeepSeek afirma que é um modelo de Mistura de Especialistas com 552B parâmetros que utiliza uma nova arquitetura Causal-Encoder-Decoder. Apenas 8B parâmetros são ativados durante o processamento da entrada, enquanto 16B são ativados durante a geração da saída. Esse design assimétrico tem o objetivo de gastar menos computação em prompts longos sem enfraquecer a etapa de geração autorregressiva.

O nome do modelo da API de produção é deepseek-flash. Ele oferece janela de contexto de 1M tokens, até 384K tokens de saída, modos com e sem raciocínio, saída JSON, chamadas de ferramenta, a Responses API, a API compatível com Anthropic e entrada visual nativa. A tabela oficial de benchmarks da DeepSeek mostra ganhos significativos em relação a V4 Flash 0731 e V4 Pro 0813 em tarefas de codificação, agentes, cibersegurança e multimodalidade.

A mudança de preços é igualmente importante. No horário de pico, o V4.1 Flash custa $0.006 por milhão de tokens de entrada com acerto de cache, $0.30 por milhão de tokens de entrada com falta de cache e $1.20 por milhão de tokens de saída. As tarifas fora do pico são metade desses valores.

Principais pontos

  • DeepSeek V4.1 Flash é um modelo lançado com pesos abertos; o identificador temporário deepseek-v4.1-flash-expires-on-0910 não é mais a referência de produção correta.
  • Seu design MoE de 552B ativa 8B parâmetros para entrada e 16B para saída, criando um perfil de eficiência diferente da arquitetura de 284B total/13B ativos do V4 Flash.
  • A multimodalidade nativa faz parte do modelo principal em vez de um branch Vision Exp separado.
  • A comparação oficial mostra o V4.1 Flash à frente do V4 Pro 0813 na maioria dos benchmarks selecionados de agentes e codificação, embora não lidere todos os benchmarks de conhecimento ou terminal contra todos os concorrentes de fronteira.
  • O cache KV global cai para 890 bytes por token, cerca de 3,9 vezes menor que o V4 Flash e aproximadamente um quarto de sua pegada anterior.
  • Os preços de API no pico são $0.006 para entrada com acerto de cache, $0.30 para entrada com falta de cache e $1.20 para saída por milhão de tokens; fora do pico, os preços são 50% menores.

O que é o DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash é o modelo base focado em eficiência da DeepSeek de setembro de 2026 para raciocínio, codificação, agentes e compreensão multimodal. O anúncio oficial o descreve como um modelo MoE com 552B parâmetros que melhora a capacidade enquanto reduz a computação e a memória necessárias para processar entradas.

A principal mudança é arquitetural. O V4 Flash anterior usava um orçamento de parâmetros ativos único em toda a inferência. O V4.1 Flash separa as cargas de entrada e saída: 8B parâmetros ficam ativos ao codificar o prompt e 16B ficam ativos ao gerar a resposta. A DeepSeek chama esse design de Causal-Encoder-Decoder.

DataStatusID do modelo
8 setBeta limitadodeepseek-v4.1-flash-expires-on-0910
10 setLançamento de produçãodeepseek-flash

Especificação do DeepSeek V4.1 Flash:

EspecificaçãoDeepSeek V4.1 Flash
Status de lançamentoAPI oficial e modelo de pesos abertos
ArquiteturaMistura de Especialistas com estrutura Causal-Encoder-Decoder
Parâmetros totais552B
Parâmetros ativados8B para entrada; 16B para saída
Janela de contexto1M tokens
Saída máxima384K tokens
Modalidades de entradaTexto e imagens
Modalidade de saídaTexto
Nome do modelo na produçãodeepseek-flash
Modos de raciocínioCom e sem raciocínio
Recursos da APISaída JSON, chamadas de ferramenta, Responses API, API Anthropic, conclusão por prefixo, conclusão FIM
Pesos abertosPublicados no Hugging Face

Como o DeepSeek V4.1 Flash funciona: Causal-Encoder-Decoder

Modelos de linguagem tradicionais apenas com decodificador usam essencialmente a mesma pilha grande para processamento do prompt e geração de tokens. O DeepSeek V4.1 Flash atribui capacidades ativas diferentes a essas etapas.

Durante a etapa de entrada, o modelo processa o prompt com um perfil ativo de 8B. Essa etapa pode examinar eficientemente o texto ou o contexto de imagem fornecidos porque a resposta completa ainda não foi gerada. Durante a etapa de saída, o modelo ativa 16B parâmetros e continua a geração causal token a token. Portanto, o design economiza computação na codificação do prompt enquanto mantém mais capacidade ativa para raciocínio e geração da resposta.

A DeepSeek não publicou todos os detalhes de implementação no anúncio, então a descrição mais segura é funcional: a arquitetura é assimétrica, as etapas de entrada e saída usam diferentes orçamentos de parâmetros ativos e o sistema resultante reduz memória e custo de inferência.

Redução do cache KV

O resultado de memória é mensurável. A DeepSeek informa 890 bytes de cache KV global por token para o V4.1 Flash, em comparação com 3,514 bytes para o V4 Flash, 48,068 bytes para o V3.2 e 389,120 bytes para o V1. O valor do V4.1 é aproximadamente 3,9 vezes menor que o do V4 Flash.

O que é o DeepSeek V4.1 Flash? Arquitetura, recursos & preços

Para agentes de longo contexto, isso importa além de um único benchmark. Um cache KV menor reduz a pressão sobre a memória de alta largura de banda enquanto a requisição está ativa e diminui a quantidade de estado que precisa ser movida para armazenamento mais lento. A DeepSeek diz que o V4.1 Flash precisa de aproximadamente um quarto da HBM e um oitavo da capacidade de SSD exigida pelo modelo anterior para cargas de trabalho de cache comparáveis.

Recursos do DeepSeek V4.1 Flash

Entrada multimodal nativa

O V4.1 Flash aceita imagens como parte da API do modelo principal. Isso substitui a divisão anterior entre o V4 Flash somente texto e o endpoint experimental V4 Flash Vision. Os desenvolvedores agora podem criar fluxos de trabalho de compreensão de documentos, análise de gráficos, interpretação de capturas de tela e agentes visuais com o mesmo modelo de produção.

Raciocínio de longo contexto

A especificação oficial da API mantém uma janela de contexto de 1M tokens e permite até 384K tokens de saída. Isso torna o modelo adequado para codificação em escala de repositório, análise multidocumento, sessões de agente de longa duração e fluxos de trabalho que precisam preservar um grande histórico de ferramentas.

Recursos da API de produção

O modelo oferece modos com e sem raciocínio, saída JSON estruturada, chamadas de ferramenta, Responses API, uma interface compatível com Anthropic, conclusão por prefixo de chat e conclusão FIM no modo sem raciocínio. Esses recursos fazem do V4.1 Flash um substituto direto em produção para muitos workloads de agentes e codificação do V4 Flash.

Pesos abertos

A DeepSeek disponibilizou os pesos do V4.1 Flash e um relatório técnico. O lançamento melhora a reprodutibilidade, mas o modelo continua extremamente grande: o anúncio da DeepSeek pede que organizações interessadas em grandes implantações planejem aproximadamente 2,000 GPUs mais um cluster de armazenamento.

Desempenho em benchmarks do DeepSeek V4.1 Flash

Os resultados oficiais mudam a avaliação anterior de que o V4.1 não tinha evidência de benchmark. A DeepSeek agora fornece uma tabela ampla cobrindo conhecimento, matemática, codificação, agentes de terminal, cibersegurança, automação e tarefas de agentes multimodais.

O que é o DeepSeek V4.1 Flash? Arquitetura, recursos & preços

BenchmarkDeepSeek V4.1 FlashV4 Pro 0813V4 Flash 0731
GPQA Diamond90.992.489.9
Classificação no Codeforces347133483289
MathArena Apex65.665.358.6
Terminal-Bench 2.190.687.982.7
DeepSWE v1.174.262.754.4
NL2Repo-Bench65.461.554.2
CyberGym88.183.376.7
Automation-Bench54.843.237.7

Nesta visão de oito benchmarks selecionados, o V4.1 Flash supera o V4 Pro 0813 em sete testes e supera o V4 Flash 0731 em todos os oito. Os maiores ganhos aparecem em engenharia de software e agentes: o DeepSWE sobe 11.5 pontos sobre o V4 Pro e 19.8 sobre o V4 Flash, enquanto o Automation-Bench melhora 11.6 e 17.1 pontos, respectivamente.

Os resultados ainda precisam de interpretação cuidadosa. O V4.1 Flash pontua abaixo do V4 Pro no GPQA Diamond, e o gráfico oficial completo mostra que o Claude Opus 5 e o GPT-5.6 Sol permanecem à frente no Terminal-Bench 3.0. Uma conclusão útil é que o V4.1 Flash melhora materialmente o equilíbrio entre eficiência e capacidade da DeepSeek; a tabela de benchmarks não prova liderança universal em todas as tarefas.

Preços da API do DeepSeek V4.1 Flash

A DeepSeek usa cobrança em horários de pico e fora do pico. As horas de pico são 01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta; todos os outros períodos, incluindo fins de semana, usam a tarifa fora do pico. A documentação de preços atual afirma que os preços fora do pico são metade dos preços de pico.

Preço por 1M de tokensV4.1 Flash fora do picoV4.1 Flash picoV4 Pro 0813 fora do picoV4 Pro 0813 pico
Entrada com acerto de cache$0.003$0.006$0.022$0.044
Entrada com falta de cache$0.15$0.30$0.66$1.32
Saída$0.60$1.20$1.98$3.96

O que é o DeepSeek V4.1 Flash? Arquitetura, recursos & preços

As economias são substanciais. Para uma carga de trabalho usando 100 milhões de tokens de entrada com falta de cache e 10 milhões de tokens de saída, o V4.1 Flash custa aproximadamente $21 fora do pico ou $42 no pico. A mesma mistura de tokens nas tarifas publicadas do V4 Pro 0813 custa aproximadamente $85.80 fora do pico ou $171.60 no pico. O V4.1 Flash é cerca de 75.5% mais barato nesse exemplo.

O cache de prompts reforça a vantagem para agentes que reutilizam repetidamente instruções de sistema, contexto de repositório ou documentos. A tarifa de acerto de cache do V4.1 é 50 vezes menor do que sua tarifa de falta de cache em ambos os períodos de cobrança.

DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro

DimensãoDeepSeek V4.1 FlashDeepSeek V4 FlashDeepSeek V4 Pro
Parâmetros totais552B284B1.6T
Parâmetros ativados8B entrada / 16B saída13B49B
Foco da arquiteturaEficiência assimétrica entre entrada e saídaV4 MoE leveMáxima capacidade V4
Visão nativaSimVariante Vision Exp separadaNão
Janela de contexto1M1M1M
Saída máxima384K384K384K
Status da API na DeepSeekModelo de produção atualDescontinuado; nome legado direciona para V4.1 FlashProgramado para direcionar ao V4.1 Flash a partir de 14 de setembro de 2026
Melhor adequaçãoAgentes gerais, codificação, visão, alto throughputCompatibilidade de migração apenasWorkloads Pro existentes durante a transição

O V4.1 Flash é maior em parâmetros totais do que o V4 Flash, mas pode ser mais barato de servir porque sua etapa de entrada ativa apenas 8B parâmetros e usa um cache KV muito menor. Em comparação com o V4 Pro, ele ativa bem menos parâmetros enquanto supera o Pro na maioria dos benchmarks de agentes e codificação selecionados acima.

Acesso à API e migração

O nome do modelo de produção da DeepSeek é deepseek-flash. Aplicações existentes podem manter a URL base compatível com OpenAI https://api.deepseek.com ou a URL base compatível com Anthropic https://api.deepseek.com/anthropic.

  1. Atualize o nome do modelo para deepseek-flash.
  2. Mantenha a URL base e o método de autenticação da DeepSeek existentes.
  3. Reteste o modo com raciocínio, chamadas de ferramenta, entradas de visão, latência e uso de tokens com prompts de produção.
  4. Monitore aliases legados: deepseek-v4-flash e deepseek-v4-flash-vision-exp agora direcionam para o V4.1 Flash, enquanto deepseek-v4-pro está programado para direcionar para o V4.1 Flash a partir de 14 de setembro até um futuro lançamento do V4.1 Pro.

Para usuários da CometAPI, a API do DeepSeek V4.1 na CometAPI agora está ativa junto com a existente API do DeepSeek V4 Flash. Antes de mudar o tráfego de produção, confirme o nome final do modelo, preços e mapeamento de aliases no painel da CometAPI, pois provedores de terceiros podem divergir da nomenclatura oficial e das tarifas da DeepSeek.

Quem deve usar o DeepSeek V4.1 Flash?

O V4.1 Flash é uma ótima opção para agentes de codificação, análise de repositórios, automação de terminal, fluxos de trabalho de documentos multimodais, assistentes de longo contexto e sistemas de alto volume que usam ferramentas. Seus ganhos em benchmarks se concentram nos mesmos workloads que mais se beneficiam de menor memória de cache e preços de tokens mais baixos.

Equipes que já utilizam o V4 Flash devem tratá-lo como candidato direto à migração. Equipes que utilizam o V4 Pro devem testar com cuidado, mas os próprios dados de benchmark e preços da DeepSeek agora tornam o V4.1 Flash o padrão mais econômico para muitas cargas de trabalho de classe Pro.

Hospedagem própria é uma decisão diferente. Pesos abertos não tornam um modelo de 552B leve. As organizações devem comparar o custo de uma implantação com grande número de GPUs e armazenamento com o uso da API hospedada antes de se comprometer com inferência local.

Limitações e questões em aberto

  • Os resultados de benchmark vêm do setup oficial de avaliação da DeepSeek; replicações independentes serão necessárias para medir o desempenho em diferentes frameworks e ambientes de ferramentas.
  • O suporte multimodal nativo está confirmado, mas as equipes de aplicação devem validar formatos de imagem suportados, contabilização de tokens e o comportamento de visão na API ativa.
  • Aliases de modelos legados agora mudam o modelo por trás de um nome existente, o que pode alterar saídas sem alteração no código da aplicação.
  • O V4.1 Flash reduz os requisitos de infraestrutura em relação aos modelos anteriores da DeepSeek, mas sua implantação com pesos abertos ainda exige computação e armazenamento substanciais.
  • O endpoint dedicado do V4.1 na CometAPI e o preço final devem ser confirmados no console ao vivo antes do uso em produção.

Veredicto final

DeepSeek V4.1 Flash é uma grande atualização de arquitetura e produto. O modelo MoE de 552B combina uma etapa de entrada ativa de 8B, uma etapa de saída ativa de 16B, visão nativa, uma janela de contexto de 1M tokens e um cache KV fortemente comprimido. Essas escolhas de design se traduzem em benchmarks oficiais mais fortes para codificação e agentes, com preços de API muito menores do que o V4 Pro 0813.

A mudança mais prática é a consolidação. O V4.1 Flash reúne texto, visão, raciocínio, uso de ferramentas e operação de longo contexto em um único nome de modelo de produção. Para a maioria das novas integrações com a DeepSeek, deepseek-flash agora é o ponto de partida lógico; o V4 Pro torna-se uma comparação de migração, em vez da escolha automática para trabalhos difíceis.

FAQ

O DeepSeek V4.1 Flash foi lançado oficialmente?

Sim. Ele está disponível por meio da API da DeepSeek sob o nome de modelo deepseek-flash, e a DeepSeek liberou pesos abertos e um relatório técnico.

O ID temporário do modelo beta V4.1 ainda é necessário?

Não. deepseek-v4.1-flash-expires-on-0910 foi um identificador beta de curta duração. Aplicações de produção devem usar deepseek-flash.

Quantos parâmetros o DeepSeek V4.1 Flash possui?

O modelo tem 552B parâmetros totais. Ele ativa 8B parâmetros durante o processamento da entrada e 16B durante a geração da saída.

O DeepSeek V4.1 Flash suporta imagens?

Sim. A entrada de visão é nativa no modelo de produção, então um endpoint V4 Flash Vision Exp separado não é mais necessário.

O V4.1 Flash é melhor do que o V4 Pro?

Ele lidera o V4 Pro 0813 na maioria das comparações publicadas pela DeepSeek em codificação, agentes, automação e cibersegurança, mas o V4 Pro permanece à frente no GPQA Diamond. As equipes devem avaliar ambos com seus próprios prompts antes da migração.

Quanto custa a API?

No horário de pico, as tarifas por milhão de tokens são $0.006 para entrada com acerto de cache, $0.30 para entrada com falta de cache e $1.20 para saída. As tarifas fora do pico são metade desses preços.

O que acontece com os nomes antigos do V4?

Os nomes legados deepseek-v4-flash e deepseek-v4-flash-vision-exp direcionam para o V4.1 Flash. A DeepSeek diz que deepseek-v4-pro também direcionará para o V4.1 Flash a partir de 14 de setembro de 2026 até o lançamento do V4.1 Pro.

Posso usar o DeepSeek V4.1 Flash via CometAPI?

Sim. A CometAPI agora oferece um endpoint da API do DeepSeek V4.1. Antes de enviar tráfego de produção, confirme o nome exato do modelo, os preços e os recursos suportados no console da CometAPI, pois provedores de terceiros podem usar convenções de nomenclatura ou tarifas diferentes das da API oficial da DeepSeek.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Sep 10, 2026
Última atualização Sep 10, 2026
0 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais