DeepSeek V4.1 Flash substitui a curta fase beta por um lançamento de produção baseado em computação assimétrica, multimodalidade nativa, benchmarks de agentes mais fortes e preços de API significativamente mais baixos.
TL;DR
DeepSeek V4.1 Flash agora é uma API oficial e um modelo de pesos abertos, não um endpoint beta com expiração. A DeepSeek afirma que é um modelo de Mistura de Especialistas com 552B parâmetros que utiliza uma nova arquitetura Causal-Encoder-Decoder. Apenas 8B parâmetros são ativados durante o processamento da entrada, enquanto 16B são ativados durante a geração da saída. Esse design assimétrico tem o objetivo de gastar menos computação em prompts longos sem enfraquecer a etapa de geração autorregressiva.
O nome do modelo da API de produção é deepseek-flash. Ele oferece janela de contexto de 1M tokens, até 384K tokens de saída, modos com e sem raciocínio, saída JSON, chamadas de ferramenta, a Responses API, a API compatível com Anthropic e entrada visual nativa. A tabela oficial de benchmarks da DeepSeek mostra ganhos significativos em relação a V4 Flash 0731 e V4 Pro 0813 em tarefas de codificação, agentes, cibersegurança e multimodalidade.
A mudança de preços é igualmente importante. No horário de pico, o V4.1 Flash custa $0.006 por milhão de tokens de entrada com acerto de cache, $0.30 por milhão de tokens de entrada com falta de cache e $1.20 por milhão de tokens de saída. As tarifas fora do pico são metade desses valores.
Principais pontos
- DeepSeek V4.1 Flash é um modelo lançado com pesos abertos; o identificador temporário
deepseek-v4.1-flash-expires-on-0910não é mais a referência de produção correta. - Seu design MoE de 552B ativa 8B parâmetros para entrada e 16B para saída, criando um perfil de eficiência diferente da arquitetura de 284B total/13B ativos do V4 Flash.
- A multimodalidade nativa faz parte do modelo principal em vez de um branch Vision Exp separado.
- A comparação oficial mostra o V4.1 Flash à frente do V4 Pro 0813 na maioria dos benchmarks selecionados de agentes e codificação, embora não lidere todos os benchmarks de conhecimento ou terminal contra todos os concorrentes de fronteira.
- O cache KV global cai para 890 bytes por token, cerca de 3,9 vezes menor que o V4 Flash e aproximadamente um quarto de sua pegada anterior.
- Os preços de API no pico são $0.006 para entrada com acerto de cache, $0.30 para entrada com falta de cache e $1.20 para saída por milhão de tokens; fora do pico, os preços são 50% menores.
O que é o DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash é o modelo base focado em eficiência da DeepSeek de setembro de 2026 para raciocínio, codificação, agentes e compreensão multimodal. O anúncio oficial o descreve como um modelo MoE com 552B parâmetros que melhora a capacidade enquanto reduz a computação e a memória necessárias para processar entradas.
A principal mudança é arquitetural. O V4 Flash anterior usava um orçamento de parâmetros ativos único em toda a inferência. O V4.1 Flash separa as cargas de entrada e saída: 8B parâmetros ficam ativos ao codificar o prompt e 16B ficam ativos ao gerar a resposta. A DeepSeek chama esse design de Causal-Encoder-Decoder.
| Data | Status | ID do modelo |
|---|---|---|
| 8 set | Beta limitado | deepseek-v4.1-flash-expires-on-0910 |
| 10 set | Lançamento de produção | deepseek-flash |
Especificação do DeepSeek V4.1 Flash:
| Especificação | DeepSeek V4.1 Flash |
|---|---|
| Status de lançamento | API oficial e modelo de pesos abertos |
| Arquitetura | Mistura de Especialistas com estrutura Causal-Encoder-Decoder |
| Parâmetros totais | 552B |
| Parâmetros ativados | 8B para entrada; 16B para saída |
| Janela de contexto | 1M tokens |
| Saída máxima | 384K tokens |
| Modalidades de entrada | Texto e imagens |
| Modalidade de saída | Texto |
| Nome do modelo na produção | deepseek-flash |
| Modos de raciocínio | Com e sem raciocínio |
| Recursos da API | Saída JSON, chamadas de ferramenta, Responses API, API Anthropic, conclusão por prefixo, conclusão FIM |
| Pesos abertos | Publicados no Hugging Face |
Como o DeepSeek V4.1 Flash funciona: Causal-Encoder-Decoder
Modelos de linguagem tradicionais apenas com decodificador usam essencialmente a mesma pilha grande para processamento do prompt e geração de tokens. O DeepSeek V4.1 Flash atribui capacidades ativas diferentes a essas etapas.
Durante a etapa de entrada, o modelo processa o prompt com um perfil ativo de 8B. Essa etapa pode examinar eficientemente o texto ou o contexto de imagem fornecidos porque a resposta completa ainda não foi gerada. Durante a etapa de saída, o modelo ativa 16B parâmetros e continua a geração causal token a token. Portanto, o design economiza computação na codificação do prompt enquanto mantém mais capacidade ativa para raciocínio e geração da resposta.
A DeepSeek não publicou todos os detalhes de implementação no anúncio, então a descrição mais segura é funcional: a arquitetura é assimétrica, as etapas de entrada e saída usam diferentes orçamentos de parâmetros ativos e o sistema resultante reduz memória e custo de inferência.
Redução do cache KV
O resultado de memória é mensurável. A DeepSeek informa 890 bytes de cache KV global por token para o V4.1 Flash, em comparação com 3,514 bytes para o V4 Flash, 48,068 bytes para o V3.2 e 389,120 bytes para o V1. O valor do V4.1 é aproximadamente 3,9 vezes menor que o do V4 Flash.
Para agentes de longo contexto, isso importa além de um único benchmark. Um cache KV menor reduz a pressão sobre a memória de alta largura de banda enquanto a requisição está ativa e diminui a quantidade de estado que precisa ser movida para armazenamento mais lento. A DeepSeek diz que o V4.1 Flash precisa de aproximadamente um quarto da HBM e um oitavo da capacidade de SSD exigida pelo modelo anterior para cargas de trabalho de cache comparáveis.
Recursos do DeepSeek V4.1 Flash
Entrada multimodal nativa
O V4.1 Flash aceita imagens como parte da API do modelo principal. Isso substitui a divisão anterior entre o V4 Flash somente texto e o endpoint experimental V4 Flash Vision. Os desenvolvedores agora podem criar fluxos de trabalho de compreensão de documentos, análise de gráficos, interpretação de capturas de tela e agentes visuais com o mesmo modelo de produção.
Raciocínio de longo contexto
A especificação oficial da API mantém uma janela de contexto de 1M tokens e permite até 384K tokens de saída. Isso torna o modelo adequado para codificação em escala de repositório, análise multidocumento, sessões de agente de longa duração e fluxos de trabalho que precisam preservar um grande histórico de ferramentas.
Recursos da API de produção
O modelo oferece modos com e sem raciocínio, saída JSON estruturada, chamadas de ferramenta, Responses API, uma interface compatível com Anthropic, conclusão por prefixo de chat e conclusão FIM no modo sem raciocínio. Esses recursos fazem do V4.1 Flash um substituto direto em produção para muitos workloads de agentes e codificação do V4 Flash.
Pesos abertos
A DeepSeek disponibilizou os pesos do V4.1 Flash e um relatório técnico. O lançamento melhora a reprodutibilidade, mas o modelo continua extremamente grande: o anúncio da DeepSeek pede que organizações interessadas em grandes implantações planejem aproximadamente 2,000 GPUs mais um cluster de armazenamento.
Desempenho em benchmarks do DeepSeek V4.1 Flash
Os resultados oficiais mudam a avaliação anterior de que o V4.1 não tinha evidência de benchmark. A DeepSeek agora fornece uma tabela ampla cobrindo conhecimento, matemática, codificação, agentes de terminal, cibersegurança, automação e tarefas de agentes multimodais.

| Benchmark | DeepSeek V4.1 Flash | V4 Pro 0813 | V4 Flash 0731 |
|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | 89.9 |
| Classificação no Codeforces | 3471 | 3348 | 3289 |
| MathArena Apex | 65.6 | 65.3 | 58.6 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 82.7 |
| DeepSWE v1.1 | 74.2 | 62.7 | 54.4 |
| NL2Repo-Bench | 65.4 | 61.5 | 54.2 |
| CyberGym | 88.1 | 83.3 | 76.7 |
| Automation-Bench | 54.8 | 43.2 | 37.7 |
Nesta visão de oito benchmarks selecionados, o V4.1 Flash supera o V4 Pro 0813 em sete testes e supera o V4 Flash 0731 em todos os oito. Os maiores ganhos aparecem em engenharia de software e agentes: o DeepSWE sobe 11.5 pontos sobre o V4 Pro e 19.8 sobre o V4 Flash, enquanto o Automation-Bench melhora 11.6 e 17.1 pontos, respectivamente.
Os resultados ainda precisam de interpretação cuidadosa. O V4.1 Flash pontua abaixo do V4 Pro no GPQA Diamond, e o gráfico oficial completo mostra que o Claude Opus 5 e o GPT-5.6 Sol permanecem à frente no Terminal-Bench 3.0. Uma conclusão útil é que o V4.1 Flash melhora materialmente o equilíbrio entre eficiência e capacidade da DeepSeek; a tabela de benchmarks não prova liderança universal em todas as tarefas.
Preços da API do DeepSeek V4.1 Flash
A DeepSeek usa cobrança em horários de pico e fora do pico. As horas de pico são 01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta; todos os outros períodos, incluindo fins de semana, usam a tarifa fora do pico. A documentação de preços atual afirma que os preços fora do pico são metade dos preços de pico.
| Preço por 1M de tokens | V4.1 Flash fora do pico | V4.1 Flash pico | V4 Pro 0813 fora do pico | V4 Pro 0813 pico |
|---|---|---|---|---|
| Entrada com acerto de cache | $0.003 | $0.006 | $0.022 | $0.044 |
| Entrada com falta de cache | $0.15 | $0.30 | $0.66 | $1.32 |
| Saída | $0.60 | $1.20 | $1.98 | $3.96 |

As economias são substanciais. Para uma carga de trabalho usando 100 milhões de tokens de entrada com falta de cache e 10 milhões de tokens de saída, o V4.1 Flash custa aproximadamente $21 fora do pico ou $42 no pico. A mesma mistura de tokens nas tarifas publicadas do V4 Pro 0813 custa aproximadamente $85.80 fora do pico ou $171.60 no pico. O V4.1 Flash é cerca de 75.5% mais barato nesse exemplo.
O cache de prompts reforça a vantagem para agentes que reutilizam repetidamente instruções de sistema, contexto de repositório ou documentos. A tarifa de acerto de cache do V4.1 é 50 vezes menor do que sua tarifa de falta de cache em ambos os períodos de cobrança.
DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro
| Dimensão | DeepSeek V4.1 Flash | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|---|
| Parâmetros totais | 552B | 284B | 1.6T |
| Parâmetros ativados | 8B entrada / 16B saída | 13B | 49B |
| Foco da arquitetura | Eficiência assimétrica entre entrada e saída | V4 MoE leve | Máxima capacidade V4 |
| Visão nativa | Sim | Variante Vision Exp separada | Não |
| Janela de contexto | 1M | 1M | 1M |
| Saída máxima | 384K | 384K | 384K |
| Status da API na DeepSeek | Modelo de produção atual | Descontinuado; nome legado direciona para V4.1 Flash | Programado para direcionar ao V4.1 Flash a partir de 14 de setembro de 2026 |
| Melhor adequação | Agentes gerais, codificação, visão, alto throughput | Compatibilidade de migração apenas | Workloads Pro existentes durante a transição |
O V4.1 Flash é maior em parâmetros totais do que o V4 Flash, mas pode ser mais barato de servir porque sua etapa de entrada ativa apenas 8B parâmetros e usa um cache KV muito menor. Em comparação com o V4 Pro, ele ativa bem menos parâmetros enquanto supera o Pro na maioria dos benchmarks de agentes e codificação selecionados acima.
Acesso à API e migração
O nome do modelo de produção da DeepSeek é deepseek-flash. Aplicações existentes podem manter a URL base compatível com OpenAI https://api.deepseek.com ou a URL base compatível com Anthropic https://api.deepseek.com/anthropic.
- Atualize o nome do modelo para
deepseek-flash. - Mantenha a URL base e o método de autenticação da DeepSeek existentes.
- Reteste o modo com raciocínio, chamadas de ferramenta, entradas de visão, latência e uso de tokens com prompts de produção.
- Monitore aliases legados:
deepseek-v4-flashedeepseek-v4-flash-vision-expagora direcionam para o V4.1 Flash, enquantodeepseek-v4-proestá programado para direcionar para o V4.1 Flash a partir de 14 de setembro até um futuro lançamento do V4.1 Pro.
Para usuários da CometAPI, a API do DeepSeek V4.1 na CometAPI agora está ativa junto com a existente API do DeepSeek V4 Flash. Antes de mudar o tráfego de produção, confirme o nome final do modelo, preços e mapeamento de aliases no painel da CometAPI, pois provedores de terceiros podem divergir da nomenclatura oficial e das tarifas da DeepSeek.
Quem deve usar o DeepSeek V4.1 Flash?
O V4.1 Flash é uma ótima opção para agentes de codificação, análise de repositórios, automação de terminal, fluxos de trabalho de documentos multimodais, assistentes de longo contexto e sistemas de alto volume que usam ferramentas. Seus ganhos em benchmarks se concentram nos mesmos workloads que mais se beneficiam de menor memória de cache e preços de tokens mais baixos.
Equipes que já utilizam o V4 Flash devem tratá-lo como candidato direto à migração. Equipes que utilizam o V4 Pro devem testar com cuidado, mas os próprios dados de benchmark e preços da DeepSeek agora tornam o V4.1 Flash o padrão mais econômico para muitas cargas de trabalho de classe Pro.
Hospedagem própria é uma decisão diferente. Pesos abertos não tornam um modelo de 552B leve. As organizações devem comparar o custo de uma implantação com grande número de GPUs e armazenamento com o uso da API hospedada antes de se comprometer com inferência local.
Limitações e questões em aberto
- Os resultados de benchmark vêm do setup oficial de avaliação da DeepSeek; replicações independentes serão necessárias para medir o desempenho em diferentes frameworks e ambientes de ferramentas.
- O suporte multimodal nativo está confirmado, mas as equipes de aplicação devem validar formatos de imagem suportados, contabilização de tokens e o comportamento de visão na API ativa.
- Aliases de modelos legados agora mudam o modelo por trás de um nome existente, o que pode alterar saídas sem alteração no código da aplicação.
- O V4.1 Flash reduz os requisitos de infraestrutura em relação aos modelos anteriores da DeepSeek, mas sua implantação com pesos abertos ainda exige computação e armazenamento substanciais.
- O endpoint dedicado do V4.1 na CometAPI e o preço final devem ser confirmados no console ao vivo antes do uso em produção.
Veredicto final
DeepSeek V4.1 Flash é uma grande atualização de arquitetura e produto. O modelo MoE de 552B combina uma etapa de entrada ativa de 8B, uma etapa de saída ativa de 16B, visão nativa, uma janela de contexto de 1M tokens e um cache KV fortemente comprimido. Essas escolhas de design se traduzem em benchmarks oficiais mais fortes para codificação e agentes, com preços de API muito menores do que o V4 Pro 0813.
A mudança mais prática é a consolidação. O V4.1 Flash reúne texto, visão, raciocínio, uso de ferramentas e operação de longo contexto em um único nome de modelo de produção. Para a maioria das novas integrações com a DeepSeek, deepseek-flash agora é o ponto de partida lógico; o V4 Pro torna-se uma comparação de migração, em vez da escolha automática para trabalhos difíceis.
FAQ
O DeepSeek V4.1 Flash foi lançado oficialmente?
Sim. Ele está disponível por meio da API da DeepSeek sob o nome de modelo deepseek-flash, e a DeepSeek liberou pesos abertos e um relatório técnico.
O ID temporário do modelo beta V4.1 ainda é necessário?
Não. deepseek-v4.1-flash-expires-on-0910 foi um identificador beta de curta duração. Aplicações de produção devem usar deepseek-flash.
Quantos parâmetros o DeepSeek V4.1 Flash possui?
O modelo tem 552B parâmetros totais. Ele ativa 8B parâmetros durante o processamento da entrada e 16B durante a geração da saída.
O DeepSeek V4.1 Flash suporta imagens?
Sim. A entrada de visão é nativa no modelo de produção, então um endpoint V4 Flash Vision Exp separado não é mais necessário.
O V4.1 Flash é melhor do que o V4 Pro?
Ele lidera o V4 Pro 0813 na maioria das comparações publicadas pela DeepSeek em codificação, agentes, automação e cibersegurança, mas o V4 Pro permanece à frente no GPQA Diamond. As equipes devem avaliar ambos com seus próprios prompts antes da migração.
Quanto custa a API?
No horário de pico, as tarifas por milhão de tokens são $0.006 para entrada com acerto de cache, $0.30 para entrada com falta de cache e $1.20 para saída. As tarifas fora do pico são metade desses preços.
O que acontece com os nomes antigos do V4?
Os nomes legados deepseek-v4-flash e deepseek-v4-flash-vision-exp direcionam para o V4.1 Flash. A DeepSeek diz que deepseek-v4-pro também direcionará para o V4.1 Flash a partir de 14 de setembro de 2026 até o lançamento do V4.1 Pro.
Posso usar o DeepSeek V4.1 Flash via CometAPI?
Sim. A CometAPI agora oferece um endpoint da API do DeepSeek V4.1. Antes de enviar tráfego de produção, confirme o nome exato do modelo, os preços e os recursos suportados no console da CometAPI, pois provedores de terceiros podem usar convenções de nomenclatura ou tarifas diferentes das da API oficial da DeepSeek.
