Gemini 3.6 Flash and 3.5 Flash Lite are now live on CometAPI →
D

DeepSeek V4 Flash

Entrada:$0.12/M
Saída:$0.24/M
Lançado:Apr 23, 2026

DeepSeek V4 Flash é um modelo Mixture-of-Experts da DeepSeek, otimizado para eficiência, com 284B de parâmetros no total e 13B de parâmetros ativados, com suporte a uma janela de contexto de 1M tokens. Ele foi projetado para inferência rápida e cargas de trabalho de alto rendimento, mantendo um desempenho sólido em raciocínio e programação.

Novo
Popular
Uso comercial

Playground para DeepSeek V4 Flash

Explore o Playground do DeepSeek V4 Flash — um ambiente interativo para testar modelos e executar consultas em tempo real. Experimente prompts, ajuste parâmetros e itere instantaneamente para acelerar o desenvolvimento e validar casos de uso.

Especificações técnicas do DeepSeek-V4-Flash

ItemDetalhes
ModelDeepSeek-V4-Flash
ProviderDeepSeek
FamilyDeepSeek-V4 preview series
ArchitectureMistura de Especialistas (MoE)
Total parameters284B
Activated parameters13B
Context length1,000,000 tokens
PrecisionFP4 + FP8 mixed
Reasoning modesNon-think, Think, Think Max
Release statusModelo de prévia
LicenseMIT License

O que é o DeepSeek-V4-Flash?

O DeepSeek-V4-Flash é o modelo de prévia com foco em eficiência da série V4 da DeepSeek. Ele é construído como um modelo de linguagem Mixture-of-Experts com uma pegada ativa relativamente pequena para seu tamanho, o que o ajuda a permanecer responsivo enquanto ainda oferece uma janela de contexto muito grande de 1M de tokens.

Principais recursos do DeepSeek-V4-Flash

  • Contexto de um milhão de tokens: O modelo suporta uma janela de contexto de 1,000,000 tokens, o que o torna adequado para documentos muito longos, grandes bases de código e sessões de agentes em múltiplas etapas.
  • Design MoE com eficiência em primeiro lugar: Ele usa 284B de parâmetros totais, mas apenas 13B de parâmetros ativados por solicitação, uma configuração voltada para inferência mais rápida e eficiente.
  • Três modos de raciocínio: Non-think, Think e Think Max permitem trocar velocidade por raciocínio mais profundo quando a tarefa fica mais difícil.
  • Arquitetura robusta para contexto longo: A DeepSeek afirma que a série V4 combina Compressed Sparse Attention e Heavily Compressed Attention para melhorar a eficiência em contexto longo.
  • Desempenho competitivo em codificação e comportamento de agentes: A ficha do modelo relata resultados fortes em benchmarks de codificação e de agentes, incluindo HumanEval, SWE Verified, Terminal Bench 2.0 e BrowseComp.
  • Pesos abertos e implantação local: O lançamento inclui pesos do modelo, orientações para inferência local e uma MIT License, o que torna a auto-hospedagem e a experimentação práticas.

Desempenho em benchmarks do DeepSeek-V4-Flash

Resultados selecionados da ficha oficial do modelo mostram que o DeepSeek-V4-Flash melhora em relação ao DeepSeek-V3.2-Base em vários benchmarks centrais:

BenchmarkDeepSeek-V3.2-BaseDeepSeek-V4-Flash-BaseDeepSeek-V4-Pro-Base
AGIEval (EM)80.182.683.1
MMLU (EM)87.888.790.1
MMLU-Pro (EM)65.568.373.5
HumanEval (Pass@1)62.869.576.8
LongBench-V2 (EM)40.244.751.5

Na tabela de raciocínio e agentes, a variante Flash também apresenta resultados sólidos em tarefas de terminal e software, com o Flash Max alcançando 56.9 no Terminal Bench 2.0 e 79.0 no SWE Verified, embora ainda fique atrás do modelo Pro maior nas tarefas mais difíceis com forte componente de conhecimento e agentes.

DeepSeek-V4-Flash vs DeepSeek-V4-Pro vs DeepSeek-V3.2

ModelMelhor adequaçãoCompromisso
DeepSeek-V4-FlashTrabalho rápido com contexto longo, assistentes de codificação e fluxos de agentes de alto rendimentoFica ligeiramente atrás do Pro em conhecimento puro e nas tarefas de agentes mais complexas
DeepSeek-V4-ProTarefas de maior capacidade, raciocínio mais profundo e fluxos de trabalho de agentes mais difíceisMais pesado e menos orientado à eficiência do que o Flash
DeepSeek-V3.2Base mais antiga para comparação e planejamento de migraçãoDesempenho de benchmark inferior ao V4-Flash nas tabelas oficiais

Casos de uso típicos do DeepSeek-V4-Flash

  1. Análise de documentos longos para contratos, pacotes de pesquisa, bases de conhecimento de suporte e wikis internas.
  2. Assistentes de codificação que precisam inspecionar grandes repositórios, seguir instruções em muitos arquivos e manter o contexto ativo.
  3. Fluxos de trabalho de agentes nos quais o modelo precisa raciocinar, chamar ferramentas e iterar sem perder o fio.
  4. Sistemas de chat corporativos que se beneficiam de uma janela de contexto muito grande e implantação de baixa fricção.
  5. Implantações locais de protótipos para equipes que desejam avaliar o comportamento do DeepSeek-V4 antes do endurecimento para produção.

Como acessar e usar a Deepseek v4 Flash API

Etapa 1: Cadastre-se para obter a chave de API

Faça login em cometapi.com. Se você ainda não for nosso usuário, registre-se primeiro. Acesse o seu Console do CometAPI. Obtenha a chave de API de credenciais de acesso da interface. Clique em “Add Token” no token de API no centro pessoal, obtenha a chave do token: sk-xxxxx e envie.

Etapa 2: Envie solicitações para a deepseek v4 flash API

Selecione o endpoint “deepseek-v4-flash” para enviar a solicitação de API e defina o corpo da solicitação. O método da solicitação e o corpo da solicitação são obtidos na documentação de API do nosso site. Nosso site também fornece teste no Apifox para sua conveniência. Substitua <YOUR_API_KEY> pela sua chave CometAPI real da sua conta. Onde chamá-la: Anthropic Messages formato e Chat formato.

Insira sua pergunta ou solicitação no campo de conteúdo — é isso que o modelo responderá. Processe a resposta da API para obter a resposta gerada.

Etapa 3: Recupere e verifique os resultados

Processe a resposta da API para obter a resposta gerada. Após o processamento, a API responde com o status da tarefa e os dados de saída. Habilite recursos como streaming, cache de prompts ou tratamento de contexto longo por meio de parâmetros padrão.

FAQ

Preços para DeepSeek V4 Flash

Explore preços competitivos para DeepSeek V4 Flash, projetado para atender diversos orçamentos e necessidades de uso. Nossos planos flexíveis garantem que você pague apenas pelo que usar, facilitando o dimensionamento conforme suas necessidades crescem. Descubra como DeepSeek V4 Flash pode aprimorar seus projetos mantendo os custos gerenciáveis.

Comet Price (USD / M Tokens)Official Price (USD / M Tokens)Discount
Entrada:$0.12/M
Saída:$0.24/M
Entrada:$0.15/M
Saída:$0.3/M
-20%

Código de exemplo e API para DeepSeek V4 Flash

Acesse código de exemplo abrangente e recursos de API para DeepSeek V4 Flash para otimizar seu processo de integração. Nossa documentação detalhada fornece orientação passo a passo, ajudando você a aproveitar todo o potencial do DeepSeek V4 Flash em seus projetos.

from openai import OpenAI
import os

# Get your CometAPI key from https://www.cometapi.com/console/token, and paste it here
COMETAPI_KEY = os.environ.get("COMETAPI_KEY") or "<YOUR_COMETAPI_KEY>"
BASE_URL = "https://api.cometapi.com/v1"

client = OpenAI(base_url=BASE_URL, api_key=COMETAPI_KEY)

completion = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Hello!"},
    ],
    stream=False,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

print(completion.choices[0].message.content)

Python Code Example

from openai import OpenAI
import os

# Get your CometAPI key from https://www.cometapi.com/console/token, and paste it here
COMETAPI_KEY = os.environ.get("COMETAPI_KEY") or "<YOUR_COMETAPI_KEY>"
BASE_URL = "https://api.cometapi.com/v1"

client = OpenAI(base_url=BASE_URL, api_key=COMETAPI_KEY)

completion = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Hello!"},
    ],
    stream=False,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high",
    },
)

print(completion.choices[0].message.content)

JavaScript Code Example

import OpenAI from "openai";

// Get your CometAPI key from https://www.cometapi.com/console/token, and paste it here
const api_key = process.env.COMETAPI_KEY || "<YOUR_COMETAPI_KEY>";
const base_url = "https://api.cometapi.com/v1";

const client = new OpenAI({
  apiKey: api_key,
  baseURL: base_url,
});

const completion = await client.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [
    { role: "system", content: "You are a helpful assistant." },
    { role: "user", content: "Hello!" },
  ],
  thinking: { type: "enabled" },
  reasoning_effort: "high",
  stream: false,
});

console.log(completion.choices[0].message.content);

Curl Code Example

curl https://api.cometapi.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "You are a helpful assistant."
      },
      {
        "role": "user",
        "content": "Hello!"
      }
    ],
    "thinking": {
      "type": "enabled"
    },
    "reasoning_effort": "high",
    "stream": false
  }'

Uptime

Taxa de sucesso de requisições nos últimos 30 dias, refletindo a confiabilidade de cada provedor de modelos. A CometAPI monitora todos os provedores conectados em tempo real, 24 horas por dia, 7 dias por semana.

RespondLIVE
2366msAvg. Response
UptimeLIVE
100.0%Avg. Uptime