TL;DR
DeepSeek-V4.1-Flash é o modelo Flash multimodal atual oferecido pela API da DeepSeek sob o ID de modelo deepseek-flash. Ele suporta contexto de 1M tokens, até 384K de saída e entrada de imagem; no guia de visão atual, cada imagem usa no máximo 1024 tokens após o redimensionamento automático.
Seu posicionamento mais forte continua sendo visão orientada a agentes: inspecionar capturas de tela, gráficos, interfaces e documentos baseados em imagem antes de seguir com código ou ferramentas. Os resultados de benchmark mais adiante neste artigo pertencem ao lançamento Vision-Exp descontinuado e devem ser lidos como evidência histórica reportada pelo fornecedor — não como um novo benchmark do DeepSeek-V4.1-Flash.
Atualmente, a CometAPI mantém deepseek-v4-flash-vision-exp como ID de modelo em seu catálogo, enquanto a API direta da DeepSeek recomenda deepseek-flash e atende a solicitação com DeepSeek-V4.1-Flash. Comece com uma solicitação de texto + imagem e avalie a rota exata nas suas próprias capturas de tela e tarefas visuais.
Principais pontos
- Rota atual: DeepSeek-V4.1-Flash é o modelo Flash multimodal ativo. O nome descontinuado
deepseek-v4-flash-vision-exppermanece aceito apenas como alias de compatibilidade na API da DeepSeek. - Grande espaço de trabalho de texto: contexto de 1M tokens e até 384K de saída suportam documentos longos, repositórios de código, históricos de ferramentas e imagens em uma conversa.
- Contabilização atual de imagens: a DeepSeek redimensiona automaticamente cada imagem e limita a 1024 tokens de entrada. Imagens abaixo de aproximadamente 544×544 pixels totais são ampliadas; imagens maiores são redimensionadas para algo próximo de 1300×1300 pixels totais.
- Visão focada em agentes: a comparação oficial enfatiza fluxos de captura de tela, gráfico, navegador, codificação e ferramentas visuais, em vez de geração de imagens.
- Amplo suporte de interface: a DeepSeek documenta as interfaces de API suportadas: Chat Completions, Messages compatível com Anthropic e Responses API. Os exemplos da CometAPI abaixo usam Chat Completions.
- Cautela em produção: aliases de rota, redimensionamento automático de imagem e resultados de benchmark sensíveis ao harness tornam essenciais os testes específicos da carga de trabalho.
O que é DeepSeek-V4-Flash-Vision?
A documentação atual da DeepSeek identifica deepseek-flash como DeepSeek-V4.1-Flash, com entrada de texto e imagem e saída de texto. O modelo Vision-Exp anterior foi descontinuado; seus nomes legados de modelo são aliases de compatibilidade roteados para o modelo Flash atual.
O caso de uso-alvo é agência multimodal. Um agente visual pode inspecionar um aplicativo renderizado, identificar um botão ou falha de layout, raciocinar sobre a próxima ação, chamar uma ferramenta e então examinar a próxima captura de tela. O mesmo padrão se aplica a análise de gráficos, garantia de qualidade visual, extração de documentos, automação de navegador e agentes de codificação que precisam comparar um design de referência com uma página renderizada.
Observação de nomenclatura: para a API direta da DeepSeek, use deepseek-flash; atualmente, ela mapeia para DeepSeek-V4.1-Flash. Os nomes legados deepseek-v4-flash e deepseek-v4-flash-vision-exp ainda são aceitos pela DeepSeek, mas os modelos correspondentes estão descontinuados e as solicitações são atendidas pelo DeepSeek-V4.1-Flash. A CometAPI continua expondo deepseek-v4-flash-vision-exp como sua própria rota de catálogo.
Especificações técnicas
| Especificação (docs oficiais) | Valor atual |
|---|---|
| ID de modelo oficial | deepseek-flash |
| Status | Rota ativa da API Flash multimodal; modelo Vision-Exp legado |
| Entradas / saída | Entrada de texto + imagem; saída de texto |
| Janela de contexto | 1.048.576 tokens (1M) |
| Saída máxima | Até 384K tokens |
| Listagem do checkpoint Vision-Exp legado | 305B parâmetros no repositório oficial do Hugging Face |
| Backbone de texto do Vision-Exp legado | 43 camadas; tamanho oculto 4.096; 64 cabeças de atenção |
| Roteamento MoE do Vision-Exp legado | 256 experts roteados; 6 selecionados por token; 1 expert compartilhado |
| Codificador de visão do Vision-Exp legado | 32 camadas; largura 1.024; 16 cabeças; patch size 14 |
| Representação de imagem | Máximo de 1024 tokens de imagem por imagem na API atual da DeepSeek |
| Formatos de imagem | JPEG, PNG, GIF, WebP |
| Métodos de entrada de imagem | URL de dados Base64, URL externa, file_id da DeepSeek Files API |
| Estilos de API | Chat Completions, Messages compatível com Anthropic, Responses |
| Modos de raciocínio | Com e sem pensamento; níveis de esforço baixo, alto, máximo |
| Licença | MIT para o repositório oficial do modelo |
Os campos de arquitetura acima vêm da configuração oficial. A interface do repositório lista um checkpoint de 305B parâmetros, mas a DeepSeek não publica separadamente uma contagem de parâmetros ativados para o modelo completo de visão. É mais seguro relatar o valor do repositório do que assumir que a contagem ativa do V4-Flash apenas texto se transfere inalterada após adicionar a pilha visual.
Como funciona a arquitetura legada do DeepSeek-V4-Flash-Vision-Exp
Backbone de texto V4-Flash
O lado de linguagem mantém os temas de design do V4 que tornam prático o trabalho de agente com longo contexto. O repositório oficial documenta os componentes de arquitetura V4: roteamento esparso Mixture-of-Experts, atenção DFlash, Hyper-Connections e DSpark. Isso torna o lançamento mais auditável do que um modelo apenas de API, embora a implantação local permaneça exigente nessa escala.
Codificador de visão e alinhador
Para o checkpoint Vision-Exp descontinuado, a configuração publicada usou um codificador visual de 32 camadas, patch size 14, largura de visão 1.024, 16 cabeças de atenção visual e uma representação de imagem de 384 tokens. Esses detalhes de arquitetura descrevem o checkpoint histórico e não devem ser assumidos como documentação da pilha de serviço atual do DeepSeek-V4.1-Flash.
Limite atual de 1024 tokens por imagem
As regras atuais de tokenização de visão da DeepSeek ampliam imagens abaixo de aproximadamente 544×544 pixels totais e reduzem imagens maiores preservando a proporção. Entradas grandes são redimensionadas para algo próximo da área de pixels de uma imagem 1300×1300, produzindo um limite superior de 1024 tokens por imagem. Uma imagem 2000×2000 e uma 5000×5000, portanto, consomem o mesmo número de tokens de imagem após o redimensionamento.
Implicação prática: recorte a região que contém rótulos pequenos, código ou controles de UI antes de enviar a imagem. Resolução de origem mais alta por si só não supera o teto atual de 1024 tokens.
Desempenho de benchmark do Vision-Exp legado
A avaliação oficial no model card compara o modelo de visão com o DeepSeek-V4-Flash-0731 e o Claude Opus 4.8 em tarefas de agente de texto e agente multimodal. O modelo de visão geralmente melhora em relação ao modelo Flash apenas texto, permanecendo competitivo com, mas não uniformemente à frente do concorrente focado em capacidade.
Comparação oficial de benchmark para avaliações de agente de texto e multimodal. Fonte: lançamento oficial da DeepSeek
| Benchmark oficial | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Público) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2* | 39.4 |
| Agents' Last Exam | 27.3 | 25.2* | 25.7 |
| Chartography | 64.3 | - | 65.0 |
| ZeroBench (Pass@5) | 35.0 | - | 34.0 |
* Em ApexBench e Agents' Last Exam, o V4-Flash apenas texto ignorou os elementos multimodais na entrada. A DeepSeek avaliou suas tarefas de agente de texto com DeepSeek Harness em modo mínimo, esforço máximo de raciocínio, temperatura 1,0 e top_p 0,95.
Observação sobre benchmarks: estes são resultados de lançamento reportados pela DeepSeek, não uma reprodução independente. As pontuações de agentes são especialmente sensíveis ao harness, definições de ferramentas, orçamento de tokens e política de tentativas, portanto devem ser tratadas como evidência direcional.
O que os resultados de benchmark significam
O resultado mais claro é a melhora em relação ao V4-Flash apenas texto quando a evidência visual importa. O ApexBench sobe de 26,2 para 36,5, e o modelo de visão adiciona resultados competitivos em Chartography e ZeroBench que o modelo apenas texto não reporta. O modelo também melhora em várias tarefas de agente de texto, incluindo Terminal Bench 2.1, NL2Repo, DeepSWE, Toolathlon-Verified e DSBench-Hard, embora Cybergym seja ligeiramente inferior.
Em comparação com o Opus 4.8, o resultado é misto. O Vision-Exp está acima em DeepSWE, Agents' Last Exam e ZeroBench nesta tabela, enquanto o modelo concorrente está acima em Terminal Bench, NL2Repo, Cybergym, Toolathlon, DSBench-Hard, ApexBench e Chartography. A alegação de benchmark multimodal da DeepSeek é, portanto, direcional em vez de prova de equivalência geral em todas as dimensões de visão, raciocínio ou confiabilidade.
DeepSeek-V4.1-Flash vs DeepSeek-V4-Flash-Vision-Exp vs Claude Opus 4.8 vs Gemini 3.7 Flash
| Dimensão | DeepSeek Vision-Exp | DeepSeek V4 Flash | Claude Opus 4.8 | Gemini 3.7 Flash |
|---|---|---|---|---|
| Status | Experimental | Beta público / rota Flash atual | Disponível de forma geral | Disponível de forma geral |
| Modalidades | Texto, imagem | Texto | Texto, imagem, documentos | Texto, imagem, vídeo, áudio, PDF |
| Saída | Texto | Texto | Texto / dados estruturados / código | Texto |
| Contexto | 1M | 1M | Até 1M dependendo da plataforma | 1.048.576 |
| Saída máxima | 384K | 384K | 128K | 65.536 |
| Principal força | Agentes visuais de baixo custo | Agentes de texto de alto throughput | Agentes complexos de alta autonomia | Multimodal amplo e versátil |
| Melhor teste inicial | Capturas de tela, gráficos, UI, codificação visual | Codificação e automação de texto | Tarefas mais difíceis de longo horizonte | Mídia rica e fluxos com ferramentas do Google |
Escolha o Vision-Exp quando a percepção de imagem precisar ser adicionada a um loop de agente de baixo custo. Escolha o V4 Flash quando toda a entrada for textual e o throughput for mais importante do que a compreensão visual. O Opus 4.8 permanece a opção focada em capacidade na própria comparação da DeepSeek, enquanto o Gemini 3.7 Flash é a alternativa multimodal mais ampla quando vídeo, áudio, PDFs e ferramentas nativas do Google importam.
O que o DeepSeek-V4-Flash-Vision pode fazer?
- Screenshot-to-code e revisão de UI — comparar uma página renderizada com um design, identificar problemas de layout ou acessibilidade e gerar orientação de implementação.
- Agentes de navegador visuais — usar capturas de tela como observações quando dados de DOM ou árvore de acessibilidade forem incompletos, então selecionar a próxima ação de ferramenta.
- Análise de gráficos e dashboards — explicar tendências, identificar anomalias e conectar métricas visíveis a um fluxo maior de texto ou ferramentas.
- Compreensão de documentos baseada em imagem — extrair informações de formulários escaneados, diagramas, slides, tabelas e capturas de tela antes do processamento estruturado.
- Agentes de codificação multimodais — combinar código-fonte, capturas de bugs, estados de IDE e saídas renderizadas em um único loop de depuração.
- Garantia de qualidade visual — comparar capturas de produtos entre dispositivos, detectar elementos ausentes e gerar relatórios estruturados de defeitos.
- Comparação multi-imagem — avaliar uma sequência de capturas de tela ou designs alternativos em uma solicitação, sujeita aos limites de tamanho da requisição e número de imagens.
Exemplo oficial de agente visual da página de lançamento da DeepSeek (GIF animado no Word). Fonte: lançamento oficial da DeepSeek
Preços e disponibilidade
A DeepSeek cobra tokens de imagem junto com tokens de entrada de texto. Sua tabela oficial de preços usa tarifas de pico e fora de pico, enquanto a página de modelo da CometAPI publica um preço único da rota atual. Os números não devem ser colapsados em um preço genérico porque a rota mais barata muda conforme a janela de tempo da DeepSeek.
| Rota / fonte | Entrada com acerto de cache | Entrada com falha de cache | Saída | Condição |
|---|---|---|---|---|
| DeepSeek oficial - fora de pico | $0.003 | $0.15 | $0.60 | Todas as horas fora das janelas de pico, incluindo fins de semana e feriados na China |
| DeepSeek oficial - pico | $0.006 | $0.30 | $1.20 | 01:00-04:00 e 06:00-10:00 UTC, seg-sex, exceto feriados públicos na China |
| Rota atual da CometAPI | Não listado separadamente | $0.352 | $1.056 | Preço unificado atual da rota |
Todos os preços são em USD por 1M tokens. As tarifas atuais do Flash da DeepSeek são $0.003/$0.15/$0.60 fora de pico e $0.006/$0.30/$1.20 no pico para entrada com acerto de cache, entrada com falha de cache e saída, respectivamente. A CometAPI atualmente lista $0.352 por 1M tokens de entrada e cerca de $1.06 por 1M tokens de saída para sua rota de compatibilidade. Imagens usam no máximo 1024 tokens de entrada cada na API atual da DeepSeek; sempre verifique os preços de rota em tempo real antes do uso em produção.
Observação de preços: os valores podem mudar. Mantenha as cifras vinculadas a páginas de preços ao vivo e verifique-as imediatamente antes de publicação ou implantação em produção.
Como usar o DeepSeek-V4-Flash-Vision com a CometAPI
A CometAPI atualmente lista deepseek-v4-flash-vision-exp pelo endpoint /v1/chat/completions compatível com OpenAI, então os exemplos da CometAPI mantêm esse ID de catálogo. Para a API direta da DeepSeek, use deepseek-flash.
Etapa 1: crie uma chave de API
- Crie ou acesse uma conta na CometAPI.
- Abra o console de tokens de API e crie uma chave.
- Armazene-a na variável de ambiente COMETAPI_KEY. Nunca coloque uma chave de produção em código client-side nem a versione no controle de código-fonte.
export COMETAPI_KEY="your-cometapi-key"
Etapa 2: envie uma imagem Base64 com cURL
Base64 é útil para arquivos locais e jobs server-side em que a imagem já está em memória. Substitua o placeholder pelos bytes codificados da imagem, sem adicionar espaços nem quebras de linha.
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Read this dashboard and return the three most important findings."
},
{
"type": "image_url",
"image_url": {
"url": "data:image/png;base64,<BASE64_DATA>"
}
}
]
}
],
"max_tokens": 1200
}'
Etapa 3: analise uma imagem local com Python
O SDK Python da OpenAI pode chamar a CometAPI alterando a URL base. Use extra_body para controles de thinking específicos da DeepSeek quando seu SDK não os expuser diretamente.
import base64
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
with open("dashboard.png", "rb") as image_file:
encoded = base64.b64encode(image_file.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": (
"Analyze the chart. Return JSON with keys: trend, "
"anomalies, evidence, and confidence."
),
},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{encoded}"
},
},
],
}
],
max_tokens=1500,
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
},
)
print(response.choices[0].message.content)
Etapa 4: use uma URL pública de imagem com JavaScript
Uma URL de imagem mantém a requisição JSON pequena, mas a URL deve ser publicamente acessível pelo modelo upstream. Evite links temporários, privados ou protegidos por autenticação, a menos que sua aplicação primeiro converta a imagem para Base64.
const response = await fetch(
"https://api.cometapi.com/v1/chat/completions",
{
method: "POST",
headers: {
Authorization: `Bearer ${process.env.COMETAPI_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "deepseek-v4-flash-vision-exp",
messages: [
{
role: "user",
content: [
{
type: "text",
text: "Identify the UI issue and propose a concrete CSS fix.",
},
{
type: "image_url",
image_url: {
url: "https://example.com/screenshot.png",
},
},
],
},
],
max_tokens: 1200,
}),
}
);
if (!response.ok) {
throw new Error(`CometAPI request failed: ${response.status}`);
}
const data = await response.json();
console.log(data.choices[0].message.content);
Etapa 5: envie múltiplas imagens
Coloque múltiplos blocos image_url na mesma mensagem do usuário e diga ao modelo como rotulá-los. Rótulos explícitos reduzem referências cruzadas acidentais entre imagens.
{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Compare Image A and Image B. List every visible regression."
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/image-a.png"}
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/image-b.png"}
}
]
}
],
"max_tokens": 1800
}
Métodos de entrada e limites
| Limite | Valor oficial da DeepSeek |
|---|---|
| Formatos suportados | JPEG, PNG, GIF, WebP |
| Tamanho da URL externa | Até 8.192 caracteres |
| Corpo da requisição | 48 MiB |
| Imagem única via Base64 / URL | 32 MiB |
| Imagem única via DeepSeek Files API | 64 MiB |
| Máximo de imagens por requisição | 600 |
| Tamanho total de imagem | 64 MiB sem file_id; até 200 MiB incluindo file_id |
| Dimensão máxima | 8.192 px por lado; 4.096 px quando houver 15+ imagens na requisição |
| Papel da mensagem da imagem | Apenas mensagens do usuário |
A API oficial da DeepSeek também suporta referências de imagem reutilizáveis por file_id por meio de sua Files API. O caminho rápido da CometAPI documentado aqui usa blocos image_url com URL pública ou URL de dados Base64. Verifique o upload de arquivo específico do provedor e o repasse de file_id antes de depender desse fluxo por uma rota de agregação.
Como criar prompts eficazes para o modelo
Um prompt confiável de agente visual deve declarar o que é a imagem, quais evidências inspecionar, qual ação tomar e qual contrato de saída seguir. Prompts vagos como descreva esta imagem deixam liberdade demais e tornam os resultados mais difíceis de validar.
- Contexto — identifique a captura de tela, gráfico, documento ou interface e seu papel no fluxo de trabalho.
- Tarefa — especifique a decisão, diagnóstico, comparação ou extração que importa.
- Evidência — exija evidência visível, rótulos, coordenadas, valores ou texto de UI citado.
- Restrições — proíba suposições não suportadas e diga ao modelo como lidar com detalhes ilegíveis.
- Saída — defina chaves JSON, uma checklist, níveis de severidade ou outra estrutura verificável por máquina.
You are reviewing a web application screenshot.
Task: identify layout, accessibility, and state-consistency defects.
Evidence: cite the visible element, label, position, or color that supports each finding.
Constraints: do not infer hidden DOM state; mark unreadable text as uncertain.
Output: return JSON with arrays named critical, major, minor, and follow_up_checks.
Boas práticas de produção
- Recorte antes do upload quando texto pequeno ou controles forem importantes; o teto de tokens de imagem significa que fundo irrelevante consome resolução visual escassa.
- Teste o esforço de thinking em vez de ativar max para toda requisição. OCR simples ou classificação geralmente precisam de menos raciocínio do que diagnóstico de UI em múltiplas etapas.
- Exija evidência em todo achado estruturado. Isso torna alegações visuais alucinadas mais fáceis de rejeitar automaticamente.
- Separe percepção de ação em automação de alto risco. Deixe o modelo descrever o estado, valide-o e então permita que uma camada de ferramentas controlada atue.
- Proteja URLs de imagem porque uma URL pública pode expor capturas sensíveis. Prefira Base64 no servidor para dados privados e aplique sua própria política de retenção.
- Faça benchmark de ponta a ponta com a mesma captura de screenshot, prompt, ferramentas, tentativas e critérios de sucesso usados em produção.
- Acompanhe mudanças experimentais fixando prompts e dados de avaliação. Um endpoint -exp pode mudar o comportamento mais rápido do que um modelo em disponibilidade geral.
- Registre IDs de requisição e falhas para distinguir erros do provedor, do modelo e de parsing da aplicação.
Limitações
A limitação mais importante é a transparência de rota: o nome legado Vision-Exp ainda pode ser aceito, mesmo que a solicitação seja atendida pelo DeepSeek-V4.1-Flash. Registre o provedor, o ID de modelo solicitado, os metadados do modelo retornado e o ID da requisição; use gates de avaliação explícitos antes de atribuir ações autônomas. Pontuações históricas de lançamento não substituem testes reproduzíveis na rota pretendida.
A segunda limitação é o detalhe visual. O redimensionamento automático e o teto atual de 1024 tokens por imagem tornam os custos previsíveis, mas ainda podem suprimir texto minúsculo, marcas finas em gráficos ou elementos densos de interface. Recorte, divida em tiles ou aproxime a região relevante e preserve a imagem original para revisão humana.
O modelo retorna apenas texto. Ele pode analisar uma imagem e propor código ou ações estruturadas, mas não gera nem edita imagens. Também aceita imagens apenas em mensagens do usuário, e a documentação oficial afirma que conteúdo de imagem em mensagens de sistema ou assistente retorna erro 400.
Por fim, a implantação local exige muita infraestrutura. O repositório oficial lista um modelo de 305B parâmetros e fornece código de inferência de referência em vez de um runtime leve pronto para uso. Para a maioria das equipes, avaliação via API gerenciada é o ponto de partida prático.
Erros comuns e correções
| Sintoma | Causa provável | Correção recomendada |
|---|---|---|
| 400: model does not support image | ID de modelo incorreto | Use deepseek-v4-flash-vision-exp |
| 400 para conteúdo da mensagem | Imagem colocada em mensagem de sistema ou assistente | Mova os blocos de imagem para uma mensagem do usuário |
| Falha no download da imagem | URL privada, expirada ou lenta | Use Base64 ou uma URL pública estável |
| Detalhes finos são perdidos | Redução automática / teto de 384 tokens | Recorte ou divida em tiles a região relevante |
| Custo inesperadamente alto | Saída longa, tentativas ou turnos repetidos | Limite max_tokens e registre o uso por turno |
| Resultado inconsistente do agente | Variação no harness ou estado das ferramentas | Fixe o prompt, as ferramentas, as tentativas e o critério de avaliação |
FAQ
DeepSeek-V4-Flash-Vision é o mesmo que DeepSeek-V4-Flash?
Não. O Vision-Exp adiciona entrada nativa de imagem e treinamento multimodal. A rota Flash apenas texto não fornece a mesma capacidade de percepção visual.
Qual ID de modelo devo usar?
Use deepseek-flash na API direta da DeepSeek. Na CometAPI, use o ID de catálogo deepseek-v4-flash-vision-exp enquanto essa rota permanecer disponível.
Ele pode analisar múltiplas imagens?
Sim. A DeepSeek documenta até 600 imagens por requisição, sujeitas a limites de tamanho da requisição e dimensão. Limites práticos podem ser menores em uma aplicação porque a latência e a clareza do prompt degradam conforme o conjunto de imagens cresce.
Quantos tokens uma imagem usa?
Na API atual da DeepSeek, as imagens são redimensionadas e convertidas em tokens com um máximo de 1024 tokens por imagem. Múltiplas imagens são contabilizadas independentemente.
Suporta geração de imagens?
Não. Ele aceita texto e imagens e retorna texto.
Está pronto para produção?
Sim, mas somente após avaliação específica da rota. Use monitoramento, fallbacks, testes de aceitação específicos da tarefa e registro da rota do modelo, porque aliases legados podem resolver para o DeepSeek-V4.1-Flash.
Devo usar a CometAPI ou a API direta da DeepSeek?
A CometAPI é útil quando uma única chave, uma única camada de cobrança e troca fácil de modelos importam. O acesso direto à DeepSeek pode ser preferível quando você precisa de recursos específicos do provedor, como semântica oficial da Files API ou preços fora de pico. Teste ambas as rotas na mesma carga de trabalho.
Conclusão
O DeepSeek-V4.1-Flash é agora a rota Flash multimodal ativa na API da DeepSeek. Sua janela de contexto de 1M, teto de saída de 384K, suporte a múltiplas interfaces e limite de 1024 tokens por imagem o tornam atraente para entendimento de capturas de tela, análise de gráficos, codificação visual e automação de navegador ou GUI. A arquitetura do Vision-Exp e os benchmarks de lançamento neste artigo são mantidos como contexto histórico.
A decisão deve permanecer orientada pela carga de trabalho. A evidência pública de benchmark para o modelo Vision-Exp descontinuado é principalmente reportada pelo fornecedor, aliases de rota atuais podem obscurecer qual modelo está atendendo a solicitação e o redimensionamento de imagem ainda pode limitar tarefas de detalhes finos. Teste a rota exata do provedor em imagens representativas, meça o custo por tarefa bem-sucedida em vez do preço por token isolado e mantenha um fallback até que a rota se prove confiável no seu harness de produção.
