Claude Opus 5 is now live on CometAPI →

DeepSeek: como funciona?

CometAPI
AnnaMay 4, 2025
DeepSeek: como funciona?

No campo em rápida evolução da inteligência artificial, a DeepSeek surgiu como um concorrente formidável, desafiando gigantes estabelecidos como a OpenAI e o Google. Fundada em julho de 2023 por Liang Wenfeng, a DeepSeek é uma empresa chinesa de IA que chamou a atenção por suas abordagens inovadoras a modelos de linguagem grande (LLMs) e por seu compromisso com o desenvolvimento open-source. Este artigo aprofunda-se na arquitetura, nas inovações e nas implicações dos modelos da DeepSeek, com foco especial em sua estrutura de Mistura de Especialistas (MoE) e nos avanços dos modelos DeepSeek-V2 e DeepSeek-R1.


O que é a DeepSeek e por que ela é importante?

A Inteligência Artificial (IA) evoluiu rapidamente, com a DeepSeek destacando-se como um dos projetos mais ambiciosos até hoje. Desenvolvida por uma equipe de ex-engenheiros e pesquisadores de IA de alto nível, a DeepSeek representa uma nova geração de modelos de linguagem open-source que busca reduzir a distância entre grandes modelos proprietários (como o GPT-4) e a comunidade de pesquisa aberta.

Lançada no fim de 2024, a DeepSeek introduziu várias ideias novas sobre eficiência de treinamento, escalonamento e recuperação de memória, expandindo os limites do que os modelos abertos podem alcançar.

Como a arquitetura da DeepSeek difere dos modelos tradicionais?

O que é MoE?

Em redes neurais densas convencionais, cada entrada percorre toda a rede, ativando todos os parâmetros independentemente da natureza da entrada. Essa abordagem, embora simples, leva a ineficiências, especialmente à medida que os modelos escalam.

A arquitetura de Mistura de Especialistas (MoE) resolve isso dividindo a rede em múltiplas sub-redes, ou “especialistas”, cada uma especializada em diferentes tarefas ou padrões de dados. Um mecanismo de roteamento (gating) seleciona dinamicamente um subconjunto desses especialistas para cada entrada, garantindo que apenas as partes mais relevantes da rede sejam ativadas. Essa ativação seletiva reduz a sobrecarga computacional e permite maior especialização do modelo.

A arquitetura de Mistura de Especialistas é uma técnica projetada para melhorar a eficiência e a escalabilidade de grandes redes neurais. Em vez de ativar todos os parâmetros para cada entrada, o MoE aciona seletivamente um subconjunto de redes “especialistas” com base nos dados de entrada. Essa abordagem reduz a carga computacional e permite um processamento mais direcionado.

A implementação de MoE da DeepSeek

Os modelos da DeepSeek, como o DeepSeek-R1 e o DeepSeek-V2, utilizam uma estrutura MoE avançada. Por exemplo, o DeepSeek-R1 possui 671 bilhões de parâmetros, mas apenas 37 bilhões são ativados durante qualquer passagem direta. Essa ativação seletiva é gerenciada por um sofisticado mecanismo de roteamento que direciona as entradas aos especialistas mais relevantes, otimizando a eficiência computacional sem comprometer o desempenho.

Como é um Transformer simplificado da DeepSeek?

Aqui está um exemplo de código simplificado de como a DeepSeek pode implementar um mecanismo esparso de mistura de especialistas:

pythonimport torch
import torch.nn as nn
import torch.nn.functional as F

class Expert(nn.Module):
    def __init__(self, hidden_dim):
        super(Expert, self).__init__()
        self.fc = nn.Linear(hidden_dim, hidden_dim)

    def forward(self, x):
        return F.relu(self.fc(x))

class SparseMoE(nn.Module):
    def __init__(self, hidden_dim, num_experts=8, k=2):
        super(SparseMoE, self).__init__()
        self.experts = nn.ModuleList()
        self.gate = nn.Linear(hidden_dim, num_experts)
        self.k = k

    def forward(self, x):
        scores = self.gate(x)
        topk = torch.topk(scores, self.k, dim=-1)
        output = 0
        for idx in range(self.k):
            expert_idx = topk.indices
            expert_weight = F.softmax(topk.values, dim=-1)
            expert_output = torch.stack((x) for j, i in enumerate(expert_idx)])
            output += expert_weight.unsqueeze(-1) * expert_output
        return output

# Exemplo de uso

batch_size, hidden_dim = 16, 512
x = torch.randn(batch_size, hidden_dim)
model = SparseMoE(hidden_dim)
out = model(x)
print(out.shape)  # Formato da saída: (16, 512)

Este exemplo básico simula a seleção dinâmica de 2 especialistas com base na entrada e a agregação de suas saídas.

DeepSeek: como funciona?

Quais estratégias de treinamento a DeepSeek utilizou?

Como foi o processo de coleta e curadoria de dados?

Os criadores da DeepSeek deram ênfase maciça à qualidade dos dados em vez da mera quantidade. Enquanto a OpenAI e outros coletaram dados da internet pública em larga escala, a DeepSeek combinou:

  • Conjuntos de dados abertos curados (Pile, segmentos do Common Crawl)
  • Corpora acadêmicos
  • Repositórios de código (como o GitHub)
  • Conjuntos de dados sintéticos especiais gerados com modelos supervisionados menores

O treinamento envolveu uma abordagem de aprendizagem curricular em múltiplas etapas:

  • Estágios iniciais treinados em conjuntos de dados mais simples e factuais
  • Estágios posteriores enfatizando tarefas de raciocínio e programação

Quais técnicas de otimização foram empregadas?

Treinar grandes modelos de linguagem de forma eficiente continua sendo um grande desafio. A DeepSeek empregou:

  • ZeRO-3 Parallelism: divisão de estados do otimizador, gradientes e parâmetros entre GPUs.
  • Quantização Int8 durante o treinamento: para minimizar o uso de memória sem prejudicar a qualidade do modelo.
  • Taxas de aprendizado adaptativas: usando técnicas como cosseno com aquecimento (cosine annealing with warmup).

Aqui está um snippet simples que demonstra agendamento adaptativo de taxa de aprendizado:

pythonfrom torch.optim.lr_scheduler import CosineAnnealingLR

optimizer = torch.optim.AdamW(model.parameters(), lr=1e-4)
scheduler = CosineAnnealingLR(optimizer, T_max=100)

for epoch in range(100):
    train(model)
    validate(model)
    scheduler.step()

Este código ajusta a taxa de aprendizado de forma suave durante o treinamento.

Como a DeepSeek alcança desempenho superior?

Qual é o papel da recuperação (retrieval)?

A DeepSeek integra um sistema de recuperação embutido — semelhante a conectar um mecanismo de busca a uma rede neural. Diante de um prompt, o modelo pode:

  1. Codificar a consulta
  2. Recuperar documentos relevantes de uma memória externa
  3. Fundir os documentos com seu próprio conhecimento interno

Isso permite que a DeepSeek mantenha-se factual e atualizada muito melhor do que modelos fechados convencionais.

Conceitualmente, é algo assim:

pythonclass Retriever:
    def __init__(self, index):
        self.index = index  # Presuma algum índice de busca pré-construído

    def retrieve(self, query_embedding):
        # Busca baseada em similaridade

        return self.index.search(query_embedding)

class DeepSeekWithRetriever(nn.Module):
    def __init__(self, model, retriever):
        super().__init__()
        self.model = model
        self.retriever = retriever

    def forward(self, query):
        embedding = self.model.encode(query)
        docs = self.retriever.retrieve(embedding)
        augmented_input = query + " " + " ".join(docs)
        output = self.model.generate(augmented_input)
        return output

Esse tipo de Geração Aumentada por Recuperação (RAG) melhora significativamente as capacidades de raciocínio de longo prazo da DeepSeek.

deepseek

Como a DeepSeek é avaliada?

O modelo foi testado em:

  • MMLU: compreensão de linguagem multitarefa
  • HumanEval: precisão de geração de código
  • TruthfulQA: capacidade de responder com veracidade
  • BIG-bench: avaliação ampla e geral de IA

Na maioria dos casos, os maiores modelos da DeepSeek (30B, 65B parâmetros) igualaram ou até superaram o GPT-4-turbo em tarefas de raciocínio, mantendo-se significativamente mais baratos de operar.

Quais desafios permanecem para a DeepSeek?

Embora impressionante, a DeepSeek não está livre de falhas:

  • Viés e toxicidade: mesmo conjuntos de dados curados podem vazar saídas problemáticas.
  • Latência de recuperação: sistemas RAG podem ser mais lentos do que modelos de geração pura.
  • Custos de computação: treinar e servir esses modelos ainda é caro, mesmo com MoE.

A equipe da DeepSeek está trabalhando ativamente na poda de modelos, em algoritmos de recuperação mais inteligentes e na mitigação de vieses.


Conclusão

A DeepSeek representa uma das mudanças mais importantes no desenvolvimento de IA aberta desde o surgimento dos modelos baseados em Transformer. Por meio de inovações arquitetônicas como especialistas esparsos, integração de recuperação e objetivos de treinamento mais inteligentes, estabeleceu um novo padrão para o que modelos abertos podem alcançar.

À medida que o cenário de IA evolui, espera-se que a DeepSeek (e seus derivados) desempenhe um papel importante na formação da próxima onda de aplicações inteligentes.

Primeiros passos

Desenvolvedores podem acessar a DeepSeek R1 API e a DeepSeek V3 API por meio da CometAPI. Para começar, explore os recursos do modelo no Playground e consulte o guia da API para instruções detalhadas. Observe que alguns desenvolvedores podem precisar verificar sua organização antes de usar o modelo.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais