Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
guide/Pesquisa CometAPI

Como usar o Wan 3: Guia da API+ Prompts

Descubra o Wan 3.0 com áudio a partir de texto, imagens, documentos (PDF/PPT) e páginas da web. Especificações, preços, prompt & como usar via API.

CometAPI
AnnaEquipe de pesquisa de modelos e API de IA
Atualizado Aug 29, 2026 8 min de leitura
Como usar o Wan 3: Guia da API+ Prompts
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Wan 3.0 (também estilizado como Wan3.0), o mais recente modelo de vídeo tudo-em-um do Tongyi Lab da Alibaba, gera clipes contínuos nativos de 30 segundos em até 1080p com áudio sincronizado em uma única passada. Suporta texto-para-vídeo, imagem-para-vídeo, condicionamento por primeiro e último quadro, e poderosos fluxos de trabalho Omni-Reference que aceitam imagens, vídeo, áudio, documentos (PDF, PPT, XLS, DOC, MD, etc.) e páginas da web.

A beta pública abriu em 6 de agosto de 2026; o acesso mais amplo ocorreu por volta de 24 de agosto de 2026. A precificação é aproximadamente $0,05/s (480p), $0,10/s (720p) e $0,20/s (1080p). Para desenvolvedores e equipes que buscam uma API unificada, compatível com OpenAI, para acessar os modelos da família Wan e 500+ outros com integração simples, a CometAPI oferece um caminho eficiente — atualmente com Wan 2.7 e um catálogo de vídeo em expansão via /v1/videos.

Principais destaques

  • Plano-sequência nativo de 30 segundos com geração em uma única tomada (o dobro do limite anterior do Wan 2.7/2.5, de ~15s), com correspondência inteligente de duração.
  • Omni-Reference: até ~10–20 ativos mistos (imagens, vídeos ≤15s no total, áudios, um documento/página da web) para forte consistência de tema, produto e estilo.
  • Conversão de documentos e páginas da web em vídeo é um destaque: forneça um PDF, apresentação, planilha ou URL pública e receba um vídeo estruturado.
  • Geração de áudio nativa na mesma passada; resoluções 480p/720p/1080p; múltiplas proporções de aspecto.
  • Maior fidelidade de rosto/microexpressões, referências mais estáveis e texto em tela mais limpo do que gerações anteriores.
  • Acesso via Alibaba Cloud Model Studio / Qwen Cloud (modelo wan3.0-video), wan.video e plataformas de terceiros. Para desenvolvimento multi-modelo simplificado, use o endpoint de vídeo unificado da CometAPI.
  • Faça prompts como um briefing de filmagem (assunto + ação + câmera + tempo + restrições) e rotule referências explicitamente (@Image1, etc.).

O que é o Wan 3.0?

O Wan 3.0 é o novo carro-chefe da família de geração de vídeo Tongyi Wanxiang (Wan) da Alibaba, desenvolvido pelo Tongyi Lab. Ele se baseia na linhagem diffusion-transformer de versões abertas e fechadas anteriores do Wan (incluindo a série Wan aberta amplamente estudada de 2025).

Principais melhorias em relação ao Wan 2.7 / 2.5 incluem:

  • Duração máxima nativa dobrada para 30 segundos em uma única geração contínua (não clipes emendados).
  • Entradas multimodais expandidas além de texto/imagem/vídeo/áudio para incluir documentos de escritório e páginas públicas da web.
  • Renderização em nível “Reality-grade” para rostos, microexpressões, detalhes de produto e consistência de conteúdo digital/UI.
  • Modelo unificado tudo-em-um cobrindo texto-para-vídeo (T2V), imagem-para-vídeo (I2V), primeiro-e-último-quadro, referência-para-vídeo e recursos relacionados de edição/extensão.

A Alibaba o posiciona para vídeos de marketing, curtas dramáticos, conteúdo social, demonstrações de produto, imagens de treinamento/simulação (por exemplo, robótica ou AV) e explicativos corporativos. O modelo permanece com pesos fechados / apenas via API (os pesos abertos param nas versões Wan 2.x anteriores).

Dados e fontes de apoio: Exemplos de preços listados (internacional): 480p $0,05/s, 720p $0,10/s, 1080p $0,20/s (um clipe de 30 segundos em 1080p ≈ $6 padrão). Algumas plataformas oferecem níveis Standard vs Prime (mais rápido) ou descontos temporários.

Como usar a API do Wan 3.0

A Alibaba Cloud expõe o Wan 3.0 por meio da API de geração de vídeo do Model Studio. O identificador de modelo atual é:

wan3.0-video

A API usa geração de vídeo assíncrona. Uma solicitação representativa é:

curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
  -H 'X-DashScope-Async: enable' \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "wan3.0-video",
    "input": {
      "prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
    },
    "parameters": {
      "resolution": "720P",
      "ratio": "16:9",
      "duration": 10,
      "enable_thinking": false
    }
  }'

A referência da API da Alibaba observa que o modelo, o endpoint e a chave de API precisam pertencer à mesma região. A API é assíncrona, portanto os aplicativos devem enviar a tarefa e depois recuperar o resultado gerado após o processamento.

Para fluxos de trabalho de imagem-para-vídeo e baseados em referência, o objeto input pode incluir mídia de referência. O exemplo atual da Alibaba demonstra uma combinação de vídeo de referência e imagens de referência na mesma solicitação.

Como usar o Wan 3.0 via CometAPI (recomendado para desenvolvedores)

A CometAPI oferece uma interface unificada, compatível com OpenAI, para 500+ modelos, incluindo os modelos de vídeo da família Alibaba Wan (Wan 2.7 atualmente listado com preços por segundo competitivos; verifique o catálogo ao vivo para Wan 3.0 conforme a disponibilidade se expande). A geração de vídeo usa o endpoint /v1/videos com dados multipart/form — ideal para pipelines de produção, automação n8n/Make ou alternar entre Wan, Seedance, Kling, Veo, MiniMax etc., sob uma única chave.

Passos na CometAPI:

  1. Cadastre-se / faça login em cometapi.com e crie uma chave de API (sk-…).
  2. Revise a documentação da API de vídeo (apidoc.cometapi.com) e a lista de modelos para o ID exato do Wan (por exemplo, padrão wan2.7; confirme o mais recente).
  3. Envie via POST https://api.cometapi.com/v1/videos com campos de formulário:
  4. Receba um task/ID; faça polling no endpoint de status ou use webhooks até a conclusão.
  5. Baixe o conteúdo de vídeo resultante.
  6. Monitore o uso e os custos no dashboard da CometAPI (pague conforme o uso, sem mínimos mensais).

Como criar prompts eficazes para o Wan 3.0

Trate os prompts como briefings de filmagem, não legendas casuais. Uma estrutura comprovada (adaptada de guias da comunidade e da plataforma):

Fórmula no estilo SPACE ou lista de planos:

  • Assunto: descrição concreta de quem/o quê.
  • Performance/Ação: movimento visível e mudanças de estado em ordem temporal.
  • Ambiente/Cenário: local, horário, iluminação, clima.
  • Câmera: tamanho do plano + um movimento claro (aproximação lenta, órbita, travelling, estática).
  • Extra: estilo, pistas de áudio, ritmo, restrições (“mantenha o rótulo legível”, “preservar identidade facial”).

Para clipes de 30s com múltiplos beats, numere os planos com faixas de tempo:

Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.

Vinculação de referências (crítica para Omni-Reference):

@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.

Dicas adicionais:

  • Seja específico sobre ações observáveis e relações espaciais.
  • Use prompts negativos para falhas comuns (mãos distorcidas, texto indesejado, deriva de estilo).
  • Para documentos: “Crie um vídeo explicativo que siga a estrutura do PDF anexado, enfatizando as três métricas-chave da página 2 e as recomendações da conclusão.”
  • Itere: gere versões curtas primeiro, depois expanda os beats bem-sucedidos.
  • Linguagem de câmera e descritores de iluminação melhoram a qualidade cinematográfica.

Por que usar o Wan 3.0?

O Wan 3.0 é mais convincente quando a aplicação precisa transformar vários tipos de material de origem em um vídeo coerente, em vez de simplesmente converter um prompt de texto em um clipe curto.

Suas maiores vantagens são:

  • 30 segundos de geração nativa de vídeo
  • Texto-para-vídeo e imagem-para-vídeo
  • Geração de vídeo com múltiplas referências
  • Entradas de texto, imagem, vídeo, áudio e documentos
  • Fluxos de trabalho de documento e página da web para vídeo
  • Geração audiovisual nativa
  • Saída em 1080P
  • Edição de vídeo baseada em instruções
  • Forte consistência de referência
  • Precificação por segundo
  • Um único modelo para vários fluxos criativos

Para desenvolvedores que constroem ferramentas de cinema com IA, sistemas de publicidade, geradores de vídeos de produto, plataformas de conteúdo educacional ou agentes criativos multimodais, esses recursos podem reduzir significativamente o número de modelos separados e etapas de pré-processamento necessárias.

Conclusão e recomendação

O Wan 3.0 representa um avanço significativo rumo a vídeo com IA prático e orientado à produção: tomadas contínuas mais longas, verdadeiro documento-para-vídeo e controle multimodal mais forte. Com prompts bem pensados e disciplina no uso de referências, ele pode comprimir dias de produção tradicional em minutos para muitos casos de marketing, explicativos e formatos curtos.

Para desenvolvedores e equipes criando aplicativos ou ferramentas internas, comece pelos canais oficiais da Alibaba para a experiência mais pura do Wan 3.0 e considere a CometAPI (cometapi.com) como um gateway de alta produtividade. Sua API unificada de vídeo, ampla cobertura de modelos (incluindo o atual Wan 2.7 e catálogo em expansão), interface compatível com OpenAI e modelo transparente pay-as-you-go tornam simples experimentar, escalar e combinar geração classe Wan com LLMs, modelos de imagem e áudio complementares sob uma única integração.

Confira a lista mais recente de modelos e a documentação na CometAPI e no Alibaba Cloud Model Studio, experimente com clipes curtos, refine seus prompts em lista de planos e escale para produções completas de 30 segundos. A combinação de duração nativa mais longa e Omni-Reference abre novos fluxos criativos e de negócios que antes eram trabalhosos ou caros.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Aug 27, 2026
Última atualização Aug 29, 2026
4 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais