Responda primeiro Vidu Q3 pode criar vídeos narrativos curtos a partir de prompts de texto ou imagens de referência, gerando diálogo sincronizado, efeitos sonoros, ambiência e visuais em um único fluxo. Ele suporta clipes de até 16 segundos em 540p, 720p ou 1080p. Criadores podem trabalhar no produto web Vidu, enquanto desenvolvedores podem chamar o modelo via CometAPI com o ID do modelo viduq3.
Este guia foca no processo criativo: planejar um plano, escolher texto-para-vídeo ou imagem-para-vídeo, dirigir movimento de câmera e áudio, gerar variações, revisar falhas e montar fluxos web ou de API repetíveis.
O que é o Vidu Q3?
Vidu Q3 é um modelo de vídeo de terceira geração da ShengShu Technology e Vidu. Ele é projetado para criação de vídeo orientada por histórias, e não apenas loops de movimento simples. O modelo pode gerar conjuntamente a sequência de imagens e áudio nativo, permitindo que diálogo, som ambiental, efeitos e sinais musicais sigam a temporização da cena.
O modelo é especialmente relevante para dramas curtos, adaptação de quadrinhos e mangá, publicidade narrativa, pré-visualização de filme, storytelling de produto e vídeo social. A Vidu destaca sincronização áudio-vídeo, saída multilíngue, cenas com vários falantes e controle detalhado de câmera e ritmo como capacidades centrais do Q3.
Vidu Q3 agora é uma família de modelos, em vez de uma única configuração de geração. Este guia foca principalmente na rota Q3 Pro exposta como viduq3 via CometAPI.
Especificações rápidas do Vidu Q3
Nota de origem: As especificações combinam a documentação da API do Vidu e a página do modelo na CometAPI**.
| Especificação | Detalhe do Vidu Q3 | Significado prático |
|---|---|---|
| Desenvolvedor | ShengShu Technology / Vidu | Modelo de vídeo comercial fechado |
| ID do modelo da API oficial | viduq3-pro | Usado nos fluxos diretos de texto, imagem e quadros |
| ID do modelo na CometAPI | viduq3 | Usado com a API unificada de vídeos da CometAPI |
| Modos de entrada | Texto, imagem, quadros inicial/final, referências | Os modos exatos dependem da superfície da API |
| Entradas atuais da CometAPI | Texto ou uma imagem de referência | Envio multipart de formulário para imagem-para-vídeo |
| Saída | Vídeo MP4 com áudio nativo sincronizado | Diálogo e efeitos sonoros podem ser gerados juntos |
| Duração | 1–16 segundos para texto, imagem e início/fim; 3–16 segundos para referência-para-vídeo | O padrão geralmente é 5 segundos |
| Resolução | 540p, 720p, 1080p | A CometAPI usa valores WxH exatos |
| Taxa de quadros | 24 FPS | Listado na página do modelo da CometAPI |
| Idiomas de saída | Inglês, japonês, chinês | Útil para diálogo localizado |
| Foco principal | Vídeo narrativo e orientado por personagem | Drama curto, anúncios, sequências em estilo cinematográfico |
Contexto breve de desempenho
Benchmarks públicos são úteis apenas como ponto de partida, porque a qualidade de vídeo depende fortemente do prompt, da imagem de referência, do design do plano e do padrão de revisão. No SuperCLUE-R2V, Vidu Q3 registra 70.89 versus 64.01 para Vidu Q2. O resultado sustenta as melhorias do Q3 em preservação de referência e continuidade do sujeito, mas criadores devem julgar o modelo com seus próprios personagens, produtos, linguagem de câmera e requisitos de áudio.
A criação importa mais do que um ranking Para trabalho prático, acompanhe o percentual de clipes que preservam identidade, seguem a ação pretendida, usam movimento de câmera aceitável, sincronizam diálogo e passam na revisão. O melhor fluxo é o que produz os planos mais utilizáveis, não a maior pontuação isolada.
Principais recursos do Vidu Q3
Geração nativa de áudio e vídeo
Vidu Q3 produz imagem e som em uma única passagem de geração. Um prompt pode solicitar diálogo falado, locução, ambiência ambiental, passos, impactos ou outros efeitos sonoros juntamente com a ação visual. Isso reduz a necessidade de construir uma trilha separada para cada rascunho e facilita avaliar a temporização durante a revisão criativa.
Há uma nuance importante de API. A documentação direta da Vidu expõe um controle audio para o Q3, mas a opção separada bgm não é efetiva para o Q3. Se a música for importante, descreva a deixa musical e a temporização no prompt. A solicitação atual unificada da Vidu na CometAPI expõe prompt, duração, tamanho e uma imagem de referência opcional, então a direção de áudio também deve ser escrita no prompt.
Até 16 segundos em uma única geração
Um teto de 16 segundos é tempo suficiente para um compasso narrativo curto completo: uma visão de estabelecimento, uma ação primária, uma linha de diálogo, um movimento de câmera e uma reação de fechamento. Ainda não é geração de longa duração. Anúncios, episódios ou videoclipes exigem um plano de shots, várias tarefas e montagem editorial.
Diálogo multilíngue e com múltiplos locutores
O produto é projetado para conversas com vários personagens e suporta saída em inglês, japonês e chinês. Isso o torna útil para drama curto localizado e campanhas sociais. Trate o suporte de idioma como uma capacidade, não como garantia de pronúncia perfeita, emoção ou sincronização labial em cada geração; revise cada saída antes da publicação.
Controle de câmera e ritmo
Q3 responde melhor quando um prompt descreve intenção de cinematografia em vez de apenas listar objetos. Especifique o tamanho do plano, sensação de lente, trajetória da câmera, iluminação, ordem de ações, ritmo, diálogo e sinais sonoros. Uma única instrução de câmera coerente geralmente produz uma taxa de acerto mais alta do que vários movimentos conflitantes no mesmo plano.
Consistência baseada em referência
O fluxo direto de referência-para-vídeo da Vidu aceita até sete sujeitos de imagem ou texto. Referências podem ancorar um personagem, produto, acessório ou estilo visual em diferentes posições de câmera.
- Texto-para-vídeo: gera cena, movimento, composição e som a partir de um prompt escrito.
- Imagem-para-vídeo: anima uma única imagem de entrada; o prompt deve focar em movimento, comportamento de câmera e áudio.
- Geração por quadros inicial/final: cria uma transição entre dois âncoras visuais na API direta da Vidu.
- Referência-para-vídeo: mantém sujeitos ou estilo consistentes ao longo de uma sequência gerada.
Como criar um vídeo com Vidu Q3 na web
O fluxo web é a maneira mais rápida de ir de uma ideia a um clipe revisado. Rótulos de interface podem mudar, mas a lógica criativa permanece: escolher o modo de entrada certo, preparar a âncora visual, escrever um plano dirigível, gerar variações e refinar apenas a dimensão que falhou.
Etapa 1: Defina o entregável
Decida onde o vídeo será usado, sua proporção de aspecto, duração-alvo, estilo visual, idioma falado e se a saída deve se conectar a outro plano. Um gancho social, plano de detalhe de produto, compasso de drama curto e plano de pré-visualização de filme precisam de ritmos diferentes.
Etapa 2: Escolha o modo de criação
Selecione Texto-para-vídeo quando a composição puder ser inventada a partir do prompt. Selecione Imagem-para-vídeo quando você já tiver o personagem, produto, arte ou enquadramento desejado. Use Referência-para-vídeo na superfície direta do Vidu quando identidade ou estilo precisarem ser ancorados por vários sujeitos.
Decisão de modo Use texto-para-vídeo para exploração. Use imagem-para-vídeo quando o primeiro quadro já contiver o design que você quer proteger. Use fluxos orientados por referência quando consistência importar mais do que surpresa visual.
Etapa 3: Prepare a imagem de referência
Para imagem-para-vídeo, comece com uma imagem nítida que já tenha as proporções corretas do sujeito, enquadramento, direção da luz e fundo. Deixe espaço visual na direção em que o sujeito ou a câmera devem se mover. Evite rostos minúsculos, mãos obstruídas, rótulos de produto ilegíveis, reflexos conflitantes e um corte que não deixe espaço para movimento.
Etapa 4: Selecione o Vidu Q3
Escolha o Q3 para planos pré-selecionados onde qualidade narrativa, continuidade de personagem, diálogo e som sincronizado importam. Use Q3 Turbo para exploração de menor custo e, em seguida, mova o prompt e a imagem de referência mais fortes para o Q3 para o render final.
Etapa 5: Escreva um prompt estruturado para o plano
Escreva o prompt na ordem em que a audiência vivencia o plano: sujeito e cenário, ação, câmera, look, diálogo, som, temporização de compassos e restrições. Dê ao modelo um movimento dominante de câmera e uma ação primária.
Estrutura de prompt reutilizável
Subject + environment + primary action + shot type + camera movement +lighting + visual style + dialogue + sound effects + timing + constraints
Etapa 6: Direcione diálogo e som
Coloque falas entre aspas, identifique quem fala, descreva a entrega e mantenha o diálogo curto o suficiente para o clipe. Separe ambiência de efeitos sonoros cronometrados. Por exemplo: Áudio: tom de sala silencioso ao longo de toda a duração; um clique cerâmico quando a xícara toca a mesa no quarto segundo; sem música.
Etapa 7: Defina duração e resolução
Comece com cinco segundos em 720p. Confirme composição, identidade, movimento e áudio antes de gastar mais em uma versão mais longa ou de maior resolução. Aumente a duração apenas quando o plano precisar de mais tempo para completar seus compassos; segundos extras não melhoram automaticamente o movimento.
Etapa 8: Gere variações
Gere vários candidatos a partir do mesmo prompt central antes de reescrever tudo. Variações revelam se um problema é aleatório ou estrutural. Se todas as saídas falham da mesma forma, mude o prompt ou a referência. Se apenas uma saída falhar, mantenha o prompt e selecione outro candidato.
Etapa 9: Revise e ajuste uma dimensão
Revise o clipe em passadas. Primeiro verifique identidade e integridade de objetos, depois ação e movimento de câmera, em seguida diálogo e temporização de áudio e, por fim, o quadro final. Altere apenas a dimensão que falhou para que uma boa composição não seja perdida ao corrigir uma deixa sonora.
- Falha de identidade: fortaleça a linguagem de preservação ou use uma imagem de referência mais limpa.
- Ação fraca: substitua verbos abstratos por um movimento visível e direção clara.
- Câmera caótica: remova movimentos concorrentes e especifique um único caminho com velocidade.
- Sincronização labial pobre: encurte o diálogo, reduza ação simultânea e declare quem fala e como entrega.
- Fundo instável: simplifique a cena e preserve explicitamente layout e iluminação.
Etapa 10: Baixe e arquive o clipe vencedor
Faça download apenas depois que a saída passar no padrão de publicação ou revisão do cliente. Salve o clipe final junto com seu prompt, imagem de entrada, variante de modelo, duração, resolução e notas de geração para que a receita criativa possa ser reutilizada.
Por que usar Vidu Q3 via CometAPI?
CometAPI é mais útil quando um produto precisa de acesso a vários provedores de IA sem manter uma camada separada de autenticação e gerenciamento de tarefas para cada um. A rota Vidu atual segue um fluxo assíncrono unificado: criar uma tarefa, receber um ID, consultar o job e baixar o MP4 concluído.
- Uma chave de API para Vidu e outras famílias de modelos.
- Um padrão de tarefa de vídeo para envio, recuperação de status e download.
- Teste A/B mais simples quando o mesmo aplicativo compara rotas Vidu, Kling, Veo, Seedance ou Wan.
- Gestão centralizada de uso para faturamento, monitoramento e revisão operacional.
- Menos código específico de provedor quando disponibilidade de modelo ou preço mudam.
Nota de preços CometAPI não é automaticamente mais barata do que a API direta da Vidu para todas as configurações do Q3. A proposta de valor é consistência operacional e escolha de modelos. Compare a rota exata, resolução, duração, modo de fila e política de cobrança antes da implantação.
Como usar Vidu Q3 com CometAPI
A implementação do Vidu na CometAPI usa POST /v1/videos com multipart/form-data. Os exemplos abaixo são do lado do servidor. Nunca exponha uma chave de produção em JavaScript de navegador, aplicativos móveis, repositórios públicos, capturas de tela ou logs do lado do cliente.
Etapa 1: Crie e armazene sua chave da CometAPI
Crie ou acesse sua conta CometAPI e gere uma chave de API. Armazene-a como uma variável de ambiente.
macOS ou Linux
export COMETAPI_KEY="your_cometapi_key"
Windows PowerShell
$env:COMETAPI_KEY="your_cometapi_key"
Etapa 2: Crie uma tarefa de texto para vídeo
A requisição mínima prática precisa de um ID de modelo e um prompt. Adicione duração e tamanho explicitamente para que a requisição seja reprodutível.
Requisição cURL de texto para vídeo
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=A cinematic medium shot of a young astronaut walking through pale blue fog. Slow dolly-in camera. Soft footsteps and distant mechanical ambience.' \ -F seconds=5 \ -F size=1280x720
O endpoint retorna imediatamente com um objeto de tarefa. Ele não espera a renderização terminar. Salve o id ou task_id retornado.
Etapa 3: Crie uma tarefa de imagem para vídeo
Para imagem-para-vídeo, envie uma imagem local via o campo multipart input_reference. Descreva como a imagem deve se mover, em vez de repetir cada detalhe visível.
Requisição cURL de imagem para vídeo
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=The character turns slowly toward the window as rain moves across the glass. Gentle handheld camera, quiet room tone, distant thunder.' \ -F seconds=6 \ -F size=1280x720 \ -F input_reference=@reference.png
Etapa 4: Leia a resposta da tarefa
Exemplo de resposta de tarefa aceita
{ "id": "task_example", "object": "video", "model": "viduq3", "status": "queued", "progress": 0 }
Trate o identificador de tarefa como uma string opaca. Normalize id e o alias de compatibilidade task_id uma vez, depois armazene o valor resultante com o modelo, prompt, duração, tamanho, timestamp da requisição e o registro do usuário ou job que iniciou o render.
Etapa 5: Consulte o status da tarefa
Chame GET /v1/videos/{task_id} até o status tornar-se completed, failed ou error. A documentação de recuperação da CometAPI inclui o mesmo padrão de estado terminal.
Loop de polling em Python com timeout
import os import time import requests task_id = "<TASK_ID>" headers = {"Authorization": f"Bearer {os.environ['COMETAPI_KEY']}"} terminal = {"completed", "failed", "error"} deadline = time.time() + 20 * 60 while time.time() < deadline: response = requests.get( f"https://api.cometapi.com/v1/videos/{task_id}", headers=headers, timeout=60, ) response.raise_for_status() task = response.json() print(task["status"], task.get("progress")) if task["status"] in terminal: if task["status"] != "completed": raise RuntimeError(task.get("error", task["status"])) break time.sleep(10) else: raise TimeoutError("Video generation did not finish in time")
Etapa 6: Baixe o vídeo concluído
Quando a tarefa estiver concluída, baixe o MP4 via o endpoint de conteúdo. Salve o ativo em armazenamento durável se o aplicativo precisar de retenção de longo prazo.
Baixe o MP4
curl "https://api.cometapi.com/v1/videos/$TASK_ID/content" \ -H "Authorization: Bearer $COMETAPI_KEY" \ -o vidu-q3-output.mp4
Etapa 7: Execute o fluxo completo em JavaScript
Exemplo de ponta a ponta em Node.js
import fs from "node:fs"; const form = new FormData(); form.append("model", "viduq3"); form.append("prompt", "A quiet product reveal with a slow orbit camera and soft mechanical sound design."); form.append("seconds", "5"); form.append("size", "1280x720"); const auth = { Authorization: `Bearer ${process.env.COMETAPI_KEY}` }; const created = await fetch("https://api.cometapi.com/v1/videos", { method: "POST", headers: auth, body: form, }).then((r) => r.json()); let task; do { await new Promise((resolve) => setTimeout(resolve, 10_000)); task = await fetch(`https://api.cometapi.com/v1/videos/${created.id}`, { headers: auth, }).then((r) => r.json()); } while (!["completed", "failed", "error"].includes(task.status)); if (task.status !== "completed") throw new Error(JSON.stringify(task.error)); const video = await fetch( `https://api.cometapi.com/v1/videos/${created.id}/content`, { headers: auth }, ); fs.writeFileSync("vidu-q3-output.mp4", Buffer.from(await video.arrayBuffer()));
Parâmetros da API do Vidu Q3
Nota de origem: Os nomes de campos e limites atuais seguem o endpoint Vidu na CometAPI**.
| Parâmetro | Tipo | Obrigatório | Recomendado | Finalidade |
|---|---|---|---|---|
| model | String | Sim | viduq3 | Seleciona o Vidu Q3 |
| prompt | String | Sim | Prompt de cena estruturado | Descreve visuais, movimento, diálogo e som |
| seconds | Integer | Não | Comece com 5 | Aceita de 1 a 16 |
| size | String | Não | 1280x720 | Usa valores WxH compatíveis |
| input_reference | File | Modo imagem | PNG/JPEG/WebP | Orienta a geração de imagem-para-vídeo |
Valores suportados de size na rota Vidu documentada:
-
960x528— nível 540p, 16:9. -
1280x720— nível 720p, 16:9. -
1920x1080— nível 1080p, 16:9.
Regra de compatibilidade Use apenas parâmetros documentados para a rota que você chama. Campos nativos do provedor como audio, callback_url, múltiplos sujeitos ou modo off-peak não devem ser assumidos como funcionais no endpoint unificado da CometAPI, a menos que a documentação da CometAPI os liste explicitamente.
Como escrever prompts melhores para o Vidu Q3?
Escreva cada prompt como um briefing compacto do plano. Mantenha os campos na ordem abaixo, para que o Vidu Q3 receba a base visual antes de movimento, direção de câmera, iluminação, fala, som e regras de preservação.
Subject → Environment → Action → Camera → Lighting → Dialogue → Audio → Constraints
Use um sujeito claro, uma ação primária e uma trajetória de câmera. Mantenha o diálogo curto, separe ambiência de sons de evento e use restrições para declarar o que deve permanecer inalterado. Para imagem-para-vídeo, trate a imagem de entrada como fonte visual da verdade e concentre o prompt em movimento, comportamento de câmera, áudio e preservação.
Exemplo de prompt cinematográfico
Subject: A tired detective in a dark trench coat.Environment: A rain-soaked alley beneath a flickering streetlight at night.Action: She stops, hears approaching footsteps, and slowly looks over her shoulder.Camera: Medium close-up with a gentle three-second dolly in and a 35mm lens feel.Lighting: Blue-magenta reflections, soft backlighting, shallow depth of field, and subtle film grain.Dialogue: In a restrained whisper, "You should not have come back."Audio: Steady rain ambience, one distant siren, and footsteps that stop after the line.Constraints: Preserve her face, coat, and alley layout; no subtitles, logos, extra people, or camera shake.
Exemplo de prompt de produto
Subject: A premium stainless-steel smartwatch with a clean blue display.Environment: The watch rests on black stone while a thin ribbon of water circles the base.Action: At second three, the display turns on and reveals a single blue pulse.Camera: Slow left-to-right orbit ending on a centered macro view of the watch face.Lighting: Crisp edge reflections, controlled highlights, and a dark luxury color grade.Dialogue: None.Audio: Soft water movement, one precise electronic chime, and a restrained low bass swell.Constraints: Preserve the watch geometry, materials, display layout, and logo placement; no hands, extra text, or deformation.
Exemplo de prompt de anime
Subject: A teenage girl holding a red umbrella in a hand-drawn anime style.Environment: A quiet rural train platform at sunset, with tall grass moving in a warm wind.Action: She looks down the empty track as a distant train light appears, then smiles slightly.Camera: Track slowly beside her and stop in a medium shot when the train light appears.Lighting: Warm sunset light, soft shadows, stable linework, and consistent character colors.Dialogue: She whispers in Japanese, "Yatto kaette kita."Audio: Summer insects, soft wind, and a distant railway bell after the dialogue.Constraints: Preserve the character design, facial features, umbrella color, and anime style; no on-screen text or extra characters.
Exemplo de prompt imagem-para-vídeo
Subject: Preserve the character's face, hairstyle, clothing, pose, and framing from the reference image.Environment: Keep the same room, furniture arrangement, background layout, and window position.Action: The character looks up from the book, smiles slightly, and turns toward the window while the curtain moves in a light breeze.Camera: Use a slow, stabilized push in with subtle natural movement.Lighting: Preserve the original light direction, exposure, skin tone, and room colors.Dialogue: None.Audio: Quiet room tone, soft page movement, light curtain rustle, and distant birds.Constraints: No identity changes, added accessories, hand distortion, sudden camera movement, background replacement, or new objects.
Crie um vídeo com múltiplos planos com Vidu Q3
Um anúncio completo, drama curto, trailer ou sequência musical geralmente precisa de vários clipes gerados. Trate o Vidu Q3 como um gerador de planos e use uma lista simples de planos para preservar continuidade ao longo da sequência.
| Plano | Objetivo | Âncora de continuidade |
|---|---|---|
| 1. Estabelecer | Plano amplo apresenta local e sujeito | Ambiente, figurino, hora do dia |
| 2. Aproximação | Plano médio inicia a ação principal | Direção de tela, posição do acessório, iluminação |
| 3. Ênfase | Close-up entrega diálogo ou detalhe de produto | Rosto ou geometria do produto, identidade sonora |
| 4. Resolução | Reação ou quadro final limpo completa o compasso | Pose final, gradação de cor, direção de transição |
Reutilize um cabeçalho de continuidade
Comece cada prompt de plano com o mesmo bloco conciso de identidade: aparência do personagem, figurino, design de produto, local, hora do dia e estilo visual. Depois, mude apenas ação, enquadramento, câmera e áudio específicos do plano.
Padrão reutilizável de prompt multi-plano
Continuity: the same woman in her early thirties, short black hair, dark green coat, silver pendant; rainy neon alley at night; blue-magenta reflections; restrained cinematic realism. Shot 3: medium close-up. She stops beneath the streetlight and looks over her shoulder. Slow dolly in. She whispers, "I heard you." Rain ambience continues; distant footsteps stop at second four.
Faça coincidir o fim de um plano com o início do próximo
- Mantenha a direção de tela consistente, a menos que a edição intencionalmente a reverta.
- Carregue o mesmo acessório na mesma mão ou posição.
- Combine figurino, clima, direção da luz e cor dominante.
- Termine em uma pose ou composição estável que possa se tornar a próxima imagem de referência.
- Use a mesma ambiência em planos adjacentes e adicione sons de evento apenas onde ações ocorrem.
Monte e finalize fora do gerador
Corte quadros de abertura ou fechamento fracos, organize os planos, normalize níveis de áudio, adicione títulos ou legendas em um editor e aplique finalização de cor e som após a geração. Texto em tela gerado por IA é menos confiável do que adicionar tipografia exata na pós-produção.
Quando escolher o Vidu Q3?
A comparação de modelos deve apoiar a decisão criativa, não dominá-la. A questão prática é qual fluxo de trabalho corresponde melhor ao plano que você precisa produzir.
| Dimensão | Vidu Q3 | Vidu Q3 Turbo | Seedance 2.5 | Kling 3.0 | Veo 3.1 |
|---|---|---|---|---|---|
| Duração | 1–16s; referência-para-vídeo oficial 3–16s | 1–16s; referência-para-vídeo oficial 3–16s | 4–30s | Até 15s, dependente do modo | 4s, 6s ou 8s por geração de API |
| Áudio | Áudio nativo sincronizado | Áudio nativo sincronizado | Geração nativa de áudio-vídeo | Disponível em modos de áudio nativo | Áudio nativo |
| Referência | Uma imagem na CometAPI; superfícies oficiais mais ricas | Uma imagem na CometAPI; superfícies oficiais mais ricas | Até 50 referências multimodais | Modos de texto-para-vídeo, imagem-para-vídeo e controle de movimento | Orientação por imagem e quadros inicial/final |
| API | CometAPI POST /v1/videos | CometAPI POST /v1/videos | CometAPI POST /v1/videos | Rotas compatíveis do Kling para text2video/image2video | CometAPI POST /v1/videos |
| Preço listado | A partir de $0.056/s | A partir de $0.028/s | A partir de $0.0824/s no estimador de rota | V3 720p: $0.336/5s sem áudio | $0.32/s em 720p ou 1080p |
| Melhor caso de uso | Planos narrativos curtos finais com diálogo e continuidade | Rascunhos, iteração de prompt e geração de maior volume | Storytelling multimodal mais longo e pesado em referências | Câmera, movimento e produção multi-plano controlados | Planos cinematográficos fotorrealistas e física realista |
Nota de origem: Superfícies de modelos e modos disponíveis podem mudar. O guia oficial do Kling documenta modos 720p/1080p e áudio nativo**; o Google descreve áudio nativo, controle de referência e fluxos de alta resolução do Veo 3.1**. Entradas de preço são instantâneos de rotas e não comparações de qualidade normalizadas; resolução, modo de áudio e nível de qualidade diferem, então verifique as páginas de modelos vinculadas antes da publicação.
Resultado prático de seleção
Escolha Vidu Q3 quando você precisar de um plano narrativo curto com continuidade de personagem ou produto, ritmo de câmera dirigível, diálogo, ambiência e efeitos sonoros em uma única geração. Use Q3 Turbo para explorar prompts e, em seguida, mova apenas a direção criativa mais forte para a rota premium. Considere outro modelo quando duração do clipe, um conjunto de referências maior, controle multi-plano especializado ou física fotorrealista forem mais importantes do que o fluxo narrativo do Q3.
Quanto custa o Vidu Q3?
Precificação precisa de uma comparação honesta de rota por rota. CometAPI cobra sua rota Vidu Q3 por segundo gerado. A API direta da Vidu também precifica por duração e resolução e oferece uma fila off-peak de menor custo com uma janela de conclusão muito mais longa.
| Resolução | CometAPI Vidu Q3 | API oficial da Vidu | Off-peak oficial |
|---|---|---|---|
| 540p | $0.056/s | $0.045/s | $0.025/s |
| 720p | $0.1232/s | $0.10/s | $0.05/s |
| 1080p | $0.1232/s | $0.12/s | $0.06/s |
Nota de origem: Preços por segundo listados na página do modelo na CometAPI e na documentação de preços da Vidu**. Verifique a cobrança ao vivo antes de publicação ou implantação voltada ao cliente.
Nas tarifas listadas, CometAPI não é a rota mais barata para todas as configurações do Q3. Sua vantagem é operacional: uma chave, um endpoint de vídeo consistente, gerenciamento centralizado de tarefas e troca mais fácil entre provedores. Uma equipe que só usa Vidu e pode esperar por processamento off-peak pode pagar menos pela API direta da Vidu.
Exemplos de custos de execução na CometAPI
| Duração | 540p | 720p | 1080p |
|---|---|---|---|
| 5 segundos | $0.28 | $0.616 | $0.616 |
| 10 segundos | $0.56 | $1.232 | $1.232 |
| 16 segundos | $0.896 | $1.9712 | $1.9712 |
Custo por clipe utilizável Uma taxa baixa por segundo ainda pode ser cara se a maioria das gerações for rejeitada. Acompanhe o gasto total dividido por saídas que passam na revisão criativa, não apenas o preço anunciado de um render.
Boas práticas de produção
Uma estratégia melhor de iteração criativa
- Comece pequeno. Use uma requisição de cinco segundos em 720p para validar composição, ação e movimento de câmera.
- Gere variações controladas. Mantenha o prompt central estável e varie apenas uma escolha criativa por vez.
- Diagnostique a dimensão que falhou. Separe problemas de identidade, movimento, câmera, áudio e continuidade antes de editar o prompt.
- Separe rotas de rascunho e finais. Use variantes mais rápidas para exploração e variantes premium apenas para prompts pré-selecionados.
- Salve a receita vencedora. Arquive o prompt final, referência, configurações, saída e notas de revisão para reutilização.
Checklist de revisão de vídeo no Vidu Q3
Revisar tudo de uma vez torna a edição do prompt difícil. Use passadas separadas para que cada rejeição leve a uma correção específica.
| Passo de revisão | Critério de aceitação | O que revisar se falhar |
|---|---|---|
| Sujeito | Rosto, corpo, figurino, geometria do produto, rótulos e acessórios permanecem consistentes | Prompt de preservação ou referência |
| Ação | O movimento primário está completo, legível e corretamente cronometrado | Verbo de ação, direção e ordem de compassos |
| Câmera | O movimento segue um caminho sem saltos, deriva ou re-enquadramentos indesejados | Tamanho do plano, trajetória, velocidade e ponto final |
| Ambiente | Layout do fundo, iluminação, clima e movimento secundário permanecem estáveis | Complexidade da cena e restrições de continuidade |
| Áudio | Diálogo, pronúncia, sincronização labial, ambiência e deixas sonoras se encaixam com a ação | Linha mais curta e cronograma de áudio claro |
| Quadro final | A composição final é limpa o suficiente para segurar, cortar ou semear o próximo plano | Pose final e ponto final da câmera |
Regra de aprovação Não aprove um clipe apenas porque um quadro parece impressionante. Assista-o em velocidade normal e, em seguida, inspecione o início, o pico da ação, o momento de diálogo e o quadro final. Um vídeo utilizável deve permanecer coerente ao longo do tempo.
Perguntas frequentes sobre Vidu Q3
Vidu Q3 pode gerar vídeo e áudio juntos?
Sim. Q3 é projetado para geração direta de áudio-vídeo, incluindo diálogo e efeitos sonoros. Descreva o áudio desejado e sua temporização dentro do prompt ao usar a rota unificada da CometAPI.
Qual é o ID do modelo do Vidu Q3 na CometAPI?
Use viduq3 com a Videos API atual da CometAPI. Não substitua o nome nativo do provedor viduq3-pro, a menos que a documentação da rota solicite explicitamente.
Qual é a duração máxima de um vídeo Vidu Q3?
Uma única geração do Q3 suporta de 1 a 16 segundos. Produções mais longas exigem vários planos e edição.
Vidu Q3 suporta geração imagem-para-vídeo?
Sim. Na CometAPI, envie uma imagem via input_reference e use o prompt para descrever movimento, comportamento de câmera, som e o que deve permanecer inalterado.
Vidu Q3 pode gerar diálogo em diferentes idiomas?
Vidu lista saída em inglês, japonês e chinês. Revise pronúncia, identidade da voz, emoção e sincronização labial antes de publicar conteúdo localizado.
Devo usar Vidu Q3 ou Vidu Q3 Turbo?
Use Q3 quando qualidade visual final, consistência narrativa e continuidade de personagem importarem mais do que velocidade de geração. Use Q3 Turbo para rascunhos, iteração de prompt e fluxos de maior volume.
CometAPI é mais barata do que a API oficial da Vidu?
Nem em toda configuração. Tarifas públicas atuais mostram que os modos normal e off-peak da Vidu direta podem ser mais baratos. Escolha CometAPI pelo acesso unificado, uma integração, gerenciamento centralizado de tarefas e troca mais fácil entre modelos de provedores—não por uma alegação não suportada de que toda rota custa menos.
Recomendação final
Vidu Q3 é uma opção forte para vídeos curtos e orientados por história que precisam de imagem, diálogo, ambiência e efeitos sonoros juntos. Seus pontos mais úteis em produção são geração de 16 segundos, consistência baseada em referência, narrativa com vários falantes, saída multilíngue e controle de câmera e ritmo no nível do prompt.
Para um primeiro teste, use uma requisição de cinco segundos em 720p com um sujeito, uma ação principal, um movimento de câmera e instruções claras de áudio. Faça iteração no prompt a baixo custo e só então aumente a resolução ou a duração depois que a composição funcionar. Use Q3 Turbo para exploração de rascunhos e Q3 padrão para renders finais pré-selecionados.
Para produção repetível, transforme cada resultado aprovado em uma receita criativa reutilizável: preserve o prompt final, imagem de referência, ID do modelo, duração, resolução, metadados da tarefa e notas de revisão. Construa vídeos multi-plano a partir de clipes individuais estáveis e, em seguida, adicione títulos, legendas, edição, cor e som finais na pós. CometAPI é mais valiosa quando esse fluxo também precisa de um padrão único de tarefa e roteamento fácil entre vários modelos de vídeo.
Comece a construir Abra a página do modelo Vidu Q3, crie uma chave da CometAPI, envie uma pequena tarefa de teste e valide o fluxo completo de criar → consultar → baixar
