Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
guide/Investigación de CometAPI

Cómo usar Vidu Q3 para crear videos

Aprende a usar Vidu Q3 para crear videos a partir de texto e imágenes, con prompts prácticos, controles de cámara, audio nativo, código de API y consejos de flujo de trabajo.

CometAPI
Mia MarenEquipo de investigación de modelos de IA y API
Actualizado Aug 29, 2026 25 min de lectura
Cómo usar Vidu Q3 para crear videos
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Responde primero Vidu Q3 puede crear videos narrativos cortos a partir de indicaciones de texto o imágenes de referencia mientras genera diálogo sincronizado, efectos de sonido, ambiente y visuales en un solo flujo de trabajo. Admite clips de hasta 16 segundos a 540p, 720p o 1080p. Los creadores pueden trabajar en el producto web de Vidu, mientras que los desarrolladores pueden llamar al modelo mediante CometAPI con el ID de modelo viduq3.

Esta guía se centra en el proceso creativo: planificar una toma, elegir texto a video o imagen a video, dirigir el movimiento de cámara y el audio, generar variaciones, revisar fallos y construir flujos de trabajo repetibles en la web o la API.

¿Qué es Vidu Q3?

Vidu Q3 es un modelo de video de tercera generación de ShengShu Technology y Vidu. Está diseñado para la creación de videos impulsados por la historia más que por bucles de movimiento simples. El modelo puede generar conjuntamente la secuencia de imágenes y audio nativo, permitiendo que el diálogo, el sonido ambiental, los efectos y las señales musicales sigan la sincronización de la escena.

El modelo es especialmente relevante para dramas cortos, adaptación de cómics y manga, publicidad narrativa, previsualización cinematográfica, storytelling de producto y video social. Vidu destaca la sincronización audio-video, salida multilingüe, escenas con múltiples hablantes y control detallado de cámara y ritmo como capacidades centrales de Q3.

Vidu Q3 ahora es una familia de modelos en lugar de una sola configuración de generación. Esta guía se centra principalmente en la ruta Q3 Pro expuesta como viduq3 a través de CometAPI.

Especificaciones rápidas de Vidu Q3

Nota de fuente: Las especificaciones combinan la documentación de la API de Vidu y la página del modelo de CometAPI.

EspecificaciónDetalle de Vidu Q3Significado práctico
DesarrolladorShengShu Technology / ViduModelo de video comercial y cerrado
ID de modelo de la API oficialviduq3-proSe usa en los flujos directos de texto, imagen y fotogramas de Vidu
ID de modelo en CometAPIviduq3Se usa con la Videos API unificada de CometAPI
Modos de entradaTexto, imagen, fotogramas inicial/final, referenciasLos modos exactos dependen de la superficie de la API
Entradas actuales en CometAPITexto o una imagen de referenciaCarga multipart para imagen a video
SalidaVideo MP4 con audio nativo sincronizadoEl diálogo y los efectos de sonido pueden generarse juntos
Duración1–16 segundos para texto, imagen y inicio/fin; 3–16 segundos para referencia a videoEl predeterminado suele ser 5 segundos
Resolución540p, 720p, 1080pCometAPI usa valores WxH exactos
Cuadro por segundo24 FPSListado en la página del modelo de CometAPI
Idiomas de salidainglés, japonés, chinoÚtil para diálogo localizado
Enfoque principalVideo narrativo y centrado en personajesDrama corto, anuncios, secuencias de estilo cine

Contexto breve de rendimiento

Los benchmarks públicos son útiles solo como punto de partida porque la calidad del video depende en gran medida de la indicación, la imagen de referencia, el diseño de la toma y el estándar de revisión. En SuperCLUE-R2V, Vidu Q3 registra 70.89 frente a 64.01 para Vidu Q2. El resultado respalda las mejoras de Q3 en preservación de referencia y continuidad del sujeto, pero los creadores deben juzgar el modelo con sus propios personajes, productos, lenguaje de cámara y requisitos de audio.

La creación importa más que una tabla de posiciones Para el trabajo práctico, rastrea el porcentaje de clips que preservan la identidad, siguen la acción prevista, usan un movimiento de cámara aceptable, sincronizan el diálogo y pasan la revisión. El mejor flujo de trabajo es el que produce las tomas más utilizables, no el puntaje aislado más alto.

Funciones clave de Vidu Q3

Generación nativa de audio y video

Vidu Q3 produce imagen y sonido en una sola pasada de generación. Una indicación puede solicitar diálogo hablado, narración, ambiente, pasos, impactos u otros efectos de sonido junto con la acción visual. Esto reduce la necesidad de construir una banda sonora separada para cada borrador y facilita evaluar la sincronización durante la revisión creativa.

Hay un matiz importante de API. La documentación directa de Vidu expone un control audio para Q3, pero el interruptor separado bgm no es efectivo para Q3. Si la música es importante, describe la señal musical y su sincronización en la indicación. La solicitud unificada actual de Vidu en CometAPI expone prompt, duración, tamaño y una imagen de referencia opcional, por lo que la dirección del audio también debe redactarse en la indicación.

Hasta 16 segundos en una sola generación

Un techo de 16 segundos es suficiente para un beat narrativo corto completo: una vista de establecimiento, una acción principal, una línea de diálogo, un movimiento de cámara y una reacción final. Aún no es generación de formato largo. Los anuncios, episodios o videos musicales requieren un plan de tomas, múltiples tareas y montaje editorial.

Diálogo multihablante y multilingüe

El producto está diseñado para conversaciones entre varios personajes y admite salida en inglés, japonés y chino. Eso lo hace útil para drama corto localizado y campañas sociales. Trata el soporte de idiomas como una capacidad, no como una garantía de pronunciación, emoción o sincronización labial perfecta en cada generación; revisa cada salida antes de su publicación.

Control de cámara y ritmo

Q3 responde mejor cuando una indicación describe la intención cinematográfica en lugar de solo enumerar objetos. Especifica el tamaño de la toma, la sensación del objetivo, la trayectoria de la cámara, la iluminación, el orden de las acciones, el ritmo, el diálogo y las señales de sonido. Una única instrucción de cámara coherente suele producir una tasa de acierto más alta que varios movimientos contradictorios en la misma toma.

Consistencia basada en referencias

El flujo de trabajo directo de referencia a video de Vidu acepta hasta siete sujetos de imagen o texto. Las referencias pueden anclar un personaje, producto, accesorio o estilo visual a través de posiciones de cámara.

  • Texto a video: genera la escena, el movimiento, la composición y el sonido a partir de una indicación escrita.
  • Imagen a video: anima una imagen de entrada única; la indicación debe centrarse en el movimiento, el comportamiento de la cámara y el audio.
  • Generación de fotograma inicial/final: crea una transición entre dos anclajes visuales en la API directa de Vidu.
  • Referencia a video: mantiene sujetos o estilo consistentes a lo largo de una secuencia generada.

Cómo crear un video con Vidu Q3 en la web

El flujo web es la forma más rápida de pasar de una idea a un clip revisado. Las etiquetas de la interfaz pueden cambiar, pero la lógica creativa sigue siendo la misma: elige el modo de entrada correcto, prepara el ancla visual, escribe una toma dirigible, genera variaciones y refina solo la dimensión fallida.

Paso 1: Define el entregable

Decide dónde se usará el video, su relación de aspecto, duración objetivo, estilo visual, idioma hablado y si la salida debe conectarse con otra toma. Un gancho social, una toma de detalle de producto, un beat de drama corto y una toma de previsualización cinematográfica requieren ritmos distintos.

Paso 2: Elige el modo de creación

Selecciona Texto a Video cuando la composición pueda inventarse a partir de la indicación. Selecciona Imagen a Video cuando ya tengas el personaje, producto, arte o encuadre deseado. Usa Referencia a Video en la superficie directa de Vidu cuando la identidad o el estilo deban anclarse con varios sujetos.

Decisión de modo Usa texto a video para exploración. Usa imagen a video cuando el primer fotograma ya contiene el diseño que quieres proteger. Usa flujos de trabajo impulsados por referencias cuando la consistencia sea más importante que la sorpresa visual.

Paso 3: Prepara la imagen de referencia

Para imagen a video, comienza con una imagen nítida que ya tenga las proporciones correctas del sujeto, encuadre, dirección de la iluminación y fondo. Deja espacio visual en la dirección hacia la cual el sujeto o la cámara deberían moverse. Evita rostros diminutos, manos obstruidas, etiquetas de producto ilegibles, reflejos contradictorios y un recorte que no deje espacio para el movimiento.

Paso 4: Selecciona Vidu Q3

Elige Q3 para tomas preseleccionadas donde la calidad narrativa, continuidad de personaje, diálogo y sonido sincronizado importan. Usa Q3 Turbo para exploración de menor costo y luego mueve la indicación y la imagen de referencia más sólidas a Q3 para el render final.

Paso 5: Escribe una indicación estructurada de toma

Escribe la indicación en el orden en que el público experimenta la toma: sujeto y entorno, acción, cámara, look, diálogo, sonido, sincronización de beats y restricciones. Dale al modelo un movimiento de cámara dominante y una acción principal.

Estructura de indicación reutilizable

Subject + environment + primary action + shot type + camera movement +lighting + visual style + dialogue + sound effects + timing + constraints

Paso 6: Dirige el diálogo y el sonido

Coloca las líneas habladas entre comillas, identifica al hablante, describe la interpretación y mantén el diálogo lo suficientemente corto para el clip. Separa el ambiente de los efectos de sonido con sincronización. Por ejemplo: Audio: tono de sala silencioso durante todo el clip; un clic cerámico cuando la taza toca la mesa en el segundo cuatro; sin música.

Paso 7: Establece duración y resolución

Comienza con cinco segundos a 720p. Confirma composición, identidad, movimiento y audio antes de gastar más en una versión más larga o de mayor resolución. Aumenta la duración solo cuando la toma necesite más tiempo para completar sus beats; los segundos extra no mejoran automáticamente el movimiento.

Paso 8: Genera variaciones

Genera varios candidatos a partir de la misma indicación central antes de reescribir todo. Las variaciones revelan si un problema es aleatorio o estructural. Si cada salida falla de la misma manera, cambia la indicación o la referencia. Si solo una salida falla, conserva la indicación y selecciona otro candidato.

Paso 9: Revisa y corrige una sola dimensión

Revisa el clip por pasadas. Primero verifica identidad e integridad de objetos, luego acción y movimiento de cámara, después diálogo y sincronización de audio y finalmente el fotograma final. Cambia solo la dimensión fallida para no perder una buena composición mientras corriges una señal de sonido.

  • Fallo de identidad: refuerza el lenguaje de preservación o usa una imagen de referencia más limpia.
  • Acción débil: reemplaza verbos abstractos por un movimiento visible con dirección clara.
  • Cámara caótica: elimina movimientos en competencia y especifica una sola trayectoria con velocidad.
  • Sincronización labial pobre: acorta el diálogo, reduce la acción simultánea y especifica hablante e interpretación.
  • Fondo inestable: simplifica la escena y preserva explícitamente distribución y iluminación.

Paso 10: Descarga y archiva el clip ganador

Descarga solo después de que la salida pase el estándar de publicación o revisión del cliente. Guarda el clip final junto con su indicación, imagen de entrada, variante de modelo, duración, resolución y notas de generación para que la receta creativa pueda reutilizarse.

¿Por qué usar Vidu Q3 a través de CometAPI?

CometAPI es más útil cuando un producto necesita acceso a varios proveedores de IA sin mantener una capa separada de autenticación y gestión de tareas para cada uno. La ruta actual de Vidu sigue un flujo de trabajo asincrónico unificado: crear una tarea, recibir un ID, consultar el trabajo y descargar el MP4 completado.

  • Una sola clave de API para Vidu y otras familias de modelos.
  • Un patrón único de tareas de video para envío, recuperación de estado y descarga.
  • Pruebas A/B más simples cuando la misma aplicación compara rutas de Vidu, Kling, Veo, Seedance o Wan.
  • Gestión centralizada del uso para facturación, monitoreo y revisión operativa.
  • Menos código específico del proveedor cuando la disponibilidad o el precio del modelo cambian.

Nota sobre precios CometAPI no es automáticamente más económico que la API directa de Vidu para todas las configuraciones de Q3. La propuesta de valor es la consistencia operativa y la elección de modelos. Compara la ruta exacta, resolución, duración, modo de cola y política de facturación antes del despliegue.

Cómo usar Vidu Q3 con CometAPI

La implementación de Vidu en CometAPI usa POST /v1/videos con multipart/form-data. Los ejemplos a continuación son del lado del servidor. Nunca expongas una clave de producción en JavaScript del navegador, aplicaciones móviles, repositorios públicos, capturas de pantalla o registros del lado del cliente.

Paso 1: Crea y almacena tu clave de CometAPI

Crea o inicia sesión en tu cuenta de CometAPI y luego genera una clave de API. Guárdala como una variable de entorno.

macOS o Linux

export COMETAPI_KEY="your_cometapi_key"

Windows PowerShell

$env:COMETAPI_KEY="your_cometapi_key"

Paso 2: Crea una tarea de texto a video

La solicitud mínima práctica necesita un ID de modelo y una indicación. Añade duración y tamaño explícitamente para que la solicitud sea reproducible.

Solicitud de cURL para texto a video

curl https://api.cometapi.com/v1/videos \  -H "Authorization: Bearer $COMETAPI_KEY" \  -F model=viduq3 \  -F 'prompt=A cinematic medium shot of a young astronaut walking through pale blue fog. Slow dolly-in camera. Soft footsteps and distant mechanical ambience.' \  -F seconds=5 \  -F size=1280x720

El endpoint devuelve de inmediato un objeto de tarea. No espera a que termine el render. Guarda el id o task_id devuelto.

Paso 3: Crea una tarea de imagen a video

Para imagen a video, sube una imagen local mediante el campo multipart input_reference. Describe cómo debería moverse la imagen en lugar de repetir cada detalle visible.

Solicitud de cURL para imagen a video

curl https://api.cometapi.com/v1/videos \  -H "Authorization: Bearer $COMETAPI_KEY" \  -F model=viduq3 \  -F 'prompt=The character turns slowly toward the window as rain moves across the glass. Gentle handheld camera, quiet room tone, distant thunder.' \  -F seconds=6 \  -F size=1280x720 \  -F input_reference=@reference.png

Paso 4: Lee la respuesta de la tarea

Respuesta de tarea aceptada (ejemplo)

{  "id": "task_example",  "object": "video",  "model": "viduq3",  "status": "queued",  "progress": 0 }

Trata el identificador de tarea como una cadena opaca. Normaliza id y el alias de compatibilidad task_id una vez, luego almacena el valor resultante con el modelo, la indicación, duración, tamaño, marca de tiempo de la solicitud y el usuario o registro de trabajo que inició el render.

Paso 5: Consulta el estado de la tarea

Llama a GET /v1/videos/{task_id} hasta que el estado sea completed, failed o error. La documentación de recuperación de CometAPI incluye el mismo patrón de estado terminal.

Bucle de sondeo en Python con tiempo límite

import os import time import requests​ task_id = "<TASK_ID>" headers = {"Authorization": f"Bearer {os.environ['COMETAPI_KEY']}"} terminal = {"completed", "failed", "error"} deadline = time.time() + 20 * 60​ while time.time() < deadline:    response = requests.get(        f"https://api.cometapi.com/v1/videos/{task_id}",        headers=headers,        timeout=60,    )    response.raise_for_status()    task = response.json()    print(task["status"], task.get("progress"))​    if task["status"] in terminal:        if task["status"] != "completed":            raise RuntimeError(task.get("error", task["status"]))        break    time.sleep(10) else:    raise TimeoutError("Video generation did not finish in time")

Paso 6: Descarga el video completado

Cuando la tarea se complete, descarga el MP4 mediante el endpoint de contenido. Guarda el recurso en almacenamiento duradero si la aplicación necesita retención a largo plazo.

Descargar el MP4

curl "https://api.cometapi.com/v1/videos/$TASK_ID/content" \  -H "Authorization: Bearer $COMETAPI_KEY" \  -o vidu-q3-output.mp4

Paso 7: Ejecuta el flujo completo en JavaScript

Ejemplo de extremo a extremo en Node.js

import fs from "node:fs";​ const form = new FormData(); form.append("model", "viduq3"); form.append("prompt", "A quiet product reveal with a slow orbit camera and soft mechanical sound design."); form.append("seconds", "5"); form.append("size", "1280x720");​ const auth = { Authorization: `Bearer ${process.env.COMETAPI_KEY}` }; const created = await fetch("https://api.cometapi.com/v1/videos", {  method: "POST", headers: auth, body: form, }).then((r) => r.json());​ let task; do {  await new Promise((resolve) => setTimeout(resolve, 10_000));  task = await fetch(`https://api.cometapi.com/v1/videos/${created.id}`, {    headers: auth,  }).then((r) => r.json()); } while (!["completed", "failed", "error"].includes(task.status));​ if (task.status !== "completed") throw new Error(JSON.stringify(task.error)); const video = await fetch(  `https://api.cometapi.com/v1/videos/${created.id}/content`,  { headers: auth }, ); fs.writeFileSync("vidu-q3-output.mp4", Buffer.from(await video.arrayBuffer()));

Parámetros de la API de Vidu Q3

Nota de fuente: Los nombres de campos y límites actuales siguen el endpoint de Vidu en CometAPI.

ParámetroTipoObligatorioRecomendadoPropósito
modelStringviduq3Selecciona Vidu Q3
promptStringIndicación de escena estructuradaDescribe visuales, movimiento, diálogo y sonido
secondsIntegerNoComienza con 5Acepta de 1 a 16
sizeStringNo1280x720Usa valores WxH compatibles
input_referenceFileModo imagenPNG/JPEG/WebPGuía la generación de imagen a video

Los valores de tamaño compatibles en la ruta documentada de Vidu son:

  • 960x528 — nivel 540p, 16:9.
  • 1280x720 — nivel 720p, 16:9.
  • 1920x1080 — nivel 1080p, 16:9.

Regla de compatibilidad Usa solo los parámetros documentados para la ruta que llamas. No debe asumirse que campos nativos del proveedor como audio, callback_url, múltiples sujetos o modo off-peak funcionen en el endpoint unificado de CometAPI a menos que la documentación de CometAPI los liste explícitamente.

¿Cómo escribir mejores indicaciones para Vidu Q3?

Escribe cada indicación como un briefing compacto de toma. Mantén los campos en el orden siguiente, para que Vidu Q3 reciba la base visual antes del movimiento, la dirección de la cámara, la iluminación, el habla, el sonido y las reglas de preservación.

Subject   → Environment → Action → Camera → Lighting → Dialogue → Audio → Constraints

Usa un sujeto claro, una acción principal y una trayectoria de cámara. Mantén el diálogo corto, separa el ambiente de los sonidos de evento y usa restricciones para indicar lo que debe permanecer sin cambios. Para imagen a video, trata la imagen de entrada como la fuente de verdad visual y enfoca la indicación en movimiento, comportamiento de cámara, audio y preservación.

Ejemplo de indicación cinematográfica

Subject: A tired detective in a dark trench coat.Environment: A rain-soaked alley beneath a flickering streetlight at night.Action: She stops, hears approaching footsteps, and slowly looks over her shoulder.Camera: Medium close-up with a gentle three-second dolly in and a 35mm lens feel.Lighting: Blue-magenta reflections, soft backlighting, shallow depth of field, and subtle film grain.Dialogue: In a restrained whisper, "You should not have come back."Audio: Steady rain ambience, one distant siren, and footsteps that stop after the line.Constraints: Preserve her face, coat, and alley layout; no subtitles, logos, extra people, or camera shake.

Ejemplo de indicación de producto

Subject: A premium stainless-steel smartwatch with a clean blue display.Environment: The watch rests on black stone while a thin ribbon of water circles the base.Action: At second three, the display turns on and reveals a single blue pulse.Camera: Slow left-to-right orbit ending on a centered macro view of the watch face.Lighting: Crisp edge reflections, controlled highlights, and a dark luxury color grade.Dialogue: None.Audio: Soft water movement, one precise electronic chime, and a restrained low bass swell.Constraints: Preserve the watch geometry, materials, display layout, and logo placement; no hands, extra text, or deformation.

Ejemplo de indicación de anime

Subject: A teenage girl holding a red umbrella in a hand-drawn anime style.Environment: A quiet rural train platform at sunset, with tall grass moving in a warm wind.Action: She looks down the empty track as a distant train light appears, then smiles slightly.Camera: Track slowly beside her and stop in a medium shot when the train light appears.Lighting: Warm sunset light, soft shadows, stable linework, and consistent character colors.Dialogue: She whispers in Japanese, "Yatto kaette kita."Audio: Summer insects, soft wind, and a distant railway bell after the dialogue.Constraints: Preserve the character design, facial features, umbrella color, and anime style; no on-screen text or extra characters.

Ejemplo de indicación de imagen a video

Subject: Preserve the character's face, hairstyle, clothing, pose, and framing from the reference image.Environment: Keep the same room, furniture arrangement, background layout, and window position.Action: The character looks up from the book, smiles slightly, and turns toward the window while the curtain moves in a light breeze.Camera: Use a slow, stabilized push in with subtle natural movement.Lighting: Preserve the original light direction, exposure, skin tone, and room colors.Dialogue: None.Audio: Quiet room tone, soft page movement, light curtain rustle, and distant birds.Constraints: No identity changes, added accessories, hand distortion, sudden camera movement, background replacement, or new objects.

Crea un video multitiro con Vidu Q3

Un anuncio completo, drama corto, tráiler o secuencia musical suele requerir varios clips generados. Trata Vidu Q3 como un generador de tomas y usa una lista simple de tomas para preservar la continuidad a lo largo de la secuencia.

TomaPropósitoAncla de continuidad
1. EstablecerLa toma abierta introduce ubicación y sujetoEntorno, vestuario, hora del día
2. AcercamientoLa toma media inicia la acción principalDirección en pantalla, posición de accesorio, iluminación
3. ÉnfasisPrimer plano entrega diálogo o detalle de productoGeometría del rostro o producto, identidad de audio
4. ResoluciónReacción o fotograma final limpio completa el beatPose final, gradación de color, dirección de transición

Reutiliza un encabezado de continuidad

Comienza cada indicación de toma con el mismo bloque conciso de identidad: apariencia del personaje, vestuario, diseño de producto, ubicación, hora del día y estilo visual. Luego cambia solo la acción específica de la toma, el encuadre, la cámara y el audio.

Patrón reutilizable de indicación multitiro

Continuity: the same woman in her early thirties, short black hair, dark green coat, silver pendant; rainy neon alley at night; blue-magenta reflections; restrained cinematic realism. Shot 3: medium close-up. She stops beneath the streetlight and looks over her shoulder. Slow dolly in. She whispers, "I heard you." Rain ambience continues; distant footsteps stop at second four.

Haz coincidir el final de una toma con el inicio de la siguiente

  • Mantén la dirección en pantalla consistente a menos que el corte la invierta intencionalmente.
  • Lleva el mismo accesorio en la misma mano o posición.
  • Iguala vestuario, clima, dirección de la luz y color dominante.
  • Termina en una pose o composición estable que pueda convertirse en la próxima imagen de referencia.
  • Usa el mismo ambiente entre tomas adyacentes y añade sonidos de evento solo donde ocurren acciones.

Ensambla y finaliza fuera del generador

Recorta fotogramas de apertura o cierre débiles, ordena las tomas, normaliza niveles de audio, añade títulos o subtítulos en un editor y aplica acabado final de color y sonido después de la generación. El texto en pantalla generado por IA es menos fiable que añadir tipografía exacta durante la postproducción.

¿Cuándo deberías elegir Vidu Q3?

La comparación de modelos debe apoyar la decisión creativa, no dominarla. La pregunta práctica es qué flujo de trabajo se ajusta mejor a la toma que necesitas producir.

DimensiónVidu Q3Vidu Q3 TurboSeedance 2.5Kling 3.0Veo 3.1
Duración1–16s; referencia oficial a video 3–16s1–16s; referencia oficial a video 3–16s4–30sHasta 15s, según modo4s, 6s u 8s por generación de API
AudioAudio nativo sincronizadoAudio nativo sincronizadoGeneración nativa de audio y videoDisponible en modos de audio nativoAudio nativo
ReferenciaUna imagen en CometAPI; superficies oficiales más ricasUna imagen en CometAPI; superficies oficiales más ricasHasta 50 referencias multimodalesModos de texto a video, imagen a video y control de movimientoImagen y guía de primer/último fotograma
APICometAPI POST /v1/videosCometAPI POST /v1/videosCometAPI POST /v1/videosRutas compatibles con Kling de text2video/image2videoCometAPI POST /v1/videos
Precio listadoDesde $0.056/sDesde $0.028/sDesde $0.0824/s en el estimador de rutaV3 720p: $0.336/5s sin audio$0.32/s a 720p o 1080p
Mejor caso de usoTomas narrativas cortas finales con diálogo y continuidadBorradores, iteración de indicaciones y generación de mayor volumenStorytelling más largo y con muchas referenciasCámara, movimiento y producción multitiro controladosTomas cinematográficas fotorrealistas y física realista

Nota de fuente: Las superficies de modelos y modos disponibles pueden cambiar. La guía oficial de Kling documenta modos 720p/1080p y audio nativo; Google describe los flujos de trabajo de audio nativo, control de referencia y alta resolución de Veo 3.1. Las entradas de precio son instantáneas de ruta más que comparaciones de calidad normalizadas; resolución, modo de audio y nivel de calidad difieren, así que verifica las páginas de modelo vinculadas antes de la publicación.

Resultado práctico de selección

Elige Vidu Q3 cuando necesites una toma narrativa corta con continuidad de personaje o producto, ritmo de cámara dirigible, diálogo, ambiente y efectos de sonido en una sola generación. Usa Q3 Turbo para explorar indicaciones y luego mueve solo la dirección creativa más sólida a la ruta premium. Considera otro modelo cuando la duración del clip, una pila de referencias mayor, control multitiro especializado o física fotorrealista sea más importante que el flujo narrativo de Q3.

¿Cuánto cuesta Vidu Q3?

La fijación de precios requiere una comparación honesta ruta por ruta. CometAPI factura su ruta Vidu Q3 por segundo generado. La API directa de Vidu también tarifica por duración y resolución y ofrece una cola de menor costo fuera de pico con una ventana de finalización mucho más larga.

ResoluciónVidu Q3 en CometAPIAPI oficial de ViduModo oficial off-peak
540p$0.056/s$0.045/s$0.025/s
720p$0.1232/s$0.10/s$0.05/s
1080p$0.1232/s$0.12/s$0.06/s

Nota de fuente: Precios por segundo listados en la página del modelo de CometAPI y la documentación de precios de Vidu. Verifica la facturación en vivo antes de publicaciones frente a clientes o despliegues.

A estas tarifas listadas, CometAPI no es la ruta más barata para todas las configuraciones de Q3. Su ventaja es operativa: una sola clave, un endpoint de video consistente, manejo centralizado de tareas y conmutación más fácil entre proveedores. Un equipo que solo usa Vidu y puede esperar el procesamiento off-peak puede pagar menos mediante la API directa de Vidu.

Ejemplos de costos de ejecución en CometAPI

Duración540p720p1080p
5 segundos$0.28$0.616$0.616
10 segundos$0.56$1.232$1.232
16 segundos$0.896$1.9712$1.9712

Costo por clip utilizable Una tarifa baja por segundo aún puede ser costosa si la mayoría de las generaciones se rechazan. Rastrea el gasto total dividido entre las salidas que pasan la revisión creativa, no solo el precio anunciado de un render.

Mejores prácticas de producción

Una mejor estrategia de iteración creativa

  • Comienza pequeño. Usa una solicitud de cinco segundos a 720p para validar composición, acción y movimiento de cámara.
  • Genera variaciones controladas. Mantén estable la indicación central y varía solo una elección creativa a la vez.
  • Diagnostica la dimensión fallida. Separa problemas de identidad, movimiento, cámara, audio y continuidad antes de editar la indicación.
  • Separa rutas de borrador y final. Usa variantes más rápidas para exploración y variantes premium solo para indicaciones preseleccionadas.
  • Guarda la receta ganadora. Archiva la indicación final, referencia, ajustes, salida y notas de revisión para reutilización.

Lista de verificación de revisión de video de Vidu Q3

Revisar todo a la vez dificulta la edición de la indicación. Usa pasadas separadas para que cada rechazo lleve a una corrección específica.

Paso de revisiónCriterio de aceptaciónQué revisar si falla
SujetoRostro, cuerpo, vestuario, geometría del producto, etiquetas y accesorios permanecen consistentesIndicación de preservación o referencia
AcciónEl movimiento principal está completo, legible y correctamente sincronizadoVerbo de acción, dirección y orden de beats
CámaraEl movimiento sigue una trayectoria sin saltos, deriva ni reencuadres indeseadosTamaño de toma, trayectoria, velocidad y punto final
EntornoDistribución del fondo, iluminación, clima y movimiento secundario permanecen establesComplejidad de escena y restricciones de continuidad
AudioDiálogo, pronunciación, sincronización labial, ambiente y señales de sonido se ajustan a la acciónLínea más corta y cronograma de audio más claro
Fotograma finalLa composición final es lo bastante limpia para sostener, cortar o sembrar la siguiente tomaPose final y punto final de cámara

Regla de aprobación No apruebes un clip solo porque un fotograma luzca impresionante. Míralo a velocidad normal, luego inspecciona el inicio, el pico de acción, el momento de diálogo y el fotograma final. Un video utilizable debe permanecer coherente en el tiempo.

Preguntas frecuentes sobre Vidu Q3

¿Puede Vidu Q3 generar video y audio juntos?

Sí. Q3 está diseñado para generación directa de audio y video, incluyendo diálogo y efectos de sonido. Describe el audio deseado y su sincronización dentro de la indicación cuando uses la ruta unificada de CometAPI.

¿Cuál es el ID de modelo de Vidu Q3 en CometAPI?

Usa viduq3 con la Videos API actual de CometAPI. No sustituyas el nombre nativo del proveedor viduq3-pro a menos que la documentación de la ruta lo solicite explícitamente.

¿Cuánto puede durar un video de Vidu Q3?

Una sola generación de Q3 admite de 1 a 16 segundos. Producciones más largas requieren múltiples tomas y edición.

¿Vidu Q3 admite generación de imagen a video?

Sí. En CometAPI, sube una imagen mediante input_reference y usa la indicación para describir movimiento, comportamiento de cámara, sonido y lo que debe permanecer sin cambios.

¿Puede Vidu Q3 generar diálogo en diferentes idiomas?

Vidu lista salida en inglés, japonés y chino. Revisa pronunciación, identidad de voz, emoción y sincronización labial antes de publicar contenido localizado.

¿Debo usar Vidu Q3 o Vidu Q3 Turbo?

Usa Q3 cuando la calidad visual final, consistencia narrativa y continuidad de personaje importen más que la velocidad de generación. Usa Q3 Turbo para borradores, iteración de indicaciones y flujos de trabajo de mayor volumen.

¿CometAPI es más barato que la API oficial de Vidu?

No en todas las configuraciones. Las tarifas públicas actuales muestran que los modos normal y off-peak directos de Vidu pueden ser más económicos. Elige CometAPI por acceso unificado, una sola integración, manejo centralizado de tareas y conmutación más fácil entre modelos de proveedores, no por una afirmación no respaldada de que cada ruta cuesta menos.

Recomendación final

Vidu Q3 es una opción sólida para videos cortos impulsados por la historia que necesitan que imagen, diálogo, ambiente y efectos de sonido se entreguen juntos. Sus fortalezas de producción más útiles son generación de hasta 16 segundos, consistencia basada en referencia, narración multihablante, salida multilingüe y control a nivel de indicación sobre cámara y ritmo.

Para una primera prueba, usa una solicitud de cinco segundos a 720p con un sujeto, una acción principal, un movimiento de cámara y instrucciones de audio claras. Itera la indicación con bajo costo, luego aumenta la resolución o duración solo después de que la composición funcione. Usa Q3 Turbo para exploración de borradores y Q3 estándar para renders finales preseleccionados.

Para una producción repetible, convierte cada resultado aprobado en una receta creativa reutilizable: preserva la indicación final, imagen de referencia, ID de modelo, duración, resolución, metadatos de tarea y notas de revisión. Construye videos multitiro a partir de clips individuales estables y luego añade títulos, subtítulos, edición, color y sonido finales en postproducción. CometAPI es más valioso cuando este flujo de trabajo también necesita un patrón único de tareas y enrutamiento sencillo entre varios modelos de video.

Empieza a crear Abre la página del modelo Vidu Q3, crea una clave de CometAPI, envía una tarea de prueba pequeña y valida el flujo completo de crear → consultar → descargar.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Aug 27, 2026
Última actualización Aug 29, 2026
2 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más