Responde primero Vidu Q3 puede crear videos narrativos cortos a partir de indicaciones de texto o imágenes de referencia mientras genera diálogo sincronizado, efectos de sonido, ambiente y visuales en un solo flujo de trabajo. Admite clips de hasta 16 segundos a 540p, 720p o 1080p. Los creadores pueden trabajar en el producto web de Vidu, mientras que los desarrolladores pueden llamar al modelo mediante CometAPI con el ID de modelo viduq3.
Esta guía se centra en el proceso creativo: planificar una toma, elegir texto a video o imagen a video, dirigir el movimiento de cámara y el audio, generar variaciones, revisar fallos y construir flujos de trabajo repetibles en la web o la API.
¿Qué es Vidu Q3?
Vidu Q3 es un modelo de video de tercera generación de ShengShu Technology y Vidu. Está diseñado para la creación de videos impulsados por la historia más que por bucles de movimiento simples. El modelo puede generar conjuntamente la secuencia de imágenes y audio nativo, permitiendo que el diálogo, el sonido ambiental, los efectos y las señales musicales sigan la sincronización de la escena.
El modelo es especialmente relevante para dramas cortos, adaptación de cómics y manga, publicidad narrativa, previsualización cinematográfica, storytelling de producto y video social. Vidu destaca la sincronización audio-video, salida multilingüe, escenas con múltiples hablantes y control detallado de cámara y ritmo como capacidades centrales de Q3.
Vidu Q3 ahora es una familia de modelos en lugar de una sola configuración de generación. Esta guía se centra principalmente en la ruta Q3 Pro expuesta como viduq3 a través de CometAPI.
Especificaciones rápidas de Vidu Q3
Nota de fuente: Las especificaciones combinan la documentación de la API de Vidu y la página del modelo de CometAPI.
| Especificación | Detalle de Vidu Q3 | Significado práctico |
|---|---|---|
| Desarrollador | ShengShu Technology / Vidu | Modelo de video comercial y cerrado |
| ID de modelo de la API oficial | viduq3-pro | Se usa en los flujos directos de texto, imagen y fotogramas de Vidu |
| ID de modelo en CometAPI | viduq3 | Se usa con la Videos API unificada de CometAPI |
| Modos de entrada | Texto, imagen, fotogramas inicial/final, referencias | Los modos exactos dependen de la superficie de la API |
| Entradas actuales en CometAPI | Texto o una imagen de referencia | Carga multipart para imagen a video |
| Salida | Video MP4 con audio nativo sincronizado | El diálogo y los efectos de sonido pueden generarse juntos |
| Duración | 1–16 segundos para texto, imagen y inicio/fin; 3–16 segundos para referencia a video | El predeterminado suele ser 5 segundos |
| Resolución | 540p, 720p, 1080p | CometAPI usa valores WxH exactos |
| Cuadro por segundo | 24 FPS | Listado en la página del modelo de CometAPI |
| Idiomas de salida | inglés, japonés, chino | Útil para diálogo localizado |
| Enfoque principal | Video narrativo y centrado en personajes | Drama corto, anuncios, secuencias de estilo cine |
Contexto breve de rendimiento
Los benchmarks públicos son útiles solo como punto de partida porque la calidad del video depende en gran medida de la indicación, la imagen de referencia, el diseño de la toma y el estándar de revisión. En SuperCLUE-R2V, Vidu Q3 registra 70.89 frente a 64.01 para Vidu Q2. El resultado respalda las mejoras de Q3 en preservación de referencia y continuidad del sujeto, pero los creadores deben juzgar el modelo con sus propios personajes, productos, lenguaje de cámara y requisitos de audio.
La creación importa más que una tabla de posiciones Para el trabajo práctico, rastrea el porcentaje de clips que preservan la identidad, siguen la acción prevista, usan un movimiento de cámara aceptable, sincronizan el diálogo y pasan la revisión. El mejor flujo de trabajo es el que produce las tomas más utilizables, no el puntaje aislado más alto.
Funciones clave de Vidu Q3
Generación nativa de audio y video
Vidu Q3 produce imagen y sonido en una sola pasada de generación. Una indicación puede solicitar diálogo hablado, narración, ambiente, pasos, impactos u otros efectos de sonido junto con la acción visual. Esto reduce la necesidad de construir una banda sonora separada para cada borrador y facilita evaluar la sincronización durante la revisión creativa.
Hay un matiz importante de API. La documentación directa de Vidu expone un control audio para Q3, pero el interruptor separado bgm no es efectivo para Q3. Si la música es importante, describe la señal musical y su sincronización en la indicación. La solicitud unificada actual de Vidu en CometAPI expone prompt, duración, tamaño y una imagen de referencia opcional, por lo que la dirección del audio también debe redactarse en la indicación.
Hasta 16 segundos en una sola generación
Un techo de 16 segundos es suficiente para un beat narrativo corto completo: una vista de establecimiento, una acción principal, una línea de diálogo, un movimiento de cámara y una reacción final. Aún no es generación de formato largo. Los anuncios, episodios o videos musicales requieren un plan de tomas, múltiples tareas y montaje editorial.
Diálogo multihablante y multilingüe
El producto está diseñado para conversaciones entre varios personajes y admite salida en inglés, japonés y chino. Eso lo hace útil para drama corto localizado y campañas sociales. Trata el soporte de idiomas como una capacidad, no como una garantía de pronunciación, emoción o sincronización labial perfecta en cada generación; revisa cada salida antes de su publicación.
Control de cámara y ritmo
Q3 responde mejor cuando una indicación describe la intención cinematográfica en lugar de solo enumerar objetos. Especifica el tamaño de la toma, la sensación del objetivo, la trayectoria de la cámara, la iluminación, el orden de las acciones, el ritmo, el diálogo y las señales de sonido. Una única instrucción de cámara coherente suele producir una tasa de acierto más alta que varios movimientos contradictorios en la misma toma.
Consistencia basada en referencias
El flujo de trabajo directo de referencia a video de Vidu acepta hasta siete sujetos de imagen o texto. Las referencias pueden anclar un personaje, producto, accesorio o estilo visual a través de posiciones de cámara.
- Texto a video: genera la escena, el movimiento, la composición y el sonido a partir de una indicación escrita.
- Imagen a video: anima una imagen de entrada única; la indicación debe centrarse en el movimiento, el comportamiento de la cámara y el audio.
- Generación de fotograma inicial/final: crea una transición entre dos anclajes visuales en la API directa de Vidu.
- Referencia a video: mantiene sujetos o estilo consistentes a lo largo de una secuencia generada.
Cómo crear un video con Vidu Q3 en la web
El flujo web es la forma más rápida de pasar de una idea a un clip revisado. Las etiquetas de la interfaz pueden cambiar, pero la lógica creativa sigue siendo la misma: elige el modo de entrada correcto, prepara el ancla visual, escribe una toma dirigible, genera variaciones y refina solo la dimensión fallida.
Paso 1: Define el entregable
Decide dónde se usará el video, su relación de aspecto, duración objetivo, estilo visual, idioma hablado y si la salida debe conectarse con otra toma. Un gancho social, una toma de detalle de producto, un beat de drama corto y una toma de previsualización cinematográfica requieren ritmos distintos.
Paso 2: Elige el modo de creación
Selecciona Texto a Video cuando la composición pueda inventarse a partir de la indicación. Selecciona Imagen a Video cuando ya tengas el personaje, producto, arte o encuadre deseado. Usa Referencia a Video en la superficie directa de Vidu cuando la identidad o el estilo deban anclarse con varios sujetos.
Decisión de modo Usa texto a video para exploración. Usa imagen a video cuando el primer fotograma ya contiene el diseño que quieres proteger. Usa flujos de trabajo impulsados por referencias cuando la consistencia sea más importante que la sorpresa visual.
Paso 3: Prepara la imagen de referencia
Para imagen a video, comienza con una imagen nítida que ya tenga las proporciones correctas del sujeto, encuadre, dirección de la iluminación y fondo. Deja espacio visual en la dirección hacia la cual el sujeto o la cámara deberían moverse. Evita rostros diminutos, manos obstruidas, etiquetas de producto ilegibles, reflejos contradictorios y un recorte que no deje espacio para el movimiento.
Paso 4: Selecciona Vidu Q3
Elige Q3 para tomas preseleccionadas donde la calidad narrativa, continuidad de personaje, diálogo y sonido sincronizado importan. Usa Q3 Turbo para exploración de menor costo y luego mueve la indicación y la imagen de referencia más sólidas a Q3 para el render final.
Paso 5: Escribe una indicación estructurada de toma
Escribe la indicación en el orden en que el público experimenta la toma: sujeto y entorno, acción, cámara, look, diálogo, sonido, sincronización de beats y restricciones. Dale al modelo un movimiento de cámara dominante y una acción principal.
Estructura de indicación reutilizable
Subject + environment + primary action + shot type + camera movement +lighting + visual style + dialogue + sound effects + timing + constraints
Paso 6: Dirige el diálogo y el sonido
Coloca las líneas habladas entre comillas, identifica al hablante, describe la interpretación y mantén el diálogo lo suficientemente corto para el clip. Separa el ambiente de los efectos de sonido con sincronización. Por ejemplo: Audio: tono de sala silencioso durante todo el clip; un clic cerámico cuando la taza toca la mesa en el segundo cuatro; sin música.
Paso 7: Establece duración y resolución
Comienza con cinco segundos a 720p. Confirma composición, identidad, movimiento y audio antes de gastar más en una versión más larga o de mayor resolución. Aumenta la duración solo cuando la toma necesite más tiempo para completar sus beats; los segundos extra no mejoran automáticamente el movimiento.
Paso 8: Genera variaciones
Genera varios candidatos a partir de la misma indicación central antes de reescribir todo. Las variaciones revelan si un problema es aleatorio o estructural. Si cada salida falla de la misma manera, cambia la indicación o la referencia. Si solo una salida falla, conserva la indicación y selecciona otro candidato.
Paso 9: Revisa y corrige una sola dimensión
Revisa el clip por pasadas. Primero verifica identidad e integridad de objetos, luego acción y movimiento de cámara, después diálogo y sincronización de audio y finalmente el fotograma final. Cambia solo la dimensión fallida para no perder una buena composición mientras corriges una señal de sonido.
- Fallo de identidad: refuerza el lenguaje de preservación o usa una imagen de referencia más limpia.
- Acción débil: reemplaza verbos abstractos por un movimiento visible con dirección clara.
- Cámara caótica: elimina movimientos en competencia y especifica una sola trayectoria con velocidad.
- Sincronización labial pobre: acorta el diálogo, reduce la acción simultánea y especifica hablante e interpretación.
- Fondo inestable: simplifica la escena y preserva explícitamente distribución y iluminación.
Paso 10: Descarga y archiva el clip ganador
Descarga solo después de que la salida pase el estándar de publicación o revisión del cliente. Guarda el clip final junto con su indicación, imagen de entrada, variante de modelo, duración, resolución y notas de generación para que la receta creativa pueda reutilizarse.
¿Por qué usar Vidu Q3 a través de CometAPI?
CometAPI es más útil cuando un producto necesita acceso a varios proveedores de IA sin mantener una capa separada de autenticación y gestión de tareas para cada uno. La ruta actual de Vidu sigue un flujo de trabajo asincrónico unificado: crear una tarea, recibir un ID, consultar el trabajo y descargar el MP4 completado.
- Una sola clave de API para Vidu y otras familias de modelos.
- Un patrón único de tareas de video para envío, recuperación de estado y descarga.
- Pruebas A/B más simples cuando la misma aplicación compara rutas de Vidu, Kling, Veo, Seedance o Wan.
- Gestión centralizada del uso para facturación, monitoreo y revisión operativa.
- Menos código específico del proveedor cuando la disponibilidad o el precio del modelo cambian.
Nota sobre precios CometAPI no es automáticamente más económico que la API directa de Vidu para todas las configuraciones de Q3. La propuesta de valor es la consistencia operativa y la elección de modelos. Compara la ruta exacta, resolución, duración, modo de cola y política de facturación antes del despliegue.
Cómo usar Vidu Q3 con CometAPI
La implementación de Vidu en CometAPI usa POST /v1/videos con multipart/form-data. Los ejemplos a continuación son del lado del servidor. Nunca expongas una clave de producción en JavaScript del navegador, aplicaciones móviles, repositorios públicos, capturas de pantalla o registros del lado del cliente.
Paso 1: Crea y almacena tu clave de CometAPI
Crea o inicia sesión en tu cuenta de CometAPI y luego genera una clave de API. Guárdala como una variable de entorno.
macOS o Linux
export COMETAPI_KEY="your_cometapi_key"
Windows PowerShell
$env:COMETAPI_KEY="your_cometapi_key"
Paso 2: Crea una tarea de texto a video
La solicitud mínima práctica necesita un ID de modelo y una indicación. Añade duración y tamaño explícitamente para que la solicitud sea reproducible.
Solicitud de cURL para texto a video
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=A cinematic medium shot of a young astronaut walking through pale blue fog. Slow dolly-in camera. Soft footsteps and distant mechanical ambience.' \ -F seconds=5 \ -F size=1280x720
El endpoint devuelve de inmediato un objeto de tarea. No espera a que termine el render. Guarda el id o task_id devuelto.
Paso 3: Crea una tarea de imagen a video
Para imagen a video, sube una imagen local mediante el campo multipart input_reference. Describe cómo debería moverse la imagen en lugar de repetir cada detalle visible.
Solicitud de cURL para imagen a video
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=The character turns slowly toward the window as rain moves across the glass. Gentle handheld camera, quiet room tone, distant thunder.' \ -F seconds=6 \ -F size=1280x720 \ -F input_reference=@reference.png
Paso 4: Lee la respuesta de la tarea
Respuesta de tarea aceptada (ejemplo)
{ "id": "task_example", "object": "video", "model": "viduq3", "status": "queued", "progress": 0 }
Trata el identificador de tarea como una cadena opaca. Normaliza id y el alias de compatibilidad task_id una vez, luego almacena el valor resultante con el modelo, la indicación, duración, tamaño, marca de tiempo de la solicitud y el usuario o registro de trabajo que inició el render.
Paso 5: Consulta el estado de la tarea
Llama a GET /v1/videos/{task_id} hasta que el estado sea completed, failed o error. La documentación de recuperación de CometAPI incluye el mismo patrón de estado terminal.
Bucle de sondeo en Python con tiempo límite
import os import time import requests task_id = "<TASK_ID>" headers = {"Authorization": f"Bearer {os.environ['COMETAPI_KEY']}"} terminal = {"completed", "failed", "error"} deadline = time.time() + 20 * 60 while time.time() < deadline: response = requests.get( f"https://api.cometapi.com/v1/videos/{task_id}", headers=headers, timeout=60, ) response.raise_for_status() task = response.json() print(task["status"], task.get("progress")) if task["status"] in terminal: if task["status"] != "completed": raise RuntimeError(task.get("error", task["status"])) break time.sleep(10) else: raise TimeoutError("Video generation did not finish in time")
Paso 6: Descarga el video completado
Cuando la tarea se complete, descarga el MP4 mediante el endpoint de contenido. Guarda el recurso en almacenamiento duradero si la aplicación necesita retención a largo plazo.
Descargar el MP4
curl "https://api.cometapi.com/v1/videos/$TASK_ID/content" \ -H "Authorization: Bearer $COMETAPI_KEY" \ -o vidu-q3-output.mp4
Paso 7: Ejecuta el flujo completo en JavaScript
Ejemplo de extremo a extremo en Node.js
import fs from "node:fs"; const form = new FormData(); form.append("model", "viduq3"); form.append("prompt", "A quiet product reveal with a slow orbit camera and soft mechanical sound design."); form.append("seconds", "5"); form.append("size", "1280x720"); const auth = { Authorization: `Bearer ${process.env.COMETAPI_KEY}` }; const created = await fetch("https://api.cometapi.com/v1/videos", { method: "POST", headers: auth, body: form, }).then((r) => r.json()); let task; do { await new Promise((resolve) => setTimeout(resolve, 10_000)); task = await fetch(`https://api.cometapi.com/v1/videos/${created.id}`, { headers: auth, }).then((r) => r.json()); } while (!["completed", "failed", "error"].includes(task.status)); if (task.status !== "completed") throw new Error(JSON.stringify(task.error)); const video = await fetch( `https://api.cometapi.com/v1/videos/${created.id}/content`, { headers: auth }, ); fs.writeFileSync("vidu-q3-output.mp4", Buffer.from(await video.arrayBuffer()));
Parámetros de la API de Vidu Q3
Nota de fuente: Los nombres de campos y límites actuales siguen el endpoint de Vidu en CometAPI.
| Parámetro | Tipo | Obligatorio | Recomendado | Propósito |
|---|---|---|---|---|
| model | String | Sí | viduq3 | Selecciona Vidu Q3 |
| prompt | String | Sí | Indicación de escena estructurada | Describe visuales, movimiento, diálogo y sonido |
| seconds | Integer | No | Comienza con 5 | Acepta de 1 a 16 |
| size | String | No | 1280x720 | Usa valores WxH compatibles |
| input_reference | File | Modo imagen | PNG/JPEG/WebP | Guía la generación de imagen a video |
Los valores de tamaño compatibles en la ruta documentada de Vidu son:
-
960x528— nivel 540p, 16:9. -
1280x720— nivel 720p, 16:9. -
1920x1080— nivel 1080p, 16:9.
Regla de compatibilidad Usa solo los parámetros documentados para la ruta que llamas. No debe asumirse que campos nativos del proveedor como audio, callback_url, múltiples sujetos o modo off-peak funcionen en el endpoint unificado de CometAPI a menos que la documentación de CometAPI los liste explícitamente.
¿Cómo escribir mejores indicaciones para Vidu Q3?
Escribe cada indicación como un briefing compacto de toma. Mantén los campos en el orden siguiente, para que Vidu Q3 reciba la base visual antes del movimiento, la dirección de la cámara, la iluminación, el habla, el sonido y las reglas de preservación.
Subject → Environment → Action → Camera → Lighting → Dialogue → Audio → Constraints
Usa un sujeto claro, una acción principal y una trayectoria de cámara. Mantén el diálogo corto, separa el ambiente de los sonidos de evento y usa restricciones para indicar lo que debe permanecer sin cambios. Para imagen a video, trata la imagen de entrada como la fuente de verdad visual y enfoca la indicación en movimiento, comportamiento de cámara, audio y preservación.
Ejemplo de indicación cinematográfica
Subject: A tired detective in a dark trench coat.Environment: A rain-soaked alley beneath a flickering streetlight at night.Action: She stops, hears approaching footsteps, and slowly looks over her shoulder.Camera: Medium close-up with a gentle three-second dolly in and a 35mm lens feel.Lighting: Blue-magenta reflections, soft backlighting, shallow depth of field, and subtle film grain.Dialogue: In a restrained whisper, "You should not have come back."Audio: Steady rain ambience, one distant siren, and footsteps that stop after the line.Constraints: Preserve her face, coat, and alley layout; no subtitles, logos, extra people, or camera shake.
Ejemplo de indicación de producto
Subject: A premium stainless-steel smartwatch with a clean blue display.Environment: The watch rests on black stone while a thin ribbon of water circles the base.Action: At second three, the display turns on and reveals a single blue pulse.Camera: Slow left-to-right orbit ending on a centered macro view of the watch face.Lighting: Crisp edge reflections, controlled highlights, and a dark luxury color grade.Dialogue: None.Audio: Soft water movement, one precise electronic chime, and a restrained low bass swell.Constraints: Preserve the watch geometry, materials, display layout, and logo placement; no hands, extra text, or deformation.
Ejemplo de indicación de anime
Subject: A teenage girl holding a red umbrella in a hand-drawn anime style.Environment: A quiet rural train platform at sunset, with tall grass moving in a warm wind.Action: She looks down the empty track as a distant train light appears, then smiles slightly.Camera: Track slowly beside her and stop in a medium shot when the train light appears.Lighting: Warm sunset light, soft shadows, stable linework, and consistent character colors.Dialogue: She whispers in Japanese, "Yatto kaette kita."Audio: Summer insects, soft wind, and a distant railway bell after the dialogue.Constraints: Preserve the character design, facial features, umbrella color, and anime style; no on-screen text or extra characters.
Ejemplo de indicación de imagen a video
Subject: Preserve the character's face, hairstyle, clothing, pose, and framing from the reference image.Environment: Keep the same room, furniture arrangement, background layout, and window position.Action: The character looks up from the book, smiles slightly, and turns toward the window while the curtain moves in a light breeze.Camera: Use a slow, stabilized push in with subtle natural movement.Lighting: Preserve the original light direction, exposure, skin tone, and room colors.Dialogue: None.Audio: Quiet room tone, soft page movement, light curtain rustle, and distant birds.Constraints: No identity changes, added accessories, hand distortion, sudden camera movement, background replacement, or new objects.
Crea un video multitiro con Vidu Q3
Un anuncio completo, drama corto, tráiler o secuencia musical suele requerir varios clips generados. Trata Vidu Q3 como un generador de tomas y usa una lista simple de tomas para preservar la continuidad a lo largo de la secuencia.
| Toma | Propósito | Ancla de continuidad |
|---|---|---|
| 1. Establecer | La toma abierta introduce ubicación y sujeto | Entorno, vestuario, hora del día |
| 2. Acercamiento | La toma media inicia la acción principal | Dirección en pantalla, posición de accesorio, iluminación |
| 3. Énfasis | Primer plano entrega diálogo o detalle de producto | Geometría del rostro o producto, identidad de audio |
| 4. Resolución | Reacción o fotograma final limpio completa el beat | Pose final, gradación de color, dirección de transición |
Reutiliza un encabezado de continuidad
Comienza cada indicación de toma con el mismo bloque conciso de identidad: apariencia del personaje, vestuario, diseño de producto, ubicación, hora del día y estilo visual. Luego cambia solo la acción específica de la toma, el encuadre, la cámara y el audio.
Patrón reutilizable de indicación multitiro
Continuity: the same woman in her early thirties, short black hair, dark green coat, silver pendant; rainy neon alley at night; blue-magenta reflections; restrained cinematic realism. Shot 3: medium close-up. She stops beneath the streetlight and looks over her shoulder. Slow dolly in. She whispers, "I heard you." Rain ambience continues; distant footsteps stop at second four.
Haz coincidir el final de una toma con el inicio de la siguiente
- Mantén la dirección en pantalla consistente a menos que el corte la invierta intencionalmente.
- Lleva el mismo accesorio en la misma mano o posición.
- Iguala vestuario, clima, dirección de la luz y color dominante.
- Termina en una pose o composición estable que pueda convertirse en la próxima imagen de referencia.
- Usa el mismo ambiente entre tomas adyacentes y añade sonidos de evento solo donde ocurren acciones.
Ensambla y finaliza fuera del generador
Recorta fotogramas de apertura o cierre débiles, ordena las tomas, normaliza niveles de audio, añade títulos o subtítulos en un editor y aplica acabado final de color y sonido después de la generación. El texto en pantalla generado por IA es menos fiable que añadir tipografía exacta durante la postproducción.
¿Cuándo deberías elegir Vidu Q3?
La comparación de modelos debe apoyar la decisión creativa, no dominarla. La pregunta práctica es qué flujo de trabajo se ajusta mejor a la toma que necesitas producir.
| Dimensión | Vidu Q3 | Vidu Q3 Turbo | Seedance 2.5 | Kling 3.0 | Veo 3.1 |
|---|---|---|---|---|---|
| Duración | 1–16s; referencia oficial a video 3–16s | 1–16s; referencia oficial a video 3–16s | 4–30s | Hasta 15s, según modo | 4s, 6s u 8s por generación de API |
| Audio | Audio nativo sincronizado | Audio nativo sincronizado | Generación nativa de audio y video | Disponible en modos de audio nativo | Audio nativo |
| Referencia | Una imagen en CometAPI; superficies oficiales más ricas | Una imagen en CometAPI; superficies oficiales más ricas | Hasta 50 referencias multimodales | Modos de texto a video, imagen a video y control de movimiento | Imagen y guía de primer/último fotograma |
| API | CometAPI POST /v1/videos | CometAPI POST /v1/videos | CometAPI POST /v1/videos | Rutas compatibles con Kling de text2video/image2video | CometAPI POST /v1/videos |
| Precio listado | Desde $0.056/s | Desde $0.028/s | Desde $0.0824/s en el estimador de ruta | V3 720p: $0.336/5s sin audio | $0.32/s a 720p o 1080p |
| Mejor caso de uso | Tomas narrativas cortas finales con diálogo y continuidad | Borradores, iteración de indicaciones y generación de mayor volumen | Storytelling más largo y con muchas referencias | Cámara, movimiento y producción multitiro controlados | Tomas cinematográficas fotorrealistas y física realista |
Nota de fuente: Las superficies de modelos y modos disponibles pueden cambiar. La guía oficial de Kling documenta modos 720p/1080p y audio nativo; Google describe los flujos de trabajo de audio nativo, control de referencia y alta resolución de Veo 3.1. Las entradas de precio son instantáneas de ruta más que comparaciones de calidad normalizadas; resolución, modo de audio y nivel de calidad difieren, así que verifica las páginas de modelo vinculadas antes de la publicación.
Resultado práctico de selección
Elige Vidu Q3 cuando necesites una toma narrativa corta con continuidad de personaje o producto, ritmo de cámara dirigible, diálogo, ambiente y efectos de sonido en una sola generación. Usa Q3 Turbo para explorar indicaciones y luego mueve solo la dirección creativa más sólida a la ruta premium. Considera otro modelo cuando la duración del clip, una pila de referencias mayor, control multitiro especializado o física fotorrealista sea más importante que el flujo narrativo de Q3.
¿Cuánto cuesta Vidu Q3?
La fijación de precios requiere una comparación honesta ruta por ruta. CometAPI factura su ruta Vidu Q3 por segundo generado. La API directa de Vidu también tarifica por duración y resolución y ofrece una cola de menor costo fuera de pico con una ventana de finalización mucho más larga.
| Resolución | Vidu Q3 en CometAPI | API oficial de Vidu | Modo oficial off-peak |
|---|---|---|---|
| 540p | $0.056/s | $0.045/s | $0.025/s |
| 720p | $0.1232/s | $0.10/s | $0.05/s |
| 1080p | $0.1232/s | $0.12/s | $0.06/s |
Nota de fuente: Precios por segundo listados en la página del modelo de CometAPI y la documentación de precios de Vidu. Verifica la facturación en vivo antes de publicaciones frente a clientes o despliegues.
A estas tarifas listadas, CometAPI no es la ruta más barata para todas las configuraciones de Q3. Su ventaja es operativa: una sola clave, un endpoint de video consistente, manejo centralizado de tareas y conmutación más fácil entre proveedores. Un equipo que solo usa Vidu y puede esperar el procesamiento off-peak puede pagar menos mediante la API directa de Vidu.
Ejemplos de costos de ejecución en CometAPI
| Duración | 540p | 720p | 1080p |
|---|---|---|---|
| 5 segundos | $0.28 | $0.616 | $0.616 |
| 10 segundos | $0.56 | $1.232 | $1.232 |
| 16 segundos | $0.896 | $1.9712 | $1.9712 |
Costo por clip utilizable Una tarifa baja por segundo aún puede ser costosa si la mayoría de las generaciones se rechazan. Rastrea el gasto total dividido entre las salidas que pasan la revisión creativa, no solo el precio anunciado de un render.
Mejores prácticas de producción
Una mejor estrategia de iteración creativa
- Comienza pequeño. Usa una solicitud de cinco segundos a 720p para validar composición, acción y movimiento de cámara.
- Genera variaciones controladas. Mantén estable la indicación central y varía solo una elección creativa a la vez.
- Diagnostica la dimensión fallida. Separa problemas de identidad, movimiento, cámara, audio y continuidad antes de editar la indicación.
- Separa rutas de borrador y final. Usa variantes más rápidas para exploración y variantes premium solo para indicaciones preseleccionadas.
- Guarda la receta ganadora. Archiva la indicación final, referencia, ajustes, salida y notas de revisión para reutilización.
Lista de verificación de revisión de video de Vidu Q3
Revisar todo a la vez dificulta la edición de la indicación. Usa pasadas separadas para que cada rechazo lleve a una corrección específica.
| Paso de revisión | Criterio de aceptación | Qué revisar si falla |
|---|---|---|
| Sujeto | Rostro, cuerpo, vestuario, geometría del producto, etiquetas y accesorios permanecen consistentes | Indicación de preservación o referencia |
| Acción | El movimiento principal está completo, legible y correctamente sincronizado | Verbo de acción, dirección y orden de beats |
| Cámara | El movimiento sigue una trayectoria sin saltos, deriva ni reencuadres indeseados | Tamaño de toma, trayectoria, velocidad y punto final |
| Entorno | Distribución del fondo, iluminación, clima y movimiento secundario permanecen estables | Complejidad de escena y restricciones de continuidad |
| Audio | Diálogo, pronunciación, sincronización labial, ambiente y señales de sonido se ajustan a la acción | Línea más corta y cronograma de audio más claro |
| Fotograma final | La composición final es lo bastante limpia para sostener, cortar o sembrar la siguiente toma | Pose final y punto final de cámara |
Regla de aprobación No apruebes un clip solo porque un fotograma luzca impresionante. Míralo a velocidad normal, luego inspecciona el inicio, el pico de acción, el momento de diálogo y el fotograma final. Un video utilizable debe permanecer coherente en el tiempo.
Preguntas frecuentes sobre Vidu Q3
¿Puede Vidu Q3 generar video y audio juntos?
Sí. Q3 está diseñado para generación directa de audio y video, incluyendo diálogo y efectos de sonido. Describe el audio deseado y su sincronización dentro de la indicación cuando uses la ruta unificada de CometAPI.
¿Cuál es el ID de modelo de Vidu Q3 en CometAPI?
Usa viduq3 con la Videos API actual de CometAPI. No sustituyas el nombre nativo del proveedor viduq3-pro a menos que la documentación de la ruta lo solicite explícitamente.
¿Cuánto puede durar un video de Vidu Q3?
Una sola generación de Q3 admite de 1 a 16 segundos. Producciones más largas requieren múltiples tomas y edición.
¿Vidu Q3 admite generación de imagen a video?
Sí. En CometAPI, sube una imagen mediante input_reference y usa la indicación para describir movimiento, comportamiento de cámara, sonido y lo que debe permanecer sin cambios.
¿Puede Vidu Q3 generar diálogo en diferentes idiomas?
Vidu lista salida en inglés, japonés y chino. Revisa pronunciación, identidad de voz, emoción y sincronización labial antes de publicar contenido localizado.
¿Debo usar Vidu Q3 o Vidu Q3 Turbo?
Usa Q3 cuando la calidad visual final, consistencia narrativa y continuidad de personaje importen más que la velocidad de generación. Usa Q3 Turbo para borradores, iteración de indicaciones y flujos de trabajo de mayor volumen.
¿CometAPI es más barato que la API oficial de Vidu?
No en todas las configuraciones. Las tarifas públicas actuales muestran que los modos normal y off-peak directos de Vidu pueden ser más económicos. Elige CometAPI por acceso unificado, una sola integración, manejo centralizado de tareas y conmutación más fácil entre modelos de proveedores, no por una afirmación no respaldada de que cada ruta cuesta menos.
Recomendación final
Vidu Q3 es una opción sólida para videos cortos impulsados por la historia que necesitan que imagen, diálogo, ambiente y efectos de sonido se entreguen juntos. Sus fortalezas de producción más útiles son generación de hasta 16 segundos, consistencia basada en referencia, narración multihablante, salida multilingüe y control a nivel de indicación sobre cámara y ritmo.
Para una primera prueba, usa una solicitud de cinco segundos a 720p con un sujeto, una acción principal, un movimiento de cámara y instrucciones de audio claras. Itera la indicación con bajo costo, luego aumenta la resolución o duración solo después de que la composición funcione. Usa Q3 Turbo para exploración de borradores y Q3 estándar para renders finales preseleccionados.
Para una producción repetible, convierte cada resultado aprobado en una receta creativa reutilizable: preserva la indicación final, imagen de referencia, ID de modelo, duración, resolución, metadatos de tarea y notas de revisión. Construye videos multitiro a partir de clips individuales estables y luego añade títulos, subtítulos, edición, color y sonido finales en postproducción. CometAPI es más valioso cuando este flujo de trabajo también necesita un patrón único de tareas y enrutamiento sencillo entre varios modelos de video.
Empieza a crear Abre la página del modelo Vidu Q3, crea una clave de CometAPI, envía una tarea de prueba pequeña y valida el flujo completo de crear → consultar → descargar.
