Réponse en premier Vidu Q3 peut créer de courtes vidéos narratives à partir de prompts textuels ou d’images de référence, tout en générant dans un même flux de travail des dialogues synchronisés, des effets sonores, une ambiance et des visuels. Il prend en charge des clips jusqu’à 16 secondes en 540p, 720p ou 1080p. Les créateurs peuvent travailler dans le produit web Vidu, tandis que les développeurs peuvent appeler le modèle via CometAPI avec l’identifiant de modèle viduq3.
Ce guide met l’accent sur le processus créatif : planification d’un plan, choix entre texte-vers-vidéo ou image-vers-vidéo, direction des mouvements de caméra et de l’audio, génération de variantes, revue des échecs et construction de workflows web ou API reproductibles.
Qu’est-ce que Vidu Q3 ?
Vidu Q3 est un modèle vidéo de troisième génération de ShengShu Technology et Vidu. Il est conçu pour la création vidéo orientée récit, plutôt que pour de simples boucles de mouvement. Le modèle peut générer conjointement la séquence d’images et l’audio natif, permettant aux dialogues, aux sons d’environnement, aux effets et aux repères musicaux de suivre la temporalité de la scène.
Le modèle est particulièrement pertinent pour les courts drames, l’adaptation de comics et manga, la publicité narrative, la prévisualisation filmique, la narration produit et la vidéo sociale. Vidu met en avant la synchronisation audio-vidéo, la sortie multilingue, les scènes multi-interlocuteurs, ainsi qu’un contrôle détaillé de la caméra et du rythme comme capacités centrales de Q3.
Vidu Q3 est désormais une famille de modèles plutôt qu’une configuration de génération unique. Ce guide se concentre principalement sur la route Q3 Pro exposée sous viduq3 via CometAPI.
Spécifications rapides de Vidu Q3
Note sur la source : Les spécifications combinent la documentation de l’API Vidu et la page modèle CometAPI**.
| Spécification | Détail Vidu Q3 | Signification pratique |
|---|---|---|
| Développeur | ShengShu Technology / Vidu | Modèle vidéo commercial fermé |
| ID de modèle API officiel | viduq3-pro | Utilisé dans les workflows directs texte, image et cadres |
| ID de modèle CometAPI | viduq3 | Utilisé avec l’API unifiée Videos de CometAPI |
| Modes d’entrée | Texte, image, frames de début/fin, références | Les modes exacts dépendent de la surface API |
| Entrées CometAPI actuelles | Texte ou une image de référence | Upload en multipart/form-data pour image-vers-vidéo |
| Sortie | Vidéo MP4 avec audio natif synchronisé | Les dialogues et effets sonores peuvent être générés ensemble |
| Durée | 1–16 secondes pour texte, image et début/fin ; 3–16 secondes pour référence-vers-vidéo | La valeur par défaut est généralement de 5 secondes |
| Résolution | 540p, 720p, 1080p | CometAPI utilise des valeurs WxH exactes |
| Fréquence d’images | 24 FPS | Indiquée sur la page modèle CometAPI |
| Langues de sortie | Anglais, Japonais, Chinois | Utile pour des dialogues localisés |
| Focalisation principale | Vidéo narrative centrée sur les personnages | Courts drames, publicités, séquences de style cinéma |
Contexte succinct des performances
Les benchmarks publics ne sont utiles qu’en point de départ, car la qualité vidéo dépend fortement du prompt, de l’image de référence, de la conception du plan et du standard de revue. Sur SuperCLUE-R2V, Vidu Q3 enregistre 70.89 contre 64.01 pour Vidu Q2. Le résultat soutient les améliorations de Q3 en préservation de référence et continuité du sujet, mais les créateurs doivent juger le modèle avec leurs propres personnages, produits, langage de caméra et exigences audio.
La création compte plus qu’un classement Pour le travail pratique, suivez le pourcentage de clips qui préservent l’identité, respectent l’action prévue, utilisent un mouvement de caméra acceptable, synchronisent le dialogue et passent la revue. Le meilleur workflow est celui qui produit le plus de plans utilisables, pas le score le plus élevé isolé.
Fonctionnalités clés de Vidu Q3
Génération audio-vidéo native
Vidu Q3 produit image et son en une seule passe de génération. Un prompt peut demander des répliques parlées, une voix off, une ambiance environnementale, des pas, des impacts ou autres effets sonores parallèlement à l’action visuelle. Cela réduit la nécessité de construire une bande-son séparée pour chaque brouillon et facilite l’évaluation du timing lors de la revue créative.
Il existe une nuance API importante. La documentation directe de Vidu expose un contrôle audio pour Q3, mais l’interrupteur bgm séparé n’est pas effectif pour Q3. Si la musique est importante, décrivez le repère musical et son timing dans le prompt. La requête unifiée actuelle de Vidu via CometAPI expose le prompt, la durée, la taille et une image de référence optionnelle ; la direction audio doit donc également être formulée dans le prompt.
Jusqu’à 16 secondes par génération
Un plafond de 16 secondes est suffisamment long pour un battement narratif court complet : une vue d’établissement, une action principale, une réplique, un mouvement de caméra et une réaction de clôture. Ce n’est toujours pas de la génération long format. Les publicités, épisodes ou clips musicaux nécessitent un plan de tournage, plusieurs tâches et un montage éditorial.
Dialogue multi-interlocuteur et multilingue
Le produit est conçu pour des conversations multi-personnages et prend en charge des sorties en anglais, japonais et chinois. Cela le rend utile pour les courts drames localisés et les campagnes sociales. Considérez le support linguistique comme une capacité, pas une garantie de prononciation, d’émotion ou de synchronisation labiale parfaite à chaque génération ; révisez chaque sortie avant publication.
Contrôle de la caméra et du rythme
Q3 répond mieux lorsqu’un prompt décrit une intention de mise en scène plutôt que de lister seulement des objets. Spécifiez la taille de plan, le ressenti d’objectif, la trajectoire de caméra, l’éclairage, l’ordre des actions, le rythme, le dialogue et les repères sonores. Une instruction de caméra cohérente unique produit généralement un taux de réussite plus élevé que plusieurs mouvements contradictoires dans le même plan.
Cohérence basée sur des références
Le workflow de référence-vers-vidéo direct de Vidu accepte jusqu’à sept sujets image ou texte. Les références peuvent ancrer un personnage, un produit, un accessoire ou un style visuel à travers des positions de caméra.
- Texte-vers-vidéo : génère la scène, le mouvement, la composition et le son à partir d’un prompt écrit.
- Image-vers-vidéo : anime une seule image d’entrée ; le prompt doit se concentrer sur le mouvement, le comportement de la caméra et l’audio.
- Génération frame de début/fin : crée une transition entre deux ancres visuelles sur l’API directe Vidu.
- Référence-vers-vidéo : conserve les sujets ou le style cohérents sur une séquence générée.
Comment créer une vidéo avec Vidu Q3 sur le web
Le workflow web est le moyen le plus rapide de passer d’une idée à un clip revu. Les libellés d’interface peuvent changer, mais la logique créative reste la même : choisir le bon mode d’entrée, préparer l’ancre visuelle, écrire un plan dirigeable, générer des variantes et ne raffiner que la dimension défaillante.
Étape 1 : Définir le livrable
Décidez où la vidéo sera utilisée, son ratio d’aspect, la durée cible, le style visuel, la langue parlée et si la sortie doit se connecter à un autre plan. Un accroche social, un plan de détail produit, un battement de court drame et un plan de prévisualisation filmique nécessitent des rythmes différents.
Étape 2 : Choisir le mode de création
Sélectionnez Texte-vers-vidéo lorsque la composition peut être inventée à partir du prompt. Sélectionnez Image-vers-vidéo lorsque vous avez déjà le personnage, le produit, l’illustration ou le cadrage souhaité. Utilisez Référence-vers-vidéo sur la surface directe Vidu lorsque l’identité ou le style doit être ancré par plusieurs sujets.
Décision de mode Utilisez texte-vers-vidéo pour l’exploration. Utilisez image-vers-vidéo lorsque la première image contient déjà le design à protéger. Utilisez des workflows pilotés par références lorsque la cohérence importe plus que la surprise visuelle.
Étape 3 : Préparer l’image de référence
Pour image-vers-vidéo, commencez avec une image nette qui possède déjà les bonnes proportions du sujet, le cadrage, la direction de lumière et l’arrière-plan. Laissez de l’espace visuel dans la direction où le sujet ou la caméra doit se déplacer. Évitez les visages minuscules, les mains obstruées, les étiquettes produit illisibles, les reflets conflictuels et un recadrage qui ne laisse aucune place au mouvement.
Étape 4 : Sélectionner Vidu Q3
Choisissez Q3 pour les plans présélectionnés où la qualité narrative, la continuité des personnages, le dialogue et le son synchronisé comptent. Utilisez Q3 Turbo pour une exploration à moindre coût, puis basculez le prompt et l’image de référence les plus solides vers Q3 pour le rendu final.
Étape 5 : Rédiger un prompt structuré de plan
Écrivez le prompt dans l’ordre où le public vit le plan : sujet et décor, action, caméra, look, dialogue, son, timing des battements et contraintes. Donnez au modèle un mouvement de caméra dominant et une action principale.
Structure de prompt réutilisable
Subject + environment + primary action + shot type + camera movement +lighting + visual style + dialogue + sound effects + timing + constraints
Étape 6 : Diriger le dialogue et le son
Placez les répliques entre guillemets, identifiez le locuteur, décrivez l’interprétation et gardez le dialogue suffisamment court pour le clip. Séparez l’ambiance des effets sonores minutés. Par exemple : Audio : bruit de fond de pièce discret tout du long ; un clic céramique lorsque la tasse touche la table à la quatrième seconde ; pas de musique.
Étape 7 : Définir la durée et la résolution
Commencez avec cinq secondes en 720p. Confirmez la composition, l’identité, le mouvement et l’audio avant d’investir davantage dans une version plus longue ou à plus haute résolution. N’augmentez la durée que lorsque le plan a besoin de plus de temps pour achever ses battements ; des secondes supplémentaires n’améliorent pas automatiquement le mouvement.
Étape 8 : Générer des variantes
Générez plusieurs candidats à partir du même prompt de base avant de tout réécrire. Les variantes révèlent si un problème est aléatoire ou structurel. Si toutes les sorties échouent de la même manière, changez le prompt ou la référence. Si une seule sortie échoue, conservez le prompt et sélectionnez un autre candidat.
Étape 9 : Revoir et corriger une seule dimension
Revoyez le clip en passes. Vérifiez d’abord l’identité et l’intégrité des objets, puis l’action et le mouvement de caméra, ensuite le dialogue et le timing audio, et enfin la frame finale. Ne changez que la dimension défaillante afin qu’une bonne composition ne soit pas perdue en corrigeant un repère sonore.
- Échec d’identité : renforcez le langage de préservation ou utilisez une image de référence plus propre.
- Action faible : remplacez des verbes abstraits par un mouvement visible avec direction claire.
- Caméra chaotique : éliminez les mouvements concurrents et spécifiez une seule trajectoire avec vitesse.
- Mauvaise synchronisation labiale : raccourcissez le dialogue, réduisez l’action simultanée et indiquez le locuteur et l’interprétation.
- Arrière-plan instable : simplifiez la scène et préservez explicitement la disposition et l’éclairage.
Étape 10 : Télécharger et archiver le clip gagnant
Téléchargez uniquement après que la sortie a passé la norme de publication ou de revue client. Sauvegardez le clip final avec son prompt, l’image d’entrée, la variante de modèle, la durée, la résolution et les notes de génération afin que la recette créative puisse être réutilisée.
Pourquoi utiliser Vidu Q3 via CometAPI ?
CometAPI est le plus utile lorsqu’un produit a besoin d’accéder à plusieurs fournisseurs d’IA sans maintenir une couche d’authentification et de gestion des tâches séparée pour chacun. La route Vidu actuelle suit un workflow asynchrone unifié : créer une tâche, recevoir un ID, interroger le job et télécharger le MP4 terminé.
- Une seule clé API pour Vidu et d’autres familles de modèles.
- Un seul pattern de tâche vidéo pour la soumission, la récupération de statut et le téléchargement.
- A/B testing plus simple lorsque la même application compare les routes Vidu, Kling, Veo, Seedance ou Wan.
- Gestion centralisée de l’usage pour la facturation, la surveillance et la revue opérationnelle.
- Moins de code spécifique fournisseur lorsque la disponibilité ou le prix du modèle change.
Note de tarification CometAPI n’est pas automatiquement moins cher que l’API directe de Vidu pour chaque configuration Q3. La proposition de valeur est la cohérence opérationnelle et le choix de modèles. Comparez la route exacte, la résolution, la durée, le mode de file d’attente et la politique de facturation avant le déploiement.
Comment utiliser Vidu Q3 avec CometAPI
L’implémentation Vidu de CometAPI utilise POST /v1/videos avec multipart/form-data. Les exemples ci-dessous sont côté serveur. N’exposez jamais une clé de production dans du JavaScript navigateur, des applications mobiles, des dépôts publics, des captures d’écran ou des logs côté client.
Étape 1 : Créer et stocker votre clé CometAPI
Créez ou connectez-vous à votre compte CometAPI, puis générez une clé API. Stockez-la comme variable d’environnement.
macOS ou Linux
export COMETAPI_KEY="your_cometapi_key"
Windows PowerShell
$env:COMETAPI_KEY="your_cometapi_key"
Étape 2 : Créer une tâche texte-vers-vidéo
La requête minimale pratique nécessite un ID de modèle et un prompt. Ajoutez la durée et la taille explicitement afin que la requête soit reproductible.
Requête cURL texte-vers-vidéo
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=A cinematic medium shot of a young astronaut walking through pale blue fog. Slow dolly-in camera. Soft footsteps and distant mechanical ambience.' \ -F seconds=5 \ -F size=1280x720
Le endpoint renvoie immédiatement un objet tâche. Il n’attend pas que le rendu soit terminé. Sauvegardez l’id ou task_id renvoyé.
Étape 3 : Créer une tâche image-vers-vidéo
Pour image-vers-vidéo, uploadez une image locale via le champ multipart input_reference. Décrivez comment l’image doit bouger plutôt que de répéter chaque détail visible.
Requête cURL image-vers-vidéo
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=The character turns slowly toward the window as rain moves across the glass. Gentle handheld camera, quiet room tone, distant thunder.' \ -F seconds=6 \ -F size=1280x720 \ -F input_reference=@reference.png
Étape 4 : Lire la réponse de tâche
Exemple de réponse de tâche acceptée
{ "id": "task_example", "object": "video", "model": "viduq3", "status": "queued", "progress": 0 }
Traitez l’identifiant de tâche comme une chaîne opaque. Normalisez id et l’alias de compatibilité task_id une fois, puis stockez la valeur résultante avec le modèle, le prompt, la durée, la taille, l’horodatage de requête et l’utilisateur ou l’enregistrement de job qui a initié le rendu.
Étape 5 : Interroger le statut de la tâche
Appelez GET /v1/videos/{task_id} jusqu’à ce que le statut devienne completed, failed ou error. La documentation de récupération de CometAPI inclut le même pattern d’état terminal.
Boucle de polling Python avec timeout
import os import time import requests task_id = "<TASK_ID>" headers = {"Authorization": f"Bearer {os.environ['COMETAPI_KEY']}"} terminal = {"completed", "failed", "error"} deadline = time.time() + 20 * 60 while time.time() < deadline: response = requests.get( f"https://api.cometapi.com/v1/videos/{task_id}", headers=headers, timeout=60, ) response.raise_for_status() task = response.json() print(task["status"], task.get("progress")) if task["status"] in terminal: if task["status"] != "completed": raise RuntimeError(task.get("error", task["status"])) break time.sleep(10) else: raise TimeoutError("Video generation did not finish in time")
Étape 6 : Télécharger la vidéo terminée
Quand la tâche est terminée, téléchargez le MP4 via l’endpoint de contenu. Sauvegardez l’actif dans un stockage durable si l’application a besoin de rétention long terme.
Télécharger le MP4
curl "https://api.cometapi.com/v1/videos/$TASK_ID/content" \ -H "Authorization: Bearer $COMETAPI_KEY" \ -o vidu-q3-output.mp4
Étape 7 : Exécuter le workflow complet en JavaScript
Exemple Node.js de bout en bout
import fs from "node:fs"; const form = new FormData(); form.append("model", "viduq3"); form.append("prompt", "A quiet product reveal with a slow orbit camera and soft mechanical sound design."); form.append("seconds", "5"); form.append("size", "1280x720"); const auth = { Authorization: `Bearer ${process.env.COMETAPI_KEY}` }; const created = await fetch("https://api.cometapi.com/v1/videos", { method: "POST", headers: auth, body: form, }).then((r) => r.json()); let task; do { await new Promise((resolve) => setTimeout(resolve, 10_000)); task = await fetch(`https://api.cometapi.com/v1/videos/${created.id}`, { headers: auth, }).then((r) => r.json()); } while (!["completed", "failed", "error"].includes(task.status)); if (task.status !== "completed") throw new Error(JSON.stringify(task.error)); const video = await fetch( `https://api.cometapi.com/v1/videos/${created.id}/content`, { headers: auth }, ); fs.writeFileSync("vidu-q3-output.mp4", Buffer.from(await video.arrayBuffer()));
Paramètres de l’API Vidu Q3
Note sur la source : Les noms de champs et limites actuels suivent le endpoint Vidu de CometAPI**.
| Paramètre | Type | Requis | Recommandé | Objectif |
|---|---|---|---|---|
| model | String | Oui | viduq3 | Sélectionne Vidu Q3 |
| prompt | String | Oui | Prompt de scène structuré | Décrit les visuels, le mouvement, le dialogue et le son |
| seconds | Integer | Non | Commencer à 5 | Accepte de 1 à 16 |
| size | String | Non | 1280x720 | Utilise des valeurs WxH supportées |
| input_reference | File | Mode image | PNG/JPEG/WebP | Guide la génération image-vers-vidéo |
Les valeurs de taille supportées sur la route Vidu documentée sont :
-
960x528— palier 540p, 16:9. -
1280x720— palier 720p, 16:9. -
1920x1080— palier 1080p, 16:9.
Règle de compatibilité N’utilisez que les paramètres documentés pour la route que vous appelez. Les champs natifs du fournisseur tels que audio, callback_url, sujets multiples ou mode hors-pointe ne doivent pas être supposés fonctionner sur l’endpoint unifié de CometAPI, sauf si la documentation CometAPI les liste explicitement.
Comment rédiger de meilleurs prompts Vidu Q3 ?
Rédigez chaque prompt comme un briefing de plan compact. Gardez les champs dans l’ordre ci-dessous, afin que Vidu Q3 reçoive la base visuelle avant le mouvement, la direction de la caméra, l’éclairage, la parole, le son et les règles de préservation.
Subject → Environment → Action → Camera → Lighting → Dialogue → Audio → Constraints
Utilisez un sujet clair, une action principale et une trajectoire de caméra uniques. Gardez le dialogue court, séparez l’ambiance des sons d’événement et utilisez des contraintes pour indiquer ce qui doit rester inchangé. Pour image-vers-vidéo, considérez l’image d’entrée comme la source de vérité visuelle et concentrez le prompt sur le mouvement, le comportement de la caméra, l’audio et la préservation.
Exemple de prompt cinématographique
Subject: A tired detective in a dark trench coat.Environment: A rain-soaked alley beneath a flickering streetlight at night.Action: She stops, hears approaching footsteps, and slowly looks over her shoulder.Camera: Medium close-up with a gentle three-second dolly in and a 35mm lens feel.Lighting: Blue-magenta reflections, soft backlighting, shallow depth of field, and subtle film grain.Dialogue: In a restrained whisper, "You should not have come back."Audio: Steady rain ambience, one distant siren, and footsteps that stop after the line.Constraints: Preserve her face, coat, and alley layout; no subtitles, logos, extra people, or camera shake.
Exemple de prompt produit
Subject: A premium stainless-steel smartwatch with a clean blue display.Environment: The watch rests on black stone while a thin ribbon of water circles the base.Action: At second three, the display turns on and reveals a single blue pulse.Camera: Slow left-to-right orbit ending on a centered macro view of the watch face.Lighting: Crisp edge reflections, controlled highlights, and a dark luxury color grade.Dialogue: None.Audio: Soft water movement, one precise electronic chime, and a restrained low bass swell.Constraints: Preserve the watch geometry, materials, display layout, and logo placement; no hands, extra text, or deformation.
Exemple de prompt anime
Subject: A teenage girl holding a red umbrella in a hand-drawn anime style.Environment: A quiet rural train platform at sunset, with tall grass moving in a warm wind.Action: She looks down the empty track as a distant train light appears, then smiles slightly.Camera: Track slowly beside her and stop in a medium shot when the train light appears.Lighting: Warm sunset light, soft shadows, stable linework, and consistent character colors.Dialogue: She whispers in Japanese, "Yatto kaette kita."Audio: Summer insects, soft wind, and a distant railway bell after the dialogue.Constraints: Preserve the character design, facial features, umbrella color, and anime style; no on-screen text or extra characters.
Exemple de prompt image-vers-vidéo
Subject: Preserve the character's face, hairstyle, clothing, pose, and framing from the reference image.Environment: Keep the same room, furniture arrangement, background layout, and window position.Action: The character looks up from the book, smiles slightly, and turns toward the window while the curtain moves in a light breeze.Camera: Use a slow, stabilized push in with subtle natural movement.Lighting: Preserve the original light direction, exposure, skin tone, and room colors.Dialogue: None.Audio: Quiet room tone, soft page movement, light curtain rustle, and distant birds.Constraints: No identity changes, added accessories, hand distortion, sudden camera movement, background replacement, or new objects.
Créer une vidéo multi-plans avec Vidu Q3
Une publicité complète, un court drame, une bande-annonce ou une séquence musicale nécessite généralement plusieurs clips générés. Traitez Vidu Q3 comme un générateur de plans et utilisez une simple liste de plans pour préserver la continuité sur la séquence.
| Plan | Objectif | Ancre de continuité |
|---|---|---|
| 1. Établir | Le plan large introduit le lieu et le sujet | Environnement, tenue, moment de la journée |
| 2. Approche | Le plan moyen commence l’action principale | Direction à l’écran, position des accessoires, éclairage |
| 3. Accent | Le gros plan délivre le dialogue ou le détail produit | Visage ou géométrie produit, identité audio |
| 4. Résolution | La réaction ou une frame finale propre achève le battement | Pose finale, étalonnage, direction de transition |
Réutiliser un en-tête de continuité
Commencez chaque prompt de plan par le même bloc d’identité concis : apparence du personnage, tenue, design produit, lieu, moment de la journée et style visuel. Modifiez ensuite seulement l’action, le cadrage, la caméra et l’audio spécifiques au plan.
Modèle de prompt multi-plans réutilisable
Continuity: the same woman in her early thirties, short black hair, dark green coat, silver pendant; rainy neon alley at night; blue-magenta reflections; restrained cinematic realism. Shot 3: medium close-up. She stops beneath the streetlight and looks over her shoulder. Slow dolly in. She whispers, "I heard you." Rain ambience continues; distant footsteps stop at second four.
Faire correspondre la fin d’un plan au début du suivant
- Maintenez la direction à l’écran cohérente, sauf si le montage l’inverse intentionnellement.
- Gardez le même accessoire dans la même main ou position.
- Faites correspondre la tenue, la météo, la direction de lumière et la couleur dominante.
- Terminez sur une pose ou une composition stable qui peut devenir la prochaine image de référence.
- Utilisez une ambiance cohérente entre les plans adjacents et ajoutez des sons d’événement uniquement là où les actions se produisent.
Assembler et finaliser hors du générateur
Rognez les frames d’ouverture ou de clôture faibles, organisez les plans, normalisez les niveaux audio, ajoutez des titres ou sous-titres dans un éditeur et appliquez l’étalonnage couleur et la finition sonore finale après génération. Le texte à l’écran généré par IA est moins fiable que l’ajout d’une typographie exacte en post-production.
Quand choisir Vidu Q3 ?
La comparaison des modèles doit servir la décision créative, pas la dominer. La question pratique est de savoir quel workflow correspond le mieux au plan que vous devez produire.
| Dimension | Vidu Q3 | Vidu Q3 Turbo | Seedance 2.5 | Kling 3.0 | Veo 3.1 |
|---|---|---|---|---|---|
| Durée | 1–16 s ; référence-vers-vidéo officielle 3–16 s | 1–16 s ; référence-vers-vidéo officielle 3–16 s | 4–30 s | Jusqu’à 15 s, selon le mode | 4 s, 6 s ou 8 s par génération API |
| Audio | Audio natif synchronisé | Audio natif synchronisé | Génération audio-vidéo native | Disponible dans les modes audio natif | Audio natif |
| Références | Une image sur CometAPI ; surfaces officielles plus riches | Une image sur CometAPI ; surfaces officielles plus riches | Jusqu’à 50 références multimodales | Modes image, début/fin et contrôle de mouvement | Image et guidage première/dernière frame |
| API | CometAPI POST /v1/videos | CometAPI POST /v1/videos | CometAPI POST /v1/videos | Routes compatibles Kling text2video/image2video | CometAPI POST /v1/videos |
| Prix listé | À partir de 0,056 $/s | À partir de 0,028 $/s | À partir de 0,0824 $/s dans l’estimateur de route | V3 720p : 0,336 $/5 s sans audio | 0,32 $/s en 720p ou 1080p |
| Meilleur cas d’usage | Plans narratifs courts finaux avec dialogue et continuité | Ébauches, itération de prompts et génération à plus fort volume | Narration multimodale plus longue et riche en références | Caméra, mouvement et production multi-plans contrôlés | Plans cinématographiques photoréalistes et physique réaliste |
Note sur la source : Les surfaces des modèles et modes disponibles peuvent changer. Le guide officiel de Kling documente les modes 720p/1080p et audio natif** ; Google décrit les workflows audio natif, contrôle de références et haute résolution de Veo 3.1**. Les prix sont des instantanés de route plutôt que des comparaisons de qualité normalisées ; la résolution, le mode audio et le palier de qualité diffèrent, vérifiez les pages modèles liées avant publication.
Résultat pratique de la sélection
Choisissez Vidu Q3 lorsque vous avez besoin d’un plan narratif court avec continuité de personnage ou de produit, un rythme de caméra dirigeable, des dialogues, une ambiance et des effets sonores en une génération. Utilisez Q3 Turbo pour explorer des prompts, puis déplacez seulement la direction créative la plus solide vers la route premium. Envisagez un autre modèle lorsque la longueur du clip, un plus grand ensemble de références, un contrôle multi-plans spécialisé ou une physique photoréaliste sont plus importants que le workflow narratif de Q3.
Combien coûte Vidu Q3 ?
La tarification nécessite une comparaison honnête route par route. CometAPI facture sa route Vidu Q3 au nombre de secondes générées. L’API directe de Vidu facture également à la durée et à la résolution et propose une file d’attente hors-pointe à moindre coût avec une fenêtre d’achèvement beaucoup plus longue.
| Résolution | CometAPI Vidu Q3 | API officielle Vidu | Hors-pointe officiel |
|---|---|---|---|
| 540p | 0,056 $/s | 0,045 $/s | 0,025 $/s |
| 720p | 0,1232 $/s | 0,10 $/s | 0,05 $/s |
| 1080p | 0,1232 $/s | 0,12 $/s | 0,06 $/s |
Note sur la source : Prix par seconde listés depuis la page modèle CometAPI et la documentation tarifaire de Vidu**. Vérifiez la facturation en direct avant toute publication ou déploiement client.
À ces tarifs listés, CometAPI n’est pas la route la moins chère pour chaque configuration Q3. Son avantage est opérationnel : une clé, un endpoint vidéo cohérent, une gestion centralisée des tâches et un basculement plus facile entre fournisseurs. Une équipe qui n’utilise que Vidu et peut attendre le traitement hors-pointe paiera peut-être moins via l’API directe de Vidu.
Exemples de coûts d’exécution via CometAPI
| Durée | 540p | 720p | 1080p |
|---|---|---|---|
| 5 secondes | 0,28 $ | 0,616 $ | 0,616 $ |
| 10 secondes | 0,56 $ | 1,232 $ | 1,232 $ |
| 16 secondes | 0,896 $ | 1,9712 $ | 1,9712 $ |
Coût par clip utilisable Un taux faible par seconde peut rester coûteux si la plupart des générations sont rejetées. Suivez la dépense totale divisée par les sorties qui passent la revue créative, pas uniquement le prix annoncé d’un rendu.
Bonnes pratiques de production
Une meilleure stratégie d’itération créative
- Commencez petit. Utilisez une requête de cinq secondes en 720p pour valider la composition, l’action et le mouvement de caméra.
- Générez des variantes contrôlées. Gardez le prompt principal stable et ne variez qu’un seul choix créatif à la fois.
- Diagnostiquez la dimension défaillante. Séparez les problèmes d’identité, de mouvement, de caméra, d’audio et de continuité avant de modifier le prompt.
- Séparez les routes brouillon et finale. Utilisez des variantes plus rapides pour l’exploration et des variantes premium seulement pour les prompts présélectionnés.
- Sauvegardez la recette gagnante. Archivez le prompt final, la référence, les réglages, la sortie et les notes de revue pour réutilisation.
Checklist de revue vidéo Vidu Q3
Revoir tout à la fois rend la révision du prompt difficile. Utilisez des passes séparées afin que chaque rejet mène à une correction spécifique.
| Pass de revue | Critère d’acceptation | Ce qu’il faut corriger en cas d’échec |
|---|---|---|
| Sujet | Visage, corps, tenue, géométrie produit, étiquettes et accessoires restent cohérents | Prompt de référence ou de préservation |
| Action | Le mouvement principal est complet, lisible et correctement minuté | Verbe d’action, direction et ordre des battements |
| Caméra | Le mouvement suit une trajectoire sans sauts, dérive ou recadrage indésirable | Taille de plan, trajectoire, vitesse et point d’arrêt |
| Environnement | Disposition du fond, éclairage, météo et mouvements secondaires restent stables | Complexité de la scène et contraintes de continuité |
| Audio | Dialogue, prononciation, synchronisation labiale, ambiance et repères sonores s’adaptent à l’action | Réplique plus courte et chronologie audio plus claire |
| Frame finale | La composition finale est assez propre pour tenir, couper ou amorcer le plan suivant | Pose finale et point d’arrêt de caméra |
Règle d’approbation N’approuvez pas un clip uniquement parce qu’une frame est impressionnante. Regardez-le à vitesse normale, puis inspectez le début, le pic d’action, le moment de dialogue et la frame finale. Une vidéo utilisable doit rester cohérente dans le temps.
FAQ sur Vidu Q3
Vidu Q3 peut-il générer vidéo et audio ensemble ?
Oui. Q3 est conçu pour la génération audio-vidéo directe, incluant dialogues et effets sonores. Décrivez l’audio souhaité et son timing dans le prompt lorsque vous utilisez la route unifiée de CometAPI.
Quel est l’ID de modèle CometAPI pour Vidu Q3 ?
Utilisez viduq3 avec l’API Videos actuelle de CometAPI. Ne substituez pas le nom natif du fournisseur viduq3-pro sauf si la documentation de la route le demande explicitement.
Quelle est la durée maximale d’une vidéo Vidu Q3 ?
Une génération Q3 unique prend en charge 1–16 secondes. Les productions plus longues nécessitent plusieurs plans et du montage.
Vidu Q3 prend-il en charge la génération image-vers-vidéo ?
Oui. Sur CometAPI, uploadez une image via input_reference et utilisez le prompt pour décrire le mouvement, le comportement de la caméra, le son et ce qui doit rester inchangé.
Vidu Q3 peut-il générer des dialogues dans différentes langues ?
Vidu liste des sorties en anglais, japonais et chinois. Revoyez la prononciation, l’identité vocale, l’émotion et la synchronisation labiale avant d’expédier du contenu localisé.
Dois-je utiliser Vidu Q3 ou Vidu Q3 Turbo ?
Utilisez Q3 lorsque la qualité visuelle finale, la cohérence narrative et la continuité des personnages comptent plus que la vitesse de génération. Utilisez Q3 Turbo pour les brouillons, l’itération de prompts et des workflows à volume plus élevé.
CometAPI est-il moins cher que l’API officielle Vidu ?
Pas dans chaque configuration. Les tarifs publics actuels montrent que les modes directs normal et hors-pointe de Vidu peuvent être moins chers. Choisissez CometAPI pour l’accès unifié, une seule intégration, une gestion centralisée des tâches et un basculement plus facile entre les fournisseurs — pas sur l’affirmation non étayée que chaque route coûte moins cher.
Recommandation finale
Vidu Q3 est une option solide pour des vidéos courtes et orientées récit qui doivent livrer image, dialogue, ambiance et effets sonores ensemble. Ses forces de production les plus utiles sont la génération sur 16 secondes, la cohérence basée sur des références, la narration multi-interlocuteurs, la sortie multilingue et le contrôle au niveau du prompt sur la caméra et le rythme.
Pour un premier test, utilisez une requête de cinq secondes en 720p avec un sujet, une action principale, un mouvement de caméra et des instructions audio claires. Itérez le prompt à faible coût, puis augmentez la résolution ou la durée seulement après que la composition fonctionne. Utilisez Q3 Turbo pour l’exploration et Q3 standard pour les rendus finaux présélectionnés.
Pour une production reproductible, transformez chaque résultat approuvé en recette créative réutilisable : préservez le prompt final, l’image de référence, l’ID de modèle, la durée, la résolution, les métadonnées de tâche et les notes de revue. Construisez des vidéos multi-plans à partir de clips individuels stables, puis ajoutez des titres, sous-titres, montage, étalonnage couleur et son final en post-production. CometAPI est le plus précieux lorsque ce workflow a également besoin d’un seul pattern de tâche et d’un routage facile entre plusieurs modèles vidéo.
Commencez à construire Ouvrez la page modèle Vidu Q3, créez une clé CometAPI, soumettez une petite tâche de test et validez le workflow complet créer → interroger → télécharger
