Spécifications techniques de Wan 3.0
| Spécification | Wan 3.0 |
|---|---|
| Type de modèle | Modèle de génération vidéo multimodal tout-en-un |
| Statut du modèle | Aperçu public de l'API |
| Types d'entrée | Texte, image, vidéo, audio, documents, pages web |
| Génération vidéo | Texte-vers-vidéo, image-vers-vidéo, référence-vers-vidéo |
| Montage vidéo | Montage basé sur des instructions et des références |
| Durée maximale | 30 secondes en une seule génération |
| Résolution de sortie | 480P, 720P, 1080P |
| Génération audio-visuelle native | Oui |
| Ressources de référence | Jusqu'à 20 ressources de référence multimodales |
| Entrées documentaires | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| Taille maximale des documents | 100 MB |
| Nombre maximal de pages | 50 pages |
| Accès API | Aperçu de l'API Alibaba Cloud Model Studio |
| Mode de génération API | Asynchrone |
| Prix 480P | $0.05/sec |
| Prix 720P | $0.10/sec |
| Prix 1080P | $0.20/sec |
Wan 3.0 est le dernier modèle de génération vidéo multimodal tout-en-un d'Alibaba Cloud, officiellement lancé en août 2026. Sa plus grande amélioration par rapport aux générations précédentes de Wan n'est pas simplement une qualité visuelle supérieure, mais la consolidation du texte, des images, de la vidéo, de l'audio, des documents et des pages web dans un seul flux créatif. Alibaba Cloud décrit le modèle comme supportant la génération native de vidéos de 30 secondes, des entrées de référence multimodales, une génération audio-visuelle synchronisée et un montage vidéo de précision.
Qu'est-ce que Wan 3.0 ?
Wan 3.0 est le modèle de génération vidéo multimodal de nouvelle génération d'Alibaba, conçu pour transformer du texte, des images, de la vidéo, de l'audio, des documents et du contenu web en une vidéo cohérente.
Les flux de travail vidéo IA antérieurs nécessitaient souvent plusieurs modèles spécialisés : un pour le texte-vers-vidéo, un autre pour l'image-vers-vidéo, un autre pour la cohérence de référence, et des outils distincts pour le montage ou l'audio. Wan 3.0 tend vers un modèle de production tout-en-un où ces entrées peuvent être combinées autour d'une instruction créative unique.
Sa capacité phare est la génération native de 30 secondes. Au lieu de produire un court clip de 5 ou 10 secondes qui doit être prolongé et assemblé à plusieurs reprises, Wan 3.0 peut générer une séquence continue de 30 secondes en un seul passage. Les démonstrations d'Alibaba montrent que le modèle maintient les personnages, les environnements, les actions, les mouvements de caméra, les dialogues et le son sur des scènes plus longues.
Un autre changement majeur est Omni-Reference. Les développeurs peuvent utiliser plusieurs ressources de référence pour établir des personnages, des produits, des environnements, des mouvements ou d'autres caractéristiques visuelles. Le référentiel officiel de Wan 3.0 décrit la prise en charge de jusqu'à 20 ressources de référence, tandis que la page produit d'Alibaba Cloud met en avant la capacité à combiner images, texte, vidéo, audio, documents et pages web comme références créatives.
Cela rend Wan 3.0 moins proche d'un simple générateur prompt-vers-vidéo et davantage d'un moteur de production créative multimodale.
Principales fonctionnalités de Wan 3.0
- Génération native de vidéos de 30 secondes : Wan 3.0 peut générer jusqu'à 30 secondes de vidéo en un seul passage, avec une sélection intelligente de la durée et des capacités d'extension de vidéo.
- Omni-Reference : Le texte, les images, la vidéo et l'audio peuvent être combinés comme références. Wan 3.0 étend également la génération basée sur des références aux documents et aux pages web.
- Document-vers-vidéo : Les fichiers PPT, PDF, DOC, XLS, TXT, KEY, PAGES, NUMBERS et MD peuvent être utilisés comme entrées créatives, permettant aux présentations, rapports et informations structurées de devenir du contenu vidéo.
- Génération audio-visuelle native : Wan 3.0 peut générer simultanément la vidéo et le son, en prenant en charge le dialogue, l'audio d'ambiance et des scènes audio-visuelles orientées musique.
- Cohérence des références : Le modèle est conçu pour préserver les personnages, accessoires, environnements, relations spatiales et styles sur les générations pilotées par des références.
- Montage vidéo : Wan 3.0 prend en charge les modifications du contenu visuel généré, de l'intrigue et des dialogues, plutôt que d'exiger que chaque itération reparte de zéro.
Comment Wan 3.0 se compare-t-il à d'autres modèles vidéo ?
| Modèle | Durée native | Image-vers-vidéo | Contrôle de référence | Audio | Entrée Document/Web | Atout principal |
|---|---|---|---|---|---|---|
| Wan 3.0 | 30s | ✓ | Fort | ✓ | ✓ | Production multimodale tout-en-un |
| Wan 2.7 | 15s | ✓ | ✓ | ✓ | Limité | Flux vidéo Wan éprouvés |
| Grok Imagine Video 1.5 | Jusqu'à 15s | ✓ | ✓ | ✓ | — | Vidéo créative courte et rapide |
| Veo | Dépend du modèle | ✓ | ✓ | ✓ | Multimodal | Génération cinématographique |
| Kling | Dépend du modèle | ✓ | ✓ | ✓ | — | Génération de personnages et de mouvements |
| Seedance | Dépend du modèle | ✓ | ✓ | ✓ | — | Vidéo créative et multi-plans |
Le principal facteur différenciant est la largeur des entrées.
Comparé à Grok Imagine Video 1.5, Wan 3.0 va beaucoup plus loin vers un flux de production tout-en-un. Grok est axé sur la génération de courtes vidéos avec des flux texte, image et référence, tandis que Wan 3.0 intègre en plus les documents, les pages web, l'audio et la vidéo comme références créatives directes.
Comparé à Wan 2.7, le plus grand changement au niveau architecture/produit est l'évolution vers un flux multimodal unifié et un plafond de génération native de 30 secondes, par rapport aux clips plus courts de la génération précédente. Les documents actuels de Wan 3.0 chez Alibaba Cloud positionnent explicitement le modèle autour de la génération narrative longue et d'Omni-Reference.
Comparé à Kling et Veo, le principal différenciateur de Wan 3.0 n'est pas nécessairement que chaque image générée sera meilleure. Il s'agit plutôt de la capacité à combiner une grande quantité de matériel source et à maintenir ces informations tout au long d'une génération plus longue.
Pour les applications où l'entrée se limite à "écrire ce prompt et générer un clip cinématographique," d'autres modèles peuvent rester compétitifs. Pour les flux où l'entrée est "voici une image produit, une référence de personnage, un PDF, une feuille de calcul, un échantillon audio et un brief créatif — transformez-les en une vidéo cohérente," Wan 3.0 devient beaucoup plus convaincant.
Cas d'utilisation représentatifs de Wan 3.0
1. Réalisation IA et production d'histoires
La capacité de génération unique de 30 secondes rend Wan 3.0 utile pour des scènes nécessitant des mouvements de caméra continus, du dialogue et plusieurs actions sans assembler de nombreux courts clips.
2. Publicité produit
Une image produit ou un ensemble de références peut être combiné avec un prompt de type réalisateur pour créer des démonstrations produits, des publicités UGC et des vidéos de marque cinématographiques.
3. Génération de présentation-vers-vidéo
Wan 3.0 peut traiter des formats PPT, PDF, DOC, XLS et autres formats de documents pris en charge, ce qui le rend adapté à la conversion de rapports, présentations et informations structurées en récits visuels.
4. Vidéo cohérente en personnages
Des images, vidéos et autres médias de référence peuvent être utilisés pour établir des personnages, objets et environnements avant de générer une scène.
5. Contenu pour les réseaux sociaux
La durée de 30 secondes et le format vertical 9:16 rendent Wan 3.0 adapté au contenu court pour les réseaux sociaux, aux publicités et aux clips narratifs.
6. Montage et itération vidéo
Wan 3.0 peut modifier du contenu généré existant, y compris les éléments visuels, le contenu de l'histoire et les dialogues, permettant des flux créatifs itératifs.
Paramètres de l'API Wan 3.0
L'API officielle utilise un point de terminaison asynchrone de génération vidéo. Une requête simplifiée contient un objet model, input et parameters.
Les paramètres importants incluent :
| Paramètre | Description |
|---|---|
| model | wan3.0-video |
| input.prompt | Instruction de génération de type réalisateur |
| input.media | Images, vidéos, audio, fichiers ou ressources web de référence |
| parameters.resolution | 480P, 720P, 1080P |
| parameters.ratio | adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 |
| parameters.duration | 2–30 secondes ; -1 active la durée intelligente |
| parameters.audio | Indique s'il faut inclure une piste audio |
| parameters.seed | Graine aléatoire pour la reproductibilité |
| parameters.watermark | Indique s'il faut ajouter un filigrane |
La documentation officielle indique que lorsqu'aucune entrée vidéo n'est fournie, la durée peut être un entier de 2 à 30 secondes. Lorsqu'une entrée vidéo est fournie, la durée d'entrée et la durée de sortie doivent ensemble rester dans la durée totale prise en charge.
Comment utiliser l'API Wan 3.0 sur CometAPI
Pour les développeurs utilisant plusieurs modèles de génération vidéo IA, CometAPI peut servir de couche d'accès unifiée pour expérimenter Wan 3.0 aux côtés d'autres modèles de génération vidéo.
Un flux de travail typique est :
- Créer un compte CometAPI ou s'y connecter.
- Obtenir une clé API CometAPI.
- Sélectionner le point de terminaison du modèle Wan 3.0.
- Soumettre une requête de génération texte-vers-vidéo, image-vers-vidéo ou basée sur des références.
- Spécifier la résolution, la durée, le format d'image et autres paramètres pris en charge.
- Surveiller la tâche de génération asynchrone.
- Récupérer la vidéo générée lorsque le traitement est terminé.
Le point de terminaison exact de CometAPI et les paramètres pris en charge doivent être vérifiés par rapport à l'intégration actuelle de Wan 3.0 sur CometAPI avant la mise en œuvre, en particulier parce que l'API amont d'Alibaba est encore en aperçu.