TL;DR Wan 3.0 (également stylisé Wan3.0), le tout dernier modèle vidéo tout-en-un du laboratoire Alibaba Tongyi, génère des plans continus natifs de 30 secondes jusqu’à 1080p avec audio synchronisé en un seul passage. Il prend en charge le texte-vers-vidéo, l’image-vers-vidéo, le conditionnement par première et dernière image, ainsi que de puissants workflows Omni-Reference acceptant des images, des vidéos, de l’audio, des documents (PDF, PPT, XLS, DOC, MD, etc.) et des pages web.
La bêta publique a ouvert le 6 août 2026 ; un accès plus large a suivi autour du 24 août 2026. La tarification est d’environ 0,05 $/s (480p), 0,10 $/s (720p) et 0,20 $/s (1080p). Pour les développeurs et les équipes recherchant une API unifiée, compatible OpenAI, pour accéder aux modèles de la famille Wan et à plus de 500 autres avec une intégration simple, CometAPI offre une voie efficace — proposant actuellement Wan 2.7 et un catalogue vidéo en expansion via /v1/videos.
Points clés
- Génération native en prise unique de 30 secondes (le double de la limite ~15 s de Wan 2.7/2.5 précédents) avec appariement intelligent de la durée.
- Omni-Reference : jusqu’à ~10–20 ressources mixtes (images, vidéos ≤15 s au total, audios, un document/une page web) pour une forte cohérence de sujet, produit et style.
- La conversion de documents et de pages web en vidéo se démarque : fournissez un PDF, un deck, une feuille de calcul ou une URL publique et recevez une vidéo structurée.
- Génération audio native dans le même passage ; résolutions 480p/720p/1080p ; multiples ratios d’aspect.
- Meilleure fidélité des visages/micro-expressions, références plus stables et texte à l’écran plus propre que les générations précédentes.
- Accès via Alibaba Cloud Model Studio / Qwen Cloud (modèle
wan3.0-video), wan.video et plateformes tierces. Pour un développement multi-modèle rationalisé, utilisez l’endpoint vidéo unifié de CometAPI. - Rédigez le prompt comme un brief de plan (sujet + action + caméra + timing + contraintes) et étiquetez clairement les références (@Image1, etc.).
Qu’est-ce que Wan 3.0 ?
Wan 3.0 est le tout nouveau fleuron de la famille de génération vidéo Tongyi Wanxiang (Wan) d’Alibaba, développé par Tongyi Lab. Il s’appuie sur la lignée diffusion-transformer des versions Wan ouvertes et fermées antérieures (y compris la série Wan ouverte largement étudiée depuis 2025).
Les améliorations clés par rapport à Wan 2.7 / 2.5 incluent :
- Durée native maximale doublée à 30 secondes en une génération continue (non pas des clips assemblés).
- Entrées multimodales étendues au-delà du texte/image/vidéo/audio pour inclure des documents bureautiques et des pages web publiques.
- Rendu “Reality-grade” amélioré pour les visages, micro-expressions, détails produits et la cohérence des contenus numériques/UI.
- Modèle unifié tout-en-un couvrant texte-vers-vidéo (T2V), image-vers-vidéo (I2V), première-et-dernière image, référence-vers-vidéo, et des capacités associées d’édition/extension.
Alibaba le positionne pour des vidéos marketing, des courts-métrages, des contenus sociaux, des démonstrations produit, des séquences d’entraînement/simulation (par ex., robotique ou AV) et des vidéos d’entreprise explicatives. Le modèle reste à poids fermés / accessible uniquement via API (les poids ouverts s’arrêtent aux versions Wan 2.x antérieures).
Données et sources à l’appui : Exemples de tarification (international) : 480p 0,05 $/s, 720p 0,10 $/s, 1080p 0,20 $/s (un clip de 30 secondes en 1080p ≈ 6 $ standard). Certaines plateformes proposent des niveaux Standard vs Prime plus rapide ou des remises temporaires.
Comment utiliser l’API Wan 3.0
Alibaba Cloud expose Wan 3.0 via l’API de génération vidéo Model Studio. L’identifiant de modèle actuel est :
wan3.0-video
L’API utilise une génération vidéo asynchrone. Une requête représentative est :
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
-H 'X-DashScope-Async: enable' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "wan3.0-video",
"input": {
"prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
},
"parameters": {
"resolution": "720P",
"ratio": "16:9",
"duration": 10,
"enable_thinking": false
}
}'
La référence de l’API Alibaba indique que le modèle, l’endpoint et la clé API doivent appartenir à la même région. L’API étant asynchrone, les applications doivent soumettre la tâche puis récupérer le résultat généré après traitement.
Pour les workflows image-vers-vidéo et basés sur des références, l’objet input peut inclure des médias de référence. L’exemple actuel d’Alibaba démontre une combinaison de vidéo de référence et d’images de référence dans une même requête.
Comment utiliser Wan 3.0 via CometAPI (recommandé pour les développeurs)
CometAPI offre une interface unifiée, compatible OpenAI, vers 500+ modèles, y compris les modèles vidéo Alibaba Wan (Wan 2.7 actuellement listé avec une tarification compétitive à la seconde ; consultez le catalogue en direct pour Wan 3.0 au fur et à mesure de sa disponibilité). La génération vidéo utilise l’endpoint /v1/videos avec formulaire multipart — idéal pour les pipelines de production, l’automatisation n8n/Make, ou le basculement entre Wan, Seedance, Kling, Veo, MiniMax, etc., sous une seule clé.
Étapes CometAPI :
- Inscrivez-vous / connectez-vous sur cometapi.com et créez une clé API (sk-…).
- Consultez la doc de l’API vidéo (apidoc.cometapi.com) et la liste des modèles pour l’ID Wan exact (par ex., motif
wan2.7; confirmez la dernière version). - Envoyez une requête POST vers
https://api.cometapi.com/v1/videosavec les champs de formulaire : - Recevez un task/ID ; interrogez l’endpoint de statut ou utilisez des webhooks jusqu’à achèvement.
- Téléchargez le contenu vidéo obtenu.
- Surveillez l’usage et les coûts dans le tableau de bord CometAPI (paiement à l’usage, sans minimum mensuel).
Comment formuler des prompts efficaces pour Wan 3.0
Traitez les prompts comme des briefs de plans, pas comme de simples légendes. Une structure éprouvée (adaptée des guides de la communauté et des plateformes) :
Formule de type SPACE ou liste de plans :
- Sujet : description concrète de qui/quoi.
- Performance/Action : mouvements visibles et changements d’état dans l’ordre temporel.
- Ambiance/Cadre : lieu, moment, éclairage, météo.
- Caméra : taille de plan + un seul mouvement clair (lent avancé, orbitale, travelling, fixe).
- Extra : style, indices audio, rythme, contraintes (« garder l’étiquette lisible », « préserver l’identité du visage »).
Pour des clips de 30 s multi-temps forts, numérotez les plans avec des plages temporelles :
Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.
Liaison des références (cruciale pour Omni-Reference) :
@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.
Conseils supplémentaires :
- Soyez précis sur les actions observables et les relations spatiales.
- Utilisez des prompts négatifs pour les échecs courants (mains déformées, texte indésirable, dérive de style).
- Pour les documents : « Créez une vidéo explicative qui suit la structure du PDF joint, en mettant en avant les trois indicateurs clés de la page 2 et les recommandations de la conclusion. »
- Itérez : générez d’abord des versions courtes, puis développez les séquences qui fonctionnent.
- Le langage caméra et les descripteurs d’éclairage améliorent la qualité cinématographique.
Pourquoi utiliser Wan 3.0 ?
Wan 3.0 est particulièrement pertinent lorsque l’application doit transformer plusieurs types de sources en une vidéo cohérente plutôt que de simplement convertir un prompt texte en un court clip.
Ses avantages les plus forts sont :
- Génération vidéo native de 30 secondes
- Texte-vers-vidéo et image-vers-vidéo
- Génération multi-références
- Entrées texte, image, vidéo, audio et document
- Workflows document-vers-vidéo et page web-vers-vidéo
- Génération audio native
- Sortie 1080P
- Édition vidéo basée sur instructions
- Forte cohérence des références
- Tarification à la seconde
- Un seul modèle pour de multiples workflows créatifs
Pour les développeurs construisant des outils de film IA, des systèmes publicitaires, des générateurs de vidéos produit, des plateformes de contenus éducatifs ou des agents créatifs multimodaux, ces capacités peuvent réduire significativement le nombre de modèles séparés et d’étapes de prétraitement nécessaires.
Conclusion et recommandation
Wan 3.0 représente un pas significatif vers une vidéo IA pratique et orientée production : prises continues plus longues, véritable document-vers-vidéo et contrôle multimodal renforcé. Combiné à un prompt réfléchi et à une discipline de référence, il peut condenser en minutes des jours de production traditionnelle pour de nombreux cas d’usage marketing, explicatifs et de formats courts.
Pour les développeurs et équipes construisant des applications ou des outils internes, commencez par les canaux officiels d’Alibaba pour l’expérience Wan 3.0 la plus fidèle, et envisagez CometAPI (cometapi.com) comme un point d’accès à forte productivité. Son API vidéo unifiée, sa large couverture de modèles (incluant le Wan 2.7 actuel et un catalogue en expansion), son interface compatible OpenAI et son modèle transparent à l’usage rendent simple l’expérimentation, l’industrialisation et la combinaison de la génération de classe Wan avec des LLM, images et modèles audio complémentaires sous une seule intégration.
Consultez la liste des modèles et la documentation les plus récentes sur CometAPI et Alibaba Cloud Model Studio, expérimentez avec des clips courts, affinez vos prompts sous forme de liste de plans, puis passez à des productions complètes de 30 secondes. La combinaison d’une durée native plus longue et d’Omni-Reference ouvre de nouveaux workflows créatifs et business auparavant lourds ou coûteux.
