TLDR Wan 3.0 (anche stilizzato Wan3.0), l’ultimo modello video all-in-one di Alibaba Tongyi Lab, genera clip continue native di 30 secondi fino a 1080p con audio sincronizzato in un’unica passata. Supporta text-to-video, image-to-video, vincolo su primo e ultimo fotogramma e potenti flussi Omni-Reference che accettano immagini, video, audio, documenti (PDF, PPT, XLS, DOC, MD, ecc.) e pagine web.
La beta pubblica è stata aperta il 6 agosto 2026; un accesso più ampio è seguito intorno al 24 agosto 2026. Il prezzo è approssimativamente $0.05/s (480p), $0.10/s (720p) e $0.20/s (1080p). Per sviluppatori e team che cercano un’API unificata e compatibile con OpenAI per accedere ai modelli della famiglia Wan e a oltre 500 altri con un’integrazione semplice, CometAPI offre una via efficiente—attualmente con Wan 2.7 e un catalogo video in crescita tramite /v1/videos.
Punti chiave
- Generazione nativa in un’unica ripresa di 30 secondi (il doppio del precedente limite di ~15 s di Wan 2.7/2.5) con abbinamento intelligente della durata.
- Omni-Reference: fino a ~10–20 asset misti (immagini, video ≤15 s totali, audio, un documento/pagina web) per una forte coerenza di soggetti, prodotti e stile.
- La conversione da documenti e pagine web a video è una caratteristica di spicco: fornisci un PDF, una presentazione, un foglio di calcolo o un URL pubblico e ricevi un video strutturato.
- Generazione audio nativa nella stessa passata; risoluzioni 480p/720p/1080p; più rapporti d’aspetto.
- Maggiore fedeltà di volti/micro-espressioni, riferimenti più stabili e testo su schermo più pulito rispetto alle generazioni precedenti.
- Accesso tramite Alibaba Cloud Model Studio / Qwen Cloud (modello
wan3.0-video), wan.video e piattaforme di terze parti. Per uno sviluppo multi-modello semplificato, usa l’endpoint video unificato di CometAPI. - Scrivi prompt come una scheda di ripresa (soggetto + azione + camera + tempistiche + vincoli) e etichetta in modo esplicito le reference (@Image1, ecc.).
Che cos’è Wan 3.0?
Wan 3.0 è il nuovo flagship della famiglia di generazione video Tongyi Wanxiang (Wan) di Alibaba, sviluppato da Tongyi Lab. Si basa sulla linea diffusion-transformer delle precedenti release Wan open e closed (incluse le serie Wan open del 2025 ampiamente studiate).
Aggiornamenti chiave rispetto a Wan 2.7 / 2.5 includono:
- Durata massima nativa raddoppiata a 30 secondi in un’unica generazione continua (non clip cuciti).
- Input multimodali estesi oltre testo/immagine/video/audio per includere documenti d’ufficio e pagine web pubbliche.
- Rendering “di livello realistico” migliorato per volti, micro-espressioni, dettagli di prodotto e coerenza dei contenuti digitali/UI.
- Modello unificato all-in-one che copre text-to-video (T2V), image-to-video (I2V), primo e ultimo fotogramma, reference-to-video e funzionalità correlate di editing/estensione.
Alibaba lo posiziona per video di marketing, corti, contenuti social, demo di prodotto, riprese di training/simulazione (es. robotica o guida autonoma) e video aziendali esplicativi. Il modello rimane a pesi chiusi / solo API (i pesi open si fermano alle precedenti release Wan 2.x).
Dati e fonti di supporto: Esempi di prezzi di listino (internazionale): 480p $0.05/s, 720p $0.10/s, 1080p $0.20/s (un clip da 30 secondi a 1080p ≈ $6 standard). Alcune piattaforme offrono livelli Standard vs Prime più veloci o sconti temporanei.
Come usare l’API di Wan 3.0
Alibaba Cloud espone Wan 3.0 tramite l’API di generazione video di Model Studio. L’identificatore del modello attuale è:
wan3.0-video
L’API utilizza la generazione video asincrona. Una richiesta rappresentativa è:
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
-H 'X-DashScope-Async: enable' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "wan3.0-video",
"input": {
"prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
},
"parameters": {
"resolution": "720P",
"ratio": "16:9",
"duration": 10,
"enable_thinking": false
}
}'
La documentazione dell’API di Alibaba segnala che il modello, l’endpoint e la chiave API devono appartenere alla stessa regione. L’API è asincrona, quindi le applicazioni dovrebbero inviare il task e poi recuperare il risultato generato dopo l’elaborazione.
Per i workflow image-to-video e basati su reference, l’oggetto input può includere media di riferimento. L’esempio attuale di Alibaba mostra una combinazione di video di riferimento e immagini di riferimento nella stessa richiesta.
Come usare Wan 3.0 tramite CometAPI (consigliato per gli sviluppatori)
CometAPI offre un’interfaccia unificata, compatibile con OpenAI, a oltre 500 modelli, inclusi i modelli video della famiglia Alibaba Wan (attualmente Wan 2.7 elencato con prezzi competitivi al secondo; verifica il catalogo live per Wan 3.0 man mano che l’offerta si amplia). La generazione video usa l’endpoint /v1/videos con form-data multipart—ideale per pipeline di produzione, automazioni n8n/Make o per passare tra Wan, Seedance, Kling, Veo, MiniMax, ecc., con una sola chiave.
Passaggi CometAPI:
- Registrati / accedi su cometapi.com e crea una chiave API (sk-…).
- Consulta la documentazione dell’API video (apidoc.cometapi.com) e l’elenco modelli per l’ID Wan esatto (ad es., pattern
wan2.7; conferma l’ultimo). - Invia una POST a
https://api.cometapi.com/v1/videoscon campi del form: - Ricevi un task/ID; interroga l’endpoint di stato o usa webhook fino al completamento.
- Scarica il contenuto video risultante.
- Monitora utilizzo e costi nella dashboard CometAPI (pagamento a consumo, senza minimi mensili).
Come creare prompt efficaci per Wan 3.0
Tratta i prompt come schede di ripresa, non come didascalie casuali. Una struttura collaudata (adattata da guide della community e delle piattaforme):
Formula in stile SPACE o elenco di inquadrature:
- Soggetto: descrizione concreta di chi/cosa.
- Performance/Azione: movimenti visibili e cambi di stato in ordine temporale.
- Ambiente/Setting: luogo, ora, illuminazione, meteo.
- Camera: dimensione dell’inquadratura + un solo movimento chiaro (lento push-in, orbit, tracking, statico).
- Extra: stile, cue audio, ritmo, vincoli (“mantieni l’etichetta leggibile”, “preserva l’identità del volto”).
Per clip multi-beat da 30 s, numerare le riprese con intervalli temporali:
Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.
Associazione delle reference (critico per Omni-Reference):
@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.
Suggerimenti aggiuntivi:
- Sii specifico su azioni osservabili e relazioni spaziali.
- Usa prompt negativi per i failure mode comuni (mani distorte, testo indesiderato, drift di stile).
- Per i documenti: “Create an explainer video that follows the structure of the attached PDF, emphasizing the three key metrics on page 2 and the conclusion recommendations.”
- Itera: genera prima versioni brevi, poi espandi i beat riusciti.
- Linguaggio di camera e descrittori di luce migliorano la qualità cinematografica.
Perché usare Wan 3.0?
Wan 3.0 è particolarmente convincente quando l’applicazione deve trasformare più tipi di materiale sorgente in un video coerente piuttosto che limitarsi a convertire un prompt testuale in una breve clip.
I suoi vantaggi più forti sono:
- Generazione video nativa da 30 secondi
- Text-to-video e image-to-video
- Generazione video multi-reference
- Input di testo, immagini, video, audio e documenti
- Workflow da documento e pagina web a video
- Generazione audiovisiva nativa
- Output 1080P
- Editing video basato su istruzioni
- Forte coerenza delle reference
- Prezzi al secondo
- Un unico modello per molteplici workflow creativi
Per gli sviluppatori che costruiscono strumenti di filmmaking AI, sistemi pubblicitari, generatori di video prodotto, piattaforme di contenuti educativi o agenti creativi multimodali, queste capacità possono ridurre significativamente il numero di modelli separati e di passaggi di pre-processing necessari.
Conclusione e raccomandazione
Wan 3.0 rappresenta un passo significativo verso un video AI pratico e orientato alla produzione: riprese continue più lunghe, autentico documento-to-video e controllo multimodale più robusto. Combinato con prompting accurato e disciplina nelle reference, può comprimere giorni di produzione tradizionale in minuti per molti casi d’uso di marketing, explainers e short-form.
Per sviluppatori e team che costruiscono applicazioni o strumenti interni, inizia con i canali ufficiali Alibaba per l’esperienza Wan 3.0 più pura e considera CometAPI (cometapi.com) come un gateway ad alta produttività. La sua API video unificata, l’ampia copertura di modelli (incluso l’attuale Wan 2.7 e un catalogo in espansione), l’interfaccia compatibile con OpenAI e il modello a consumo trasparente rendono semplice sperimentare, scalare e combinare la generazione classe Wan con LLM, modelli immagine e audio complementari sotto un’unica integrazione.
Verifica l’elenco modelli e la documentazione più recenti su CometAPI e Alibaba Cloud Model Studio, sperimenta con clip brevi, affina i prompt in shot-list e scala fino a produzioni complete da 30 secondi. La combinazione di durata nativa più lunga e Omni-Reference apre nuovi workflow creativi e di business prima macchinosi o costosi.
