Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
guide/Ricerca CometAPI

Come utilizzare Wan 3: Guida alle API + prompt

Scopri Wan 3.0 con audio a partire da testo, immagini, documenti (PDF/PPT) e pagine web. Specifiche, prezzi, prompt & come usarlo via API.

CometAPI
AnnaTeam di ricerca su modelli AI e API
Aggiornato Aug 29, 2026 7 min di lettura
Come utilizzare Wan 3: Guida alle API + prompt
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Wan 3.0 (anche stilizzato Wan3.0), l’ultimo modello video all-in-one di Alibaba Tongyi Lab, genera clip continue native di 30 secondi fino a 1080p con audio sincronizzato in un’unica passata. Supporta text-to-video, image-to-video, vincolo su primo e ultimo fotogramma e potenti flussi Omni-Reference che accettano immagini, video, audio, documenti (PDF, PPT, XLS, DOC, MD, ecc.) e pagine web.

La beta pubblica è stata aperta il 6 agosto 2026; un accesso più ampio è seguito intorno al 24 agosto 2026. Il prezzo è approssimativamente $0.05/s (480p), $0.10/s (720p) e $0.20/s (1080p). Per sviluppatori e team che cercano un’API unificata e compatibile con OpenAI per accedere ai modelli della famiglia Wan e a oltre 500 altri con un’integrazione semplice, CometAPI offre una via efficiente—attualmente con Wan 2.7 e un catalogo video in crescita tramite /v1/videos.

Punti chiave

  • Generazione nativa in un’unica ripresa di 30 secondi (il doppio del precedente limite di ~15 s di Wan 2.7/2.5) con abbinamento intelligente della durata.
  • Omni-Reference: fino a ~10–20 asset misti (immagini, video ≤15 s totali, audio, un documento/pagina web) per una forte coerenza di soggetti, prodotti e stile.
  • La conversione da documenti e pagine web a video è una caratteristica di spicco: fornisci un PDF, una presentazione, un foglio di calcolo o un URL pubblico e ricevi un video strutturato.
  • Generazione audio nativa nella stessa passata; risoluzioni 480p/720p/1080p; più rapporti d’aspetto.
  • Maggiore fedeltà di volti/micro-espressioni, riferimenti più stabili e testo su schermo più pulito rispetto alle generazioni precedenti.
  • Accesso tramite Alibaba Cloud Model Studio / Qwen Cloud (modello wan3.0-video), wan.video e piattaforme di terze parti. Per uno sviluppo multi-modello semplificato, usa l’endpoint video unificato di CometAPI.
  • Scrivi prompt come una scheda di ripresa (soggetto + azione + camera + tempistiche + vincoli) e etichetta in modo esplicito le reference (@Image1, ecc.).

Che cos’è Wan 3.0?

Wan 3.0 è il nuovo flagship della famiglia di generazione video Tongyi Wanxiang (Wan) di Alibaba, sviluppato da Tongyi Lab. Si basa sulla linea diffusion-transformer delle precedenti release Wan open e closed (incluse le serie Wan open del 2025 ampiamente studiate).

Aggiornamenti chiave rispetto a Wan 2.7 / 2.5 includono:

  • Durata massima nativa raddoppiata a 30 secondi in un’unica generazione continua (non clip cuciti).
  • Input multimodali estesi oltre testo/immagine/video/audio per includere documenti d’ufficio e pagine web pubbliche.
  • Rendering “di livello realistico” migliorato per volti, micro-espressioni, dettagli di prodotto e coerenza dei contenuti digitali/UI.
  • Modello unificato all-in-one che copre text-to-video (T2V), image-to-video (I2V), primo e ultimo fotogramma, reference-to-video e funzionalità correlate di editing/estensione.

Alibaba lo posiziona per video di marketing, corti, contenuti social, demo di prodotto, riprese di training/simulazione (es. robotica o guida autonoma) e video aziendali esplicativi. Il modello rimane a pesi chiusi / solo API (i pesi open si fermano alle precedenti release Wan 2.x).

Dati e fonti di supporto: Esempi di prezzi di listino (internazionale): 480p $0.05/s, 720p $0.10/s, 1080p $0.20/s (un clip da 30 secondi a 1080p ≈ $6 standard). Alcune piattaforme offrono livelli Standard vs Prime più veloci o sconti temporanei.

Come usare l’API di Wan 3.0

Alibaba Cloud espone Wan 3.0 tramite l’API di generazione video di Model Studio. L’identificatore del modello attuale è:

wan3.0-video

L’API utilizza la generazione video asincrona. Una richiesta rappresentativa è:

curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
  -H 'X-DashScope-Async: enable' \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "wan3.0-video",
    "input": {
      "prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
    },
    "parameters": {
      "resolution": "720P",
      "ratio": "16:9",
      "duration": 10,
      "enable_thinking": false
    }
  }'

La documentazione dell’API di Alibaba segnala che il modello, l’endpoint e la chiave API devono appartenere alla stessa regione. L’API è asincrona, quindi le applicazioni dovrebbero inviare il task e poi recuperare il risultato generato dopo l’elaborazione.

Per i workflow image-to-video e basati su reference, l’oggetto input può includere media di riferimento. L’esempio attuale di Alibaba mostra una combinazione di video di riferimento e immagini di riferimento nella stessa richiesta.

Come usare Wan 3.0 tramite CometAPI (consigliato per gli sviluppatori)

CometAPI offre un’interfaccia unificata, compatibile con OpenAI, a oltre 500 modelli, inclusi i modelli video della famiglia Alibaba Wan (attualmente Wan 2.7 elencato con prezzi competitivi al secondo; verifica il catalogo live per Wan 3.0 man mano che l’offerta si amplia). La generazione video usa l’endpoint /v1/videos con form-data multipart—ideale per pipeline di produzione, automazioni n8n/Make o per passare tra Wan, Seedance, Kling, Veo, MiniMax, ecc., con una sola chiave.

Passaggi CometAPI:

  1. Registrati / accedi su cometapi.com e crea una chiave API (sk-…).
  2. Consulta la documentazione dell’API video (apidoc.cometapi.com) e l’elenco modelli per l’ID Wan esatto (ad es., pattern wan2.7; conferma l’ultimo).
  3. Invia una POST a https://api.cometapi.com/v1/videos con campi del form:
  4. Ricevi un task/ID; interroga l’endpoint di stato o usa webhook fino al completamento.
  5. Scarica il contenuto video risultante.
  6. Monitora utilizzo e costi nella dashboard CometAPI (pagamento a consumo, senza minimi mensili).

Come creare prompt efficaci per Wan 3.0

Tratta i prompt come schede di ripresa, non come didascalie casuali. Una struttura collaudata (adattata da guide della community e delle piattaforme):

Formula in stile SPACE o elenco di inquadrature:

  • Soggetto: descrizione concreta di chi/cosa.
  • Performance/Azione: movimenti visibili e cambi di stato in ordine temporale.
  • Ambiente/Setting: luogo, ora, illuminazione, meteo.
  • Camera: dimensione dell’inquadratura + un solo movimento chiaro (lento push-in, orbit, tracking, statico).
  • Extra: stile, cue audio, ritmo, vincoli (“mantieni l’etichetta leggibile”, “preserva l’identità del volto”).

Per clip multi-beat da 30 s, numerare le riprese con intervalli temporali:

Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.

Associazione delle reference (critico per Omni-Reference):

@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.

Suggerimenti aggiuntivi:

  • Sii specifico su azioni osservabili e relazioni spaziali.
  • Usa prompt negativi per i failure mode comuni (mani distorte, testo indesiderato, drift di stile).
  • Per i documenti: “Create an explainer video that follows the structure of the attached PDF, emphasizing the three key metrics on page 2 and the conclusion recommendations.”
  • Itera: genera prima versioni brevi, poi espandi i beat riusciti.
  • Linguaggio di camera e descrittori di luce migliorano la qualità cinematografica.

Perché usare Wan 3.0?

Wan 3.0 è particolarmente convincente quando l’applicazione deve trasformare più tipi di materiale sorgente in un video coerente piuttosto che limitarsi a convertire un prompt testuale in una breve clip.

I suoi vantaggi più forti sono:

  • Generazione video nativa da 30 secondi
  • Text-to-video e image-to-video
  • Generazione video multi-reference
  • Input di testo, immagini, video, audio e documenti
  • Workflow da documento e pagina web a video
  • Generazione audiovisiva nativa
  • Output 1080P
  • Editing video basato su istruzioni
  • Forte coerenza delle reference
  • Prezzi al secondo
  • Un unico modello per molteplici workflow creativi

Per gli sviluppatori che costruiscono strumenti di filmmaking AI, sistemi pubblicitari, generatori di video prodotto, piattaforme di contenuti educativi o agenti creativi multimodali, queste capacità possono ridurre significativamente il numero di modelli separati e di passaggi di pre-processing necessari.

Conclusione e raccomandazione

Wan 3.0 rappresenta un passo significativo verso un video AI pratico e orientato alla produzione: riprese continue più lunghe, autentico documento-to-video e controllo multimodale più robusto. Combinato con prompting accurato e disciplina nelle reference, può comprimere giorni di produzione tradizionale in minuti per molti casi d’uso di marketing, explainers e short-form.

Per sviluppatori e team che costruiscono applicazioni o strumenti interni, inizia con i canali ufficiali Alibaba per l’esperienza Wan 3.0 più pura e considera CometAPI (cometapi.com) come un gateway ad alta produttività. La sua API video unificata, l’ampia copertura di modelli (incluso l’attuale Wan 2.7 e un catalogo in espansione), l’interfaccia compatibile con OpenAI e il modello a consumo trasparente rendono semplice sperimentare, scalare e combinare la generazione classe Wan con LLM, modelli immagine e audio complementari sotto un’unica integrazione.

Verifica l’elenco modelli e la documentazione più recenti su CometAPI e Alibaba Cloud Model Studio, sperimenta con clip brevi, affina i prompt in shot-list e scala fino a produzioni complete da 30 secondi. La combinazione di durata nativa più lunga e Omni-Reference apre nuovi workflow creativi e di business prima macchinosi o costosi.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Aug 27, 2026
Ultimo aggiornamento Aug 29, 2026
6 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più