Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
guide/CometAPI Research

So verwenden Sie Wan 3: API-Leitfaden+ Prompts

Entdecken Sie Wan 3.0 mit Audio aus Texten, Bildern, Dokumenten (PDF/PPT) und Webseiten. Spezifikationen, Preise, Prompt & wie Sie es über die API verwenden.

CometAPI
AnnaForschungsteam für KI-Modelle und API
Aktualisiert Aug 29, 2026 6 Min. Lesezeit
So verwenden Sie Wan 3: API-Leitfaden+ Prompts
Dieses Muster verwenden

Den ersten API-Aufruf ausführen.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Wan 3.0 (auch als Wan3.0 geschrieben), das neueste All-in-One-Videomodell des Alibaba Tongyi Lab, erzeugt native, 30-sekündige, durchgehende Clips mit bis zu 1080p und synchronisiertem Audio in einem einzigen Durchlauf. Es unterstützt Text-zu-Video, Bild-zu-Video, First‑und‑Last‑Frame‑Conditioning sowie leistungsfähige Omni-Reference‑Workflows, die Bilder, Videos, Audios, Dokumente (PDF, PPT, XLS, DOC, MD usw.) und Webseiten akzeptieren.

Die öffentliche Beta startete am 6. August 2026; breiterer Zugriff folgte um den 24. August 2026. Die Preise liegen ungefähr bei $0.05/s (480p), $0.10/s (720p) und $0.20/s (1080p). Für Entwickler und Teams, die eine einheitliche, OpenAI-kompatible API suchen, um mit einfacher Integration auf die Wan‑Familie und 500+ weitere Modelle zuzugreifen, bietet CometAPI einen effizienten Weg—derzeit mit Wan 2.7 und einem wachsenden Videokatalog über /v1/videos.

Wichtigste Punkte

  • Native, 30‑sekündige Single-Take‑Generierung (doppelt so lang wie das frühere Limit von ca. ~15 s bei Wan 2.7/2.5) mit intelligenter Daueranpassung.
  • Omni-Reference: bis zu ~10–20 gemischte Assets (Bilder, Videos ≤15 s insgesamt, Audios, ein Dokument/eine Webseite) für starke Subjekt‑, Produkt‑ und Stil-Konsistenz.
  • Dokument‑ und Webseiten‑zu‑Video ist herausragend: PDF, Präsentation, Tabelle oder öffentliche URL einspeisen und ein strukturiertes Video erhalten.
  • Native Audiogenerierung im selben Durchlauf; Auflösungen 480p/720p/1080p; mehrere Seitenverhältnisse.
  • Bessere Gesichtstreue/Mikromimik, stabilere Referenzen und sauberere On‑Screen‑Texte als in früheren Generationen.
  • Zugriff über Alibaba Cloud Model Studio / Qwen Cloud (Modell wan3.0-video), wan.video und Drittplattformen. Für schlanke Multi‑Modell‑Entwicklung nutzen Sie CometAPIs einheitlichen Video‑Endpunkt.
  • Prompten Sie wie ein Shot‑Brief (Subjekt + Aktion + Kamera + Timing + Constraints) und kennzeichnen Sie Referenzen explizit (@Image1 usw.).

Was ist Wan 3.0?

Wan 3.0 ist das neueste Flaggschiff in Alibabas Tongyi Wanxiang (Wan) Video‑Familie, entwickelt vom Tongyi Lab. Es baut auf der Diffusion‑Transformer‑Linie früherer offener und geschlossener Wan‑Releases auf (einschließlich der viel untersuchten offenen Wan‑Serie aus 2025).

Wesentliche Upgrades gegenüber Wan 2.7 / 2.5 umfassen:

  • Verdopplung der maximalen nativen Dauer auf 30 Sekunden in einer kontinuierlichen Generation (keine zusammengesetzten Clips).
  • Erweiterte multimodale Eingaben über Text/Bild/Video/Audio hinaus um Office‑Dokumente und öffentliche Webseiten.
  • Verbesserte „Reality‑Grade“-Renderqualität für Gesichter, Mikromimik, Produktdetails und Konsistenz bei digitalen/UI‑Inhalten.
  • Vereinheitlichtes All‑in‑One‑Modell für Text‑zu‑Video (T2V), Bild‑zu‑Video (I2V), First‑und‑Last‑Frame, Reference‑to‑Video sowie zugehörige Editing/Extension‑Fähigkeiten.

Alibaba positioniert es für Marketingvideos, Kurzdramen, Social‑Content, Produktdemos, Trainings-/Simulationsmaterial (z. B. Robotik oder AV) und Unternehmens‑Erklärvideos. Das Modell bleibt mit geschlossenen Gewichten, nur per API (offene Gewichte enden bei früheren Wan‑2.x‑Versionen).

Daten & Quellen: Beispiele für Listenpreise (international): 480p $0.05/s, 720p $0.10/s, 1080p $0.20/s (ein 30‑Sekunden‑Clip in 1080p ≈ $6 Standard). Einige Plattformen bieten Standard‑ vs. schnellere Prime‑Tiers oder temporäre Rabatte.

Wie verwendet man die Wan‑3.0‑API

Alibaba Cloud stellt Wan 3.0 über die Video‑Generierungs‑API von Model Studio bereit. Die aktuelle Modellkennung lautet:

wan3.0-video

Die API nutzt asynchrone Videogenerierung. Eine repräsentative Anfrage ist:

curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
  -H 'X-DashScope-Async: enable' \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "wan3.0-video",
    "input": {
      "prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
    },
    "parameters": {
      "resolution": "720P",
      "ratio": "16:9",
      "duration": 10,
      "enable_thinking": false
    }
  }'

Die API‑Referenz von Alibaba weist darauf hin, dass Modell, Endpunkt und API‑Schlüssel derselben Region angehören müssen. Die API ist asynchron, daher sollten Anwendungen die Aufgabe einreichen und das erzeugte Ergebnis nach der Verarbeitung abrufen.

Für Bild‑zu‑Video‑ und referenzbasierte Workflows kann das Objekt input Referenzmedien enthalten. Alibabas aktuelles Beispiel demonstriert eine Kombination aus Referenzvideo und Referenzbildern in derselben Anfrage.

Nutzung von Wan 3.0 über CometAPI (für Entwickler empfohlen)

CometAPI bietet eine einheitliche, OpenAI‑kompatible Schnittstelle zu 500+ Modellen, einschließlich der Video‑Modelle der Alibaba‑Wan‑Familie (Wan 2.7 derzeit gelistet mit wettbewerbsfähiger Sekundenpreis‑Abrechnung; prüfen Sie den Live‑Katalog für Wan 3.0, sobald die Verfügbarkeit wächst). Die Videogenerierung erfolgt über den Endpunkt /v1/videos mit Multipart‑Formdaten—ideal für Produktionspipelines, n8n/Make‑Automatisierung oder den Wechsel zwischen Wan, Seedance, Kling, Veo, MiniMax usw. unter einem einzigen Schlüssel.

CometAPI‑Schritte:

  1. Bei cometapi.com registrieren/anmelden und einen API‑Schlüssel erstellen (sk‑…).
  2. Die Video‑API‑Doku (apidoc.cometapi.com) und die Modellijste prüfen, um die genaue Wan‑ID zu finden (z. B. wan2.7‑Pattern; neuesten Stand bestätigen).
  3. Über POST https://api.cometapi.com/v1/videos mit Formularfeldern einreichen:
  4. Eine Task/ID erhalten; den Status‑Endpunkt pollen oder Webhooks nutzen, bis die Verarbeitung abgeschlossen ist.
  5. Den resultierenden Videoinhalt herunterladen.
  6. Nutzung und Kosten im CometAPI‑Dashboard überwachen (verbrauchsbasiert, keine monatlichen Mindestbeträge).

Wie man Wan 3.0 effektiv promptet

Behandeln Sie Prompts wie Shot‑Briefs, nicht wie lockere Bildunterschriften. Eine bewährte Struktur (adaptiert aus Community‑ und Plattform‑Leitfäden):

SPACE‑Stil bzw. Shot‑List‑Formel:

  • Subjekt: konkrete Beschreibung von wer/was.
  • Performance/Aktion: sichtbare Bewegung und Zustandsänderungen in zeitlicher Reihenfolge.
  • Ambiente/Setting: Ort, Zeit, Licht, Wetter.
  • Kamera: Einstellungsgröße + eine klare Bewegung (langsamer Push‑in, Orbit, Tracking, statisch).
  • Extra: Stil, Audio‑Cues, Taktung, Constraints („Etikett lesbar halten“, „Gesichtsidentität bewahren“).

Für mehrteilige 30‑Sekunden‑Clips die Shots mit Zeitspannen nummerieren:

Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.

Referenzbindung (entscheidend für Omni‑Reference):

@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.

Zusätzliche Tipps:

  • Seien Sie spezifisch hinsichtlich beobachtbarer Aktionen und räumlicher Beziehungen.
  • Nutzen Sie Negativ‑Prompts für häufige Fehlermuster (verzerrte Hände, unerwünschter Text, Stil‑Drift).
  • Für Dokumente: „Erstellen Sie ein Erklärvideo, das der Struktur des angehängten PDFs folgt, mit Schwerpunkt auf den drei Kennzahlen auf Seite 2 und den Schlussfolgerungsempfehlungen.“
  • Iterieren: zuerst kurze Versionen generieren, dann erfolgreiche Beats ausbauen.
  • Kamerasprache und Lichtbeschreibungen verbessern die filmische Qualität.

Warum Wan 3.0 verwenden?

Wan 3.0 ist besonders überzeugend, wenn Anwendungen mehrere Arten von Ausgangsmaterial in ein kohärentes Video transformieren müssen—statt lediglich einen Textprompt in einen Kurzclip zu verwandeln.

Seine größten Vorteile sind:

  • 30‑sekündige native Videogenerierung
  • Text‑zu‑Video und Bild‑zu‑Video
  • Multireferenz‑Videogenerierung
  • Eingaben aus Text, Bild, Video, Audio und Dokumenten
  • Dokument‑ und Webseiten‑zu‑Video‑Workflows
  • Native audiovisuelle Generierung
  • 1080P‑Ausgabe
  • Anweisungsbasierte Videobearbeitung
  • Hohe Referenzkonsistenz
  • Abrechnung pro Sekunde
  • Ein einziges Modell für mehrere kreative Workflows

Für Entwickler, die KI‑Filmtools, Werbesysteme, Produktvideo‑Generatoren, Bildungsplattformen oder multimodale Kreativ‑Agenten bauen, können diese Fähigkeiten die Anzahl separater Modelle und Vorverarbeitungsschritte deutlich reduzieren.

Fazit und Empfehlung

Wan 3.0 ist ein bedeutender Schritt in Richtung praxisnaher, produktionsorientierter KI‑Videoerstellung: längere durchgehende Takes, echtes Dokument‑zu‑Video und stärkere multimodale Steuerung. In Kombination mit durchdachtem Prompting und disziplinierter Referenznutzung lassen sich für viele Marketing‑, Erklär‑ und Kurzformat‑Use‑Cases Tage traditioneller Produktion auf Minuten komprimieren.

Für Teams und Entwickler, die Anwendungen oder interne Tools aufbauen, starten Sie mit den offiziellen Alibaba‑Kanälen für die unverfälschte Wan‑3.0‑Experience und erwägen Sie CometAPI (cometapi.com) als produktiven Zugang. Die einheitliche Video‑API, breite Modellabdeckung (einschließlich aktuellem Wan 2.7 und wachsendem Katalog), OpenAI‑kompatible Schnittstelle und transparente, verbrauchsbasierte Abrechnung erleichtern das Experimentieren, Skalieren und Kombinieren von Wan‑Klasse‑Generierung mit ergänzenden LLM‑, Bild‑ und Audiomodellen unter einer einzigen Integration.

Prüfen Sie die aktuelle Modellijste und Dokumentation auf CometAPI und Alibaba Cloud Model Studio, experimentieren Sie mit kurzen Clips, verfeinern Sie Ihre Shot‑List‑Prompts und skalieren Sie zu vollständigen 30‑Sekunden‑Produktionen. Die Kombination aus längerer nativer Dauer und Omni‑Reference eröffnet neue kreative und geschäftliche Workflows, die zuvor umständlich oder teuer waren.

Weiterlernen

Diesen Artikel mit der nächsten Entscheidung verknüpfen.

Alle Themen anzeigen
Veröffentlicht am Aug 27, 2026
Zuletzt aktualisiert Aug 29, 2026
4 Aufrufe
Auf Klarheit, Quellenangabe und aktuelle API-Terminologie geprüft.

Bereit, die KI-Entwicklungskosten um 20 % zu senken?

In wenigen Minuten kostenlos starten. Inklusive kostenlosem Testguthaben. Keine Kreditkarte erforderlich.

Mehr lesen