Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
guide/Investigación de CometAPI

Cómo utilizar Wan 3: Guía de la API+ prompts

Descubre Wan 3.0 con audio a partir de texto, imágenes, documentos (PDF/PPT) y páginas web. Especificaciones, precios, prompt y cómo usarlo mediante la API.

CometAPI
AnnaEquipo de investigación de modelos de IA y API
Actualizado Aug 29, 2026 8 min de lectura
Cómo utilizar Wan 3: Guía de la API+ prompts
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Wan 3.0 (también estilizado como Wan3.0), el último modelo de video todo en uno de Alibaba Tongyi Lab, genera clips continuos nativos de 30 segundos de hasta 1080p con audio sincronizado en una sola pasada. Admite texto a video, imagen a video, condicionamiento por primer y último fotograma, y potentes flujos Omni-Reference que aceptan imágenes, video, audio, documentos (PDF, PPT, XLS, DOC, MD, etc.) y páginas web.

La beta pública se abrió el 6 de agosto de 2026; el acceso más amplio llegó alrededor del 24 de agosto de 2026. Los precios son aproximadamente $0.05/s (480p), $0.10/s (720p) y $0.20/s (1080p). Para desarrolladores y equipos que busquen una API unificada compatible con OpenAI para acceder a la familia Wan y a 500+ modelos más con integración sencilla, CometAPI ofrece una vía eficiente, con Wan 2.7 disponible actualmente y un catálogo de video en crecimiento vía /v1/videos.

Puntos clave

  • Generación nativa de una sola toma de 30 segundos (el doble del límite previo de ~15s en Wan 2.7/2.5) con ajuste inteligente de la duración.
  • Omni-Reference: hasta ~10–20 activos mixtos (imágenes, videos ≤15s en total, audios, un documento/página web) para una sólida consistencia de sujeto, producto y estilo.
  • La conversión de documentos y páginas web a video destaca: sube un PDF, presentación, hoja de cálculo o URL pública y recibe un video estructurado.
  • Generación de audio nativa en la misma pasada; resoluciones 480p/720p/1080p; múltiples relaciones de aspecto.
  • Mayor fidelidad en rostros/microexpresiones, referencias más estables y texto en pantalla más limpio que en generaciones anteriores.
  • Acceso vía Alibaba Cloud Model Studio / Qwen Cloud (modelo wan3.0-video), wan.video y plataformas de terceros. Para un desarrollo multimodelo simplificado, usa el endpoint unificado de video de CometAPI.
  • Redacta el prompt como una ficha técnica del plano (sujeto + acción + cámara + temporización + restricciones) y etiqueta las referencias explícitamente (@Image1, etc.).

¿Qué es Wan 3.0?

Wan 3.0 es el nuevo buque insignia de la familia de generación de video Tongyi Wanxiang (Wan) de Alibaba, desarrollado por Tongyi Lab. Se basa en el linaje difusion-transformer de lanzamientos Wan anteriores abiertos y cerrados (incluida la serie Wan abierta de 2025 ampliamente estudiada).

Las mejoras clave frente a Wan 2.7 / 2.5 incluyen:

  • Duración máxima nativa duplicada a 30 segundos en una sola generación continua (no clips cosidos).
  • Entradas multimodales ampliadas más allá de texto/imagen/video/audio para incluir documentos ofimáticos y páginas web públicas.
  • Renderizado de “grado realidad” mejorado para rostros, microexpresiones, detalles de producto y consistencia de contenido digital/UI.
  • Modelo unificado todo en uno que cubre texto a video (T2V), imagen a video (I2V), primer y último fotograma, referencia a video y capacidades relacionadas de edición/extensión.

Alibaba lo posiciona para videos de marketing, minidramas, contenido social, demos de producto, metraje de formación/simulación (p. ej., robótica o AV) y explicativos corporativos. El modelo sigue siendo de pesos cerrados / solo API (los pesos abiertos se detienen en las versiones Wan 2.x anteriores).

Datos y fuentes de soporte: Ejemplos de precios de lista (internacionales): 480p $0.05/s, 720p $0.10/s, 1080p $0.20/s (un clip de 30 segundos a 1080p ≈ $6 estándar). Algunas plataformas ofrecen niveles Standard vs Prime (más rápido) o descuentos temporales.

Cómo usar la API de Wan 3.0

Alibaba Cloud expone Wan 3.0 a través de la API de generación de video de Model Studio. El identificador de modelo actual es:

wan3.0-video

La API utiliza generación de video asíncrona. Una solicitud representativa es:

curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
  -H 'X-DashScope-Async: enable' \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "wan3.0-video",
    "input": {
      "prompt": "Un comercial de producto cinematográfico que muestra una cafetera premium en una cocina moderna."
    },
    "parameters": {
      "resolution": "720P",
      "ratio": "16:9",
      "duration": 10,
      "enable_thinking": false
    }
  }'

La documentación de la API de Alibaba señala que el modelo, el endpoint y la clave de API deben pertenecer a la misma región. La API es asíncrona, por lo que las aplicaciones deben enviar la tarea y luego recuperar el resultado generado tras el procesamiento.

Para flujos de imagen a video y basados en referencias, el objeto input puede incluir medios de referencia. El ejemplo actual de Alibaba demuestra una combinación de video de referencia e imágenes de referencia en la misma solicitud.

Cómo usar Wan 3.0 a través de CometAPI (recomendado para desarrolladores)

CometAPI ofrece una interfaz unificada, compatible con OpenAI, para 500+ modelos, incluidos los modelos de video de la familia Alibaba Wan (Wan 2.7 actualmente listado con precios competitivos por segundo; consulta el catálogo en vivo para Wan 3.0 a medida que se amplíe su disponibilidad). La generación de video utiliza el endpoint /v1/videos con datos de formulario multipart, ideal para canalizaciones de producción, automatización en n8n/Make o cambiar entre Wan, Seedance, Kling, Veo, MiniMax, etc., con una sola clave.

Pasos con CometAPI:

  1. Regístrate/inicia sesión en cometapi.com y crea una clave de API (sk-…).
  2. Revisa la documentación de la API de video (apidoc.cometapi.com) y la lista de modelos para el ID exacto de Wan (p. ej., patrón wan2.7; confirma el más reciente).
  3. Envía vía POST https://api.cometapi.com/v1/videos con campos de formulario.
  4. Recibe un task/ID; consulta el endpoint de estado o usa webhooks hasta completar.
  5. Descarga el contenido de video resultante.
  6. Supervisa el uso y los costos en el panel de CometAPI (pago por uso, sin mínimos mensuales).

Cómo redactar prompts efectivos para Wan 3.0

Trata los prompts como fichas técnicas de plano, no como subtítulos casuales. Una estructura demostrada (adaptada de guías de la comunidad y la plataforma):

Fórmula estilo SPACE o lista de planos:

  • Sujeto: descripción concreta de quién/qué.
  • Interpretación/Acción: movimiento visible y cambios de estado en orden temporal.
  • Ambiente/Escenario: lugar, hora, iluminación, clima.
  • Cámara: tamaño de plano + un movimiento claro (acercamiento lento, órbita, travelling, estática).
  • Extra: estilo, pistas de audio, ritmo, restricciones (“mantener la etiqueta legible”, “preservar la identidad del rostro”).

Para clips de 30s con varios beats, numera los planos con rangos de tiempo:

General: Revelación de producto premium de un frasco de perfume cerámico sobre piedra negra mojada al atardecer.
Plano 1 [0-8s]: Establecedor abierto, órbita de tres cuartos lenta, contraluz cálido, lluvia suave.
Plano 2 [8-18s]: Enfoque más cercano al producto, el frasco gira lentamente, la etiqueta y la tapa dorada se mantienen nítidas.
Plano 3 [18-30s]: Empuje final hacia el detalle, música ambiental suave, mantener el logo en cuadro.
Mantén consistentes la forma del frasco, la posición de la etiqueta y la tapa dorada. Cinemático, ritmo calmado, sin superposiciones de texto.

Vinculación de referencias (crítica para Omni-Reference):

@Image1 es el personaje femenino (rostro y chaqueta amarilla).
@Image2 es el fondo del callejón lluvioso.
@Audio1 provee el timbre de voz.
El personaje de @Image1 camina por el callejón de @Image2 y dice “…” usando la voz de @Audio1.

Consejos adicionales:

  • Sé específico sobre acciones observables y relaciones espaciales.
  • Usa prompts negativos para fallas comunes (manos deformadas, texto no deseado, deriva de estilo).
  • Para documentos: “Crea un video explicativo que siga la estructura del PDF adjunto, enfatizando las tres métricas clave de la página 2 y las recomendaciones de la conclusión.”
  • Itera: genera versiones cortas primero y luego expande los beats exitosos.
  • El lenguaje de cámara y los descriptores de iluminación mejoran la calidad cinematográfica.

¿Por qué usar Wan 3.0?

Wan 3.0 es más convincente cuando la aplicación necesita transformar múltiples tipos de material fuente en un video coherente, en lugar de simplemente convertir un prompt de texto en un clip corto.

Sus mayores ventajas son:

  • Generación nativa de video de 30 segundos
  • Texto a video e imagen a video
  • Generación de video con múltiples referencias
  • Entradas de texto, imagen, video, audio y documentos
  • Flujos de trabajo de documento y página web a video
  • Generación audiovisual nativa
  • Salida 1080P
  • Edición de video basada en instrucciones
  • Fuerte consistencia de referencias
  • Tarificación por segundo
  • Un solo modelo para múltiples flujos creativos

Para desarrolladores que construyen herramientas de cine con IA, sistemas publicitarios, generadores de videos de producto, plataformas de contenido educativo o agentes creativos multimodales, estas capacidades pueden reducir significativamente la cantidad de modelos separados y pasos de preprocesamiento requeridos.

Conclusión y recomendación

Wan 3.0 representa un avance significativo hacia un video con IA práctico y orientado a producción: tomas continuas más largas, verdadera conversión de documentos a video y control multimodal más sólido. Combinado con prompts bien pensados y disciplina en las referencias, puede comprimir días de producción tradicional en minutos para muchos casos de marketing, explicativos y formatos cortos.

Para desarrolladores y equipos que construyen aplicaciones o herramientas internas, comienza con los canales oficiales de Alibaba para la experiencia más pura de Wan 3.0 y considera CometAPI (cometapi.com) como un portal de alta productividad. Su API unificada de video, amplia cobertura de modelos (incluido el actual Wan 2.7 y un catálogo en expansión), interfaz compatible con OpenAI y modelo de pago por uso transparente facilitan experimentar, escalar y combinar la generación de clase Wan con LLMs, modelos de imagen y audio complementarios bajo una sola integración.

Consulta la lista de modelos y la documentación más recientes en CometAPI y Alibaba Cloud Model Studio, experimenta con clips cortos, refina tus prompts tipo lista de planos y escala a producciones completas de 30 segundos. La combinación de mayor duración nativa y Omni-Reference abre nuevos flujos creativos y de negocio que antes eran engorrosos o costosos.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Aug 27, 2026
Última actualización Aug 29, 2026
6 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más