Alibaba y ByteDance ahora ofrecen dos sistemas de video de IA de 30 segundos inusualmente completos. Uno prioriza una canalización todo en uno que puede convertir documentos y páginas web en video; el otro prioriza la narración de formato largo, un control denso de referencias y una edición audiovisual quirúrgica. Esta guía separa las especificaciones verificadas de la evidencia de benchmarks independientes para que los desarrolladores elijan por ajuste a producción y no por afirmaciones de lanzamiento.
TL;DR
Conclusión: Wan 3.0 es la opción predeterminada más sólida cuando quieres la señal de calidad independiente más clara, salida en 1080p, entradas de documentos/páginas web y un costo inicial de API actualmente más bajo. Seedance 2.5 es la opción más especializada de producción creativa cuando necesitas hasta 50 referencias, continuación en múltiples rondas, edición a nivel de marcas de tiempo, flujos de trabajo de pantalla verde o previsualización con modelo en blanco.
Aún no existe un benchmark público limpio y directo cara a cara. Artificial Analysis sitúa actualmente al modelo de Alibaba en primer lugar en su arena de texto a video con audio, mientras que la versión de ByteDance aún no aparece listada bajo la misma evaluación. Debido a que Seedance 2.5 aún no ha sido evaluado en la misma arena, esta clasificación no puede respaldar una comparación de calidad directa entre los dos modelos.
Wan 3.0 vs Seedance 2.5: Comparación rápida
| Categoría | Wan 3.0 | Seedance 2.5 |
|---|---|---|
| Desarrollador | Alibaba Tongyi / Wan | ByteDance Seed |
| Lanzamiento / disponibilidad | Public API release: Aug 24, 2026 | Official launch: Jul 31; CometAPI route: Aug 6, 2026 |
| Diseño principal | Producción de video multimodal todo en uno | Generación audio-video conjunta para narrativas controladas |
| Duración nativa máxima | 2-30 segundos | 4–30 segundos. |
| Resolución de salida | 480p, 720p, 1080p | CometAPI actualmente documenta rutas de 480p y 720p |
| Capacidad de referencias | Hasta 10 imágenes + 5 clips de video + 5 clips de audio; además de 1 documento o 1 página pública. | 30 imágenes + 10 videos + 10 clips de audio |
| Tipos de entrada | Texto, imagen, video, audio, documentos, páginas web | Texto, imagen, video, audio |
| Audio nativo | Diálogo, BGM, efectos de sonido | Generación conjunta de audio y video con sonido sincronizado |
| Edición | Edición por instrucciones, extensión, control de primer/último fotograma | Ediciones por marcas de tiempo, pantalla verde, edición de cámara y referencias |
| Benchmark independiente | #1 T2V con audio; 1,241 Elo | Aún no listado bajo el mismo benchmark |
| Precio inicial en CometAPI | $0.04 por segundo generado | $0.0824 por segundo generado |
| Mejor caso de uso inicial | Demos de producto, explicativos, documento a video, opción por defecto guiada por calidad | Narrativa con muchas referencias, control en cine/publicidad, ediciones dirigidas |
¿Qué es Wan 3.0?
El último modelo de video hospedado de Alibaba consolida texto a video, imagen a video, generación con referencias, edición, extensión y audio nativo dentro de un solo sistema. Su característica definitoria no es solo el límite de 30 segundos: acepta contexto creativo de imágenes, video, audio, documentos de oficina y páginas web públicas, permitiendo que un brief de producto o una presentación se convierta en parte de la instrucción de generación.
La guía oficial del API de Wan 3.0 especifica hasta 30 segundos a 30 fps, salidas 480p/720p/1080p y diálogo/BGM/efectos de sonido nativos. Sus límites por solicitud documentados son hasta 10 imágenes de referencia, 5 videos de referencia y 5 clips de audio de referencia; la solicitud también puede incluir un documento compatible o una página web pública. También documenta control del primer fotograma y del primero y último fotograma, continuación de video y edición en lenguaje natural.
Fuente: Exhibición oficial de Alibaba Tongyi Wan
Especificaciones del modelo de Alibaba
| Especificación | Valor verificado |
|---|---|
| Estado del modelo | Modelo comercial hospedado; API disponible |
| Modos de generación | Texto a video, imagen a video, referencia a video, edición, continuación |
| Duración máxima | 30 segundos por generación; 2-30 segundos documentados |
| Velocidad de fotogramas | 30 fps |
| Resolución | 480p, 720p, 1080p |
| Relaciones de aspecto | Adaptativa, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Referencias | Hasta 10 imágenes de referencia, 5 videos de referencia y 5 clips de audio de referencia; una solicitud también puede usar 1 documento o 1 página pública. |
| Documentos | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| Límites de documentos | Hasta 100 MB y 50 páginas |
| Audio | Voz/diálogo nativos, BGM y efectos de sonido |
| ID de modelo en CometAPI | wan3.0 |
| Endpoint de CometAPI | POST /v1/videos; flujo asíncrono de creación y sondeo |
Dónde destaca el modelo de Alibaba
- Documento a video y página web a video eliminan un paso de preprocesamiento para presentaciones, informes, páginas de producto, material de formación y explicativos corporativos.
- Una ruta 1080p y salida a 30 fps proporcionan un camino de entrega final claramente documentado.
- El mismo modelo cubre generación, acondicionamiento con referencias, edición y extensión, reduciendo la orquestación específica por modelo.
- Sus resultados independientes actuales en T2V y edición de video brindan evidencia pública más sólida que las demos del proveedor por sí solas.
¿Qué es Seedance 2.5?
El modelo audiovisual de nueva generación de ByteDance se centra en historias completas de 30 segundos, grandes conjuntos de referencias multimodales y edición de producción. El modelo puede organizar múltiples planos relacionados en una sola generación, continuar una salida existente a lo largo de rondas adicionales y mantener un lenguaje audiovisual coherente en narrativas más largas.
En el anuncio oficial de lanzamiento, ByteDance documenta hasta 30 imágenes, 10 clips de video y 10 clips de audio en una pasada. También describe ediciones audiovisuales a nivel de marcas de tiempo, reemplazo de pantalla verde, edición de perspectiva de cámara, referencias de movimiento, referencias creativas y control de render de arcilla para composición, puesta en escena, iluminación y planificación de cámara.

Fuente: Exhibición oficial de ByteDance Seedance 2.5
Especificaciones del modelo de ByteDance
| Especificación | Valor verificado |
|---|---|
| Estado del modelo | Lanzado oficialmente; plataforma comercial y acceso por API |
| Modos de generación | Texto a video, imagen a video, referencia a video, extensión, edición |
| Duración máxima | ByteDance confirma oficialmente hasta 30 segundos por generación; la ruta actual documentada de CometAPI acepta 4–30 segundos. |
| Continuación | Extensión en múltiples rondas; la página de producto describe hasta dos extensiones |
| Resolución | CometAPI actualmente documenta rutas con precios a 480p y 720p |
| Referencias | Hasta 30 imágenes, 10 clips de video y 10 clips de audio |
| Tipos de entrada | Texto, imagen, video, audio |
| Documentos | No aparece listado como entrada de referencia nativa en los materiales oficiales de Seedance 2.5. |
| Límites de documentos | No aplica / no documentado para la ruta actual de Seedance 2.5. |
| Audio | Generación conjunta de audio y video y audio de referencia |
| Edición | Control por marcas de tiempo, pantalla verde, perspectiva de cámara, edición por referencias |
| Previsualización | Control de render de arcilla / modelo en blanco |
| ID de modelo en CometAPI | seedance-2-5 |
| Endpoint de CometAPI | POST /v1/videos; flujo asíncrono de creación y sondeo |
Dónde destaca el modelo de ByteDance
- Cincuenta referencias en total dan a los creadores más margen para restricciones de múltiples personajes, múltiples ubicaciones, marca, utilería, voz y movimiento.
- Los cambios a nivel de marcas de tiempo permiten revisar un golpe, acción, sonido o segmento de cámara concretos sin tratar todo el video como un borrador desechable.
- Los flujos de trabajo de pantalla verde y render de arcilla conectan el video generativo con prácticas convencionales de previsualización y composición.
- La continuación en múltiples rondas está diseñada para extender un lenguaje visual y sonoro coherente más allá del clip inicial de 30 segundos.
Wan 3.0 vs Seedance 2.5: Resultados de benchmark
Regla de benchmark: solo los resultados producidos bajo la misma clasificación, tarea, modo de audio y método de votación son directamente comparables. Las demostraciones del proveedor y las puntuaciones de modelos anteriores son contexto útil, pero no sustituyen la ausencia de un resultado directo cara a cara.
La clasificación actual de Texto a Video de Artificial Analysis sitúa al modelo de Alibaba en primer lugar en la arena con audio con 1,241 Elo, con un intervalo de confianza del 95% de +/-9 y 6,195 muestras de comparación ciega. El mismo evaluador también lo sitúa primero en edición de video con audio con 1,189 Elo, con un intervalo de +/-7 y 5,231 muestras.
La versión de ByteDance aún no figura en esas dos tablas. Artificial Analysis sí lista una generación anterior de Seedance, pero usar esa puntuación antigua como si representara el modelo nuevo sería metodológicamente incorrecto. Por lo tanto, la conclusión más justa es que Alibaba tiene actualmente la evidencia independiente más fuerte, no que ByteDance haya demostrado ser más débil de forma independiente.

Fuente: Artificial Analysis Text to Video Leaderboard
| Tipo de evidencia | Modelo de Alibaba | Modelo de ByteDance | Interpretación |
|---|---|---|---|
| Texto a video con audio | 1,241 Elo; rango #1; +/-9; 6,195 muestras | No listado | Comparación directa independiente no disponible |
| Edición de video con audio | 1,189 Elo; rango #1; +/-7; 5,231 muestras | No listado | Comparación directa independiente no disponible |
| Evidencia cualitativa oficial | Renderizado a nivel de realidad, consistencia a largo plazo, omni-referencia | Narración de formato largo, control denso de referencias, edición por marcas de tiempo | Demos y afirmaciones diferentes; no puntuadas directamente |
Wan 3.0 vs Seedance 2.5: Diferencias clave comparadas
1. Narrativa de formato largo y coherencia temporal
Ambos modelos pueden generar hasta 30 segundos en una pasada. El rango oficial del API de Wan 3.0 es 2–30 segundos, mientras que la documentación oficial del API de BytePlus especifica 4–30 segundos para Seedance 2.5; la ruta actual de Seedance en CometAPI también documenta 4–30 segundos. Por lo tanto, Wan es la opción documentada para planos nativos de 2–3 segundos en estas rutas. El enfoque de Alibaba es más sólido cuando el clip debe absorber material fuente variado y convertirlo en una salida coherente. El enfoque de ByteDance es más fuerte cuando los 30 segundos deben contener un arco narrativo planificado, múltiples planos conectados y una continuación posterior con personajes, escenarios, ritmo y sonido consistentes.
Resultado: elige Alibaba para una solicitud de producción multimodal autocontenida; elige ByteDance para construcción narrativa episódica o en múltiples rondas.
2. Calidad visual, movimiento y plausibilidad física
Alibaba tiene la señal de calidad pública más clara porque su salida lidera actualmente la arena de preferencia ciega T2V con audio. Los materiales de producto también enfatizan rostros, microexpresiones, detalles de producto, texto, disposición espacial e interacciones físicas. ByteDance enfatiza transiciones más suaves, estabilidad del sujeto entre cortes, texturas e iluminación más realistas y movimiento que sigue la estructura espacial de las referencias de render de arcilla.
Resultado: Alibaba es la primera prueba respaldada por evidencia para la preferencia visual general. ByteDance sigue siendo muy atractivo para el bloqueo dirigido, la coreografía de cámara y escenas planificadas desde activos de previsualización.
3. Control de referencias y consistencia de personajes
Wan 3.0 acepta hasta 10 imágenes de referencia, 5 videos de referencia y 5 clips de audio de referencia, además de un documento compatible o una página web pública. Seedance 2.5 acepta el conjunto convencional más grande: hasta 30 imágenes, 10 videos y 10 clips de audio, pero sus materiales oficiales no listan documentos o páginas web como entradas nativas de referencia. Este techo más alto de referencias convencionales importa cuando el brief incluye elenco, múltiples entornos, variantes de producto, vestuario, utilería, muestras de voz, referencias de cámara y ejemplos de movimiento.
Resultado: ByteDance gana en densidad de referencias; Alibaba gana en amplitud de referencias.
4. Audio nativo, diálogo y diseño sonoro
Ambos generan sonido con la imagen en lugar de requerir una pasada de doblaje separada. Alibaba documenta explícitamente diálogo, música de fondo y efectos de sonido. ByteDance se basa en una arquitectura unificada de audio-video y admite referencias de audio, consistencia de voz y ediciones audiovisuales dirigidas.
Resultado: la competencia a nivel de especificación es reñida. Prueba la inteligibilidad del diálogo, la sincronización labial, la identidad del hablante, la estabilidad de la música de fondo y el tiempo de los efectos de sonido con el mismo guion antes de elegir una ruta de producción.
5. Edición e iteración
Alibaba cubre edición en lenguaje natural, extensión y flujos de trabajo condicionados por fotogramas dentro de su modelo todo en uno. ByteDance profundiza más en un flujo de trabajo tipo editor: los prompts pueden dirigirse a marcas de tiempo específicas, reemplazar fondos mediante pantalla verde, ajustar la perspectiva de cámara y revisar personajes, acciones, trama o audio preservando la continuidad circundante.
Resultado: ByteDance tiene la superficie de control documentada más sólida para la revisión creativa quirúrgica; Alibaba ofrece la canalización unificada más simple.
6. Documentos, páginas web y contenido empresarial
Esta es la ventaja más clara e indiscutida de Alibaba. Un PDF, presentación, hoja de cálculo, documento de texto, archivo de productividad de Apple, documento Markdown o página web puede convertirse en material fuente para un explicativo generado, video de producto, clip de formación o resumen ejecutivo. La visión publicada del modelo de ByteDance se centra en texto, imágenes, video y audio en lugar del análisis de documentos.
Resultado: elige Alibaba para documento a video, página web a video, conocimiento corporativo y canalizaciones de reutilización de contenido automatizadas.
7. Resolución y flujo de entrega
Alibaba documenta rutas de 480p, 720p y 1080p. Esto respalda una escalera limpia: iterar a 480p, revisar a 720p y generar planos aceptados a 1080p. CometAPI actualmente documenta precios de 480p y 720p para la ruta de ByteDance; el artículo oficial de lanzamiento de ByteDance no proporciona una tabla de resolución equivalente por ruta.
Resultado: Alibaba tiene el camino de entrega en alta resolución más claramente documentado. Confirma la ruta activa de ByteDance antes de convertir la resolución en una promesa de producto firme.
Comparación de precios
Las tarjetas de modelo activas de CometAPI muestran un precio inicial de $0.04 por segundo generado para Alibaba y $0.0824 por segundo para ByteDance. Sus secciones detalladas de precios también muestran precios de rutas ascendentes: Alibaba lista $0.05/$0.10/$0.20 por segundo para 480p/720p/1080p, mientras que ByteDance lista $0.103 y $0.231 por segundo para 480p y 720p. Debido a que las páginas de modelo y los descuentos por ruta pueden cambiar de forma independiente, las estimaciones de producción deben usar la ruta exacta seleccionada al enviar.
| Elemento de costo | Wan 3.0 | Seedance 2.5 | Notas |
|---|---|---|---|
| Precio inicial destacado en CometAPI | $0.04/s | $0.0824/s | Alibaba es ~51% más bajo en el piso mostrado |
| Clip de 10 segundos al precio inicial | $0.40 | $0.824 | Antes de reintentos |
| Clip de 30 segundos al precio inicial | $1.20 | $2.472 | Antes de reintentos |
| Precio de ruta publicada 480p | $0.05/s | $0.103/s | Ruta listada aguas arriba |
| Precio de ruta publicada 720p | $0.10/s | $0.231/s | Ruta listada aguas arriba |
| Precio de ruta publicada 1080p | $0.20/s | No mostrado en la tabla actual de CometAPI | Verificar disponibilidad de ruta |
Regla de costo de producción: compara el costo por clip aceptado, no el precio por segundo. Incluye salidas rechazadas, reintentos, escalado, almacenamiento, tiempo de edición y la revisión humana necesaria para que un clip sea publicable.
Wan 3.0 vs Seedance 2.5: Fortalezas y compromisos
| Modelo | Fortalezas | Compromisos |
|---|---|---|
| Modelo de Alibaba | Señal independiente #1 en T2V con audio; señal #1 en edición; entradas de documentos/web; 1080p; precio inicial más bajo; flujo unificado | Límite de 20 referencias; pesos cerrados hospedados; los clips más largos aún pueden derivar; audio/texto pueden requerir posproducción |
| Modelo de ByteDance | 50 referencias; extensión en múltiples rondas; ediciones por marcas de tiempo; pantalla verde; edición de cámara; previsualización con render de arcilla | Aún no hay Elo independiente bajo el mismo marco; la tabla de resolución actual de CometAPI se detiene en 720p; los materiales oficiales reconocen límites en movimiento complejo y multisujeto |
¿Qué modelo deberías elegir?
| Caso de uso | Elección inicial | Por qué |
|---|---|---|
| Mejor predeterminado para una nueva función de video | Modelo de Alibaba | Evidencia independiente más fuerte y precio inicial más bajo |
| Comercial de producto de 30 segundos | Modelo de Alibaba | Entradas de documento/producto, ruta 1080p, piso de iteración más bajo |
| PDF o página web a video explicativo | Modelo de Alibaba | Análisis nativo de documentos y páginas web |
| Campaña de marca con muchas referencias | Modelo de ByteDance | Hasta 50 referencias creativas |
| Drama corto multicaracter | Modelo de ByteDance | Continuidad narrativa, referencias densas, extensión |
| Revisión precisa de un rango temporal | Modelo de ByteDance | Edición audiovisual a nivel de marcas de tiempo |
| Flujo de trabajo con pantalla verde o render en blanco | Modelo de ByteDance | Controles profesionales de producción explícitos |
| Benchmark de calidad guiado por evidencia | Modelo de Alibaba | Liderazgo actual en preferencia ciega y edición |
| Decisión final de despliegue | Probar ambos | Usa los mismos activos, duración, rúbrica y umbral de aceptación |
Cómo ejecutar una prueba A/B imparcial
- Construye un conjunto de 20-40 prompts que cubran tomas de producto, diálogo humano, escenas multicaracter, movimiento de cámara, física, texto/UI y generación con muchas referencias.
- Usa duración, resolución, relación de aspecto, requisito de audio y activos fuente equiparables donde ambas rutas admitan ajustes equivalentes.
- Ciega a los revisores respecto a la identidad del modelo y puntúa por separado calidad visual, adherencia al prompt, consistencia del sujeto, movimiento, sincronía de audio, calidad de diálogo y esfuerzo de edición.
- Registra fallos, reintentos, rechazos por seguridad, latencia de generación y minutos de posproducción además de la salida exitosa.
- Elige la ruta con el menor costo por clip aceptado para cada carga de trabajo, en lugar de forzar un único ganador universal.
Cómo acceder a ambos modelos a través de CometAPI
Ambas rutas están disponibles a través de CometAPI, lo que permite a los equipos mantener una sola cuenta, clave de API, capa de facturación y ciclo de vida de video asíncrono mientras evalúan distintos proveedores. Los IDs de modelo de cara al cliente vigentes son wan3.0 y seedance-2-5.
- Crea una cuenta y genera una clave de API. Guárdala en una variable de entorno del lado del servidor.
- Abre la documentación del API de video y confirma los campos exactos admitidos por la ruta de modelo seleccionada.
- Envía POST /v1/videos, guarda el ID de la tarea de video retornado y sondea GET /v1/videos/{id} hasta que la tarea alcance un estado terminal.
- Descarga el recurso completado y almacena el ID de modelo, ruta, duración, resolución, latencia, precio y resultado de revisión con el resultado.
Idioma: Bash
export COMETAPI_KEY="your_api_key"
curl -X POST "https://api.cometapi.com/v1/videos" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-F 'model=wan3.0' \
-F 'prompt=Una presentación de producto cinematográfica con audio ambiental sincronizado.' \
-F 'seconds=10' \
-F 'size=1280x720'
# Para una prueba A/B, envía una carga útil de Seedance validada con:
# -F 'model=seedance-2-5'
No asumas que cada parámetro de medios es portable solo porque ambos modelos comparten un endpoint. Los campos de referencia, las resoluciones admitidas, los controles de edición y el comportamiento de callbacks pueden seguir siendo específicos por ruta. Valida cada carga útil antes de cambiar tráfico de producción.
Wan 3.0 vs Seedance 2.5: Limitaciones y advertencias
- Los benchmarks independientes cambian a medida que llegan nuevos votos; Elo es una señal de preferencia relativa, no una medida absoluta de cumplimiento factual del prompt o de usabilidad comercial.
- La ausencia de una puntuación de ByteDance bajo el marco independiente actual impide un ranking directo de calidad con validez estadística.
- Las demostraciones oficiales usan prompts y activos curados. Los resultados reales pueden variar con la complejidad del sujeto, filtros de seguridad, idioma, relación de aspecto y calidad de las referencias.
- La propia publicación de lanzamiento de ByteDance reconoce margen de mejora en plausibilidad física de movimiento complejo y estabilidad de interacción multisujeto.
- Las salidas más largas de Alibaba aún pueden mostrar deriva de identidad, deformación de objetos, errores de texto o defectos de audio; 30 segundos es un límite de capacidad, no una garantía de calidad.
- Los precios y la disponibilidad de rutas pueden cambiar. Revisa la página de modelo en vivo de CometAPI antes de publicar afirmaciones de precio fijas o comprometer la economía unitaria.
Conclusión
La respuesta más defendible depende de la carga de trabajo. Alibaba ofrece actualmente el paquete predeterminado más sólido: liderazgo en preferencia ciega independiente, señal de primer lugar en edición, entradas de documento y página web, una ruta 1080p documentada y un precio inicial mostrado más bajo. Es la primera prueba lógica para video de producto, explicativos, conversión automatizada de contenido empresarial y despliegue de API de propósito general.
ByteDance ofrece el sistema de control creativo más especializado. Su techo de 50 referencias, continuación en múltiples rondas, cambios a nivel de marcas de tiempo, flujo de trabajo de pantalla verde, edición de cámara y previsualización con modelo en blanco pueden pesar más que el benchmark faltante cuando la construcción profesional de historias y la iteración quirúrgica son los criterios reales de aceptación.
Para producción, no elijas solo por el titular. Pasa el mismo brief por ambos modelos, mide salidas aceptadas en lugar de primeros intentos y enruta cada trabajo al sistema que entregue la calidad requerida con menos reintentos y menos edición.
Preguntas frecuentes
¿Es Wan 3.0 mejor que Seedance 2.5?
Alibaba tiene actualmente la evidencia de benchmark independiente más fuerte y un soporte más amplio de entradas empresariales. ByteDance puede ser mejor para referencias densas, narrativas extendidas y edición creativa precisa. Aún no existe una comparación Elo directa bajo el mismo marco.
¿Qué modelo es más barato?
Las páginas actuales de CometAPI muestran precios iniciales de $0.04 por segundo para Alibaba y $0.0824 por segundo para ByteDance. El costo final depende de la ruta, resolución, reintentos y tasa de aceptación.
¿Qué modelo admite más referencias?
Seedance 2.5 admite el conjunto de referencias convencional más grande: hasta 30 imágenes, 10 videos y 10 clips de audio. Wan 3.0 admite hasta 10 imágenes, 5 videos y 5 clips de audio, y además puede usar un documento compatible o una página web pública.
¿Qué modelo es mejor para la edición de video?
Alibaba lidera actualmente la arena independiente de edición de video con audio. ByteDance documenta un flujo creativo más granular con edición por marcas de tiempo, reemplazo de pantalla verde, cambios de perspectiva de cámara y edición basada en referencias. La mejor elección depende de si importa más la calidad por preferencia o la profundidad de control.
¿Ambos modelos pueden generar audio nativo?
Sí. Ambos están diseñados para generar audio y video sincronizados. Evalúa claridad del diálogo, sincronía labial, efectos de sonido, estabilidad de la música y consistencia de la voz con tus propios prompts.
¿Puedo acceder a ambos con una sola clave de API?
Sí. Ambos están listados actualmente en CometAPI y usan su flujo de trabajo asíncrono de generación de video, aunque aún debes verificar los campos de solicitud válidos por ruta.
