Respuesta rápida
FLUX 3 es el modelo de video multimodal de Black Forest Labs para generación de texto a video e imagen a video con audio sincronizado. En CometAPI, el ID del modelo de producción es flux-3. El flujo asíncrono verificado utiliza POST /v1/videos para crear una tarea, GET /v1/videos/{task_id} para consultarla y GET /v1/videos/{task_id}/content para descargar el MP4 completado.
Actualización de disponibilidad (verificada el 24 de septiembre de 2026): Black Forest Labs pasó FLUX 3 Video más allá de la fase de Acceso Anticipado de julio e hizo la versión inicial de texto a video e imagen a video de disponibilidad general a través de la API de BFL y socios seleccionados el 4 de agosto de 2026. CometAPI añadió el ID de modelo de producción flux-3 en su formato de Video API el 13 de agosto de 2026. Utiliza el anuncio de lanzamiento de BFL y la página del modelo en vivo de CometAPI como fuentes de verdad para disponibilidad, campos y precios.
¿Qué cambió desde el Acceso Anticipado de FLUX 3?
El cambio importante es la disponibilidad operativa. La cobertura temprana se centró en el despliegue de julio basado en solicitud, pero el lanzamiento de agosto de BFL introdujo un endpoint de video invocable, restricciones publicadas y precios de producción. Posteriormente, CometAPI expuso flux-3 a través de su Video API unificada.
El artículo anterior de CometAPI, FLUX 3 API: Availability, Early Access, Video & Dev, sigue siendo útil para el historial de lanzamiento y la evaluación preliminar de julio. La comparación más amplia Best AI Video APIs in 2026 cubre la selección a nivel de mercado. Esta guía mantiene esos temas concisos y se centra en solicitudes funcionales, sondeo, prompts, control de costos y manejo en producción.
¿Qué es FLUX 3?
FLUX 3 es la familia de modelos multimodales de BFL para video, audio, imágenes y predicción relacionada con acciones. La versión actual de video admite texto a video, imagen a video y continuación de video mediante un único endpoint nativo del proveedor.
Para desarrolladores de video, las capacidades destacadas son hasta 20 segundos a 24 fps, salida en HD o Full HD, audio sincronizado, voz multilingüe con sincronización labial, múltiples planos en una sola generación y hasta diez fotogramas clave anclados para control de imagen a video.
Especificaciones de la API de FLUX 3
| Especificación | Especificación oficial de BFL | Integración de CometAPI |
|---|---|---|
| Flujos principales | Texto a video, imagen a video, continuación de video | Se listan texto a video e imagen a video |
| Duración máxima | 5–20 s para T2V/I2V; 5–15 s para V2V | Usa valores del quickstart en vivo para solicitudes a la pasarela |
| Velocidad de fotogramas | 24 fps | Salida del proveedor |
| Resolución | rHD nativa; FHD mediante el upsampler de video. La documentación actual de FLUX 3 Video de BFL no lista salida 4K/UHD. La especificación “hasta 4MP” aplica a modelos de imagen FLUX.2, no a FLUX 3 Video. | Precios listados para 720p y 1080p |
| Audio nativo | Sí; habilitado por defecto | La función de salida sigue la integración activa |
| Control por imagen | 1–10 fotogramas clave en I2V nativo | Verifica el mapeo actual de reference-image en la pasarela |
| Relaciones de aspecto | 21:9, 2:1, 16:9, 4:3, 1:1, 3:4, 9:16 | El quickstart usa dimensiones explícitas como 1280x720 |
| Invocación | Asíncrona | Crear → sondear → descargar |
| ID de modelo en CometAPI | — | flux-3 |
¿Qué tan bueno es FLUX 3 Video?
BFL informa una puntuación Elo de texto a video de 1135 en su evaluación de preferencia humana todos-contra-todos. En la misma comparación publicada, FLUX 3 empató con Seedance 2.0 en preferencia de imagen a video y se ubicó por delante de los otros modelos probados.
Estos resultados son evidencia útil de posicionamiento, pero son evaluaciones de preferencia humana realizadas por el proveedor, no un benchmark independiente de producción. No miden la latencia de la pasarela, fiabilidad de la cola, consistencia de costos o estabilidad en generaciones repetidas, por lo que los equipos de producción deberían evaluar su propio conjunto de prompts.
Rendimiento de benchmark de FLUX 3
| Métrica | Resultado publicado | Interpretación |
|---|---|---|
| Elo todos-contra-todos T2V | 1135 | BFL informa que FLUX 3 lidera su comparación interna |
| Preferencia I2V | Empate con Seedance 2.0 | Resultado direccional del proveedor, no un ranking de terceros |
| Tipo de evaluación | Preferencia humana | Mide calidad percibida de salida, no infraestructura de API |

Fuente: Black Forest Labs — FLUX 3 Video, Part 1: Generation.
Lo que necesitas antes de usar la API de FLUX 3
- Una cuenta de CometAPI y una clave de API almacenada en una variable de entorno del backend.
- Un prompt que defina el sujeto, movimiento, dirección de cámara, atmósfera y cualquier audio o diálogo requerido.
- Una ruta de manejo de trabajos duradera porque la generación de video es asíncrona.
- Crédito suficiente para pruebas iterativas; la facturación depende de la duración generada y la resolución.
Crea la clave en el panel de CometAPI. No la coloques en JavaScript del frontend, paquetes móviles, repositorios públicos ni capturas de pantalla.
ID de modelo y endpoints de FLUX 3
| Operación | Método y endpoint | Propósito |
|---|---|---|
| Crear video | POST https://api.cometapi.com/v1/videos | Enviar una tarea de generación |
| Consultar tarea | GET https://api.cometapi.com/v1/videos/{task\_id} | Leer estado y progreso |
| Descargar salida | GET https://api.cometapi.com/v1/videos/{task\_id}/content | Descargar el MP4 completado |
Cómo usar la API de FLUX 3 con CometAPI
Paso 1: Configura tu clave de API
En macOS o Linux:
export COMETAPI_KEY="your_api_key"
En Windows PowerShell:
$env:COMETAPI_KEY="your_api_key"
Paso 2: Crea un video con FLUX 3
El quickstart de FLUX 3 actual usa una solicitud multipart con model, prompt, seconds y size. Este ejemplo solicita un clip de cinco segundos en 720p:
curl https://api.cometapi.com/v1/videos \
-H "Authorization: Bearer $COMETAPI_KEY" \
-F "model=flux-3" \
-F "prompt=A paper boat glides across a still pond in soft morning light" \
-F "seconds=5" \
-F "size=1280x720"
Esta solicitud inicia un trabajo. No diseñes la aplicación para recibir un MP4 finalizado en la misma respuesta HTTP.
Paso 3: Guarda el ID de la tarea
Conserva el identificador inmediatamente después de que la solicitud de creación se complete con éxito:
{
"id": "video_task_id",
"status": "queued"
}
Almacena el ID de la tarea junto al registro del usuario o del trabajo antes de comenzar el sondeo. Un reinicio del proceso no debería perder una generación que ya ha sido facturada.
Paso 4: Sondea el estado del video
curl https://api.cometapi.com/v1/videos/{task_id} \
-H "Authorization: Bearer $COMETAPI_KEY"
Comienza con un intervalo moderado, como diez segundos. Trata completed, succeeded o success como estados terminales de éxito; trata failed, failure, cancelled o canceled como fallos terminales.
Paso 5: Descarga el MP4
curl https://api.cometapi.com/v1/videos/{task_id}/content \
-H "Authorization: Bearer $COMETAPI_KEY" \
--output flux3_output.mp4
Tras la finalización, copia el archivo a tu propio almacenamiento de objetos o canalización de medios en lugar de mantener una URL temporal del proveedor como recurso permanente.
Flujo completo en Python para generación de video con FLUX 3
El siguiente ejemplo crea un trabajo, guarda su ID, sondea hasta la finalización, verifica estados de fallo, valida la firma MP4 y escribe la salida en disco.
import os
import time
from pathlib import Path
import requests
api_key = os.environ["COMETAPI_KEY"]
base_url = "https://api.cometapi.com"
headers = {"Authorization": f"Bearer {api_key}"}
response = requests.post(
f"{base_url}/v1/videos",
headers=headers,
files={
"model": (None, "flux-3"),
"prompt": (
None,
"A product bottle rotates slowly on wet black stone, "
"soft rim lighting, macro lens, realistic reflections.",
),
"seconds": (None, "5"),
"size": (None, "1280x720"),
},
timeout=120,
)
response.raise_for_status()
task = response.json()
data = task.get("data") or {}
task_id = (
task.get("id")
or task.get("task_id")
or data.get("id")
or data.get("task_id")
)
if not task_id:
raise RuntimeError(f"Create response has no task ID: {task}")
while True:
response = requests.get(
f"{base_url}/v1/videos/{task_id}",
headers=headers,
timeout=60,
)
response.raise_for_status()
task = response.json()
data = task.get("data") or {}
status = str(task.get("status") or data.get("status") or "").lower()
progress = task.get("progress") or data.get("progress") or "unknown"
print(f"Status: {status or 'unknown'}; progress: {progress}")
if status in {"failed", "failure", "cancelled", "canceled"}:
raise RuntimeError(f"Video generation failed: {task}")
if status in {"completed", "succeeded", "success"} or progress == "100%":
break
time.sleep(10)
response = requests.get(
f"{base_url}/v1/videos/{task_id}/content",
headers=headers,
timeout=300,
)
response.raise_for_status()
video = response.content
if len(video) < 12 or video[4:8] != b"ftyp":
raise RuntimeError("Content response is not a non-empty MP4 file")
output_dir = Path("output")
output_dir.mkdir(parents=True, exist_ok=True)
output_path = output_dir / f"{task_id}.mp4"
output_path.write_bytes(video)
print(f"Saved: {output_path} ({len(video)} bytes)")
Cómo usar imagen a video y fotogramas clave
La página de FLUX 3 en CometAPI lista imagen a video como una capacidad admitida. Su muestra pública actual demuestra texto a video, así que verifica la documentación en vivo de la pasarela antes de asumir que un campo de imagen de referencia copiado de otro modelo funcionará sin cambios.
La API nativa de BFL es explícita: imagen a video utiliza mode i2v y el campo keyframes. Una imagen fija el fotograma inicial, dos imágenes pueden fijar el inicio y el final, y hasta diez imágenes temporizadas pueden crear un storyboard de un clip continuo.
Ejemplo nativo de BFL con fotogramas clave
curl -X POST https://api.bfl.ai/v1/flux-3-video \
-H "x-key: $BFL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"mode": "i2v",
"prompt": "They sprint through the lantern-lit alley as the camera tracks behind them.",
"keyframes": [
[0, "data:image/png;base64,<first-frame>"],
[8, "data:image/png;base64,<last-frame>"]
],
"duration": 8
}'
Mantén separados los parámetros nativos del proveedor y los de la pasarela. BFL usa campos como mode, keyframes, start_video, resolution y draft; la muestra verificada de CometAPI usa model, prompt, seconds y size.
Parámetros de la API de FLUX 3 explicados
| Parámetro | API | Qué controla | Recomendación práctica |
|---|---|---|---|
| model | CometAPI | Selección de modelo | Usa flux-3 |
| prompt | Ambas | Escena, acción, cámara, audio | Describe el cambio visible a lo largo del tiempo |
| seconds | Muestra de CometAPI | Longitud del clip solicitada | Empieza con 5–8 segundos mientras ajustas |
| size | Muestra de CometAPI | Dimensiones de salida | Comienza con 1280x720 para pruebas económicas |
| mode | Nativa de BFL | t2v / i2v / v2v / draft_enhance | No lo envíes a menos que la pasarela lo mapee |
| duration | Nativa de BFL | 5–20 s T2V/I2V; 5–15 s V2V | auto es compatible en la API nativa |
| resolution | Nativa de BFL | hd o fhd; 4K/UHD no figura actualmente para FLUX 3 Video | FHD finaliza mediante el upsampler de video |
| generate_audio | Nativa de BFL | Activar/desactivar audio sincronizado | Por defecto es true |
| draft | Nativa de BFL | Modo de vista previa rápida | Úsalo para iteración creativa de menor costo |
Cómo escribir mejores prompts para FLUX 3
La guía de prompts de video de BFL recomienda una dirección clara para el sujeto y la acción, cámara, escena y atmósfera, calidad del movimiento y continuidad. Para escenas guiadas por audio, especifica diálogo, voz, efectos de sonido y ambiente.
Una estructura práctica de prompt
Subject + Environment + Action + Camera + Lighting
+ Dialogue/Voice + Sound Effects + Ambience + Constraints
Prompt cinematográfico
A lone cyclist rides through a rain-soaked neon street at midnight.
The camera begins low beside the rear wheel, then rises into a smooth tracking shot.
Reflections stretch across wet asphalt under moving cyan and magenta light.
Audio: steady rainfall, chain noise, distant traffic, no music, no dialogue.
Keep the same rider, bicycle, jacket, and weather throughout the shot.
Prompt de producto
A premium stainless-steel espresso machine stands on a dark stone counter.
Begin with a macro close-up of water droplets on the metal housing.
Orbit clockwise as the machine brews; steam catches warm side light.
Finish on a clean three-quarter hero angle with the cup in the foreground.
Audio: pump vibration, steam hiss, ceramic contact, quiet cafe ambience.
Do not change the product shape, logo placement, material, or color.
Prompt de diálogo y audio nativo
A young chef works alone in a compact Tokyo ramen shop at night.
Start close on boiling broth, then pull back as the chef sets down a bowl.
Warm tungsten lighting, natural reflections, documentary handheld motion.
The chef quietly says in Japanese: 「お待たせしました。」
Audio: bubbling broth, soft rain outside, distant street traffic.
No subtitles and no background music.
Un prompt como “make a cinematic ramen shop video” deja sin especificar el movimiento, el encuadre, el sonido y la continuidad. Una dirección explícita produce un brief de producción más comprobable.
Precios de la API de FLUX 3
La tarificación de BFL es específica por flujo: las renderizaciones completas de texto a video e imagen a video cuestan $0.17/s en HD o $0.29/s en FHD, con Modo Borrador en HD a $0.06/s. La continuación de video cuesta $0.43/s en HD o $0.54/s en FHD, con borradores en HD a $0.12/s. CometAPI actualmente lista flux-3 a $0.136/s para 720p y $0.232/s para 1080p. Verifica los precios en vivo antes de un lote grande.
| Proveedor / flujo | HD / 720p completo | FHD / 1080p completo | Borrador | Render de 5 s completo | Render de 10 s completo |
|---|---|---|---|---|---|
| BFL T2V | $0.17/s | $0.29/s | $0.06/s (HD) | $0.85 / $1.45 | $1.70 / $2.90 |
| BFL I2V | $0.17/s | $0.29/s | $0.06/s (HD) | $0.85 / $1.45 | $1.70 / $2.90 |
| BFL V2V continuation | $0.43/s | $0.54/s | $0.12/s (HD) | $2.15 / $2.70 | $4.30 / $5.40 |
| CometAPI flux-3 | $0.136/s | $0.232/s | No listado | $0.68 / $1.16 | $1.36 / $2.32 |
Cómo leer las dos últimas columnas: los valores se muestran primero como HD/720p y después como FHD/1080p.
Cómo reducir los costos de iteración
- Prototipa en 720p antes de pasar un prompt seleccionado a 1080p.
- Usa clips de cinco segundos para validar composición, movimiento e interpretación del prompt.
- Cambia una variable principal del prompt a la vez.
- Al usar la API nativa de BFL, prueba el Modo Borrador antes de un render de calidad completa.
- Almacena prompts exitosos y decisiones de referencia en metadatos de la aplicación.
FLUX 3 vs Wan 3.0 vs Seedance 2.5
Compara FLUX 3, Wan 3.0 y Seedance 2.5 por flujo de trabajo en lugar de buscar un único “ganador” universal. Los enlaces de especificación autorizados permanecen en el encabezado de la tabla a continuación.
| Dimensión | FLUX 3 Especificaciones oficiales | Wan 3.0 Especificaciones oficiales | Seedance 2.5 Especificaciones oficiales |
|---|---|---|---|
| Longitud máxima de clip | Hasta 20 s T2V/I2V | Hasta 30 s | Hasta 30 s |
| Audio sincronizado | Sí | Sí | Sí |
| Texto a video | Sí | Sí | Sí |
| Imagen a video | Sí | Sí | Sí |
| Estrategia de referencia | Hasta 10 fotogramas clave nativos | Flujo multimodal amplio y Omni-Reference | Gran capacidad de referencia multimodal |
| Continuación/edición | Continuación v2v nativa de BFL | Flujos de trabajo de formato largo y edición | Flujos de extensión y edición |
| Fortaleza distintiva | Lógica de movimiento, escenas multi-plano, salida audiovisual sincronizada | Amplitud de entrada y generación de 30 segundos | Narrativa larga y control intensivo de identidad y estilo |
| Precio inicial en CometAPI | $0.136/s | $0.04/s | $0.0824/s |
| Mejor ajuste | Planos audiovisuales cinematográficos o realistas | Canalizaciones de producción multimodales todo-en-uno | Narrativa más larga con fuerte control de identidad, producto y estilo |
Nota sobre precios: Los precios iniciales no son una comparación equivalente en calidad o resolución. Usa la tabla específica de resolución en la página en vivo de cada modelo para presupuestar.
¿Qué Video API deberías elegir?
- Elige FLUX 3 para movimiento realista, sonido sincronizado, lógica multi-plano, fotogramas clave nativos o continuación.
- Elige Wan 3.0 cuando el flujo de trabajo comience con muchos tipos de entrada y sea importante la ventana de 30 segundos.
- Elige Seedance 2.5 para narrativa más larga, rica en referencias, con fuerte control de identidad, producto y estilo.
Mejores prácticas de producción con la API de FLUX 3
Conserva trabajos asíncronos como estado duradero
Guarda el ID de la tarea inmediatamente después del envío. Un reinicio del servidor o un reintento del worker no debería obligar al usuario a pagar otra generación porque la aplicación perdió la tarea original.
Evita sondeos agresivos
Comienza cerca de un intervalo de diez segundos, a menos que la documentación en vivo recomiende lo contrario. Sondear cada segundo añade presión de solicitudes sin mejorar materialmente la experiencia.
Valida la descarga
Verifica la longitud del contenido y la firma MP4 antes de marcar un recurso como completo. Una respuesta HTTP exitosa no siempre prueba que el cuerpo sea un video válido.
Separa esquemas nativos y de pasarela
Mantén adaptadores separados para solicitudes nativas de BFL y de CometAPI. Esto previene que campos nativos como mode, keyframes y start_video se filtren a una llamada de pasarela que espera model, prompt, seconds y size.
Almacena el contexto completo de fallos
Registra el estado HTTP, el cuerpo de la respuesta, el ID de la tarea, el ID del modelo, la versión del prompt, el tamaño, la duración y el ID interno del trabajo. Redacta la clave de API.
Usa un conjunto pequeño de evaluación antes de publicar
Construye 10–30 prompts representativos que cubran movimiento de cámara, personas, productos, tipografía, diálogo, escenas de alto movimiento y relaciones de aspecto requeridas. Ejecuta el mismo conjunto cuando cambie la versión de un modelo o integración, y repite prompts importantes porque la generación de video es estocástica.
Preguntas frecuentes
¿Cuál es el ID de modelo de FLUX 3 en CometAPI?
El ID de modelo actual es flux-3.
¿Qué endpoint de CometAPI usa FLUX 3?
El flujo verificado de Video API usa POST /v1/videos, seguido por GET /v1/videos/{task_id} y GET /v1/videos/{task_id}/content.
¿FLUX 3 es síncrono?
No. Trátalo como un trabajo asíncrono: envía, conserva el ID de la tarea, sondea y descarga.
¿Cuánto tiempo puede generar FLUX 3?
BFL documenta 5–20 segundos para T2V/I2V y 5–15 segundos para continuación.
¿FLUX 3 genera audio?
Sí. BFL documenta audio sincronizado habilitado por defecto en su API nativa.
¿FLUX 3 admite imagen a video?
Sí. CometAPI lista soporte de imagen a video, mientras que la API nativa de BFL lo implementa mediante el modo i2v y keyframes.
¿Puedo usar los keyframes de BFL a través de CometAPI sin cambios?
No lo asumas. Los esquemas de solicitud difieren; verifica el quickstart actual de CometAPI antes de implementar un flujo de imagen de referencia en la pasarela.
¿Cuánto cuesta un video de cinco segundos de FLUX 3 en CometAPI?
A las tarifas actualmente listadas por CometAPI, cinco segundos cuestan $0.68 en 720p o $1.16 en 1080p. Consulta la tabla de precios consolidada arriba para el enlace de referencia en vivo.
¿FLUX 3 es mejor que Wan 3.0 o Seedance 2.5?
Depende del flujo de trabajo. FLUX 3 es convincente para planos audiovisuales con coherencia de movimiento y control nativo de fotogramas clave o continuación; Wan 3.0 enfatiza la amplitud de entrada; Seedance 2.5 enfatiza narrativa más larga y control intensivo por referencia.
Conclusión
FLUX 3 ahora tiene una ruta de Video API asíncrona funcional en CometAPI, mientras que la documentación nativa de BFL expone controles más profundos para fotogramas clave, continuación, audio y Modo Borrador.
Una ruta de integración segura es directa: comienza con una solicitud corta de texto a video en 720p, conserva el ID de la tarea, sondea de forma conservadora, descarga y valida el MP4; luego añade plantillas de prompts, almacenamiento, lógica de reintentos y un conjunto de evaluación repetible. Mantén separados los esquemas nativo y de pasarela, y verifica la página del modelo en vivo antes de codificar campos o precios.
