TL;DR
Usa Omni cuando un proyecto dependa de combinar personas, productos, escenarios, voces o video fuente reutilizables en un único flujo de trabajo controlado. Su valor es la orquestación de referencias y la continuidad audiovisual, no una mejora automática de calidad frente al modelo estándar. Empieza con una toma corta de validación, aprueba las referencias, añade audio y amplía a un guion gráfico solo cuando el activo principal se mantenga estable.
Key Takeaways
- Omni admite referencias de texto, imagen, elemento, video y voz, con salida a nivel de modelo de hasta 15 segundos en flujos de trabajo compatibles.
- Kling VIDEO 3.0 sigue siendo competitivo en benchmarks de preferencia; elige Kling VIDEO 3.0 Omni cuando su flujo de referencia más amplio resuelva una necesidad de producción específica.
- Valida por separado identidad, forma del producto, composición y audio antes de combinarlos en una secuencia de múltiples planos.
- Para trabajo vía API, sigue los parámetros documentados para la ruta del proveedor seleccionada en lugar de suponer que todas las funciones de la interfaz están expuestas.
- Presupuesta en función de los clips aceptados, no solo del costo publicitado de un intento.
Espacio de trabajo oficial de Omni y controles de referencia.
What Does the Omni Model Support?
Kling posiciona Omni en torno a referencias multimodales y consistencia audiovisual. La implicación práctica es simple: define los activos que deben permanecer reconocibles y describe lo que quieres que ocurra con ellos.
| Especificación — guía oficial de generación | Capacidad de Omni |
|---|---|
| Opciones de entrada | Texto, imágenes, referencias de video, elementos reutilizables y referencias de voz |
| Duración de salida a nivel de modelo | 3–15 segundos |
| Resolución de video | 720p y 1080p; 4K nativo en flujos de trabajo compatibles |
| Audio | Generación audiovisual nativa con vinculación personaje–voz |
| Control de planos | Generación de plano único y secuenciación personalizada de múltiples planos |
| Creación de elementos con múltiples imágenes | 2–4 imágenes |
| Creación de personaje basada en video | Un clip de personaje de 3–8 segundos |
| Muestra de voz recomendada | 5–30 segundos de habla clara con un único hablante |
| Límite combinado de imágenes y elementos | Hasta 7 sin entrada de video; hasta 4 con entrada de video |
Crear un elemento es diferente a adjuntar referencias a una única solicitud de generación. Varias vistas pueden pertenecer a un mismo elemento reutilizable; no se cuentan automáticamente como varias ranuras de elemento independientes.
La capacidad a nivel de modelo no garantiza controles idénticos entre proveedores. Un flujo de 15 segundos en la interfaz de Kling y una solicitud de API de terceros pueden exponer parámetros y valores de duración diferentes.
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: Cuándo elegir cada uno
La elección no es simplemente video básico frente a video con sonido. El modelo estándar también admite audio nativo, generación multiplano y vinculación de elementos. La distinción más útil es cómo un proyecto organiza y reutiliza referencias.
| Dimensión | Kling VIDEO 3.0 | Kling VIDEO 3.0 Omni |
|---|---|---|
| Organización de referencias | Vinculación de elementos en torno a un fotograma inicial aprobado o fotogramas inicial/final aprobados | Composición más amplia con imágenes, elementos y referencias de video |
| Relación entre elementos | Mejor cuando los sujetos importantes ya existen en el fotograma definitorio | Mejor cuando se deben combinar o reutilizar activos separados |
| Voz del personaje | Puede usar elementos con voz vinculada | Admite referencias visuales y de voz en un único flujo Omni |
| Generación multiplano | Compatible | Compatible con controles personalizados de guion gráfico |
| Punto de partida recomendado | Un fotograma clave aprobado que ya defina la escena | Una colección de activos que deben permanecer reconocibles a través de los planos |
Resultado de la comparación: empieza con el flujo estándar cuando un fotograma aprobado ya contiene la información esencial. Elige Omni cuando la composición de referencias, la reutilización de activos o la continuidad audiovisual entre planos sea central para el trabajo.
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: Benchmarks
Las siguientes estimaciones puntuales comparan las entradas Pro 1080p con audio habilitado disponibles en Artificial Analysis cuando se revisó esta guía el 9 de septiembre de 2026. Los valores después de “±” son intervalos de confianza publicados al 95%.
| Evaluación — texto a video / imagen a video | Estándar | Omni |
|---|---|---|
| Elo de texto a video | 1108 ± 5 | 1090 ± 6 |
| Elo de imagen a video | 1072 ± 6 | 1060 ± 7 |
Estas son puntuaciones basadas en preferencias, no porcentajes de éxito de generación. El modelo estándar tiene la estimación puntual más alta en ambas comparaciones, mientras que los intervalos de confianza de imagen a video se solapan. Las puntuaciones pueden cambiar a medida que lleguen nuevas evaluaciones.
Resultado del benchmark: la ventaja de Omni debe evaluarse por el manejo de referencias y la continuidad de producción, no inferirse por su nombre ni tratarse como una clasificación de calidad universal.
How to Build Your First Reference-Led Video
Imagina un anuncio vertical con una presentadora llamada Maya, una botella azul reutilizable y un escenario de estudio aprobado. Son activos de producción ilustrativos, no una prueba de generación reportada.
Prepara un conjunto pequeño y coherente de activos
| Activo | Preparación | Criterio de aceptación |
|---|---|---|
| Presentadora | Vistas claras con cabello, vestuario e iluminación consistentes | Rostro reconocible y vestuario sin cambios |
| Botella | Vistas frontal, lateral y tres cuartos | Cuerpo, tapa, color y etiqueta estables |
| Escenario | Una referencia de estudio aprobada | Fondo consistente y dirección de luz coherente |
| Voz | Locución limpia de un hablante autorizado | Voz reconocible sin voces concurrentes |
Usa solo rostros, grabaciones y activos de marca que estés autorizado a usar. Las referencias en conflicto deben corregirse antes de intentar compensarlas con un prompt más largo.
Crea y nombra tus elementos
En la Element Library de Kling, crea activos reutilizables en lugar de volver a describir el mismo sujeto en cada plano. El flujo oficial admite la creación de personajes con múltiples imágenes y basada en video.
Usa nombres descriptivos como Maya, BlueBottle y Studio. Los nombres son ayudas organizativas; seleccionar el elemento guardado es lo que adjunta la referencia. Para voces cargadas, usa audio claro con un único hablante sin música ni voces superpuestas.

Controles oficiales de elemento de personaje y vinculación de voz.
En los prompts siguientes, @Maya, @BlueBottle y @Studio representan elementos seleccionados en la interfaz de Kling. Escribir estos nombres sin adjuntar los activos correspondientes no crea una referencia.
Genera primero un plano sencillo
Abre el espacio de trabajo de generación Omni, elige el modelo y adjunta los activos necesarios. Empieza con cinco segundos, un movimiento de cámara y sin diálogo.
Create a single continuous product shot using @BlueBottle in @Studio.
The bottle stands upright on a clean tabletop. Keep its body shape,
cap, surface color, and label placement consistent with the references.
Camera: a slow, straight push-in from a medium close-up.
Lighting: soft studio light from camera left.
Action: the bottle remains stationary.
Composition: leave clear space above the bottle for text added later.
No cuts, no extra products, and no generated captions.
Inspecciona el inicio, la mitad y el final. Revisa la tapa, la silueta, la posición de la etiqueta y el contacto con la superficie de la mesa. Si el activo cambia, simplifica el plano o mejora las referencias antes de añadir nuevas exigencias.
Añade la presentadora y audio nativo
Después de que el plano de la botella sea aceptable, introduce a la presentadora y una línea corta hablada. Kling documenta la generación de voz en varios idiomas, pero la calidad de salida sigue dependiendo de la calidad de las referencias, el timing y la claridad del prompt.
Create a five-second continuous shot using @Maya, @BlueBottle,
and @Studio.
Maya stands beside the bottle, looks toward the camera, and says:
“Ready when you are.”
Use Maya’s bound voice. Keep the bottle unchanged. Use one static
camera angle. Do not add music, captions, cuts, or additional speech.
Revisa el audio por separado de la imagen: confirma que habla la persona prevista, que la línea está completa y que el timing coincide con la interpretación visible.
Después de validar un plano único, reutiliza sus referencias aprobadas para planificar una secuencia de múltiples planos; asigna a cada plano una duración y un propósito visual distinto. Los controles personalizados de guion gráfico admiten instrucciones a nivel de plano para duración, encuadre, comportamiento de cámara y progresión narrativa.
| Tiempo | Propósito | Instrucción visual | Instrucción de audio |
|---|---|---|---|
| 0–5 segundos | Presentar el producto | Primer plano de la botella; avance lento | Tono de sala |
| 5–10 segundos | Introducir a la presentadora | Plano medio de Maya junto a la botella; cámara estática | “Ready when you are.” |
| 10–15 segundos | Finalizar en el producto | Plano principal limpio; mantener la composición final | Tono de sala |

Panel personalizado oficial de guion gráfico multiplano.
Create a three-shot product advertisement using @Maya, @BlueBottle,
and @Studio.
Continuity rules:
Use the same presenter, outfit, bottle, and studio throughout.
Keep the bottle’s shape, cap, color, and label unchanged.
Maintain the same lighting direction.
Use Maya’s bound voice only.
Do not add people, products, captions, or extra dialogue.
Follow the separate shot descriptions and durations.
End on a stable product composition.
Revisa las transiciones con el mismo cuidado que los planos individuales. Compara la última vista clara del producto antes de cada corte con la primera vista clara después de este. Añade avisos legales, precios exactos, subtítulos y tipografía de marca en un editor para que el texto quede bajo control directo.
How to Use Video References for Character Creation and Video Editing
Un clip usado para crear un personaje reutilizable es diferente de metraje fuente suministrado para una tarea de edición. El primero establece la identidad; el segundo aporta movimiento y composición existentes para transformar o preservar. Para la creación de personajes, usa un clip de 3–8 segundos de un personaje. Para edición de video, la guía oficial de Omni de Kling permite un video fuente de 3–10 segundos, hasta 200 MB y resolución 2K; verifica los límites actuales de la ruta de API seleccionada y prueba un clip corto antes de escalar la producción.
Use the uploaded video as the source.
Change only the background to a softly lit studio.
Preserve the presenter’s identity, clothing, actions, and timing.
Preserve the bottle and the original camera movement.
Do not add cuts, gestures, objects, or dialogue.
Una solicitud de edición controlada no garantiza una preservación exacta fotograma a fotograma. Decide por separado si conservar el audio fuente o generar sonido nuevo, y luego compara la salida con el clip original.
How to Use the Omni API in CometAPI
Para acceso programático, usa el endpoint de video Omni dedicado. El identificador documentado usado a continuación es kling-v3-omni.
Los ejemplos siguen el esquema de API publicado; no reportan una prueba de generación en vivo. La ruta seleccionada documenta valores de duración “5” y “10” para los modos relevantes, así que no supongas que un flujo de 15 segundos en la interfaz se corresponde con la misma solicitud.
Submit a Generation Task
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
curl --fail --silent --show-error \
--request POST \
"https://api.cometapi.com/kling/v1/videos/omni-video" \
--header "Authorization: Bearer ${COMETAPI_KEY}" \
--header "Content-Type: application/json" \
--data-raw '{
"model_name": "kling-v3-omni",
"prompt": "A blue reusable bottle stands on a clean studio tabletop. One continuous shot with a slow straight push-in. Soft light from camera left. No people, no cuts, no captions.",
"mode": "std",
"aspect_ratio": "9:16",
"duration": "5",
"sound": "off"
}'
Para una referencia de primer fotograma, integra el siguiente fragmento en la solicitud y reemplaza la URL de ejemplo con una imagen accesible:
{
"image_list": [
{
"image_url": "https://your-public-host.example/bottle.jpg",
"type": "first_frame"
}
],
"prompt": "Starting from <<<image_1>>>, create one continuous slow push-in. Preserve the bottle and studio composition. No cuts or captions."
}
La sintaxis <<<image_1>>> de la API es diferente de las referencias @Element seleccionadas en la interfaz. Los valores documentados de sound son on y off.
Retrieve the Finished Video
Guarda el data.task_id devuelto y luego consulta la ruta de estado de tareas Omni:
TASK_ID="REPLACE_WITH_RETURNED_TASK_ID"
curl --fail --silent --show-error \
"https://api.cometapi.com/kling/v1/videos/omni-video/${TASK_ID}" \
--header "Authorization: Bearer ${COMETAPI_KEY}"
Los estados documentados son submitted, processing, succeed y failed. Una respuesta de creación con code: 0 significa que la solicitud fue aceptada; no significa que el video esté listo. Cuando la tarea tenga éxito, obtén el resultado desde data.task_result.videos[0].url.
Usa sondeo acotado con backoff, conserva el ID de tarea junto con el prompt y la configuración, e inspecciona el mensaje de error antes de reintentar. Una solicitud de cliente que expira puede haber creado ya una tarea facturable.
What Does Kling VIDEO 3.0 Omni Cost?
Usa precios específicos de configuración en lugar de un “precio por video” genérico. Las cifras siguientes se verificaron el 9 de septiembre de 2026 y pueden cambiar.
La guía oficial de VIDEO 3.0 Omni de Kling lista las siguientes tarifas de créditos de plataforma. Los precios en dólares de CometAPI en la siguiente tabla usan unidades de facturación diferentes; los créditos no se pueden convertir a dólares sin la tasa aplicable de compra de créditos de Kling.
| Configuración Omni | Créditos oficiales / segundo | Créditos oficiales / 5 segundos | Créditos oficiales / 10 segundos |
|---|---|---|---|
| 720p, sin entrada de video, audio nativo apagado | 6 | 30 | 60 |
| 1080p, sin entrada de video, audio nativo apagado | 8 | 40 | 80 |
| 1080p, sin entrada de video, audio nativo encendido | 12 | 60 | 120 |
| 1080p, con entrada de video, audio nativo apagado | 16 | 80 | 160 |
La guía oficial no lista una tarifa de créditos Omni para 4K y marca el audio nativo con entrada de video como no compatible en esta tabla de precios. Confirma las tarifas vigentes en el producto antes de ordenar.
| Omni API en CometAPI | Salida de 5 segundos | Salida de 10 segundos |
|---|---|---|
| 720p, sin entrada de video | $0.336 | $0.672 |
| 1080p, sin entrada de video | $0.448 | $0.896 |
| 1080p, audio nativo | $0.560 | $1.120 |
| 1080p, con entrada de video | $0.672 | $1.344 |
| 4K, sin entrada de video | $1.680 | $3.360 |
Son configuraciones de API separadas. No sumes las filas ni infieras que todas las combinaciones de resolución, audio y entrada de video están disponibles. Un precio para 4K tampoco establece qué parámetro o ruta habilita 4K.
Kling introdujo video 4K nativo después del lanzamiento original. Aprueba el contenido y el movimiento antes de pagar iteraciones de mayor resolución.
Presupuesta por clips aceptados
Una medida de producción más útil es:
Costo por clip aceptado = gasto total de generación ÷ clips aceptados
Tres intentos de cinco segundos a la tarifa de audio nativo 1080p cuestan 3 × $0.560 = $1.680. Si solo un intento cumple los criterios de aceptación, su costo efectivo de generación es $1.680. Este cálculo ilustra la presupuestación; no es una tasa de reintento medida.
Mantén separados los créditos de la aplicación Kling de la facturación en dólares de CometAPI. La guía de costo de créditos de Kling trata duración, resolución, audio y flujo de trabajo como factores de planificación independientes.
Troubleshooting: What Should You Change First?
| Problema | Primera verificación | Ajuste sugerido |
|---|---|---|
| El personaje cambia entre planos | Referencias en conflicto o descripciones de vestuario | Reutiliza un elemento aprobado y simplifica el plano |
| Forma del producto o etiqueta cambian | Calidad de referencia y movimiento exigente | Añade una vista del producto más clara; prueba un plano estacionario |
| Voz incorrecta o discurso adicional | Vinculación de voz e instrucciones en conflicto | Mantén un solo hablante y una línea breve |
| Cortes no deseados | Configuración del guion gráfico y cambios de escena | Prueba un plano continuo sin saltos narrativos |
| La API rechaza la solicitud | Esquema, tipos y duración específicos de la ruta | Vuelve a la solicitud mínima documentada |
| La tarea existe pero no tiene URL de video | La generación puede seguir en curso | Consulta la tarea existente en lugar de crear otra |
| Mayor resolución sigue viéndose mal | Persiste el problema de movimiento o identidad | Revisa la escena antes de aumentar la calidad de salida |
Cambia una variable a la vez. Registra los activos, el prompt, la configuración, la salida y la razón del rechazo para que las mejoras puedan atribuirse a una decisión específica.
Final Recommendation
Usa Omni cuando la producción dependa de combinar y reutilizar activos reconocibles, no simplemente porque el nombre sugiera una mejora universal. Empieza con un plano corto guiado por referencias, aprueba el personaje o producto, introduce la voz vinculada y luego construye el guion gráfico. Al pasar a CometAPI, alinea el identificador del modelo, la duración, la sintaxis de referencias y el flujo asíncrono de tareas con el endpoint seleccionado.
La pregunta más útil no es “¿Cuánto puedo meter en un solo prompt?” sino “¿Qué incertidumbre debo eliminar antes de la próxima generación?”
FAQ
¿Omni es siempre mejor que el modelo estándar?
No. Los benchmarks de preferencia pueden favorecer al modelo estándar en algunas evaluaciones. Omni es más útil cuando su flujo de referencia más amplio mejora la reutilización de activos, la continuidad o el control de edición.
¿Todo flujo Omni puede generar videos de 15 segundos?
No. Quince segundos es una capacidad a nivel de modelo en flujos compatibles. Las interfaces y rutas de API individuales pueden exponer opciones de duración más cortas.
¿Debo empezar con audio nativo y múltiples planos?
Por lo general, no. Primero valida un plano visual corto. Añade una voz solo después de que la identidad y la consistencia del producto sean aceptables, luego amplía a un guion gráfico.
¿Los nombres @Element funcionan en una solicitud de API?
No automáticamente. Los elementos seleccionados en la interfaz de Kling y la sintaxis de referencias de imagen de una API son mecanismos diferentes. Sigue el esquema de la ruta que estés llamando.
¿Cómo debo estimar un presupuesto de producción?
Sigue el gasto total de generación y divídelo por los clips aceptados. Incluye intentos rechazados, repeticiones a mayor resolución, almacenamiento y posproducción en la estimación de trabajo.
