TL;DR
Usa Omni quando un progetto dipende dal combinare persone, prodotti, ambientazioni, voci o video sorgente riutilizzabili in un unico flusso di lavoro controllato. Il suo valore sta nell’orchestrazione dei riferimenti e nella continuità audiovisiva, non in un vantaggio di qualità automatico rispetto al modello standard. Inizia con una breve inquadratura di validazione, approva i riferimenti, aggiungi l’audio ed espandi a uno storyboard solo dopo che l’asset principale è stabile.
Punti chiave
- Omni supporta riferimenti di testo, immagine, elemento, video e voce, con output a livello di modello fino a 15 secondi nei flussi supportati.
- Kling VIDEO 3.0 rimane competitivo nei benchmark di preferenza; scegli Kling VIDEO 3.0 Omni quando il suo flusso di riferimento più ampio risolve un’esigenza produttiva specifica.
- Convalida separatamente identità, forma del prodotto, composizione e audio prima di combinarli in una sequenza multi-shot.
- Per l’uso dell’API, segui i parametri documentati per la route del provider selezionata invece di presumere che ogni funzione dell’interfaccia sia esposta.
- Imposta il budget in base alle clip accettate, non solo al costo pubblicizzato di un singolo tentativo.
Spazio di lavoro ufficiale di Omni e controlli dei riferimenti.
Che cosa supporta il modello Omni?
Kling colloca Omni intorno a riferimenti multimodali e alla coerenza audiovisiva. L’implicazione pratica è semplice: definisci gli asset che devono restare riconoscibili, poi descrivi cosa dovrebbe accadere loro.
| Specifica — guida ufficiale alla generazione | Capacità di Omni |
|---|---|
| Opzioni di input | Testo, immagini, riferimenti video, elementi riutilizzabili e riferimenti vocali |
| Durata output a livello di modello | 3–15 secondi |
| Risoluzione video | 720p e 1080p; 4K nativo nei flussi supportati |
| Audio | Generazione audiovisiva nativa con binding personaggio–voce supportato |
| Controllo delle inquadrature | Generazione a singola inquadratura e sequenziamento multi-shot personalizzato |
| Creazione di elementi multi-immagine | 2–4 immagini |
| Creazione di personaggi basata su video | Clip di personaggio da 3–8 secondi |
| Campione vocale consigliato | 5–30 secondi di parlato chiaro con un solo speaker |
| Budget combinato di immagini ed elementi | Fino a 7 senza input video; fino a 4 con input video |
Creare un elemento è diverso dall’allegare riferimenti a una singola richiesta di generazione. Più viste possono appartenere a un unico elemento riutilizzabile; non vengono conteggiate automaticamente come diversi slot di elemento indipendenti.
La capacità a livello di modello non garantisce controlli identici tra provider. Un flusso di 15 secondi nell’interfaccia di Kling e una richiesta API di terze parti possono esporre parametri e valori di durata differenti.
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: quando scegliere l’uno o l’altro
La scelta non è semplicemente video base contro video con audio. Anche il modello standard supporta audio nativo, generazione multi-shot e binding degli elementi. La distinzione più utile riguarda il modo in cui un progetto organizza e riutilizza i riferimenti.
| Dimensione | Kling VIDEO 3.0 | Kling VIDEO 3.0 Omni |
|---|---|---|
| Organizzazione dei riferimenti | Binding degli elementi intorno a un fotogramma iniziale approvato o a fotogrammi di inizio/fine | Composizione più ampia con immagini, elementi e riferimenti video |
| Relazione degli elementi | Ideale quando i soggetti importanti sono già presenti nel fotogramma definitorio | Ideale quando asset separati devono essere combinati o riutilizzati |
| Voce del personaggio | Può usare elementi con voce associata | Supporta riferimenti visivi e vocali in un unico flusso Omni |
| Generazione multi-shot | Supportata | Supportata con controlli di storyboard personalizzati |
| Punto di partenza consigliato | Un keyframe approvato che definisce già la scena | Una raccolta di asset che devono restare riconoscibili tra le inquadrature |
Risultato del confronto: inizia con il flusso standard quando un fotogramma approvato contiene già le informazioni essenziali. Scegli Omni quando composizione dei riferimenti, riuso degli asset o continuità audiovisiva tra inquadrature sono centrali per il lavoro.
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: benchmark
Le seguenti stime puntuali confrontano le voci 1080p Pro con audio abilitate disponibili in Artificial Analysis quando questa guida è stata revisionata il 9 settembre 2026. I valori dopo “±” sono gli intervalli di confidenza pubblicati al 95%.
| Valutazione — da testo a video / da immagine a video | Standard | Omni |
|---|---|---|
| Elo da testo a video | 1108 ± 5 | 1090 ± 6 |
| Elo da immagine a video | 1072 ± 6 | 1060 ± 7 |
Si tratta di valutazioni basate sulle preferenze, non di percentuali di successo di generazione. Il modello standard ha la stima puntuale più alta in entrambi i confronti, mentre gli intervalli di confidenza per l’immagine‑video si sovrappongono. I punteggi possono cambiare con l’arrivo di nuove valutazioni.
Risultato del benchmark: il vantaggio di Omni andrebbe valutato in base alla gestione dei riferimenti e alla continuità produttiva, non inferito dal nome né trattato come una classifica di qualità universale.
Come realizzare il tuo primo video guidato dai riferimenti
Immagina una pubblicità verticale con una presentatrice di nome Maya, una bottiglia blu riutilizzabile e un’unica ambientazione studio approvata. Si tratta di asset di produzione illustrativi, non di un test di generazione riportato.
Prepara un set di asset piccolo e coerente
| Asset | Preparazione | Criterio di accettazione |
|---|---|---|
| Presentatrice | Viste chiare con capelli, abbigliamento e illuminazione coerenti | Volto riconoscibile e guardaroba invariato |
| Bottiglia | Viste frontale, laterale e a tre quarti | Forma, tappo, colore ed etichetta stabili |
| Ambientazione | Un riferimento studio approvato | Sfondo e direzione della luce coerenti |
| Voce | Parlato pulito da uno speaker autorizzato | Voce riconoscibile senza parlato sovrapposto |
Usa solo volti, registrazioni e asset di brand di cui sei autorizzato all’uso. I riferimenti in conflitto andrebbero corretti prima di provare a compensare con un prompt più lungo.
Crea e denomina i tuoi elementi
Nella Element Library di Kling, crea asset riutilizzabili invece di ridecrivere lo stesso soggetto per ogni inquadratura. Il flusso ufficiale supporta la creazione di personaggi multi‑immagine e basata su video.
Usa nomi descrittivi come Maya, BlueBottle e Studio. I nomi sono ausili organizzativi; è la selezione dell’elemento salvato che allega il riferimento. Per le voci caricate, usa audio chiaro, con un solo speaker senza musica o voci sovrapposte.

Controlli ufficiali per gli elementi personaggio e il binding della voce.
Nei prompt seguenti, @Maya, @BlueBottle e @Studio rappresentano elementi selezionati nell’interfaccia di Kling. Digitare questi nomi senza allegare i relativi asset non crea un riferimento.
Genera prima una singola inquadratura semplice
Apri lo spazio di lavoro di generazione Omni, scegli il modello e allega gli asset richiesti. Inizia con cinque secondi, un solo movimento di camera e nessun dialogo.
Create a single continuous product shot using @BlueBottle in @Studio.
The bottle stands upright on a clean tabletop. Keep its body shape,
cap, surface color, and label placement consistent with the references.
Camera: a slow, straight push-in from a medium close-up.
Lighting: soft studio light from camera left.
Action: the bottle remains stationary.
Composition: leave clear space above the bottle for text added later.
No cuts, no extra products, and no generated captions.
Ispeziona inizio, metà e fine. Controlla tappo, silhouette, posizionamento dell’etichetta e contatto con il piano d’appoggio. Se l’asset cambia, semplifica l’inquadratura o migliora i riferimenti prima di aggiungere nuove richieste.
Aggiungi la presentatrice e l’audio nativo
Dopo che la ripresa della bottiglia è accettabile, introduce la presentatrice e una breve battuta parlata. Kling documenta la generazione del parlato in diverse lingue, ma la qualità dell’output dipende comunque dalla qualità dei riferimenti, dal timing e dalla chiarezza del prompt.
Create a five-second continuous shot using @Maya, @BlueBottle,
and @Studio.
Maya stands beside the bottle, looks toward the camera, and says:
“Ready when you are.”
Use Maya’s bound voice. Keep the bottle unchanged. Use one static
camera angle. Do not add music, captions, cuts, or additional speech.
Rivedi l’audio separatamente dall’immagine: conferma che parli la persona prevista, che la frase sia completa e che il timing corrisponda alla performance visibile.
Dopo aver validato una singola inquadratura, riusa i riferimenti approvati per pianificare una sequenza multi‑shot; assegna a ciascuna inquadratura una durata e uno scopo visivo distinto. I controlli di storyboard personalizzati supportano istruzioni a livello di inquadratura per durata, inquadratura, comportamento della camera e progressione narrativa.
| Tempo | Scopo | Istruzione visiva | Istruzione audio |
|---|---|---|---|
| 0–5 secondi | Presentare il prodotto | Primo piano della bottiglia; lento push‑in | Rumore di fondo ambiente tenue |
| 5–10 secondi | Introdurre la presentatrice | Mezza figura di Maya accanto alla bottiglia; camera statica | “Pronta quando vuoi.” |
| 10–15 secondi | Chiudere sul prodotto | Hero shot pulito; mantieni la composizione finale | Rumore di fondo ambiente |

Pannello ufficiale di storyboard multi‑shot personalizzato.
Create a three-shot product advertisement using @Maya, @BlueBottle,
and @Studio.
Continuity rules:
Use the same presenter, outfit, bottle, and studio throughout.
Keep the bottle’s shape, cap, color, and label unchanged.
Maintain the same lighting direction.
Use Maya’s bound voice only.
Do not add people, products, captions, or extra dialogue.
Follow the separate shot descriptions and durations.
End on a stable product composition.
Esamina le transizioni con la stessa attenzione delle singole inquadrature. Confronta l’ultima vista chiara del prodotto prima di ogni taglio con la prima vista chiara dopo di esso. Aggiungi diciture legali, prezzi esatti, sottotitoli e tipografia del brand in un editor così che il testo resti sotto controllo diretto.
Come usare i riferimenti video per la creazione dei personaggi e il video editing
Una clip usata per creare un personaggio riutilizzabile è diversa da un girato sorgente fornito per un compito di editing. La prima stabilisce l’identità; il secondo fornisce movimento e composizione esistenti da trasformare o preservare. Per la creazione di personaggi, usa una clip da 3–8 secondi di un solo personaggio. Per il video editing, la guida ufficiale di Omni consente un solo video sorgente da 3–10 secondi, fino a 200 MB e risoluzione 2K; verifica i limiti correnti della route API selezionata e testa una clip breve prima di scalare la produzione.
Use the uploaded video as the source.
Change only the background to a softly lit studio.
Preserve the presenter’s identity, clothing, actions, and timing.
Preserve the bottle and the original camera movement.
Do not add cuts, gestures, objects, or dialogue.
Una richiesta di editing controllato non garantisce una preservazione perfetta al fotogramma. Decidi separatamente se mantenere l’audio sorgente o generare un nuovo suono, quindi confronta l’output con la clip originale.
Come usare l’API Omni in CometAPI
Per l’accesso programmatico, usa l’endpoint video Omni dedicato. L’identificatore documentato usato di seguito è kling-v3-omni.
Gli esempi seguono lo schema API pubblicato; non riportano un test di generazione live. La route selezionata documenta valori di durata “5” e “10” per le modalità pertinenti, quindi non dare per scontato che un flusso da 15 secondi dell’interfaccia corrisponda alla stessa richiesta.
Invia un task di generazione
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
curl --fail --silent --show-error \
--request POST \
"https://api.cometapi.com/kling/v1/videos/omni-video" \
--header "Authorization: Bearer ${COMETAPI_KEY}" \
--header "Content-Type: application/json" \
--data-raw '{
"model_name": "kling-v3-omni",
"prompt": "A blue reusable bottle stands on a clean studio tabletop. One continuous shot with a slow straight push-in. Soft light from camera left. No people, no cuts, no captions.",
"mode": "std",
"aspect_ratio": "9:16",
"duration": "5",
"sound": "off"
}'
Per un riferimento al primo fotogramma, integra il seguente frammento nella richiesta e sostituisci l’URL di esempio con un’immagine accessibile:
{
"image_list": [
{
"image_url": "https://your-public-host.example/bottle.jpg",
"type": "first_frame"
}
],
"prompt": "Starting from <<<image_1>>>, create one continuous slow push-in. Preserve the bottle and studio composition. No cuts or captions."
}
La sintassi <<<image_1>>> dell’API è diversa dai riferimenti @Element selezionati nell’interfaccia. I valori documentati per sound sono on e off.
Recupera il video completato
Conserva il data.task_id restituito, quindi interroga la route di stato del task Omni:
TASK_ID="REPLACE_WITH_RETURNED_TASK_ID"
curl --fail --silent --show-error \
"https://api.cometapi.com/kling/v1/videos/omni-video/${TASK_ID}" \
--header "Authorization: Bearer ${COMETAPI_KEY}"
Gli stati documentati sono submitted, processing, succeed e failed. Una risposta di creazione con code: 0 significa che la richiesta è stata accettata; non significa che il video sia pronto. Quando il task ha successo, ottieni il risultato da data.task_result.videos[0].url.
Usa polling con limiti e backoff, conserva l’ID del task insieme a prompt e impostazioni e verifica il messaggio d’errore prima di riprovare. Una richiesta client andata in timeout potrebbe aver già creato un task fatturabile.
Quanto costa Kling VIDEO 3.0 Omni?
Usa prezzi specifici per configurazione invece di un generico “prezzo per video”. Le cifre seguenti sono state verificate il 9 settembre 2026 e possono cambiare.
La guida ufficiale a VIDEO 3.0 Omni di Kling elenca le seguenti tariffe in crediti della piattaforma. I prezzi in dollari di CometAPI nella tabella successiva usano unità di fatturazione diverse; i crediti non possono essere convertiti in dollari senza il tasso di acquisto dei crediti Kling applicabile.
| Configurazione Omni | Crediti ufficiali / secondo | Crediti ufficiali / 5 secondi | Crediti ufficiali / 10 secondi |
|---|---|---|---|
| 720p, nessun input video, audio nativo disattivato | 6 | 30 | 60 |
| 1080p, nessun input video, audio nativo disattivato | 8 | 40 | 80 |
| 1080p, nessun input video, audio nativo attivato | 12 | 60 | 120 |
| 1080p, input video, audio nativo disattivato | 16 | 80 | 160 |
La guida ufficiale non riporta una tariffa in crediti per Omni 4K e indica l’audio nativo con input video come non supportato in questa tabella prezzi. Conferma le tariffe correnti in prodotto prima di ordinare.
| Omni API in CometAPI | Output di 5 secondi | Output di 10 secondi |
|---|---|---|
| 720p, nessun input video | $0.336 | $0.672 |
| 1080p, nessun input video | $0.448 | $0.896 |
| 1080p, audio nativo | $0.560 | $1.120 |
| 1080p, input video | $0.672 | $1.344 |
| 4K, nessun input video | $1.680 | $3.360 |
Si tratta di configurazioni API distinte. Non sommare le righe e non inferire che ogni combinazione di risoluzione, audio e input video sia disponibile. Un prezzo 4K non stabilisce neppure quale parametro o route abiliti il 4K.
Kling ha introdotto il video 4K nativo dopo il lancio iniziale. Approva contenuto e movimento prima di pagare iterazioni a risoluzione più alta.
Budget per le clip accettate
Una misura produttiva più utile è:
Costo per clip accettata = spesa totale di generazione ÷ clip accettate
Tre tentativi da cinque secondi alla tariffa 1080p con audio nativo costano 3 × $0.560 = $1.680. Se solo un tentativo soddisfa i criteri di accettazione, il suo costo effettivo di generazione è $1.680. Questo calcolo illustra la pianificazione del budget; non è un tasso di ripetizione misurato.
Tieni separati i crediti dell’applicazione Kling dalla fatturazione in dollari di CometAPI. La guida al costo dei crediti di Kling considera durata, risoluzione, audio e flusso di lavoro come fattori di pianificazione indipendenti.
Risoluzione dei problemi: cosa dovresti cambiare per primo?
| Problema | Prima verifica | Regolazione suggerita |
|---|---|---|
| Il personaggio cambia tra le inquadrature | Riferimenti o descrizioni del guardaroba in conflitto | Riusa un elemento approvato e semplifica l’inquadratura |
| La forma del prodotto o l’etichetta cambiano | Qualità dei riferimenti e movimento impegnativo | Aggiungi una vista del prodotto più chiara; testa un’inquadratura statica |
| Voce errata o parlato aggiuntivo | Binding della voce e istruzioni in conflitto | Mantieni un solo speaker e una battuta breve |
| Tagli indesiderati | Impostazioni dello storyboard e cambi di scena | Prova un’inquadratura continua senza salti narrativi |
| L’API rifiuta la richiesta | Schema, tipi e durata specifici della route | Torna alla richiesta minima documentata |
| Il task esiste ma non ha un URL video | La generazione potrebbe essere ancora in corso | Interroga il task esistente invece di crearne un altro |
| La risoluzione più alta è ancora sbagliata | Permane il problema di movimento o identità | Rivedi la scena prima di aumentare la qualità dell’output |
Modifica una variabile alla volta. Registra asset, prompt, impostazioni, output e motivo del rifiuto in modo che i miglioramenti possano essere ricondotti a una decisione specifica.
Raccomandazione finale
Usa Omni quando la produzione dipende dal combinare e riutilizzare asset riconoscibili, non semplicemente perché il nome suggerisce un upgrade universale. Inizia con una breve inquadratura guidata dai riferimenti, approva il personaggio o il prodotto, introduci la voce associata e poi costruisci lo storyboard. Passando a CometAPI, allinea l’identificatore del modello, la durata, la sintassi dei riferimenti e il flusso asincrono dei task con l’endpoint selezionato.
La domanda più utile non è “Quanto posso far entrare in un solo prompt?” bensì “Quale incertezza dovrei rimuovere prima della prossima generazione?”
FAQ
Omni è sempre migliore del modello standard?
No. I benchmark basati sulle preferenze possono favorire il modello standard in alcune valutazioni. Omni è più utile quando il suo flusso di riferimento più ampio migliora il riuso degli asset, la continuità o il controllo in fase di editing.
Ogni flusso Omni può generare video da 15 secondi?
No. Quindici secondi sono una capacità a livello di modello nei flussi supportati. Interfacce e route API specifiche possono esporre opzioni di durata più brevi.
Dovrei iniziare con audio nativo e più inquadrature?
Di solito no. Convalida prima una breve inquadratura visiva. Aggiungi una voce solo dopo che identità e coerenza del prodotto sono accettabili, quindi espandi in uno storyboard.
I nomi @Element funzionano in una richiesta API?
Non automaticamente. Gli elementi selezionati nell’interfaccia di Kling e la sintassi dei riferimenti immagine di un’API sono meccanismi diversi. Segui lo schema della route che stai chiamando.
Come dovrei stimare un budget di produzione?
Tieni traccia della spesa totale di generazione e dividila per le clip accettate. Includi nella stima operativa i tentativi respinti, i rerun ad alta risoluzione, l’archiviazione e la post‑produzione.
