GPT-6.1 Sol are now live on CometAPI →
guide/Ricerca CometAPI

Guida utente di Kling VIDEO 3.0 Omni Model

Impara a utilizzare Kling 3.0 Omni con elementi riutilizzabili, audio nativo, storyboard multi-shot, esempi di CometAPI, contesto di benchmark e controllo pratico dei costi.

CometAPI
Deon GoodwinTeam di ricerca su modelli AI e API
Aggiornato Oct 5, 2026 15 min di lettura
Guida utente di Kling VIDEO 3.0 Omni Model
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Usa Omni quando un progetto dipende dal combinare persone, prodotti, ambientazioni, voci o video sorgente riutilizzabili in un unico flusso di lavoro controllato. Il suo valore sta nell’orchestrazione dei riferimenti e nella continuità audiovisiva, non in un vantaggio di qualità automatico rispetto al modello standard. Inizia con una breve inquadratura di validazione, approva i riferimenti, aggiungi l’audio ed espandi a uno storyboard solo dopo che l’asset principale è stabile.

Punti chiave

  • Omni supporta riferimenti di testo, immagine, elemento, video e voce, con output a livello di modello fino a 15 secondi nei flussi supportati.
  • Kling VIDEO 3.0 rimane competitivo nei benchmark di preferenza; scegli Kling VIDEO 3.0 Omni quando il suo flusso di riferimento più ampio risolve un’esigenza produttiva specifica.
  • Convalida separatamente identità, forma del prodotto, composizione e audio prima di combinarli in una sequenza multi-shot.
  • Per l’uso dell’API, segui i parametri documentati per la route del provider selezionata invece di presumere che ogni funzione dell’interfaccia sia esposta.
  • Imposta il budget in base alle clip accettate, non solo al costo pubblicizzato di un singolo tentativo.

Guida utente di Kling VIDEO 3.0 Omni Model

Spazio di lavoro ufficiale di Omni e controlli dei riferimenti.

Che cosa supporta il modello Omni?

Kling colloca Omni intorno a riferimenti multimodali e alla coerenza audiovisiva. L’implicazione pratica è semplice: definisci gli asset che devono restare riconoscibili, poi descrivi cosa dovrebbe accadere loro.

Specifica — guida ufficiale alla generazioneCapacità di Omni
Opzioni di inputTesto, immagini, riferimenti video, elementi riutilizzabili e riferimenti vocali
Durata output a livello di modello3–15 secondi
Risoluzione video720p e 1080p; 4K nativo nei flussi supportati
AudioGenerazione audiovisiva nativa con binding personaggio–voce supportato
Controllo delle inquadratureGenerazione a singola inquadratura e sequenziamento multi-shot personalizzato
Creazione di elementi multi-immagine2–4 immagini
Creazione di personaggi basata su videoClip di personaggio da 3–8 secondi
Campione vocale consigliato5–30 secondi di parlato chiaro con un solo speaker
Budget combinato di immagini ed elementiFino a 7 senza input video; fino a 4 con input video

Creare un elemento è diverso dall’allegare riferimenti a una singola richiesta di generazione. Più viste possono appartenere a un unico elemento riutilizzabile; non vengono conteggiate automaticamente come diversi slot di elemento indipendenti.

La capacità a livello di modello non garantisce controlli identici tra provider. Un flusso di 15 secondi nell’interfaccia di Kling e una richiesta API di terze parti possono esporre parametri e valori di durata differenti.

Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: quando scegliere l’uno o l’altro

La scelta non è semplicemente video base contro video con audio. Anche il modello standard supporta audio nativo, generazione multi-shot e binding degli elementi. La distinzione più utile riguarda il modo in cui un progetto organizza e riutilizza i riferimenti.

DimensioneKling VIDEO 3.0Kling VIDEO 3.0 Omni
Organizzazione dei riferimentiBinding degli elementi intorno a un fotogramma iniziale approvato o a fotogrammi di inizio/fineComposizione più ampia con immagini, elementi e riferimenti video
Relazione degli elementiIdeale quando i soggetti importanti sono già presenti nel fotogramma definitorioIdeale quando asset separati devono essere combinati o riutilizzati
Voce del personaggioPuò usare elementi con voce associataSupporta riferimenti visivi e vocali in un unico flusso Omni
Generazione multi-shotSupportataSupportata con controlli di storyboard personalizzati
Punto di partenza consigliatoUn keyframe approvato che definisce già la scenaUna raccolta di asset che devono restare riconoscibili tra le inquadrature

Risultato del confronto: inizia con il flusso standard quando un fotogramma approvato contiene già le informazioni essenziali. Scegli Omni quando composizione dei riferimenti, riuso degli asset o continuità audiovisiva tra inquadrature sono centrali per il lavoro.

Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: benchmark

Le seguenti stime puntuali confrontano le voci 1080p Pro con audio abilitate disponibili in Artificial Analysis quando questa guida è stata revisionata il 9 settembre 2026. I valori dopo “±” sono gli intervalli di confidenza pubblicati al 95%.

Valutazione — da testo a video / da immagine a videoStandardOmni
Elo da testo a video1108 ± 51090 ± 6
Elo da immagine a video1072 ± 61060 ± 7

Si tratta di valutazioni basate sulle preferenze, non di percentuali di successo di generazione. Il modello standard ha la stima puntuale più alta in entrambi i confronti, mentre gli intervalli di confidenza per l’immagine‑video si sovrappongono. I punteggi possono cambiare con l’arrivo di nuove valutazioni.

Risultato del benchmark: il vantaggio di Omni andrebbe valutato in base alla gestione dei riferimenti e alla continuità produttiva, non inferito dal nome né trattato come una classifica di qualità universale.

Come realizzare il tuo primo video guidato dai riferimenti

Immagina una pubblicità verticale con una presentatrice di nome Maya, una bottiglia blu riutilizzabile e un’unica ambientazione studio approvata. Si tratta di asset di produzione illustrativi, non di un test di generazione riportato.

Prepara un set di asset piccolo e coerente

AssetPreparazioneCriterio di accettazione
PresentatriceViste chiare con capelli, abbigliamento e illuminazione coerentiVolto riconoscibile e guardaroba invariato
BottigliaViste frontale, laterale e a tre quartiForma, tappo, colore ed etichetta stabili
AmbientazioneUn riferimento studio approvatoSfondo e direzione della luce coerenti
VoceParlato pulito da uno speaker autorizzatoVoce riconoscibile senza parlato sovrapposto

Usa solo volti, registrazioni e asset di brand di cui sei autorizzato all’uso. I riferimenti in conflitto andrebbero corretti prima di provare a compensare con un prompt più lungo.

Crea e denomina i tuoi elementi

Nella Element Library di Kling, crea asset riutilizzabili invece di ridecrivere lo stesso soggetto per ogni inquadratura. Il flusso ufficiale supporta la creazione di personaggi multi‑immagine e basata su video.

Usa nomi descrittivi come Maya, BlueBottle e Studio. I nomi sono ausili organizzativi; è la selezione dell’elemento salvato che allega il riferimento. Per le voci caricate, usa audio chiaro, con un solo speaker senza musica o voci sovrapposte.

Guida utente di Kling VIDEO 3.0 Omni Model

Controlli ufficiali per gli elementi personaggio e il binding della voce.

Nei prompt seguenti, @Maya, @BlueBottle e @Studio rappresentano elementi selezionati nell’interfaccia di Kling. Digitare questi nomi senza allegare i relativi asset non crea un riferimento.

Genera prima una singola inquadratura semplice

Apri lo spazio di lavoro di generazione Omni, scegli il modello e allega gli asset richiesti. Inizia con cinque secondi, un solo movimento di camera e nessun dialogo.

Create a single continuous product shot using @BlueBottle in @Studio.

The bottle stands upright on a clean tabletop. Keep its body shape,
cap, surface color, and label placement consistent with the references.

Camera: a slow, straight push-in from a medium close-up.
Lighting: soft studio light from camera left.
Action: the bottle remains stationary.
Composition: leave clear space above the bottle for text added later.

No cuts, no extra products, and no generated captions.

Ispeziona inizio, metà e fine. Controlla tappo, silhouette, posizionamento dell’etichetta e contatto con il piano d’appoggio. Se l’asset cambia, semplifica l’inquadratura o migliora i riferimenti prima di aggiungere nuove richieste.

Aggiungi la presentatrice e l’audio nativo

Dopo che la ripresa della bottiglia è accettabile, introduce la presentatrice e una breve battuta parlata. Kling documenta la generazione del parlato in diverse lingue, ma la qualità dell’output dipende comunque dalla qualità dei riferimenti, dal timing e dalla chiarezza del prompt.

Create a five-second continuous shot using @Maya, @BlueBottle,
and @Studio.

Maya stands beside the bottle, looks toward the camera, and says:
“Ready when you are.”

Use Maya’s bound voice. Keep the bottle unchanged. Use one static
camera angle. Do not add music, captions, cuts, or additional speech.

Rivedi l’audio separatamente dall’immagine: conferma che parli la persona prevista, che la frase sia completa e che il timing corrisponda alla performance visibile.

Dopo aver validato una singola inquadratura, riusa i riferimenti approvati per pianificare una sequenza multi‑shot; assegna a ciascuna inquadratura una durata e uno scopo visivo distinto. I controlli di storyboard personalizzati supportano istruzioni a livello di inquadratura per durata, inquadratura, comportamento della camera e progressione narrativa.

TempoScopoIstruzione visivaIstruzione audio
0–5 secondiPresentare il prodottoPrimo piano della bottiglia; lento push‑inRumore di fondo ambiente tenue
5–10 secondiIntrodurre la presentatriceMezza figura di Maya accanto alla bottiglia; camera statica“Pronta quando vuoi.”
10–15 secondiChiudere sul prodottoHero shot pulito; mantieni la composizione finaleRumore di fondo ambiente

Guida utente di Kling VIDEO 3.0 Omni Model

Pannello ufficiale di storyboard multi‑shot personalizzato.

Create a three-shot product advertisement using @Maya, @BlueBottle,
and @Studio.

Continuity rules:
Use the same presenter, outfit, bottle, and studio throughout.
Keep the bottle’s shape, cap, color, and label unchanged.
Maintain the same lighting direction.
Use Maya’s bound voice only.
Do not add people, products, captions, or extra dialogue.

Follow the separate shot descriptions and durations.
End on a stable product composition.

Esamina le transizioni con la stessa attenzione delle singole inquadrature. Confronta l’ultima vista chiara del prodotto prima di ogni taglio con la prima vista chiara dopo di esso. Aggiungi diciture legali, prezzi esatti, sottotitoli e tipografia del brand in un editor così che il testo resti sotto controllo diretto.

Come usare i riferimenti video per la creazione dei personaggi e il video editing

Una clip usata per creare un personaggio riutilizzabile è diversa da un girato sorgente fornito per un compito di editing. La prima stabilisce l’identità; il secondo fornisce movimento e composizione esistenti da trasformare o preservare. Per la creazione di personaggi, usa una clip da 3–8 secondi di un solo personaggio. Per il video editing, la guida ufficiale di Omni consente un solo video sorgente da 3–10 secondi, fino a 200 MB e risoluzione 2K; verifica i limiti correnti della route API selezionata e testa una clip breve prima di scalare la produzione.

Use the uploaded video as the source.

Change only the background to a softly lit studio.
Preserve the presenter’s identity, clothing, actions, and timing.
Preserve the bottle and the original camera movement.
Do not add cuts, gestures, objects, or dialogue.

Una richiesta di editing controllato non garantisce una preservazione perfetta al fotogramma. Decidi separatamente se mantenere l’audio sorgente o generare un nuovo suono, quindi confronta l’output con la clip originale.

Come usare l’API Omni in CometAPI

Per l’accesso programmatico, usa l’endpoint video Omni dedicato. L’identificatore documentato usato di seguito è kling-v3-omni.

Gli esempi seguono lo schema API pubblicato; non riportano un test di generazione live. La route selezionata documenta valori di durata “5” e “10” per le modalità pertinenti, quindi non dare per scontato che un flusso da 15 secondi dell’interfaccia corrisponda alla stessa richiesta.

Invia un task di generazione

export COMETAPI_KEY="YOUR_COMETAPI_KEY"

curl --fail --silent --show-error \
  --request POST \
  "https://api.cometapi.com/kling/v1/videos/omni-video" \
  --header "Authorization: Bearer ${COMETAPI_KEY}" \
  --header "Content-Type: application/json" \
  --data-raw '{
    "model_name": "kling-v3-omni",
    "prompt": "A blue reusable bottle stands on a clean studio tabletop. One continuous shot with a slow straight push-in. Soft light from camera left. No people, no cuts, no captions.",
    "mode": "std",
    "aspect_ratio": "9:16",
    "duration": "5",
    "sound": "off"
  }'

Per un riferimento al primo fotogramma, integra il seguente frammento nella richiesta e sostituisci l’URL di esempio con un’immagine accessibile:

{
  "image_list": [
    {
      "image_url": "https://your-public-host.example/bottle.jpg",
      "type": "first_frame"
    }
  ],
  "prompt": "Starting from <<<image_1>>>, create one continuous slow push-in. Preserve the bottle and studio composition. No cuts or captions."
}

La sintassi <<<image_1>>> dell’API è diversa dai riferimenti @Element selezionati nell’interfaccia. I valori documentati per sound sono on e off.

Recupera il video completato

Conserva il data.task_id restituito, quindi interroga la route di stato del task Omni:

TASK_ID="REPLACE_WITH_RETURNED_TASK_ID"

curl --fail --silent --show-error \
  "https://api.cometapi.com/kling/v1/videos/omni-video/${TASK_ID}" \
  --header "Authorization: Bearer ${COMETAPI_KEY}"

Gli stati documentati sono submitted, processing, succeed e failed. Una risposta di creazione con code: 0 significa che la richiesta è stata accettata; non significa che il video sia pronto. Quando il task ha successo, ottieni il risultato da data.task_result.videos[0].url.

Usa polling con limiti e backoff, conserva l’ID del task insieme a prompt e impostazioni e verifica il messaggio d’errore prima di riprovare. Una richiesta client andata in timeout potrebbe aver già creato un task fatturabile.

Quanto costa Kling VIDEO 3.0 Omni?

Usa prezzi specifici per configurazione invece di un generico “prezzo per video”. Le cifre seguenti sono state verificate il 9 settembre 2026 e possono cambiare.

La guida ufficiale a VIDEO 3.0 Omni di Kling elenca le seguenti tariffe in crediti della piattaforma. I prezzi in dollari di CometAPI nella tabella successiva usano unità di fatturazione diverse; i crediti non possono essere convertiti in dollari senza il tasso di acquisto dei crediti Kling applicabile.

Configurazione OmniCrediti ufficiali / secondoCrediti ufficiali / 5 secondiCrediti ufficiali / 10 secondi
720p, nessun input video, audio nativo disattivato63060
1080p, nessun input video, audio nativo disattivato84080
1080p, nessun input video, audio nativo attivato1260120
1080p, input video, audio nativo disattivato1680160

La guida ufficiale non riporta una tariffa in crediti per Omni 4K e indica l’audio nativo con input video come non supportato in questa tabella prezzi. Conferma le tariffe correnti in prodotto prima di ordinare.

Omni API in CometAPIOutput di 5 secondiOutput di 10 secondi
720p, nessun input video$0.336$0.672
1080p, nessun input video$0.448$0.896
1080p, audio nativo$0.560$1.120
1080p, input video$0.672$1.344
4K, nessun input video$1.680$3.360

Si tratta di configurazioni API distinte. Non sommare le righe e non inferire che ogni combinazione di risoluzione, audio e input video sia disponibile. Un prezzo 4K non stabilisce neppure quale parametro o route abiliti il 4K.

Kling ha introdotto il video 4K nativo dopo il lancio iniziale. Approva contenuto e movimento prima di pagare iterazioni a risoluzione più alta.

Budget per le clip accettate

Una misura produttiva più utile è:

Costo per clip accettata = spesa totale di generazione ÷ clip accettate

Tre tentativi da cinque secondi alla tariffa 1080p con audio nativo costano 3 × $0.560 = $1.680. Se solo un tentativo soddisfa i criteri di accettazione, il suo costo effettivo di generazione è $1.680. Questo calcolo illustra la pianificazione del budget; non è un tasso di ripetizione misurato.

Tieni separati i crediti dell’applicazione Kling dalla fatturazione in dollari di CometAPI. La guida al costo dei crediti di Kling considera durata, risoluzione, audio e flusso di lavoro come fattori di pianificazione indipendenti.

Risoluzione dei problemi: cosa dovresti cambiare per primo?

ProblemaPrima verificaRegolazione suggerita
Il personaggio cambia tra le inquadratureRiferimenti o descrizioni del guardaroba in conflittoRiusa un elemento approvato e semplifica l’inquadratura
La forma del prodotto o l’etichetta cambianoQualità dei riferimenti e movimento impegnativoAggiungi una vista del prodotto più chiara; testa un’inquadratura statica
Voce errata o parlato aggiuntivoBinding della voce e istruzioni in conflittoMantieni un solo speaker e una battuta breve
Tagli indesideratiImpostazioni dello storyboard e cambi di scenaProva un’inquadratura continua senza salti narrativi
L’API rifiuta la richiestaSchema, tipi e durata specifici della routeTorna alla richiesta minima documentata
Il task esiste ma non ha un URL videoLa generazione potrebbe essere ancora in corsoInterroga il task esistente invece di crearne un altro
La risoluzione più alta è ancora sbagliataPermane il problema di movimento o identitàRivedi la scena prima di aumentare la qualità dell’output

Modifica una variabile alla volta. Registra asset, prompt, impostazioni, output e motivo del rifiuto in modo che i miglioramenti possano essere ricondotti a una decisione specifica.

Raccomandazione finale

Usa Omni quando la produzione dipende dal combinare e riutilizzare asset riconoscibili, non semplicemente perché il nome suggerisce un upgrade universale. Inizia con una breve inquadratura guidata dai riferimenti, approva il personaggio o il prodotto, introduci la voce associata e poi costruisci lo storyboard. Passando a CometAPI, allinea l’identificatore del modello, la durata, la sintassi dei riferimenti e il flusso asincrono dei task con l’endpoint selezionato.

La domanda più utile non è “Quanto posso far entrare in un solo prompt?” bensì “Quale incertezza dovrei rimuovere prima della prossima generazione?”

FAQ

Omni è sempre migliore del modello standard?

No. I benchmark basati sulle preferenze possono favorire il modello standard in alcune valutazioni. Omni è più utile quando il suo flusso di riferimento più ampio migliora il riuso degli asset, la continuità o il controllo in fase di editing.

Ogni flusso Omni può generare video da 15 secondi?

No. Quindici secondi sono una capacità a livello di modello nei flussi supportati. Interfacce e route API specifiche possono esporre opzioni di durata più brevi.

Dovrei iniziare con audio nativo e più inquadrature?

Di solito no. Convalida prima una breve inquadratura visiva. Aggiungi una voce solo dopo che identità e coerenza del prodotto sono accettabili, quindi espandi in uno storyboard.

I nomi @Element funzionano in una richiesta API?

Non automaticamente. Gli elementi selezionati nell’interfaccia di Kling e la sintassi dei riferimenti immagine di un’API sono meccanismi diversi. Segui lo schema della route che stai chiamando.

Come dovrei stimare un budget di produzione?

Tieni traccia della spesa totale di generazione e dividila per le clip accettate. Includi nella stima operativa i tentativi respinti, i rerun ad alta risoluzione, l’archiviazione e la post‑produzione.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Oct 5, 2026
Ultimo aggiornamento Oct 5, 2026
0 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Leggi di più