TL;DR
Gemini Omni 1.1 Flash è generalmente disponibile tramite la Gemini Developer API a pagamento con l’identificatore gemini-omni-1.1-flash, mentre la Gemini Enterprise Agent Platform attualmente fornisce l’endpoint in anteprima gemini-omni-1.1-flash-preview. Aggiunge un maggiore controllo su scene, keyframe, riferimenti e risoluzione di output, risultando particolarmente utile quando una clip richiede diversi cicli di direzione.
- Controllo: estendere una scena fino a 40 secondi cumulativi e guidare un’inquadratura con i suoi primi e ultimi frame.
- Costo: elaborare bozze a circa $0.03 al secondo in 360p; riservare le risoluzioni più alte alle riprese selezionate.
- Qualità: gli output 1080p e 4K utilizzano upscaling. Non sono affermazioni di generazione a risoluzione nativa.
- Evidenze: le valutazioni ufficiali a livello di famiglia favoriscono l’editing e il rispetto delle istruzioni, ma non ogni metrica di movimento o riferimento.
- Accesso: gli ID di piattaforma differiscono: la Gemini Developer API usa gemini-omni-1.1-flash, mentre la Gemini Enterprise Agent Platform attualmente usa gemini-omni-1.1-flash-preview. Confermare la versione esatta dietro ogni percorso di terze parti.
Il progetto Omni di Google tratta la creazione video come una conversazione multimodale. La domanda pratica è quanto bene un creatore possa preservare una ripresa utile, cambiare un dettaglio indesiderato e continuare la scena senza ricominciare da capo.
Che cos’è Gemini Omni 1.1 Flash?
Gemini Omni 1.1 Flash è il modello multimodale di generazione ed editing video di Google DeepMind. Google ha reso il modello generalmente disponibile il 27 agosto 2026 con l’identificatore stabile gemini-omni-1.1-flash.
La sua scheda modello descrive input nativi di testo, immagine, audio e video e un output video con audio. Le singole operazioni API supportano combinazioni di input diverse, quindi il design multimodale generale del modello non deve essere interpretato come la promessa che ogni endpoint accetti ogni modalità.
Il modello può creare una clip, rivedere filmati, lavorare da riferimenti, interpolare tra immagini ed estendere una scena. Il suo workflow conversazionale permette a un’applicazione di conservare il contesto creativo attraverso le iterazioni. Per una dimostrazione di prodotto o uno storyboard, ciò significa che la prima generazione accettabile può diventare il punto di partenza per un editing più controllato.
Specifiche di Gemini Omni 1.1 Flash
| Specifica | Gemini Omni 1.1 Flash |
|---|---|
| Sviluppatore | Google DeepMind |
| ID del modello stabile | gemini-omni-1.1-flash |
| Stato/versione di rilascio | Disponibile generalmente; 27 agosto 2026 |
| Finestra di contesto | 1,048,576 token |
| Input per generazione API | Testo, immagine, video; supporto in base all’operazione |
| Output | Video con audio |
| Durata clip | 3–10 secondi per generazione |
| Frame rate | 24 FPS |
| Risoluzioni di output | 360p, 720p, 1080p, 4K |
| Risoluzione predefinita | 720p |
| 1080p / 4K | Output upscalati |
| Estensione della scena | Incrementi di 10 secondi, fino a 40 secondi cumulativi |
| Contesto video precedente per estensione | Fino a 10 secondi |
| Controllo primo e ultimo frame | Supportato |
| Video di riferimento per generazione scena | Fino a 3 secondi nei workflow supportati |
| Workflow principale | Gemini API / Interactions API |
| Livello API gratuito | Non disponibile |
| Ritiro della preview | 30 settembre 2026 |
Il limite di tre secondi per il video di riferimento e il limite di dieci secondi per il contesto precedente descrivono operazioni diverse. Allo stesso modo, una clip di output di dieci secondi e una catena di estensioni di quaranta secondi sono unità di lavoro differenti. Mantenere esplicite tali distinzioni rende più utili la pianificazione API e i confronti di prezzo.
Cosa c’è di nuovo in Gemini Omni 1.1 Flash?
Proseguire una scena invece di unire clip scollegate
L’aggiornamento esamina fino a dieci secondi di filmato precedente, rispetto all’ultimo secondo descritto per i modelli precedenti, e supporta estensioni di 10 secondi fino a 40 secondi cumulativi. Il contesto aggiuntivo può aiutare a preservare personaggi, ambientazione e direzione narrativa nei prosegui.
Non si tratta di una singola richiesta di testo-a-video di quaranta secondi. Ogni continuazione aggiunge un altro segmento a una sequenza esistente. Verificare i raccordi, l’identità dei personaggi e i movimenti di camera dopo ogni estensione prima di approvare l’intera scena.
Definire entrambe le estremità di un’inquadratura
I creatori possono fornire sia il primo sia l’ultimo frame e lasciare che il modello generi la transizione tra di essi. Questo è utile per reveal di prodotto controllati, sequenze prima/dopo, movimenti di camera e riprese che devono connettersi con il filmato circostante.
Usare il 360p per bozze economiche
Google riporta fino al 60% di throughput di sistema superiore a 360p rispetto a 720p, con un costo di output video pari a circa un terzo. Si tratta di un confronto di throughput, non di un miglioramento di latenza garantito per ogni richiesta.
Un ciclo pratico consiste nel testare composizione e movimento in bozze a bassa risoluzione, rivedere il prompt o i riferimenti e approvare una ripresa prima di pagare per la consegna ad alta risoluzione. Includere i tentativi scartati quando si confronta il costo di una clip accettata.
Consegnare 1080p e 4K tramite upscaling
Il rilascio supporta un output predefinito a 720p e consegne a risoluzione superiore, con 1080p e 4K generati tramite upscaling. Dimensioni pixel più elevate non stabiliscono una generazione della scena nativa in 4K né rimuovono errori di movimento e coerenza.
Usare video esistenti come materiale di riferimento
Per i workflow di generazione scena supportati, fino a tre secondi di video di riferimento possono veicolare tempistiche, movimento e contesto dei personaggi che una singola immagine statica non può. Questa operazione di riferimento è distinta dal contesto più lungo usato quando si estende una clip esistente.
Migrare dall’endpoint di anteprima
Google ha pianificato il ritiro dell’endpoint legacy della Gemini API gemini-omni-flash-preview per il 30 settembre 2026; ciò non si riferisce all’endpoint di anteprima gemini-omni-1.1-flash-preview attualmente esposto dalla Gemini Enterprise Agent Platform. Gli sviluppatori dovrebbero verificare la nuova configurazione delle richieste e gli output prima di reindirizzare il traffico in produzione.
Cosa mostrano i benchmark ufficiali di Gemini Omni Flash?
Ambito del benchmark:
I grafici di performance ufficiali identificano Gemini Omni Flash, senza isolare un checkpoint 1.1. Trattarli come evidenze a livello di famiglia, non come un miglioramento misurato dalla preview alla versione 1.1. I valori Elo sono valutazioni relative, non percentuali; i conteggi dei campioni descrivono la dimensione della valutazione.
| Valutazione | Ordine delle metriche | Campioni | Gemini Omni Flash — Elo | Seedance 2.0 — Elo |
|---|---|---|---|---|
| Montaggio video | Complessivo / istruzioni | 504 | 1087 / 1082 | 946 / 960 |
| MovieGenBench text-to-video | Complessivo / istruzioni | 1,003 | 1113 / 1108 | 1070 / 1051 |
| Movimento veloce | Qualità del movimento veloce | 500 | 1050 | 1112 |
| VBench image-to-video | Preferenza complessiva | 355 | 1057 | 1003 |
| Reference-to-video | Complessivo / parlato / riferimento | 468 | 1004 / 1028 / 962 | 996 / 972 / 1038 |
All’interno di queste valutazioni, i risultati più forti della famiglia sono l’editing e il rispetto delle istruzioni. Il quadro cambia per il movimento veloce e l’aderenza al riferimento: Seedance 2.0 guida in queste due metriche. Un modello può quindi essere più facile da dirigere senza essere la scelta migliore per ogni scena d’azione o compito fortemente basato su riferimenti.
Il grafico image-to-video riporta 1057 per Omni, 1054 per Grok Imagine Video e 1053 per Kling v3 Pro. Scarti così piccoli non dovrebbero essere trattati come un vantaggio qualitativo decisivo. I grafici pubblicati non forniscono intervalli di confidenza per valutare la significatività statistica.


Grafici ufficiali di Google su montaggio video e movimento veloce: screenshot dei grafici interattivi originali del benchmark.
Per un test di produzione, valutare gli output che il vostro team accetta effettivamente: aderenza al prompt, continuità dei personaggi, movimento, audio e numero di correzioni necessarie. La leadership nei benchmark è un’evidenza utile, ma il costo per ottenere una ripresa accettabile determina la decisione di deployment.
Gemini Omni 1.1 Flash vs Gemini Omni Flash Preview
| Dimensione | Gemini Omni 1.1 Flash | Gemini Omni Flash Preview |
|---|---|---|
| Ciclo di vita | Stabile / generalmente disponibile | Anteprima; ritiro programmato |
| ID del modello | gemini-omni-1.1-flash | gemini-omni-flash-preview |
| Indicazione per la produzione | Sostituzione consigliata | Migrare al modello stabile |
| Data di chiusura | Nessuna chiusura annunciata | 30 settembre 2026 |
| Contesto precedente per continuazione | Fino a 10 secondi | Ultimo secondo, secondo il confronto al lancio |
| Livello di bozza 360p | Disponibile | Non incluso nel pricing del lancio precedente |
| Output 1080p / 4K | Disponibile tramite upscaling | Assente nel pricing del lancio precedente |
| Interpolazione primo/ultimo frame | Aggiunta con 1.1 | Non stabilita dal confronto con la preview citata |
| Catena di estensioni | Fino a 40 secondi cumulativi | Nessun limite cumulativo corrispondente nella comparazione citata |
| Vantaggio indipendente nei benchmark | Nessun punteggio isolato di versione | I risultati a livello di famiglia non quantificano l’upgrade |
L’aggiornamento più chiaro riguarda controllo e ciclo di vita produttivo. Il rilascio stabile espone più modi per vincolare una ripresa e sostituisce un endpoint prossimo al ritiro. Quando la documentazione della preview non affronta una funzionalità, trattarla come non confermata invece di presumere che non sia supportata.
Prezzi di Gemini Omni 1.1 Flash
Il modello stabile è disponibile tramite il livello API a pagamento di Google. Le sue tariffe a token sono $1.50 per input e $17.50 per output video per milione di token; l’output testuale è $9 per milione di token. Queste sono tariffe Google, separate da qualsiasi percorso CometAPI.
A 720p, la fatturazione usa 5,792 token di output video al secondo. Moltiplicare 5,792 per $17.50 per milione dà $0.10136 al secondo, il che spiega la cifra arrotondata di $0.10 usata nel confronto al lancio.
| Risoluzione | Google: Omni 1.1 Flash | Google: Veo 3.1 Fast | CometAPI: Veo 3.1 Fast |
|---|---|---|---|
| 360p | $0.03 | Non disponibile | Non disponibile |
| 720p | $0.10 | $0.10 | $0.08 |
| 1080p | $0.15 | $0.12 | $0.096 |
| 4K | $0.30 | $0.30 | $0.24 |
USD per secondo generato; verifica al 8 settembre 2026. La colonna Omni di Google usa stime arrotondate del lancio. Le due colonne a destra distinguono il pricing del provider originale dal pricing CometAPI per lo stesso modello di confronto nominato.

Confronto dei prezzi ufficiale di lancio di Google, riprodotto direttamente. Questa immagine mostra i prezzi Google, non le tariffe CometAPI.
Stimare il costo di una ripresa
| Risoluzione | Output di 3 secondi | Output di 10 secondi | 40 secondi di output generato |
|---|---|---|---|
| 360p | ~$0.09 | ~$0.30 | ~$1.20 |
| 720p | ~$0.30 | ~$1.00 | ~$4.00 |
| 1080p | ~$0.45 | ~$1.50 | ~$6.00 |
| 4K | ~$0.90 | ~$3.00 | ~$12.00 |
Stima dei costi:
Questi calcoli moltiplicano la tariffa arrotondata di output video Google per la durata generata. Escludono costi di input, output testuale, tentativi scartati e qualsiasi attività fatturabile separatamente. Una catena di estensioni di quaranta secondi può comportare ulteriore elaborazione del contesto; non è un pacchetto a prezzo fisso.
Generare bozze sperimentali in 4K costa circa dieci volte di più per secondo di output rispetto al drafting in 360p secondo queste stime. Valutare prima composizione e movimento, quindi preventivare la consegna finale. Tracciare la spesa totale attraverso tutti i tentativi divisa per le riprese accettate per confrontare correttamente i workflow.
Gemini Omni 1.1 Flash vs Veo 3.1 Fast
| Dimensione | Gemini Omni 1.1 Flash | Veo 3.1 Fast |
|---|---|---|
| Scopo principale | Creazione ed editing conversazionali | Generazione video diretta e veloce |
| Input testo/immagine | Supportati | Supportati |
| Lavoro condizionato da video | Riferimenti, editing ed estensione | Le operazioni supportate dipendono dal percorso |
| Output audio | Supportato | Supportato |
| Frame rate | 24 FPS | 24 FPS |
| Drafting a 360p | Disponibile | Nessun livello documentato comparabile |
| 720p | Supportato | Supportato |
| 1080p / 4K | Output upscalati | Supportati; requisito di generazione di 8 secondi |
| Durata standard clip | 3–10 secondi | 4, 6 o 8 secondi |
| Estensione | Fino a 40 secondi cumulativi | Supportata a 720p |
| Primo / ultimo frame | Interpolazione | Controlli di interpolazione |
| Enfasi del workflow | Direzione iterativa e contesto creativo | Controlli di generazione e output diretto |
Google documenta 720p, 1080p e 4K a 24 FPS per il percorso di confronto. Le risoluzioni più alte richiedono generazioni di otto secondi, mentre l’output delle estensioni è limitato a 720p. Il supporto delle funzionalità del gateway dovrebbe essere verificato separatamente rispetto alle specifiche di capacità del provider originale.
Alle tariffe pubblicate da Google, i modelli sono alla pari a 720p e 4K, mentre l’alternativa di generazione diretta costa meno a 1080p. Le tariffe CometAPI sono ancora inferiori per quel percorso, come mostrato nella sezione prezzi. L’ulteriore livello 360p di Omni serve un’esigenza diversa: sperimentazione economica prima della consegna.
Scegliere Omni quando ripetute indicazioni, continuità della scena, vincoli di keyframe e revisioni determinano il successo. Scegliere l’alternativa quando una richiesta di generazione diretta e i suoi controlli esistenti soddisfano già i requisiti di produzione. Né un punteggio Elo a livello di famiglia né il pricing a token, da soli, stabiliscono il costo inferiore per ripresa accettata.
Perché Gemini Omni 1.1 Flash è importante
Un workflow di produzione raramente termina dopo la prima generazione riuscita. Un regista può apprezzare il movimento di camera ma non la posa finale. Un marketer può avere bisogno della stessa composizione di prodotto con un’azione di sfondo diversa. Un artista di storyboard può richiedere che la ripresa successiva inizi esattamente dove finisce la precedente.
Questi compiti richiedono che il sistema preservi lo stato utile mentre cambia un vincolo specifico. I controlli creativi di Omni affrontano quel workflow: un riferimento aiuta a definire la scena, i keyframe ne vincolano gli estremi e un’estensione la porta avanti.
L’opportunità pratica è ridurre i riavvii completi. Misurate quanto spesso una modifica mirata produce un risultato accettabile, quante revisioni occorrono e se la sequenza finale preserva l’intento originale. Quella valutazione è più informativa che scegliere un modello solo da una vetrina visiva.
Limitazioni di Gemini Omni 1.1 Flash
Google identifica limiti persistenti in coerenza, movimento complesso e rendering del testo. Catene di estensioni più lunghe creano maggiori opportunità di deriva in identità, geometria, illuminazione o oggetti, anche quando le singole clip appaiono convincenti.
Un output a risoluzione più alta non ripara ogni errore di generazione. Ispezionare la scena stessa prima di trattare un file 4K come un asset finito. Allo stesso modo, il design multimodale ampio del modello non stabilisce capacità identiche in ogni operazione API.
Il confronto Elo ufficiale argomenta anche a favore di valutazioni specifiche per compito. Qualità dell’editing, movimento veloce e aderenza al riferimento misurano cose diverse; un vantaggio complessivo di preferenza non dovrebbe essere generalizzato a tutte e tre.
È disponibile Gemini Omni 1.1 Flash tramite CometAPI?
Gemini Omni Fast API in CometAPI fornisce percorsi della famiglia Omni come omni-fast e omni-fast-v2v. La documentazione pubblica verificata per questo articolo non stabilisce che questi identificatori mappino al checkpoint stabile gemini-omni-1.1-flash di Google.
Verifica versione:
Accesso alla famiglia Omni e accesso confermato alla 1.1 sono affermazioni diverse. Prima di migrare, verificare la versione esatta del modello, il supporto delle operazioni e la fatturazione sul percorso disponibile per il vostro account. Un nome di prodotto simile non è un’evidenza sufficiente di un alias.
Per altri workflow video Google, Veo 3.1 API in CometAPI offre un percorso di integrazione alternativo. Confrontare le operazioni supportate e i prezzi specifici del provider prima di selezionare un percorso.
Vale la pena usare Gemini Omni 1.1 Flash?
Il modello è più convincente quando una ripresa utilizzabile richiede diversi cicli di direzione. Concept pubblicitari, storyboard, visualizzazione di prodotto e brevi scene narrative possono beneficiare di bozze economiche e di un controllo più stretto di continuità ed estremi.
Il caso più forte è un workflow in cui questi controlli riducono le riprese scartate o le riparazioni manuali. Se il vostro modello attuale produce già in modo affidabile la clip desiderata, valutare i controlli di editing aggiuntivi prima di spostare il traffico di produzione. Per azioni altamente dinamiche o stretta fedeltà al riferimento, testare alternative su quei requisiti specifici.
FAQ
La versione 1.1 è la stessa della precedente Omni Flash preview?
È il successore stabile con controlli aggiuntivi e un diverso ID modello Google. L’endpoint legacy della Gemini API gemini-omni-flash-preview è programmato per il ritiro; è distinto dall’endpoint di anteprima gemini-omni-1.1-flash-preview attualmente esposto dalla Gemini Enterprise Agent Platform.
Può generare un video di quaranta secondi?
Può costruire una sequenza fino a quaranta secondi tramite estensioni successive. Questa durata cumulativa è diversa da una generazione singola normale, che produce una clip più breve.
Genera 4K nativo?
No. Le opzioni documentate 1080p e 4K usano upscaling. Trattarle come risoluzioni di consegna, non come evidenza di generazione nativa in 4K.
Quanto costa?
Le stime arrotondate di output video di Google variano da $0.03 per secondo in 360p a $0.30 in 4K. Input, output testuale e retry possono aggiungere costo. Usare la tabella prezzi etichettata per provider sopra, invece di applicare la tariffa di una piattaforma a un’altra.
Esiste un livello API gratuito?
Il modello stabile è disponibile sul livello API a pagamento di Google. L’accesso tramite un abbonamento consumer è un prodotto e un accordo di fatturazione separati.
I punteggi dei benchmark provano che la 1.1 batte ogni alternativa?
No. I grafici mostrati identificano la famiglia Omni Flash, non un checkpoint 1.1 separato. I risultati differiscono anche per metrica: la famiglia performa bene in editing, mentre altri modelli guidano in movimento veloce o aderenza al riferimento.
Conclusione
Gemini Omni 1.1 Flash rende la creazione video conversazionale più pratica tramite estensione della scena, vincoli di keyframe, riferimenti video, bozze economiche e consegna ad alta risoluzione. Il suo valore è la capacità di continuare a dirigere una ripresa promettente invece di scartarla dopo ogni disallineamento.
Usare i benchmark ufficiali a livello di famiglia come evidenze direzionali, mantenere separati i prezzi di Google e CometAPI e verificare la versione esatta dietro il percorso scelto. La misura decisiva è quanto affidabilmente il workflow produce una clip accettabile a un costo totale sostenibile.
