TL;DR
Używaj Omni, gdy projekt zależy od łączenia wielokrotnego użytku ludzi, produktów, ustawień, głosów lub materiału źródłowego wideo w jednym kontrolowanym przepływie pracy. Jego wartością jest orkiestracja referencji i ciągłość audiowizualna, a nie automatyczna przewaga jakości nad modelem standardowym. Zacznij od krótkiego ujęcia walidacyjnego, zatwierdź referencje, dodaj dźwięk i rozwiń do storyboardu dopiero po upewnieniu się, że kluczowy zasób pozostaje stabilny.
Kluczowe wnioski
- Omni obsługuje referencje tekstu, obrazu, elementu, wideo i głosu, z czasem wyjścia na poziomie modelu do 15 sekund w obsługiwanych przepływach pracy.
- Kling VIDEO 3.0 pozostaje konkurencyjny w benchmarkach preferencji; wybierz Kling VIDEO 3.0 Omni, gdy jego szerszy przepływ pracy z referencjami rozwiązuje konkretną potrzebę produkcyjną.
- Waliduj tożsamość, kształt produktu, kompozycję i dźwięk osobno, zanim połączysz je w sekwencji wielo-ujęciowej.
- W pracy z API stosuj parametry udokumentowane dla wybranej trasy dostawcy zamiast zakładać, że każde cechy interfejsu są udostępnione.
- Planuj budżet względem zaakceptowanych klipów, nie tylko względem reklamowanego kosztu jednej próby.
Oficjalny obszar roboczy Omni i kontrolki referencji.
Co obsługuje model Omni?
Kling pozycjonuje Omni wokół multimodalnych referencji i spójności audiowizualnej. Praktyczna implikacja jest prosta: zdefiniuj zasoby, które muszą pozostawać rozpoznawalne, a następnie opisz, co ma się z nimi wydarzyć.
| Specyfikacja — oficjalny przewodnik generowania | Możliwości Omni |
|---|---|
| Opcje wejścia | Tekst, obrazy, referencje wideo, elementy wielokrotnego użytku i głosy |
| Czas trwania wyjścia na poziomie modelu | 3–15 sekund |
| Rozdzielczość wideo | 720p i 1080p; natywne 4K w obsługiwanych przepływach pracy |
| Dźwięk | Natywna generacja audiowizualna z powiązaniem postaci–głosu |
| Kontrola ujęcia | Generowanie pojedynczego ujęcia i niestandardowe sekwencjonowanie wielo-ujęciowe |
| Tworzenie elementu z wieloma obrazami | 2–4 obrazy |
| Tworzenie postaci na podstawie wideo | 3–8-sekundowy klip postaci |
| Zalecana próbka głosu | 5–30 sekund czystej mowy jednego mówcy |
| Łączny budżet obrazów i elementów | Do 7 bez wejścia wideo; do 4 z wejściem wideo |
Utworzenie elementu różni się od dołączania referencji do jednego żądania generacji. Kilka ujęć może należeć do jednego elementu wielokrotnego użytku; nie są automatycznie liczone jako kilka niezależnych slotów elementów.
Możliwość na poziomie modelu nie gwarantuje identycznych kontrolek u wszystkich dostawców. Przepływ 15-sekundowy w interfejsie Kling i żądanie API strony trzeciej mogą ujawniać różne parametry i wartości czasu trwania.
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: kiedy wybrać który
Wybór nie sprowadza się po prostu do podstawowego wideo versus wideo z dźwiękiem. Model standardowy także obsługuje natywny dźwięk, generowanie wielo-ujęciowe i powiązywanie elementów. Bardziej użyteczne rozróżnienie dotyczy tego, jak projekt organizuje i ponownie wykorzystuje referencje.
| Wymiar | Kling VIDEO 3.0 | Kling VIDEO 3.0 Omni |
|---|---|---|
| Organizacja referencji | Powiązanie elementu wokół zatwierdzonej klatki startowej lub startowej/końcowej | Szersza kompozycja z obrazami, elementami i referencjami wideo |
| Relacja elementów | Najlepszy, gdy ważne obiekty już istnieją w klatce definiującej | Najlepszy, gdy trzeba połączyć lub ponownie użyć odrębne zasoby |
| Głos postaci | Może używać elementów powiązanych z głosem | Obsługuje referencje wizualne i głosowe w jednym przepływie Omni |
| Generowanie wielo-ujęciowe | Obsługiwane | Obsługiwane z niestandardowymi kontrolkami storyboardu |
| Zalecany punkt wyjścia | Jedna zatwierdzona klatka kluczowa, która już definiuje scenę | Zbiór zasobów, które muszą pozostawać rozpoznawalne między ujęciami |
Wynik porównania: zacznij od standardowego przepływu, gdy jedna zatwierdzona klatka już zawiera kluczowe informacje. Wybierz Omni, gdy sednem zadania jest kompozycja referencji, ponowne użycie zasobów lub audiowizualna ciągłość między ujęciami.
Kling VIDEO 3.0 Omni vs Kling VIDEO 3.0: benchmarki
Poniższe oszacowania punktowe porównują 1080p Pro, wpisy z włączonym dźwiękiem dostępne w Artificial Analysis w momencie przeglądu tego przewodnika 9 września 2026 r. Wartości po „±” to opublikowane 95% przedziały ufności.
| Ocena — tekst-do-wideo / obraz-do-wideo | Standard | Omni |
|---|---|---|
| Elo tekst-do-wideo | 1108 ± 5 | 1090 ± 6 |
| Elo obraz-do-wideo | 1072 ± 6 | 1060 ± 7 |
To oceny oparte na preferencjach, a nie odsetki udanych generacji. Model standardowy ma wyższą wartość punktową w obu porównaniach, podczas gdy przedziały ufności obraz-do-wideo się pokrywają. Wyniki mogą się zmieniać wraz z napływem nowych ewaluacji.
Wynik benchmarku: przewagę Omni należy oceniać poprzez obsługę referencji i ciągłość produkcyjną, nie wyciągać jej z nazwy ani traktować jako uniwersalny ranking jakości.
Jak zbudować swój pierwszy film prowadzony referencjami
Wyobraź sobie pionową reklamę z prezenterką o imieniu Maya, niebieską butelką wielokrotnego użytku i jednym zatwierdzonym ustawieniem studyjnym. To przykładowe zasoby produkcyjne, a nie zgłoszony test generacji.
Przygotuj niewielki, spójny zestaw zasobów
| Zasób | Przygotowanie | Kryterium akceptacji |
|---|---|---|
| Prezenter | Wyraźne ujęcia przy spójnych włosach, ubraniu i świetle | Rozpoznawalna twarz i niezmieniona garderoba |
| Butelka | Widok z przodu, z boku i pod kątem trzech czwartych | Stabilny kształt korpusu, zakrętka, kolor i etykieta |
| Ustawienie | Jedna zatwierdzona referencja studyjna | Spójne tło i kierunek oświetlenia |
| Głos | Czysta mowa uprawnionego mówcy | Rozpoznawalny głos bez konkurencyjnej mowy |
Używaj wyłącznie twarzy, nagrań i zasobów marki, do których masz uprawnienia. Sprzeczne referencje należy skorygować, zanim spróbujesz kompensować je dłuższą podpowiedzią.
Utwórz i nazwij swoje elementy
W Kling’s Element Library twórz zasoby wielokrotnego użytku zamiast ponownie opisywać ten sam obiekt dla każdego ujęcia. Oficjalny przepływ pracy wspiera tworzenie postaci z wielu obrazów i na podstawie wideo.
Używaj opisowych nazw, takich jak Maya, BlueBottle i Studio. Nazwy są pomocą organizacyjną; wybranie zapisanego elementu to działanie, które dołącza referencję. W przypadku przesłanych głosów używaj czystej, jednego mówcy mowy bez muzyki ani nakładających się głosów.

Oficjalne kontrolki elementu postaci i powiązania głosu.
W poniższych podpowiedziach @Maya, @BlueBottle i @Studio reprezentują elementy wybrane w interfejsie Kling. Wpisanie tych nazw bez dołączenia odpowiednich zasobów nie tworzy referencji.
Najpierw wygeneruj jedno proste ujęcie
Otwórz obszar generowania Omni, wybierz model i dołącz wymagane zasoby. Zacznij od pięciu sekund, jednego ruchu kamery i bez dialogu.
Create a single continuous product shot using @BlueBottle in @Studio.
The bottle stands upright on a clean tabletop. Keep its body shape,
cap, surface color, and label placement consistent with the references.
Camera: a slow, straight push-in from a medium close-up.
Lighting: soft studio light from camera left.
Action: the bottle remains stationary.
Composition: leave clear space above the bottle for text added later.
No cuts, no extra products, and no generated captions.
Sprawdź początek, środek i koniec. Skontroluj zakrętkę, sylwetkę, położenie etykiety i kontakt z blatem. Jeśli zasób się zmienia, uprość ujęcie lub popraw referencje, zanim dodasz nowe wymagania.
Dodaj prezentera i natywny dźwięk
Po zaakceptowaniu ujęcia z butelką wprowadź prezenterkę i jedną krótką kwestię mówioną. Kling dokumentuje generowanie mowy w kilku językach, ale jakość wyjścia wciąż zależy od jakości referencji, timing’u i klarowności podpowiedzi.
Create a five-second continuous shot using @Maya, @BlueBottle,
and @Studio.
Maya stands beside the bottle, looks toward the camera, and says:
“Ready when you are.”
Use Maya’s bound voice. Keep the bottle unchanged. Use one static
camera angle. Do not add music, captions, cuts, or additional speech.
Oceń dźwięk oddzielnie od obrazu: potwierdź, że mówi zamierzona osoba, kwestia jest kompletna, a timing pasuje do widocznego wykonania.
Po zwalidowaniu pojedynczego ujęcia ponownie użyj jego zatwierdzonych referencji, aby zaplanować sekwencję wielo-ujęciową; przypisz każdemu ujęciu czas trwania i odrębny cel wizualny. Niestandardowe kontrolki storyboardu obsługują instrukcje na poziomie ujęć dotyczące czasu trwania, kadrowania, zachowania kamery i rozwoju narracji.
| Czas | Cel | Instrukcja wizualna | Instrukcja dźwiękowa |
|---|---|---|---|
| 0–5 sekund | Przedstaw produkt | Zbliżenie butelki; powolny najazd | Cichy szum pomieszczenia |
| 5–10 sekund | Wprowadź prezentera | Ujęcie średnie Mai obok butelki; statyczna kamera | “Ready when you are.” |
| 10–15 sekund | Zakończ na produkcie | Czyste ujęcie bohatera produktu; utrzymaj finalną kompozycję | Szum pomieszczenia |

Oficjalny panel niestandardowego storyboardu wielo-ujęciowego.
Create a three-shot product advertisement using @Maya, @BlueBottle,
and @Studio.
Continuity rules:
Use the same presenter, outfit, bottle, and studio throughout.
Keep the bottle’s shape, cap, color, and label unchanged.
Maintain the same lighting direction.
Use Maya’s bound voice only.
Do not add people, products, captions, or extra dialogue.
Follow the separate shot descriptions and durations.
End on a stable product composition.
Oceniaj przejścia równie uważnie jak pojedyncze ujęcia. Porównaj ostatni wyraźny widok produktu przed każdym cięciem z pierwszym wyraźnym widokiem po nim. Dodaj klauzule prawne, dokładne ceny, napisy i typografię marki w edytorze, aby sformułowania pozostały pod bezpośrednią kontrolą.
Jak używać referencji wideo do tworzenia postaci i edycji wideo
Klip użyty do stworzenia postaci wielokrotnego użytku różni się od materiału źródłowego dostarczonego do zadania edycyjnego. Pierwszy ustanawia tożsamość; drugi dostarcza istniejący ruch i kompozycję do przekształcenia lub zachowania. Do tworzenia postaci użyj 3–8-sekundowego klipu jednej postaci. Do edycji wideo oficjalny przewodnik Omni firmy Kling pozwala na jedno źródłowe wideo 3–10 sekund, do 200 MB i rozdzielczość 2K; sprawdź bieżące limity wybranej trasy API i przetestuj krótki klip przed skalowaniem produkcji.
Use the uploaded video as the source.
Change only the background to a softly lit studio.
Preserve the presenter’s identity, clothing, actions, and timing.
Preserve the bottle and the original camera movement.
Do not add cuts, gestures, objects, or dialogue.
Kontrolowane żądanie edycji nie jest gwarancją zachowania klatka w klatkę. Osobno zdecyduj, czy zachować źródłowy dźwięk, czy wygenerować nowy, a następnie porównaj wynik z oryginalnym klipem.
Jak używać Omni API w CometAPI
Do dostępu programistycznego użyj dedykowanego punktu końcowego wideo Omni. Udokumentowany identyfikator użyty poniżej to kling-v3-omni.
Przykłady podążają za opublikowanym schematem API; nie raportują żywego testu generacji. Wybrana trasa dokumentuje wartości czasu trwania „5” i „10” dla odpowiednich trybów, więc nie zakładaj, że przepływ 15-sekundowy w interfejsie Kling odwzorowuje się na to samo żądanie.
Prześlij zadanie generacji
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
curl --fail --silent --show-error \
--request POST \
"https://api.cometapi.com/kling/v1/videos/omni-video" \
--header "Authorization: Bearer ${COMETAPI_KEY}" \
--header "Content-Type: application/json" \
--data-raw '{
"model_name": "kling-v3-omni",
"prompt": "A blue reusable bottle stands on a clean studio tabletop. One continuous shot with a slow straight push-in. Soft light from camera left. No people, no cuts, no captions.",
"mode": "std",
"aspect_ratio": "9:16",
"duration": "5",
"sound": "off"
}'
Dla referencji pierwszej klatki scal poniższy fragment z żądaniem i zastąp przykładowy URL dostępnym obrazem:
{
"image_list": [
{
"image_url": "https://your-public-host.example/bottle.jpg",
"type": "first_frame"
}
],
"prompt": "Starting from <<<image_1>>>, create one continuous slow push-in. Preserve the bottle and studio composition. No cuts or captions."
}
Składnia API <<<image_1>>> różni się od wybranych referencji @Element w interfejsie. Udokumentowane wartości sound to on i off.
Pobierz gotowy film
Zapisz zwrócone data.task_id, a następnie odpytaj trasę statusu zadania Omni:
TASK_ID="REPLACE_WITH_RETURNED_TASK_ID"
curl --fail --silent --show-error \
"https://api.cometapi.com/kling/v1/videos/omni-video/${TASK_ID}" \
--header "Authorization: Bearer ${COMETAPI_KEY}"
Udokumentowane stany to submitted, processing, succeed i failed. Odpowiedź utworzenia z code: 0 oznacza, że żądanie zostało przyjęte; nie oznacza, że wideo jest gotowe. Gdy zadanie się powiedzie, pobierz wynik z data.task_result.videos[0].url.
Używaj ograniczonego odpytywania z backoffem, zachowuj identyfikator zadania wraz z podpowiedzią i ustawieniami oraz sprawdzaj komunikat o błędzie przed ponowną próbą. Żądanie klienta, które przekroczyło limit czasu, mogło już utworzyć rozliczane zadanie.
Ile kosztuje Kling VIDEO 3.0 Omni?
Używaj cen specyficznych dla konfiguracji, a nie ogólnego „cena za wideo”. Poniższe liczby sprawdzono 9 września 2026 r. i mogą ulec zmianie.
Oficjalny przewodnik Kling dotyczący VIDEO 3.0 Omni (link) wymienia następujące stawki kredytowe platformy. Ceny w dolarach CometAPI w kolejnej tabeli używają innych jednostek rozliczeniowych; kredytów nie można przeliczyć na dolary bez odpowiedniej stawki zakupu kredytów Kling.
| Konfiguracja Omni | Oficjalne kredyty / sekunda | Oficjalne kredyty / 5 sekund | Oficjalne kredyty / 10 sekund |
|---|---|---|---|
| 720p, bez wejścia wideo, natywny dźwięk wyłączony | 6 | 30 | 60 |
| 1080p, bez wejścia wideo, natywny dźwięk wyłączony | 8 | 40 | 80 |
| 1080p, bez wejścia wideo, natywny dźwięk włączony | 12 | 60 | 120 |
| 1080p, wejście wideo, natywny dźwięk wyłączony | 16 | 80 | 160 |
Oficjalny przewodnik nie podaje stawki kredytowej Omni dla 4K i oznacza natywny dźwięk z wejściem wideo jako nieobsługiwany w tej tabeli cen. Potwierdź bieżące stawki w produkcie przed zamówieniem.
| Omni API w CometAPI | Wyjście 5-sekundowe | Wyjście 10-sekundowe |
|---|---|---|
| 720p, bez wejścia wideo | $0.336 | $0.672 |
| 1080p, bez wejścia wideo | $0.448 | $0.896 |
| 1080p, natywny dźwięk | $0.560 | $1.120 |
| 1080p, wejście wideo | $0.672 | $1.344 |
| 4K, bez wejścia wideo | $1.680 | $3.360 |
To odrębne konfiguracje API. Nie sumuj wierszy ani nie wnioskuj, że każda kombinacja rozdzielczości, dźwięku i wejścia wideo jest dostępna. Cena 4K nie określa też, który parametr lub trasa umożliwia 4K.
Kling wprowadził natywne wideo 4K po pierwotnym uruchomieniu. Zatwierdź treść i ruch, zanim zapłacisz za iteracje o wyższej rozdzielczości.
Budżet dla zaakceptowanych klipów
Bardziej użyteczna miara produkcyjna to:
Koszt na zaakceptowany klip = całkowity wydatek na generację ÷ zaakceptowane klipy
Trzy pięciosekundowe próby w stawce 1080p z natywnym dźwiękiem kosztują 3 × $0.560 = $1.680. Jeśli tylko jedna próba spełnia kryteria akceptacji, jej efektywny koszt generacji wynosi $1.680. Ten rachunek ilustruje budżetowanie; nie jest to zmierzony wskaźnik ponownych prób.
Trzymaj kredyty aplikacji Kling oddzielnie od rozliczeń dolarowych CometAPI. Przewodnik Kling dotyczący kosztów kredytów (link) traktuje czas trwania, rozdzielczość, dźwięk i przepływ pracy jako niezależne czynniki planistyczne.
Rozwiązywanie problemów: co zmienić najpierw?
| Problem | Pierwsza kontrola | Sugerowana korekta |
|---|---|---|
| Postać zmienia się między ujęciami | Sprzeczne referencje lub opisy garderoby | Ponownie użyj jednego zatwierdzonego elementu i uprość ujęcie |
| Kształt produktu lub etykieta się zmienia | Jakość referencji i wymagający ruch | Dodaj wyraźniejszy widok produktu; przetestuj statyczne ujęcie |
| Zły głos lub dodatkowa mowa | Powiązanie głosu i sprzeczne instrukcje | Pozostań przy jednym mówcy i jednej krótkiej kwestii |
| Niechciane cięcia | Ustawienia storyboardu i zmiany sceny | Przetestuj jedno ciągłe ujęcie bez skoków narracyjnych |
| API odrzuca żądanie | Schemat, typy i czas trwania specyficzne dla trasy | Wróć do udokumentowanego minimalnego żądania |
| Zadanie istnieje, ale brak URL wideo | Generacja może nadal trwać | Odpytuj istniejące zadanie zamiast tworzyć kolejne |
| Wyższa rozdzielczość wciąż wygląda źle | Problem ruchu lub tożsamości pozostaje | Zmień scenę przed zwiększeniem jakości wyjścia |
Zmieniaj tylko jedną zmienną naraz. Rejestruj zasoby, podpowiedź, ustawienia, wynik i powód odrzucenia, aby ulepszenia można było powiązać z konkretną decyzją.
Rekomendacja końcowa
Używaj Omni, gdy produkcja zależy od łączenia i ponownego użycia rozpoznawalnych zasobów, a nie tylko dlatego, że nazwa sugeruje uniwersalne ulepszenie. Zacznij od jednego krótkiego ujęcia z referencjami, zatwierdź postać lub produkt, wprowadź powiązany głos, a następnie zbuduj storyboard. Przechodząc do CometAPI, dopasuj identyfikator modelu, czas trwania, składnię referencji i asynchroniczny przepływ z wybraną trasą.
Najbardziej użyteczne pytanie nie brzmi „Ile mogę zmieścić w jednej podpowiedzi?” lecz „Jaką niepewność powinienem usunąć przed kolejną generacją?”
FAQ
Czy Omni zawsze jest lepszy od modelu standardowego?
Nie. Benchmarki preferencji mogą faworyzować model standardowy w niektórych ewaluacjach. Omni jest najprzydatniejszy, gdy jego szerszy przepływ pracy z referencjami poprawia ponowne użycie zasobów, ciągłość lub kontrolę edycji.
Czy każdy przepływ Omni generuje 15-sekundowe wideo?
Nie. Piętnaście sekund to możliwość na poziomie modelu w obsługiwanych przepływach. Poszczególne interfejsy i trasy API mogą ujawniać krótsze opcje czasu trwania.
Czy powinienem zacząć od natywnego dźwięku i wielu ujęć?
Zwykle nie. Najpierw zwaliduj jedno krótkie ujęcie wizualne. Dodaj głos dopiero po zaakceptowaniu spójności tożsamości i produktu, a następnie rozszerz do storyboardu.
Czy nazwy @Element działają w żądaniu API?
Nie automatycznie. Wybrane elementy w interfejsie Kling i składnia referencji obrazów w API to różne mechanizmy. Podążaj za schematem trasy, którą wywołujesz.
Jak oszacować budżet produkcji?
Śledź całkowite wydatki na generację i podziel je przez zaakceptowane klipy. Uwzględnij odrzucone próby, ponowne uruchomienia w wyższej rozdzielczości, magazynowanie i postprodukcję w roboczym szacunku.
