Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
guide/Badania CometAPI

Jak używać Vidu Q3 do tworzenia filmów

Dowiedz się, jak używać Vidu Q3 do tworzenia wideo z tekstu i z obrazów, wraz z praktycznymi promptami, sterowaniem kamerą, natywnym dźwiękiem, kodem API i wskazówkami dotyczącymi przepływu pracy.

CometAPI
Mia MarenZespół badań AI modeli i API
Zaktualizowano Aug 28, 2026 21 min czyt.
Jak używać Vidu Q3 do tworzenia filmów
Użyj tego wzorca

Wykonaj pierwsze wywołanie API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Najpierw odpowiedź Vidu Q3 może tworzyć krótkie narracyjne wideo na podstawie promptów tekstowych lub obrazów referencyjnych, generując w jednym przebiegu zsynchronizowany dialog, efekty dźwiękowe, tło dźwiękowe i obraz. Obsługuje klipy do 16 sekund w 540p, 720p lub 1080p. Twórcy mogą pracować w aplikacji webowej Vidu, a deweloperzy mogą wywoływać model przez CometAPI, używając identyfikatora modelu viduq3.

Ten przewodnik koncentruje się na procesie twórczym: planowaniu ujęcia, wyborze trybu text-to-video lub image-to-video, reżyserii ruchu kamery i dźwięku, generowaniu wariantów, przeglądzie nieudanych wyników oraz budowaniu powtarzalnych workflow w sieci lub przez API.

Czym jest Vidu Q3?

Vidu Q3 to model wideo trzeciej generacji od ShengShu Technology i Vidu. Został zaprojektowany do tworzenia wideo zorientowanego na opowieść, a nie prostych pętli ruchu. Model potrafi wspólnie generować sekwencję obrazów i natywny dźwięk, dzięki czemu dialog, dźwięki otoczenia, efekty i sygnały muzyczne podążają za timingiem sceny.

Model jest szczególnie istotny dla krótkich dramatów, adaptacji komiksów i mang, narracyjnej reklamy, prewizualizacji filmowej, opowiadania o produkcie oraz wideo społecznościowego. Vidu podkreśla synchronizację audio-wideo, wielojęzyczne wyjście, sceny z wieloma mówcami oraz szczegółową kontrolę kamery i tempa jako kluczowe możliwości Q3.

Vidu Q3 to obecnie rodzina modeli, a nie pojedyncza konfiguracja generacyjna. Ten przewodnik koncentruje się głównie na trasie Q3 Pro wystawionej jako viduq3 przez CometAPI.

Szybka specyfikacja Vidu Q3

Uwaga dotycząca źródła: Specyfikacje łączą dokumentację API Vidu oraz stronę modelu CometAPI**.

SpecyfikacjaSzczegóły Vidu Q3Znaczenie praktyczne
TwórcaShengShu Technology / ViduKomercyjny zamknięty model wideo
Oficjalny ID modelu APIviduq3-proUżywany w bezpośrednich workflowach Vidu (tekst, obraz, klatki)
ID modelu CometAPIviduq3Używany z ujednoliconym Videos API CometAPI
Tryby wejściaTekst, obraz, klatki początkowe/końcowe, referencjeDokładne tryby zależą od powierzchni API
Bieżące wejścia CometAPITekst lub jeden obraz referencyjnyUpload multipart form dla image-to-video
WyjścieWideo MP4 z natywnie zsynchronizowanym dźwiękiemDialog i efekty dźwiękowe mogą być generowane razem
Czas trwania1–16 sekund dla tekstu, obrazu i start/end; 3–16 sekund dla reference-to-videoDomyślnie zazwyczaj 5 sekund
Rozdzielczość540p, 720p, 1080pCometAPI używa dokładnych wartości WxH
Liczba klatek24 FPSWymienione na stronie modelu CometAPI
Języki wyjścioweAngielski, japoński, chińskiPrzydatne dla zlokalizowanego dialogu
Główny fokusNarracyjne i oparte na postaciach wideoKrótkie dramaty, reklamy, ujęcia filmowe

Kontekst wydajności w skrócie

Publiczne benchmarki są użyteczne tylko jako punkt wyjścia, ponieważ jakość wideo silnie zależy od promptu, obrazu referencyjnego, projektu ujęcia i standardu oceny. W SuperCLUE-R2V Vidu Q3 osiąga 70,89 wobec 64,01 dla Vidu Q2. Wynik wspiera poprawę Q3 w zachowaniu odniesienia i ciągłości postaci, ale twórcy powinni oceniać model własnymi postaciami, produktami, językiem kamery i wymaganiami audio.

Tworzenie liczy się bardziej niż tabela wyników Dla praktycznej pracy śledź odsetek klipów, które zachowują tożsamość, podążają za zamierzoną akcją, używają akceptowalnego ruchu kamery, synchronizują dialog i przechodzą przegląd. Najlepszy workflow to ten, który produkuje najwięcej użytecznych ujęć, a nie najwyższy izolowany wynik.

Kluczowe funkcje Vidu Q3

Natywna generacja audio-wideo

Vidu Q3 produkuje obraz i dźwięk w jednym przejściu generacyjnym. Prompt może zawierać prośbę o mówiony dialog, lektora, tło dźwiękowe, kroki, uderzenia lub inne efekty dźwiękowe wraz z akcją wizualną. Zmniejsza to potrzebę budowania osobnej ścieżki dźwiękowej dla każdego szkicu i ułatwia ocenę timingu podczas przeglądu kreatywnego.

Jest ważna niuansowa kwestia API. Bezpośrednia dokumentacja Vidu udostępnia kontrolę audio dla Q3, ale oddzielny przełącznik bgm nie jest skuteczny dla Q3. Jeśli muzyka jest ważna, opisz w promptcie muzyczny sygnał i timing. Obecne ujednolicone żądanie Vidu w CometAPI wystawia prompt, czas trwania, rozmiar i opcjonalny obraz referencyjny, więc kierunek audio również powinien być zapisany w promptcie.

Do 16 sekund w jednej generacji

Limit 16 sekund jest wystarczający na kompletny krótki beat narracyjny: ujęcie ustanawiające, jedną główną akcję, kwestię dialogową, ruch kamery i zamykającą reakcję. To nadal nie jest generowanie długiej formy. Reklamy, odcinki lub teledyski wymagają planu ujęć, wielu zadań i montażu.

Wielu mówców i wielojęzyczny dialog

Produkt jest zaprojektowany dla rozmów wielopostaciowych i obsługuje wyjście po angielsku, japońsku i chińsku. Dzięki temu jest przydatny przy zlokalizowanych krótkich dramach i kampaniach społecznościowych. Traktuj wsparcie językowe jako możliwość, a nie gwarancję perfekcyjnej wymowy, emocji czy synchronizacji ust w każdej generacji; przejrzyj każde wyjście przed publikacją.

Kontrola kamery i tempa

Q3 najlepiej reaguje, gdy prompt opisuje zamysł filmowy, a nie tylko wymienia obiekty. Określ rozmiar ujęcia, charakter obiektywu, ścieżkę kamery, oświetlenie, kolejność akcji, tempo, dialog i sygnały dźwiękowe. Jedno spójne polecenie kamery zwykle daje wyższy odsetek trafień niż kilka sprzecznych ruchów w tym samym ujęciu.

Spójność oparta na referencjach

Bezpośredni workflow reference-to-video Vidu akceptuje do siedmiu obrazów lub tematów tekstowych. Referencje mogą zakotwiczyć postać, produkt, rekwizyt lub styl wizualny w różnych pozycjach kamery.

  • Text-to-video: generuje scenę, ruch, kompozycję i dźwięk z promptu tekstowego.
  • Image-to-video: animuje pojedynczy obraz wejściowy; prompt powinien skupiać się na ruchu, zachowaniu kamery i audio.
  • Start/end-frame generation: tworzy przejście między dwoma wizualnymi kotwicami w bezpośrednim API Vidu.
  • Reference-to-video: utrzymuje spójność tematów lub stylu w generowanej sekwencji.

Jak utworzyć wideo z Vidu Q3 w przeglądarce

Workflow webowy to najszybszy sposób przejścia od pomysłu do klipu po przeglądzie. Etykiety interfejsu mogą się zmieniać, ale logika kreatywna pozostaje ta sama: wybierz właściwy tryb wejścia, przygotuj wizualną kotwicę, napisz jedno ujęcie, którym można kierować, generuj warianty i poprawiaj tylko tę wymiar, który zawiódł.

Krok 1: Zdefiniuj deliverable

Zdecyduj, gdzie wideo będzie używane, jaki ma mieć format obrazu, docelowy czas trwania, styl wizualny, język mówiony oraz czy wynik ma łączyć się z innym ujęciem. Hook społecznościowy, ujęcie detalu produktu, beat krótkiego dramatu i ujęcie prewizualizacji filmowej potrzebują innego tempa.

Krok 2: Wybierz tryb tworzenia

Wybierz Text to Video, gdy kompozycja może być wymyślona z promptu. Wybierz Image to Video, gdy masz już pożądany charakter postaci, produktu, grafiki lub kadrowania. Użyj Reference to Video na bezpośredniej powierzchni Vidu, gdy tożsamość lub styl muszą być zakotwiczone przez kilka tematów.

Decyzja o trybie Używaj text-to-video do eksploracji. Używaj image-to-video, gdy pierwsza klatka zawiera już projekt, który chcesz chronić. Używaj workflowów opartych na referencjach, gdy spójność jest ważniejsza niż wizualna niespodzianka.

Krok 3: Przygotuj obraz referencyjny

Dla image-to-video zacznij od ostrego obrazu, który już ma właściwe proporcje tematu, kadrowanie, kierunek oświetlenia i tło. Zostaw przestrzeń wizualną w kierunku, w którym temat lub kamera mają się poruszyć. Unikaj małych twarzy, zasłoniętych dłoni, nieczytelnych etykiet produktów, sprzecznych odbić i kadru, który nie zostawia miejsca na ruch.

Krok 4: Wybierz Vidu Q3

Wybierz Q3 dla ujęć z krótkiej listy, gdzie liczy się jakość narracji, ciągłość postaci, dialog i zsynchronizowany dźwięk. Używaj Q3 Turbo do tańszej eksploracji, a następnie przenieś najsilniejszy prompt i obraz referencyjny do Q3 dla finalnego renderu.

Krok 5: Napisz ustrukturyzowany prompt ujęcia

Napisz prompt w kolejności, w jakiej widz doświadcza ujęcia: temat i miejsce, akcja, kamera, wygląd, dialog, dźwięk, timing beatów i ograniczenia. Daj modelowi jeden dominujący ruch kamery i jedną główną akcję.

Wielorazowa struktura promptu

Subject + environment + primary action + shot type + camera movement +lighting + visual style + dialogue + sound effects + timing + constraints

Krok 6: Reżyseruj dialog i dźwięk

Umieszczaj wypowiadane kwestie w cudzysłowie, identyfikuj mówcę, opisz sposób wypowiedzi i zachowuj dialog na tyle krótki, by mieścił się w klipie. Oddziel tło dźwiękowe od dźwięków o określonym czasie. Na przykład: Audio: ciche tło pokoju przez cały czas; ceramiczny klik, gdy kubek dotyka stołu w czwartej sekundzie; bez muzyki.

Krok 7: Ustaw czas trwania i rozdzielczość

Zacznij od pięciu sekund w 720p. Potwierdź kompozycję, tożsamość, ruch i audio, zanim wydasz więcej na dłuższą lub wyższej rozdzielczości wersję. Zwiększaj czas trwania tylko wtedy, gdy ujęcie potrzebuje więcej czasu na zrealizowanie beatów; dodatkowe sekundy nie poprawiają automatycznie ruchu.

Krok 8: Generuj warianty

Wygeneruj kilka kandydatów z tego samego głównego promptu przed przepisaniem wszystkiego. Warianty pokazują, czy problem jest losowy, czy strukturalny. Jeśli każdy wynik zawodzi w ten sam sposób, zmień prompt lub referencję. Jeśli tylko jeden wynik zawodzi, zachowaj prompt i wybierz innego kandydata.

Krok 9: Przeglądaj i poprawiaj jedną wymiarę

Oglądaj klip w przejściach. Najpierw sprawdź tożsamość i integralność obiektu, potem akcję i ruch kamery, następnie dialog i timing audio, a na końcu końcową klatkę. Zmieniaj tylko zawiedzioną wymiarę, by dobra kompozycja nie została utracona podczas poprawy sygnału dźwiękowego.

  • Błąd tożsamości: wzmocnij język zachowania lub użyj czystszego obrazu referencyjnego.
  • Słaba akcja: zastąp abstrakcyjne czasowniki jednym widocznym ruchem i jasnym kierunkiem.
  • Chaotyczna kamera: usuń konkurujące ruchy i określ jedną ścieżkę z prędkością.
  • Słaba synchronizacja ust: skróć dialog, zmniejsz równoczesną akcję, wskaż mówcę i sposób wypowiedzi.
  • Niestabilne tło: uprość scenę i wyraźnie zachowaj układ i oświetlenie.

Krok 10: Pobierz i zarchiwizuj zwycięski klip

Pobieraj dopiero po tym, jak wynik przejdzie standard publikacji lub przeglądu klienta. Zapisz finalny klip razem z jego promptem, obrazem wejściowym, wariantem modelu, czasem trwania, rozdzielczością i uwagami z generacji, aby można było ponownie użyć receptury kreatywnej.

Dlaczego używać Vidu Q3 przez CometAPI?

CometAPI jest najbardziej przydatne, gdy produkt potrzebuje dostępu do kilku dostawców AI bez utrzymywania osobno warstwy uwierzytelniania i zarządzania zadaniami dla każdego z nich. Obecna trasa Vidu podąża za ujednoliconym asynchronicznym workflow: utwórz zadanie, otrzymaj ID, odpytywaj job i pobierz ukończony MP4.

  • Jeden klucz API dla Vidu i innych rodzin modeli.
  • Jeden wzorzec zadań wideo dla zgłoszenia, pobierania statusu i pobierania.
  • Prostsze testy A/B gdy ta sama aplikacja porównuje trasy Vidu, Kling, Veo, Seedance lub Wan.
  • Scentralizowane zarządzanie użyciem dla rozliczeń, monitoringu i przeglądu operacyjnego.
  • Mniej specyficznego dla dostawcy kodu gdy dostępność modelu lub cena się zmienia.

Uwaga o cenach CometAPI nie jest automatycznie tańsze niż bezpośrednie API Vidu dla każdej konfiguracji Q3. Propozycja wartości to spójność operacyjna i wybór modeli. Porównaj dokładną trasę, rozdzielczość, czas trwania, tryb kolejki i politykę rozliczeń przed wdrożeniem.

Jak używać Vidu Q3 z CometAPI

Implementacja Vidu w CometAPI używa POST /v1/videos z multipart/form-data. Poniższe przykłady są po stronie serwera. Nigdy nie ujawniaj produkcyjnego klucza w JavaScript przeglądarkowym, aplikacjach mobilnych, publicznych repozytoriach, zrzutach ekranu ani logach po stronie klienta.

Krok 1: Utwórz i przechowuj klucz CometAPI

Utwórz lub zaloguj się do konta CometAPI, następnie wygeneruj klucz API. Przechowuj go jako zmienną środowiskową.

macOS lub Linux

export COMETAPI_KEY="your_cometapi_key"

Windows PowerShell

$env:COMETAPI_KEY="your_cometapi_key"

Krok 2: Utwórz zadanie text-to-video

Minimalne praktyczne żądanie wymaga ID modelu i promptu. Dodaj czas trwania i rozmiar jawnie, aby żądanie było replikowalne.

Żądanie cURL text-to-video

curl https://api.cometapi.com/v1/videos \  -H "Authorization: Bearer $COMETAPI_KEY" \  -F model=viduq3 \  -F 'prompt=A cinematic medium shot of a young astronaut walking through pale blue fog. Slow dolly-in camera. Soft footsteps and distant mechanical ambience.' \  -F seconds=5 \  -F size=1280x720

Endpoint zwraca natychmiast obiekt zadania. Nie czeka na zakończenie renderowania. Zapisz zwrócone id lub task_id.

Krok 3: Utwórz zadanie image-to-video

Dla image-to-video załaduj jeden lokalny obraz przez pole multipart input_reference. Opisz, jak obraz powinien się poruszać, zamiast powtarzać każdy widoczny detal.

Żądanie cURL image-to-video

curl https://api.cometapi.com/v1/videos \  -H "Authorization: Bearer $COMETAPI_KEY" \  -F model=viduq3 \  -F 'prompt=The character turns slowly toward the window as rain moves across the glass. Gentle handheld camera, quiet room tone, distant thunder.' \  -F seconds=6 \  -F size=1280x720 \  -F input_reference=@reference.png

Krok 4: Odczytaj odpowiedź zadania

Przykład przyjętej odpowiedzi zadania

{  "id": "task_example",  "object": "video",  "model": "viduq3",  "status": "queued",  "progress": 0 }

Traktuj identyfikator zadania jako nieprzezroczysty ciąg. Znormalizuj id i alias kompatybilności task_id raz, następnie przechowuj wynikową wartość wraz z modelem, promptem, czasem trwania, rozmiarem, znacznikiem czasu żądania oraz użytkownikiem lub rekordem joba, który zainicjował render.

Krok 5: Odpytuj status zadania

Wywołuj GET /v1/videos/{task_id} aż status stanie się completed, failed lub error. Dokumentacja retrieve CometAPI obejmuje ten sam wzorzec stanów terminalnych.

Pętla odpytywania w Pythonie z timeoutem

import os import time import requests​ task_id = "<TASK_ID>" headers = {"Authorization": f"Bearer {os.environ['COMETAPI_KEY']}"} terminal = {"completed", "failed", "error"} deadline = time.time() + 20 * 60​ while time.time() < deadline:    response = requests.get(        f"https://api.cometapi.com/v1/videos/{task_id}",        headers=headers,        timeout=60,    )    response.raise_for_status()    task = response.json()    print(task["status"], task.get("progress"))​    if task["status"] in terminal:        if task["status"] != "completed":            raise RuntimeError(task.get("error", task["status"]))        break    time.sleep(10) else:    raise TimeoutError("Video generation did not finish in time")

Krok 6: Pobierz ukończone wideo

Gdy zadanie zostanie ukończone, pobierz MP4 przez endpoint zawartości. Zapisz zasób do trwałego magazynu, jeśli aplikacja potrzebuje długoterminowego przechowywania.

Pobierz MP4

curl "https://api.cometapi.com/v1/videos/$TASK_ID/content" \  -H "Authorization: Bearer $COMETAPI_KEY" \  -o vidu-q3-output.mp4

Krok 7: Uruchom pełny workflow w JavaScript

Przykład end-to-end w Node.js

import fs from "node:fs";​ const form = new FormData(); form.append("model", "viduq3"); form.append("prompt", "A quiet product reveal with a slow orbit camera and soft mechanical sound design."); form.append("seconds", "5"); form.append("size", "1280x720");​ const auth = { Authorization: `Bearer ${process.env.COMETAPI_KEY}` }; const created = await fetch("https://api.cometapi.com/v1/videos", {  method: "POST", headers: auth, body: form, }).then((r) => r.json());​ let task; do {  await new Promise((resolve) => setTimeout(resolve, 10_000));  task = await fetch(`https://api.cometapi.com/v1/videos/${created.id}`, {    headers: auth,  }).then((r) => r.json()); } while (!["completed", "failed", "error"].includes(task.status));​ if (task.status !== "completed") throw new Error(JSON.stringify(task.error)); const video = await fetch(  `https://api.cometapi.com/v1/videos/${created.id}/content`,  { headers: auth }, ); fs.writeFileSync("vidu-q3-output.mp4", Buffer.from(await video.arrayBuffer()));

Parametry API Vidu Q3

Uwaga dotycząca źródła: Bieżące nazwy pól i limity odpowiadają endpointowi Vidu w CometAPI**.

ParametrTypWymaganeZalecaneCel
modelStringTakviduq3Wybiera Vidu Q3
promptStringTakUstrukturyzowany prompt scenyOpisuje obraz, ruch, dialog i dźwięk
secondsIntegerNieZacznij od 5Akceptuje 1 do 16
sizeStringNie1280x720Używa wspieranych wartości WxH
input_referenceFileTryb obrazuPNG/JPEG/WebPKieruje generacją image-to-video

Obsługiwane wartości size na udokumentowanej trasie Vidu:

  • 960x528 — poziom 540p, 16:9.
  • 1280x720 — poziom 720p, 16:9.
  • 1920x1080 — poziom 1080p, 16:9.

Reguła zgodności Używaj tylko parametrów udokumentowanych dla trasy, którą wywołujesz. Pola natywnego dostawcy, takie jak audio, callback_url, wiele tematów lub tryb off-peak, nie powinny być uznawane za działające na ujednoliconym endpointzie CometAPI, chyba że dokumentacja CometAPI wyraźnie je wymienia.

Jak pisać lepsze prompty dla Vidu Q3 ?

Napisz każdy prompt jako zwięzły brief ujęcia. Zachowaj pola w kolejności poniżej, aby Vidu Q3 otrzymał najpierw fundament wizualny, a dopiero potem ruch, kierunek kamery, oświetlenie, mowę, dźwięk i reguły zachowania.

Subject   → Environment → Action → Camera → Lighting → Dialogue → Audio → Constraints

Użyj jednego wyraźnego tematu, jednej głównej akcji i jednej ścieżki kamery. Zachowaj dialog krótki, oddziel tło dźwiękowe od dźwięków zdarzeń i używaj ograniczeń do stwierdzenia, co musi pozostać niezmienione. Dla image-to-video traktuj obraz wejściowy jako wizualne źródło prawdy i skup prompt na ruchu, zachowaniu kamery, audio i zachowaniu.

Przykład filmowego promptu

Subject: A tired detective in a dark trench coat.Environment: A rain-soaked alley beneath a flickering streetlight at night.Action: She stops, hears approaching footsteps, and slowly looks over her shoulder.Camera: Medium close-up with a gentle three-second dolly in and a 35mm lens feel.Lighting: Blue-magenta reflections, soft backlighting, shallow depth of field, and subtle film grain.Dialogue: In a restrained whisper, "You should not have come back."Audio: Steady rain ambience, one distant siren, and footsteps that stop after the line.Constraints: Preserve her face, coat, and alley layout; no subtitles, logos, extra people, or camera shake.

Przykład promptu produktowego

Subject: A premium stainless-steel smartwatch with a clean blue display.Environment: The watch rests on black stone while a thin ribbon of water circles the base.Action: At second three, the display turns on and reveals a single blue pulse.Camera: Slow left-to-right orbit ending on a centered macro view of the watch face.Lighting: Crisp edge reflections, controlled highlights, and a dark luxury color grade.Dialogue: None.Audio: Soft water movement, one precise electronic chime, and a restrained low bass swell.Constraints: Preserve the watch geometry, materials, display layout, and logo placement; no hands, extra text, or deformation.

Przykład promptu anime

Subject: A teenage girl holding a red umbrella in a hand-drawn anime style.Environment: A quiet rural train platform at sunset, with tall grass moving in a warm wind.Action: She looks down the empty track as a distant train light appears, then smiles slightly.Camera: Track slowly beside her and stop in a medium shot when the train light appears.Lighting: Warm sunset light, soft shadows, stable linework, and consistent character colors.Dialogue: She whispers in Japanese, "Yatto kaette kita."Audio: Summer insects, soft wind, and a distant railway bell after the dialogue.Constraints: Preserve the character design, facial features, umbrella color, and anime style; no on-screen text or extra characters.

Przykład promptu image-to-video

Subject: Preserve the character's face, hairstyle, clothing, pose, and framing from the reference image.Environment: Keep the same room, furniture arrangement, background layout, and window position.Action: The character looks up from the book, smiles slightly, and turns toward the window while the curtain moves in a light breeze.Camera: Use a slow, stabilized push in with subtle natural movement.Lighting: Preserve the original light direction, exposure, skin tone, and room colors.Dialogue: None.Audio: Quiet room tone, soft page movement, light curtain rustle, and distant birds.Constraints: No identity changes, added accessories, hand distortion, sudden camera movement, background replacement, or new objects.

Utwórz wieloujęciowe wideo z Vidu Q3

Kompletna reklama, krótki dramat, zwiastun lub muzyczna sekwencja zwykle potrzebuje kilku wygenerowanych klipów. Traktuj Vidu Q3 jako generator ujęć i użyj prostej listy ujęć, by zachować ciągłość w sekwencji.

UjęcieCelKotwica ciągłości
1. UstanówSzerokie ujęcie wprowadza lokalizację i tematŚrodowisko, garderoba, pora dnia
2. ZbliżenieŚrednie ujęcie rozpoczyna główną akcjęKierunek na ekranie, pozycja rekwizytu, światło
3. EmfazaZbliżenie dostarcza dialog lub detal produktuTwarz lub geometria produktu, tożsamość audio
4. DomknięcieReakcja lub czysta końcowa klatka domyka beatKońcowa poza, gradacja kolorów, kierunek przejścia

Użyj nagłówka ciągłości wielokrotnego użytku

Zacznij każdy prompt ujęcia od tego samego zwięzłego bloku tożsamości: wygląd postaci, garderoba, projekt produktu, lokalizacja, pora dnia i styl wizualny. Następnie zmieniaj tylko akcję specyficzną dla ujęcia, kadrowanie, kamerę i audio.

Wielorazowy wzorzec promptu wieloujęciowego

Continuity: the same woman in her early thirties, short black hair, dark green coat, silver pendant; rainy neon alley at night; blue-magenta reflections; restrained cinematic realism. Shot 3: medium close-up. She stops beneath the streetlight and looks over her shoulder. Slow dolly in. She whispers, "I heard you." Rain ambience continues; distant footsteps stop at second four.

Dopasuj koniec jednego ujęcia do początku następnego

  • Zachowaj spójny kierunek na ekranie, chyba że montaż celowo go odwraca.
  • Noś ten sam rekwizyt w tej samej dłoni lub pozycji.
  • Dopasuj garderobę, pogodę, kierunek światła i dominujący kolor.
  • Zakończ stabilną pozą lub kompozycją, która może stać się kolejną referencją.
  • Używaj spójnego tła dźwiękowego między sąsiadującymi ujęciami i dodawaj dźwięki zdarzeń tylko tam, gdzie występują akcje.

Montuj i finalizuj poza generatorem

Przytnij słabe ramki otwierające lub kończące, ułóż ujęcia, znormalizuj poziomy audio, dodaj tytuły lub napisy w edytorze i zastosuj finalną korekcję koloru oraz dźwięku po generacji. Generowany przez AI tekst ekranowy jest mniej niezawodny niż dodanie dokładnej typografii w postprodukcji.

Kiedy wybrać Vidu Q3?

Porównanie modeli powinno wspierać decyzję kreatywną, a nie ją dominować. Praktyczne pytanie brzmi: który workflow najlepiej odpowiada ujęciu, które musisz wyprodukować.

WymiarVidu Q3Vidu Q3 TurboSeedance 2.5Kling 3.0Veo 3.1
Czas trwania1–16 s; oficjalne reference-to-video 3–16 s1–16 s; oficjalne reference-to-video 3–16 s4–30 sDo 15 s, zależnie od trybu4 s, 6 s lub 8 s na generację w API
AudioNatywne zsynchronizowane audioNatywne zsynchronizowane audioNatywna generacja audio-wideoDostępne w trybach natywnego audioNatywne audio
ReferencjeJeden obraz w CometAPI; bogatsze oficjalne powierzchnieJeden obraz w CometAPI; bogatsze oficjalne powierzchnieDo 50 referencji multimodalnychTryby image, start/end i kontroli ruchuImage oraz prowadzenie pierwszą/ostatnią klatką
APICometAPI POST /v1/videosCometAPI POST /v1/videosCometAPI POST /v1/videosTrasy kompatybilne z Kling text2video/image2videoCometAPI POST /v1/videos
Cena listowaOd $0.056/sOd $0.028/sOd $0.0824/s w estimatorze trasyV3 720p: $0.336/5 s bez audio$0.32/s w 720p lub 1080p
Najlepszy use caseFinalne krótkie ujęcia narracyjne z dialogiem i ciągłościąSzkicowanie, iteracja promptów, większa skala generacjiDłuższe opowieści multimodalne i referencyjneKontrolowana kamera, ruch i produkcja wieloujęciowaFotorealistyczne ujęcia filmowe i realistyczna fizyka

Uwaga dotycząca źródła: Powierzchnie modeli i dostępne tryby mogą się zmieniać. Oficjalny przewodnik Kling dokumentuje tryby 720p/1080p i natywnego audio**; Google opisuje natywne audio, kontrolę referencji i workflowy wysokiej rozdzielczości Veo 3.1**. Pozycje cenowe są migawkami tras, a nie znormalizowanymi porównaniami jakości; rozdzielczość, tryb audio i poziom jakości różnią się, więc zweryfikuj linkowane strony modeli przed publikacją.

Praktyczny wynik wyboru

Wybierz Vidu Q3, gdy potrzebujesz krótkiego, narracyjnego ujęcia z ciągłością postaci lub produktu, kierowalnym rytmem kamery, dialogiem, tłem dźwiękowym i efektami w jednej generacji. Używaj Q3 Turbo do eksploracji promptów, a następnie przenieś tylko najsilniejszy kierunek kreatywny na trasę premium. Rozważ inny model, gdy długość klipu, większy stos referencji, specjalistyczna kontrola multi-shot lub fotorealistyczna fizyka są ważniejsze niż narracyjny workflow Q3.

Ile kosztuje Vidu Q3?

Cennik wymaga uczciwego porównania trasa po trasie. CometAPI rozlicza trasę Vidu Q3 za wygenerowaną sekundę. Bezpośrednie API Vidu również wycenia według czasu trwania i rozdzielczości oraz oferuje tańszy tryb off-peak z dużo dłuższym czasem ukończenia.

RozdzielczośćCometAPI Vidu Q3Oficjalne API ViduOficjalny off-peak
540p$0.056/s$0.045/s$0.025/s
720p$0.1232/s$0.10/s$0.05/s
1080p$0.1232/s$0.12/s$0.06/s

Uwaga dotycząca źródła: Ceny za sekundę pochodzą ze strony modelu CometAPI i dokumentacji cen Vidu**. Zweryfikuj bieżące rozliczenia przed publikacją klientowską lub wdrożeniem.

Przy tych wartościach CometAPI nie jest tańszą trasą dla każdej konfiguracji Q3. Jego przewaga jest operacyjna: jeden klucz, spójny endpoint wideo, scentralizowana obsługa zadań i łatwiejsze przełączanie między dostawcami. Zespół, który używa tylko Vidu i może czekać na przetwarzanie off-peak, może zapłacić mniej przez bezpośrednie API Vidu.

Przykładowe koszty uruchomień w CometAPI

Czas trwania540p720p1080p
5 sekund$0.28$0.616$0.616
10 sekund$0.56$1.232$1.232
16 sekund$0.896$1.9712$1.9712

Koszt na użyteczny klip Niska stawka za sekundę nadal może być droga, jeśli większość generacji jest odrzucana. Śledź całkowity koszt podzielony przez wyniki, które przechodzą przegląd kreatywny, a nie tylko reklamowaną cenę jednego renderu.

Najlepsze praktyki produkcyjne

Lepsza strategia iteracji kreatywnej

  • Zacznij od małego. Użyj żądania pięciosekundowego 720p, aby zweryfikować kompozycję, akcję i ruch kamery.
  • Generuj kontrolowane warianty. Utrzymuj rdzeń promptu stabilny i zmieniaj tylko jeden wybór kreatywny naraz.
  • Diagnozuj zawiedzioną wymiarę. Rozdziel problemy tożsamości, ruchu, kamery, audio i ciągłości przed edycją promptu.
  • Oddziel trasy szkicowe i finalne. Używaj szybszych wariantów do eksploracji, a premium tylko dla promptów z krótkiej listy.
  • Zapisz zwycięski przepis. Archiwizuj finalny prompt, referencję, ustawienia, wyjście i notatki z przeglądu do ponownego użycia.

Lista kontrolna przeglądu wideo Vidu Q3

Przeglądanie wszystkiego naraz utrudnia poprawę promptu. Używaj osobnych przejść, aby każde odrzucenie prowadziło do konkretnej korekty.

PrzeglądKryterium akceptacjiCo poprawić w razie porażki
TematTwarz, ciało, ubranie, geometria produktu, etykiety i rekwizyty są spójneReferencja lub prompt zachowania
AkcjaGłówny ruch jest kompletny, czytelny i poprawnie ztimowanyCzasownik akcji, kierunek i kolejność
KameraRuch podąża jedną ścieżką bez skoków, dryfu i niechcianego przekadrowaniaRozmiar ujęcia, ścieżka, prędkość, koniec
ŚrodowiskoUkład tła, oświetlenie, pogoda i ruchy drugoplanowe są stabilneZłożoność sceny i ograniczenia ciągłości
AudioDialog, wymowa, synchronizacja ust, tło dźwiękowe i sygnały pasują do akcjiKrótsza kwestia i wyraźniejsza oś audio
Końcowa klatkaFinalna kompozycja jest na tyle czysta, by ją utrzymać, ciąć lub zasilić kolejne ujęcieKońcowa poza i punkt kamery

Reguła akceptacji Nie zatwierdzaj klipu tylko dlatego, że jedna klatka wygląda imponująco. Obejrzyj go w normalnej prędkości, potem sprawdź początek, szczyt akcji, moment dialogu i finalną klatkę. Użyteczne wideo musi pozostać spójne w czasie.

Najczęściej zadawane pytania o Vidu Q3

Czy Vidu Q3 potrafi generować wideo i audio razem?

Tak. Q3 jest zaprojektowany do bezpośredniej generacji audio-wideo, w tym dialogu i efektów dźwiękowych. Opisz pożądane audio i jego timing w promptcie, gdy używasz ujednoliconej trasy CometAPI.

Jaki jest ID modelu Vidu Q3 w CometAPI?

Używaj viduq3 z bieżącym Videos API CometAPI. Nie zastępuj natywnej nazwy dostawcy viduq3-pro, chyba że dokumentacja dla trasy wyraźnie tego wymaga.

Jak długie może być wideo Vidu Q3?

Pojedyncza generacja Q3 obsługuje 1–16 sekund. Dłuższe produkcje wymagają wielu ujęć i montażu.

Czy Vidu Q3 obsługuje generowanie image-to-video?

Tak. W CometAPI prześlij jeden obraz przez input_reference i użyj promptu, by opisać ruch, zachowanie kamery, dźwięk oraz to, co musi pozostać niezmienione.

Czy Vidu Q3 potrafi generować dialog w różnych językach?

Vidu wymienia wyjście po angielsku, japońsku i chińsku. Przejrzyj wymowę, tożsamość głosu, emocję i synchronizację ust przed wysyłką zlokalizowanej treści.

Czy użyć Vidu Q3 czy Vidu Q3 Turbo?

Używaj Q3, gdy finalna jakość wizualna, spójność narracyjna i ciągłość postaci liczą się bardziej niż prędkość generacji. Używaj Q3 Turbo do szkiców, iteracji promptów i generacji na większą skalę.

Czy CometAPI jest tańszy niż oficjalne API Vidu?

Nie w każdej konfiguracji. Bieżące publiczne stawki pokazują, że bezpośrednie normalne i off-peak Vidu mogą być tańsze. Wybierz CometAPI dla ujednoliconego dostępu, jednej integracji, scentralizowanej obsługi zadań i łatwiejszego przełączania między dostawcami, a nie na niepopartym twierdzeniu, że każda trasa kosztuje mniej.

Ostateczna rekomendacja

Vidu Q3 to mocna opcja dla krótkich, opartych na historii wideo, które potrzebują, by obraz, dialog, tło dźwiękowe i efekty dotarły razem. Najbardziej użyteczne atuty produkcyjne to 16-sekundowa generacja, spójność oparta na referencjach, opowieści z wieloma mówcami, wielojęzyczne wyjście oraz kontrola nad kamerą i rytmem na poziomie promptu.

Na pierwszy test użyj pięciosekundowego żądania w 720p z jednym tematem, jedną główną akcją, jednym ruchem kamery i jasnymi instrukcjami audio. Iteruj prompt przy niskim koszcie, a następnie podnieś rozdzielczość lub czas trwania dopiero po tym, gdy kompozycja zadziała. Używaj Q3 Turbo do eksploracji szkiców i standardowego Q3 do finalnych renderów z krótkiej listy.

Dla powtarzalnej produkcji zamieniaj każdy zatwierdzony wynik w wielorazową recepturę kreatywną: zachowaj finalny prompt, obraz referencyjny, ID modelu, czas trwania, rozdzielczość, metadane zadania i notatki z przeglądu. Buduj wieloujęciowe wideo ze stabilnych indywidualnych klipów, a następnie dodaj dokładne tytuły, napisy, montaż, kolor i finalny dźwięk w postprodukcji. CometAPI jest najbardziej wartościowe, gdy ten workflow potrzebuje także jednego wzorca zadań i łatwego routingu przez kilka modeli wideo.

Zacznij budować Otwórz stronę modelu Vidu Q3, utwórz klucz CometAPI, złóż małe testowe zadanie i zweryfikuj kompletny workflow create → poll → download

Kontynuuj naukę

Połącz ten artykuł z następną decyzją.

Zobacz wszystkie tematy
Opublikowano Aug 27, 2026
Ostatnia aktualizacja Aug 28, 2026
1 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej