Najpierw odpowiedź Vidu Q3 może tworzyć krótkie narracyjne wideo na podstawie promptów tekstowych lub obrazów referencyjnych, generując w jednym przebiegu zsynchronizowany dialog, efekty dźwiękowe, tło dźwiękowe i obraz. Obsługuje klipy do 16 sekund w 540p, 720p lub 1080p. Twórcy mogą pracować w aplikacji webowej Vidu, a deweloperzy mogą wywoływać model przez CometAPI, używając identyfikatora modelu viduq3.
Ten przewodnik koncentruje się na procesie twórczym: planowaniu ujęcia, wyborze trybu text-to-video lub image-to-video, reżyserii ruchu kamery i dźwięku, generowaniu wariantów, przeglądzie nieudanych wyników oraz budowaniu powtarzalnych workflow w sieci lub przez API.
Czym jest Vidu Q3?
Vidu Q3 to model wideo trzeciej generacji od ShengShu Technology i Vidu. Został zaprojektowany do tworzenia wideo zorientowanego na opowieść, a nie prostych pętli ruchu. Model potrafi wspólnie generować sekwencję obrazów i natywny dźwięk, dzięki czemu dialog, dźwięki otoczenia, efekty i sygnały muzyczne podążają za timingiem sceny.
Model jest szczególnie istotny dla krótkich dramatów, adaptacji komiksów i mang, narracyjnej reklamy, prewizualizacji filmowej, opowiadania o produkcie oraz wideo społecznościowego. Vidu podkreśla synchronizację audio-wideo, wielojęzyczne wyjście, sceny z wieloma mówcami oraz szczegółową kontrolę kamery i tempa jako kluczowe możliwości Q3.
Vidu Q3 to obecnie rodzina modeli, a nie pojedyncza konfiguracja generacyjna. Ten przewodnik koncentruje się głównie na trasie Q3 Pro wystawionej jako viduq3 przez CometAPI.
Szybka specyfikacja Vidu Q3
Uwaga dotycząca źródła: Specyfikacje łączą dokumentację API Vidu oraz stronę modelu CometAPI**.
| Specyfikacja | Szczegóły Vidu Q3 | Znaczenie praktyczne |
|---|---|---|
| Twórca | ShengShu Technology / Vidu | Komercyjny zamknięty model wideo |
| Oficjalny ID modelu API | viduq3-pro | Używany w bezpośrednich workflowach Vidu (tekst, obraz, klatki) |
| ID modelu CometAPI | viduq3 | Używany z ujednoliconym Videos API CometAPI |
| Tryby wejścia | Tekst, obraz, klatki początkowe/końcowe, referencje | Dokładne tryby zależą od powierzchni API |
| Bieżące wejścia CometAPI | Tekst lub jeden obraz referencyjny | Upload multipart form dla image-to-video |
| Wyjście | Wideo MP4 z natywnie zsynchronizowanym dźwiękiem | Dialog i efekty dźwiękowe mogą być generowane razem |
| Czas trwania | 1–16 sekund dla tekstu, obrazu i start/end; 3–16 sekund dla reference-to-video | Domyślnie zazwyczaj 5 sekund |
| Rozdzielczość | 540p, 720p, 1080p | CometAPI używa dokładnych wartości WxH |
| Liczba klatek | 24 FPS | Wymienione na stronie modelu CometAPI |
| Języki wyjściowe | Angielski, japoński, chiński | Przydatne dla zlokalizowanego dialogu |
| Główny fokus | Narracyjne i oparte na postaciach wideo | Krótkie dramaty, reklamy, ujęcia filmowe |
Kontekst wydajności w skrócie
Publiczne benchmarki są użyteczne tylko jako punkt wyjścia, ponieważ jakość wideo silnie zależy od promptu, obrazu referencyjnego, projektu ujęcia i standardu oceny. W SuperCLUE-R2V Vidu Q3 osiąga 70,89 wobec 64,01 dla Vidu Q2. Wynik wspiera poprawę Q3 w zachowaniu odniesienia i ciągłości postaci, ale twórcy powinni oceniać model własnymi postaciami, produktami, językiem kamery i wymaganiami audio.
Tworzenie liczy się bardziej niż tabela wyników Dla praktycznej pracy śledź odsetek klipów, które zachowują tożsamość, podążają za zamierzoną akcją, używają akceptowalnego ruchu kamery, synchronizują dialog i przechodzą przegląd. Najlepszy workflow to ten, który produkuje najwięcej użytecznych ujęć, a nie najwyższy izolowany wynik.
Kluczowe funkcje Vidu Q3
Natywna generacja audio-wideo
Vidu Q3 produkuje obraz i dźwięk w jednym przejściu generacyjnym. Prompt może zawierać prośbę o mówiony dialog, lektora, tło dźwiękowe, kroki, uderzenia lub inne efekty dźwiękowe wraz z akcją wizualną. Zmniejsza to potrzebę budowania osobnej ścieżki dźwiękowej dla każdego szkicu i ułatwia ocenę timingu podczas przeglądu kreatywnego.
Jest ważna niuansowa kwestia API. Bezpośrednia dokumentacja Vidu udostępnia kontrolę audio dla Q3, ale oddzielny przełącznik bgm nie jest skuteczny dla Q3. Jeśli muzyka jest ważna, opisz w promptcie muzyczny sygnał i timing. Obecne ujednolicone żądanie Vidu w CometAPI wystawia prompt, czas trwania, rozmiar i opcjonalny obraz referencyjny, więc kierunek audio również powinien być zapisany w promptcie.
Do 16 sekund w jednej generacji
Limit 16 sekund jest wystarczający na kompletny krótki beat narracyjny: ujęcie ustanawiające, jedną główną akcję, kwestię dialogową, ruch kamery i zamykającą reakcję. To nadal nie jest generowanie długiej formy. Reklamy, odcinki lub teledyski wymagają planu ujęć, wielu zadań i montażu.
Wielu mówców i wielojęzyczny dialog
Produkt jest zaprojektowany dla rozmów wielopostaciowych i obsługuje wyjście po angielsku, japońsku i chińsku. Dzięki temu jest przydatny przy zlokalizowanych krótkich dramach i kampaniach społecznościowych. Traktuj wsparcie językowe jako możliwość, a nie gwarancję perfekcyjnej wymowy, emocji czy synchronizacji ust w każdej generacji; przejrzyj każde wyjście przed publikacją.
Kontrola kamery i tempa
Q3 najlepiej reaguje, gdy prompt opisuje zamysł filmowy, a nie tylko wymienia obiekty. Określ rozmiar ujęcia, charakter obiektywu, ścieżkę kamery, oświetlenie, kolejność akcji, tempo, dialog i sygnały dźwiękowe. Jedno spójne polecenie kamery zwykle daje wyższy odsetek trafień niż kilka sprzecznych ruchów w tym samym ujęciu.
Spójność oparta na referencjach
Bezpośredni workflow reference-to-video Vidu akceptuje do siedmiu obrazów lub tematów tekstowych. Referencje mogą zakotwiczyć postać, produkt, rekwizyt lub styl wizualny w różnych pozycjach kamery.
- Text-to-video: generuje scenę, ruch, kompozycję i dźwięk z promptu tekstowego.
- Image-to-video: animuje pojedynczy obraz wejściowy; prompt powinien skupiać się na ruchu, zachowaniu kamery i audio.
- Start/end-frame generation: tworzy przejście między dwoma wizualnymi kotwicami w bezpośrednim API Vidu.
- Reference-to-video: utrzymuje spójność tematów lub stylu w generowanej sekwencji.
Jak utworzyć wideo z Vidu Q3 w przeglądarce
Workflow webowy to najszybszy sposób przejścia od pomysłu do klipu po przeglądzie. Etykiety interfejsu mogą się zmieniać, ale logika kreatywna pozostaje ta sama: wybierz właściwy tryb wejścia, przygotuj wizualną kotwicę, napisz jedno ujęcie, którym można kierować, generuj warianty i poprawiaj tylko tę wymiar, który zawiódł.
Krok 1: Zdefiniuj deliverable
Zdecyduj, gdzie wideo będzie używane, jaki ma mieć format obrazu, docelowy czas trwania, styl wizualny, język mówiony oraz czy wynik ma łączyć się z innym ujęciem. Hook społecznościowy, ujęcie detalu produktu, beat krótkiego dramatu i ujęcie prewizualizacji filmowej potrzebują innego tempa.
Krok 2: Wybierz tryb tworzenia
Wybierz Text to Video, gdy kompozycja może być wymyślona z promptu. Wybierz Image to Video, gdy masz już pożądany charakter postaci, produktu, grafiki lub kadrowania. Użyj Reference to Video na bezpośredniej powierzchni Vidu, gdy tożsamość lub styl muszą być zakotwiczone przez kilka tematów.
Decyzja o trybie Używaj text-to-video do eksploracji. Używaj image-to-video, gdy pierwsza klatka zawiera już projekt, który chcesz chronić. Używaj workflowów opartych na referencjach, gdy spójność jest ważniejsza niż wizualna niespodzianka.
Krok 3: Przygotuj obraz referencyjny
Dla image-to-video zacznij od ostrego obrazu, który już ma właściwe proporcje tematu, kadrowanie, kierunek oświetlenia i tło. Zostaw przestrzeń wizualną w kierunku, w którym temat lub kamera mają się poruszyć. Unikaj małych twarzy, zasłoniętych dłoni, nieczytelnych etykiet produktów, sprzecznych odbić i kadru, który nie zostawia miejsca na ruch.
Krok 4: Wybierz Vidu Q3
Wybierz Q3 dla ujęć z krótkiej listy, gdzie liczy się jakość narracji, ciągłość postaci, dialog i zsynchronizowany dźwięk. Używaj Q3 Turbo do tańszej eksploracji, a następnie przenieś najsilniejszy prompt i obraz referencyjny do Q3 dla finalnego renderu.
Krok 5: Napisz ustrukturyzowany prompt ujęcia
Napisz prompt w kolejności, w jakiej widz doświadcza ujęcia: temat i miejsce, akcja, kamera, wygląd, dialog, dźwięk, timing beatów i ograniczenia. Daj modelowi jeden dominujący ruch kamery i jedną główną akcję.
Wielorazowa struktura promptu
Subject + environment + primary action + shot type + camera movement +lighting + visual style + dialogue + sound effects + timing + constraints
Krok 6: Reżyseruj dialog i dźwięk
Umieszczaj wypowiadane kwestie w cudzysłowie, identyfikuj mówcę, opisz sposób wypowiedzi i zachowuj dialog na tyle krótki, by mieścił się w klipie. Oddziel tło dźwiękowe od dźwięków o określonym czasie. Na przykład: Audio: ciche tło pokoju przez cały czas; ceramiczny klik, gdy kubek dotyka stołu w czwartej sekundzie; bez muzyki.
Krok 7: Ustaw czas trwania i rozdzielczość
Zacznij od pięciu sekund w 720p. Potwierdź kompozycję, tożsamość, ruch i audio, zanim wydasz więcej na dłuższą lub wyższej rozdzielczości wersję. Zwiększaj czas trwania tylko wtedy, gdy ujęcie potrzebuje więcej czasu na zrealizowanie beatów; dodatkowe sekundy nie poprawiają automatycznie ruchu.
Krok 8: Generuj warianty
Wygeneruj kilka kandydatów z tego samego głównego promptu przed przepisaniem wszystkiego. Warianty pokazują, czy problem jest losowy, czy strukturalny. Jeśli każdy wynik zawodzi w ten sam sposób, zmień prompt lub referencję. Jeśli tylko jeden wynik zawodzi, zachowaj prompt i wybierz innego kandydata.
Krok 9: Przeglądaj i poprawiaj jedną wymiarę
Oglądaj klip w przejściach. Najpierw sprawdź tożsamość i integralność obiektu, potem akcję i ruch kamery, następnie dialog i timing audio, a na końcu końcową klatkę. Zmieniaj tylko zawiedzioną wymiarę, by dobra kompozycja nie została utracona podczas poprawy sygnału dźwiękowego.
- Błąd tożsamości: wzmocnij język zachowania lub użyj czystszego obrazu referencyjnego.
- Słaba akcja: zastąp abstrakcyjne czasowniki jednym widocznym ruchem i jasnym kierunkiem.
- Chaotyczna kamera: usuń konkurujące ruchy i określ jedną ścieżkę z prędkością.
- Słaba synchronizacja ust: skróć dialog, zmniejsz równoczesną akcję, wskaż mówcę i sposób wypowiedzi.
- Niestabilne tło: uprość scenę i wyraźnie zachowaj układ i oświetlenie.
Krok 10: Pobierz i zarchiwizuj zwycięski klip
Pobieraj dopiero po tym, jak wynik przejdzie standard publikacji lub przeglądu klienta. Zapisz finalny klip razem z jego promptem, obrazem wejściowym, wariantem modelu, czasem trwania, rozdzielczością i uwagami z generacji, aby można było ponownie użyć receptury kreatywnej.
Dlaczego używać Vidu Q3 przez CometAPI?
CometAPI jest najbardziej przydatne, gdy produkt potrzebuje dostępu do kilku dostawców AI bez utrzymywania osobno warstwy uwierzytelniania i zarządzania zadaniami dla każdego z nich. Obecna trasa Vidu podąża za ujednoliconym asynchronicznym workflow: utwórz zadanie, otrzymaj ID, odpytywaj job i pobierz ukończony MP4.
- Jeden klucz API dla Vidu i innych rodzin modeli.
- Jeden wzorzec zadań wideo dla zgłoszenia, pobierania statusu i pobierania.
- Prostsze testy A/B gdy ta sama aplikacja porównuje trasy Vidu, Kling, Veo, Seedance lub Wan.
- Scentralizowane zarządzanie użyciem dla rozliczeń, monitoringu i przeglądu operacyjnego.
- Mniej specyficznego dla dostawcy kodu gdy dostępność modelu lub cena się zmienia.
Uwaga o cenach CometAPI nie jest automatycznie tańsze niż bezpośrednie API Vidu dla każdej konfiguracji Q3. Propozycja wartości to spójność operacyjna i wybór modeli. Porównaj dokładną trasę, rozdzielczość, czas trwania, tryb kolejki i politykę rozliczeń przed wdrożeniem.
Jak używać Vidu Q3 z CometAPI
Implementacja Vidu w CometAPI używa POST /v1/videos z multipart/form-data. Poniższe przykłady są po stronie serwera. Nigdy nie ujawniaj produkcyjnego klucza w JavaScript przeglądarkowym, aplikacjach mobilnych, publicznych repozytoriach, zrzutach ekranu ani logach po stronie klienta.
Krok 1: Utwórz i przechowuj klucz CometAPI
Utwórz lub zaloguj się do konta CometAPI, następnie wygeneruj klucz API. Przechowuj go jako zmienną środowiskową.
macOS lub Linux
export COMETAPI_KEY="your_cometapi_key"
Windows PowerShell
$env:COMETAPI_KEY="your_cometapi_key"
Krok 2: Utwórz zadanie text-to-video
Minimalne praktyczne żądanie wymaga ID modelu i promptu. Dodaj czas trwania i rozmiar jawnie, aby żądanie było replikowalne.
Żądanie cURL text-to-video
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=A cinematic medium shot of a young astronaut walking through pale blue fog. Slow dolly-in camera. Soft footsteps and distant mechanical ambience.' \ -F seconds=5 \ -F size=1280x720
Endpoint zwraca natychmiast obiekt zadania. Nie czeka na zakończenie renderowania. Zapisz zwrócone id lub task_id.
Krok 3: Utwórz zadanie image-to-video
Dla image-to-video załaduj jeden lokalny obraz przez pole multipart input_reference. Opisz, jak obraz powinien się poruszać, zamiast powtarzać każdy widoczny detal.
Żądanie cURL image-to-video
curl https://api.cometapi.com/v1/videos \ -H "Authorization: Bearer $COMETAPI_KEY" \ -F model=viduq3 \ -F 'prompt=The character turns slowly toward the window as rain moves across the glass. Gentle handheld camera, quiet room tone, distant thunder.' \ -F seconds=6 \ -F size=1280x720 \ -F input_reference=@reference.png
Krok 4: Odczytaj odpowiedź zadania
Przykład przyjętej odpowiedzi zadania
{ "id": "task_example", "object": "video", "model": "viduq3", "status": "queued", "progress": 0 }
Traktuj identyfikator zadania jako nieprzezroczysty ciąg. Znormalizuj id i alias kompatybilności task_id raz, następnie przechowuj wynikową wartość wraz z modelem, promptem, czasem trwania, rozmiarem, znacznikiem czasu żądania oraz użytkownikiem lub rekordem joba, który zainicjował render.
Krok 5: Odpytuj status zadania
Wywołuj GET /v1/videos/{task_id} aż status stanie się completed, failed lub error. Dokumentacja retrieve CometAPI obejmuje ten sam wzorzec stanów terminalnych.
Pętla odpytywania w Pythonie z timeoutem
import os import time import requests task_id = "<TASK_ID>" headers = {"Authorization": f"Bearer {os.environ['COMETAPI_KEY']}"} terminal = {"completed", "failed", "error"} deadline = time.time() + 20 * 60 while time.time() < deadline: response = requests.get( f"https://api.cometapi.com/v1/videos/{task_id}", headers=headers, timeout=60, ) response.raise_for_status() task = response.json() print(task["status"], task.get("progress")) if task["status"] in terminal: if task["status"] != "completed": raise RuntimeError(task.get("error", task["status"])) break time.sleep(10) else: raise TimeoutError("Video generation did not finish in time")
Krok 6: Pobierz ukończone wideo
Gdy zadanie zostanie ukończone, pobierz MP4 przez endpoint zawartości. Zapisz zasób do trwałego magazynu, jeśli aplikacja potrzebuje długoterminowego przechowywania.
Pobierz MP4
curl "https://api.cometapi.com/v1/videos/$TASK_ID/content" \ -H "Authorization: Bearer $COMETAPI_KEY" \ -o vidu-q3-output.mp4
Krok 7: Uruchom pełny workflow w JavaScript
Przykład end-to-end w Node.js
import fs from "node:fs"; const form = new FormData(); form.append("model", "viduq3"); form.append("prompt", "A quiet product reveal with a slow orbit camera and soft mechanical sound design."); form.append("seconds", "5"); form.append("size", "1280x720"); const auth = { Authorization: `Bearer ${process.env.COMETAPI_KEY}` }; const created = await fetch("https://api.cometapi.com/v1/videos", { method: "POST", headers: auth, body: form, }).then((r) => r.json()); let task; do { await new Promise((resolve) => setTimeout(resolve, 10_000)); task = await fetch(`https://api.cometapi.com/v1/videos/${created.id}`, { headers: auth, }).then((r) => r.json()); } while (!["completed", "failed", "error"].includes(task.status)); if (task.status !== "completed") throw new Error(JSON.stringify(task.error)); const video = await fetch( `https://api.cometapi.com/v1/videos/${created.id}/content`, { headers: auth }, ); fs.writeFileSync("vidu-q3-output.mp4", Buffer.from(await video.arrayBuffer()));
Parametry API Vidu Q3
Uwaga dotycząca źródła: Bieżące nazwy pól i limity odpowiadają endpointowi Vidu w CometAPI**.
| Parametr | Typ | Wymagane | Zalecane | Cel |
|---|---|---|---|---|
| model | String | Tak | viduq3 | Wybiera Vidu Q3 |
| prompt | String | Tak | Ustrukturyzowany prompt sceny | Opisuje obraz, ruch, dialog i dźwięk |
| seconds | Integer | Nie | Zacznij od 5 | Akceptuje 1 do 16 |
| size | String | Nie | 1280x720 | Używa wspieranych wartości WxH |
| input_reference | File | Tryb obrazu | PNG/JPEG/WebP | Kieruje generacją image-to-video |
Obsługiwane wartości size na udokumentowanej trasie Vidu:
-
960x528— poziom 540p, 16:9. -
1280x720— poziom 720p, 16:9. -
1920x1080— poziom 1080p, 16:9.
Reguła zgodności Używaj tylko parametrów udokumentowanych dla trasy, którą wywołujesz. Pola natywnego dostawcy, takie jak audio, callback_url, wiele tematów lub tryb off-peak, nie powinny być uznawane za działające na ujednoliconym endpointzie CometAPI, chyba że dokumentacja CometAPI wyraźnie je wymienia.
Jak pisać lepsze prompty dla Vidu Q3 ?
Napisz każdy prompt jako zwięzły brief ujęcia. Zachowaj pola w kolejności poniżej, aby Vidu Q3 otrzymał najpierw fundament wizualny, a dopiero potem ruch, kierunek kamery, oświetlenie, mowę, dźwięk i reguły zachowania.
Subject → Environment → Action → Camera → Lighting → Dialogue → Audio → Constraints
Użyj jednego wyraźnego tematu, jednej głównej akcji i jednej ścieżki kamery. Zachowaj dialog krótki, oddziel tło dźwiękowe od dźwięków zdarzeń i używaj ograniczeń do stwierdzenia, co musi pozostać niezmienione. Dla image-to-video traktuj obraz wejściowy jako wizualne źródło prawdy i skup prompt na ruchu, zachowaniu kamery, audio i zachowaniu.
Przykład filmowego promptu
Subject: A tired detective in a dark trench coat.Environment: A rain-soaked alley beneath a flickering streetlight at night.Action: She stops, hears approaching footsteps, and slowly looks over her shoulder.Camera: Medium close-up with a gentle three-second dolly in and a 35mm lens feel.Lighting: Blue-magenta reflections, soft backlighting, shallow depth of field, and subtle film grain.Dialogue: In a restrained whisper, "You should not have come back."Audio: Steady rain ambience, one distant siren, and footsteps that stop after the line.Constraints: Preserve her face, coat, and alley layout; no subtitles, logos, extra people, or camera shake.
Przykład promptu produktowego
Subject: A premium stainless-steel smartwatch with a clean blue display.Environment: The watch rests on black stone while a thin ribbon of water circles the base.Action: At second three, the display turns on and reveals a single blue pulse.Camera: Slow left-to-right orbit ending on a centered macro view of the watch face.Lighting: Crisp edge reflections, controlled highlights, and a dark luxury color grade.Dialogue: None.Audio: Soft water movement, one precise electronic chime, and a restrained low bass swell.Constraints: Preserve the watch geometry, materials, display layout, and logo placement; no hands, extra text, or deformation.
Przykład promptu anime
Subject: A teenage girl holding a red umbrella in a hand-drawn anime style.Environment: A quiet rural train platform at sunset, with tall grass moving in a warm wind.Action: She looks down the empty track as a distant train light appears, then smiles slightly.Camera: Track slowly beside her and stop in a medium shot when the train light appears.Lighting: Warm sunset light, soft shadows, stable linework, and consistent character colors.Dialogue: She whispers in Japanese, "Yatto kaette kita."Audio: Summer insects, soft wind, and a distant railway bell after the dialogue.Constraints: Preserve the character design, facial features, umbrella color, and anime style; no on-screen text or extra characters.
Przykład promptu image-to-video
Subject: Preserve the character's face, hairstyle, clothing, pose, and framing from the reference image.Environment: Keep the same room, furniture arrangement, background layout, and window position.Action: The character looks up from the book, smiles slightly, and turns toward the window while the curtain moves in a light breeze.Camera: Use a slow, stabilized push in with subtle natural movement.Lighting: Preserve the original light direction, exposure, skin tone, and room colors.Dialogue: None.Audio: Quiet room tone, soft page movement, light curtain rustle, and distant birds.Constraints: No identity changes, added accessories, hand distortion, sudden camera movement, background replacement, or new objects.
Utwórz wieloujęciowe wideo z Vidu Q3
Kompletna reklama, krótki dramat, zwiastun lub muzyczna sekwencja zwykle potrzebuje kilku wygenerowanych klipów. Traktuj Vidu Q3 jako generator ujęć i użyj prostej listy ujęć, by zachować ciągłość w sekwencji.
| Ujęcie | Cel | Kotwica ciągłości |
|---|---|---|
| 1. Ustanów | Szerokie ujęcie wprowadza lokalizację i temat | Środowisko, garderoba, pora dnia |
| 2. Zbliżenie | Średnie ujęcie rozpoczyna główną akcję | Kierunek na ekranie, pozycja rekwizytu, światło |
| 3. Emfaza | Zbliżenie dostarcza dialog lub detal produktu | Twarz lub geometria produktu, tożsamość audio |
| 4. Domknięcie | Reakcja lub czysta końcowa klatka domyka beat | Końcowa poza, gradacja kolorów, kierunek przejścia |
Użyj nagłówka ciągłości wielokrotnego użytku
Zacznij każdy prompt ujęcia od tego samego zwięzłego bloku tożsamości: wygląd postaci, garderoba, projekt produktu, lokalizacja, pora dnia i styl wizualny. Następnie zmieniaj tylko akcję specyficzną dla ujęcia, kadrowanie, kamerę i audio.
Wielorazowy wzorzec promptu wieloujęciowego
Continuity: the same woman in her early thirties, short black hair, dark green coat, silver pendant; rainy neon alley at night; blue-magenta reflections; restrained cinematic realism. Shot 3: medium close-up. She stops beneath the streetlight and looks over her shoulder. Slow dolly in. She whispers, "I heard you." Rain ambience continues; distant footsteps stop at second four.
Dopasuj koniec jednego ujęcia do początku następnego
- Zachowaj spójny kierunek na ekranie, chyba że montaż celowo go odwraca.
- Noś ten sam rekwizyt w tej samej dłoni lub pozycji.
- Dopasuj garderobę, pogodę, kierunek światła i dominujący kolor.
- Zakończ stabilną pozą lub kompozycją, która może stać się kolejną referencją.
- Używaj spójnego tła dźwiękowego między sąsiadującymi ujęciami i dodawaj dźwięki zdarzeń tylko tam, gdzie występują akcje.
Montuj i finalizuj poza generatorem
Przytnij słabe ramki otwierające lub kończące, ułóż ujęcia, znormalizuj poziomy audio, dodaj tytuły lub napisy w edytorze i zastosuj finalną korekcję koloru oraz dźwięku po generacji. Generowany przez AI tekst ekranowy jest mniej niezawodny niż dodanie dokładnej typografii w postprodukcji.
Kiedy wybrać Vidu Q3?
Porównanie modeli powinno wspierać decyzję kreatywną, a nie ją dominować. Praktyczne pytanie brzmi: który workflow najlepiej odpowiada ujęciu, które musisz wyprodukować.
| Wymiar | Vidu Q3 | Vidu Q3 Turbo | Seedance 2.5 | Kling 3.0 | Veo 3.1 |
|---|---|---|---|---|---|
| Czas trwania | 1–16 s; oficjalne reference-to-video 3–16 s | 1–16 s; oficjalne reference-to-video 3–16 s | 4–30 s | Do 15 s, zależnie od trybu | 4 s, 6 s lub 8 s na generację w API |
| Audio | Natywne zsynchronizowane audio | Natywne zsynchronizowane audio | Natywna generacja audio-wideo | Dostępne w trybach natywnego audio | Natywne audio |
| Referencje | Jeden obraz w CometAPI; bogatsze oficjalne powierzchnie | Jeden obraz w CometAPI; bogatsze oficjalne powierzchnie | Do 50 referencji multimodalnych | Tryby image, start/end i kontroli ruchu | Image oraz prowadzenie pierwszą/ostatnią klatką |
| API | CometAPI POST /v1/videos | CometAPI POST /v1/videos | CometAPI POST /v1/videos | Trasy kompatybilne z Kling text2video/image2video | CometAPI POST /v1/videos |
| Cena listowa | Od $0.056/s | Od $0.028/s | Od $0.0824/s w estimatorze trasy | V3 720p: $0.336/5 s bez audio | $0.32/s w 720p lub 1080p |
| Najlepszy use case | Finalne krótkie ujęcia narracyjne z dialogiem i ciągłością | Szkicowanie, iteracja promptów, większa skala generacji | Dłuższe opowieści multimodalne i referencyjne | Kontrolowana kamera, ruch i produkcja wieloujęciowa | Fotorealistyczne ujęcia filmowe i realistyczna fizyka |
Uwaga dotycząca źródła: Powierzchnie modeli i dostępne tryby mogą się zmieniać. Oficjalny przewodnik Kling dokumentuje tryby 720p/1080p i natywnego audio**; Google opisuje natywne audio, kontrolę referencji i workflowy wysokiej rozdzielczości Veo 3.1**. Pozycje cenowe są migawkami tras, a nie znormalizowanymi porównaniami jakości; rozdzielczość, tryb audio i poziom jakości różnią się, więc zweryfikuj linkowane strony modeli przed publikacją.
Praktyczny wynik wyboru
Wybierz Vidu Q3, gdy potrzebujesz krótkiego, narracyjnego ujęcia z ciągłością postaci lub produktu, kierowalnym rytmem kamery, dialogiem, tłem dźwiękowym i efektami w jednej generacji. Używaj Q3 Turbo do eksploracji promptów, a następnie przenieś tylko najsilniejszy kierunek kreatywny na trasę premium. Rozważ inny model, gdy długość klipu, większy stos referencji, specjalistyczna kontrola multi-shot lub fotorealistyczna fizyka są ważniejsze niż narracyjny workflow Q3.
Ile kosztuje Vidu Q3?
Cennik wymaga uczciwego porównania trasa po trasie. CometAPI rozlicza trasę Vidu Q3 za wygenerowaną sekundę. Bezpośrednie API Vidu również wycenia według czasu trwania i rozdzielczości oraz oferuje tańszy tryb off-peak z dużo dłuższym czasem ukończenia.
| Rozdzielczość | CometAPI Vidu Q3 | Oficjalne API Vidu | Oficjalny off-peak |
|---|---|---|---|
| 540p | $0.056/s | $0.045/s | $0.025/s |
| 720p | $0.1232/s | $0.10/s | $0.05/s |
| 1080p | $0.1232/s | $0.12/s | $0.06/s |
Uwaga dotycząca źródła: Ceny za sekundę pochodzą ze strony modelu CometAPI i dokumentacji cen Vidu**. Zweryfikuj bieżące rozliczenia przed publikacją klientowską lub wdrożeniem.
Przy tych wartościach CometAPI nie jest tańszą trasą dla każdej konfiguracji Q3. Jego przewaga jest operacyjna: jeden klucz, spójny endpoint wideo, scentralizowana obsługa zadań i łatwiejsze przełączanie między dostawcami. Zespół, który używa tylko Vidu i może czekać na przetwarzanie off-peak, może zapłacić mniej przez bezpośrednie API Vidu.
Przykładowe koszty uruchomień w CometAPI
| Czas trwania | 540p | 720p | 1080p |
|---|---|---|---|
| 5 sekund | $0.28 | $0.616 | $0.616 |
| 10 sekund | $0.56 | $1.232 | $1.232 |
| 16 sekund | $0.896 | $1.9712 | $1.9712 |
Koszt na użyteczny klip Niska stawka za sekundę nadal może być droga, jeśli większość generacji jest odrzucana. Śledź całkowity koszt podzielony przez wyniki, które przechodzą przegląd kreatywny, a nie tylko reklamowaną cenę jednego renderu.
Najlepsze praktyki produkcyjne
Lepsza strategia iteracji kreatywnej
- Zacznij od małego. Użyj żądania pięciosekundowego 720p, aby zweryfikować kompozycję, akcję i ruch kamery.
- Generuj kontrolowane warianty. Utrzymuj rdzeń promptu stabilny i zmieniaj tylko jeden wybór kreatywny naraz.
- Diagnozuj zawiedzioną wymiarę. Rozdziel problemy tożsamości, ruchu, kamery, audio i ciągłości przed edycją promptu.
- Oddziel trasy szkicowe i finalne. Używaj szybszych wariantów do eksploracji, a premium tylko dla promptów z krótkiej listy.
- Zapisz zwycięski przepis. Archiwizuj finalny prompt, referencję, ustawienia, wyjście i notatki z przeglądu do ponownego użycia.
Lista kontrolna przeglądu wideo Vidu Q3
Przeglądanie wszystkiego naraz utrudnia poprawę promptu. Używaj osobnych przejść, aby każde odrzucenie prowadziło do konkretnej korekty.
| Przegląd | Kryterium akceptacji | Co poprawić w razie porażki |
|---|---|---|
| Temat | Twarz, ciało, ubranie, geometria produktu, etykiety i rekwizyty są spójne | Referencja lub prompt zachowania |
| Akcja | Główny ruch jest kompletny, czytelny i poprawnie ztimowany | Czasownik akcji, kierunek i kolejność |
| Kamera | Ruch podąża jedną ścieżką bez skoków, dryfu i niechcianego przekadrowania | Rozmiar ujęcia, ścieżka, prędkość, koniec |
| Środowisko | Układ tła, oświetlenie, pogoda i ruchy drugoplanowe są stabilne | Złożoność sceny i ograniczenia ciągłości |
| Audio | Dialog, wymowa, synchronizacja ust, tło dźwiękowe i sygnały pasują do akcji | Krótsza kwestia i wyraźniejsza oś audio |
| Końcowa klatka | Finalna kompozycja jest na tyle czysta, by ją utrzymać, ciąć lub zasilić kolejne ujęcie | Końcowa poza i punkt kamery |
Reguła akceptacji Nie zatwierdzaj klipu tylko dlatego, że jedna klatka wygląda imponująco. Obejrzyj go w normalnej prędkości, potem sprawdź początek, szczyt akcji, moment dialogu i finalną klatkę. Użyteczne wideo musi pozostać spójne w czasie.
Najczęściej zadawane pytania o Vidu Q3
Czy Vidu Q3 potrafi generować wideo i audio razem?
Tak. Q3 jest zaprojektowany do bezpośredniej generacji audio-wideo, w tym dialogu i efektów dźwiękowych. Opisz pożądane audio i jego timing w promptcie, gdy używasz ujednoliconej trasy CometAPI.
Jaki jest ID modelu Vidu Q3 w CometAPI?
Używaj viduq3 z bieżącym Videos API CometAPI. Nie zastępuj natywnej nazwy dostawcy viduq3-pro, chyba że dokumentacja dla trasy wyraźnie tego wymaga.
Jak długie może być wideo Vidu Q3?
Pojedyncza generacja Q3 obsługuje 1–16 sekund. Dłuższe produkcje wymagają wielu ujęć i montażu.
Czy Vidu Q3 obsługuje generowanie image-to-video?
Tak. W CometAPI prześlij jeden obraz przez input_reference i użyj promptu, by opisać ruch, zachowanie kamery, dźwięk oraz to, co musi pozostać niezmienione.
Czy Vidu Q3 potrafi generować dialog w różnych językach?
Vidu wymienia wyjście po angielsku, japońsku i chińsku. Przejrzyj wymowę, tożsamość głosu, emocję i synchronizację ust przed wysyłką zlokalizowanej treści.
Czy użyć Vidu Q3 czy Vidu Q3 Turbo?
Używaj Q3, gdy finalna jakość wizualna, spójność narracyjna i ciągłość postaci liczą się bardziej niż prędkość generacji. Używaj Q3 Turbo do szkiców, iteracji promptów i generacji na większą skalę.
Czy CometAPI jest tańszy niż oficjalne API Vidu?
Nie w każdej konfiguracji. Bieżące publiczne stawki pokazują, że bezpośrednie normalne i off-peak Vidu mogą być tańsze. Wybierz CometAPI dla ujednoliconego dostępu, jednej integracji, scentralizowanej obsługi zadań i łatwiejszego przełączania między dostawcami, a nie na niepopartym twierdzeniu, że każda trasa kosztuje mniej.
Ostateczna rekomendacja
Vidu Q3 to mocna opcja dla krótkich, opartych na historii wideo, które potrzebują, by obraz, dialog, tło dźwiękowe i efekty dotarły razem. Najbardziej użyteczne atuty produkcyjne to 16-sekundowa generacja, spójność oparta na referencjach, opowieści z wieloma mówcami, wielojęzyczne wyjście oraz kontrola nad kamerą i rytmem na poziomie promptu.
Na pierwszy test użyj pięciosekundowego żądania w 720p z jednym tematem, jedną główną akcją, jednym ruchem kamery i jasnymi instrukcjami audio. Iteruj prompt przy niskim koszcie, a następnie podnieś rozdzielczość lub czas trwania dopiero po tym, gdy kompozycja zadziała. Używaj Q3 Turbo do eksploracji szkiców i standardowego Q3 do finalnych renderów z krótkiej listy.
Dla powtarzalnej produkcji zamieniaj każdy zatwierdzony wynik w wielorazową recepturę kreatywną: zachowaj finalny prompt, obraz referencyjny, ID modelu, czas trwania, rozdzielczość, metadane zadania i notatki z przeglądu. Buduj wieloujęciowe wideo ze stabilnych indywidualnych klipów, a następnie dodaj dokładne tytuły, napisy, montaż, kolor i finalny dźwięk w postprodukcji. CometAPI jest najbardziej wartościowe, gdy ten workflow potrzebuje także jednego wzorca zadań i łatwego routingu przez kilka modeli wideo.
Zacznij budować Otwórz stronę modelu Vidu Q3, utwórz klucz CometAPI, złóż małe testowe zadanie i zweryfikuj kompletny workflow create → poll → download
