GUIDES · August 24, 2026 · 6 MIN READ

Jak używać Veo 3.1 do fotorealistycznego wideo z dźwiękiem

Veo 3.1 od Google to wzorzec fotorealizmu: fizyka, która się sprawdza, natywne dialogi i ujęcia 4/6/8-sekundowe z zsynchronizowanym dźwiękiem. Wersje robocze Fast kosztują 90 kredytów; Standard to wersje finalne.

Veo 3.1 to model, po który sięgasz, gdy klip musi wyglądać na nakręcony, a nie wygenerowany: fizyka świata rzeczywistego, wiarygodna skóra i woda oraz najlepsze natywne dialogi w tej dziedzinie. Na ManifoldGen działa jako konwersja obrazu na wideo w dwóch poziomach — Fast do iteracji, Standard do wersji finalnych — oba z zsynchronizowanym dźwiękiem.

TrasaRozdzielczośćCzas trwaniaCena
Veo 3.1 Fast (obraz)720p · 1080p4 · 6 · 8sod 90 kredytów / 5s
Veo 3.1 Standard (obraz)720p · 1080p4 · 6 · 8sod 240 kredytów / 5s

Zawsze zaczynaj od zdjęcia

Obie ścieżki ManifoldGen to konwersja obrazu na wideo, i to jest zresztą prawidłowy workflow. Veo religijnie podąża za kompozycją, więc zdjęcie daje Ci za darmo obsadę, kadrowanie i kierunek oświetlenia — wtedy prompt wideo musi tylko opisywać ruch i dźwięk. Wygeneruj swój kadr dowolnym modelem obrazu, wybierz ujęcie, które byś nakręcił, i animuj je.

Pisz ruch jak reżyser, nie jak podpis

The chef turns from the window, wipes her hands on her apron,
and looks back at the rain. Camera holds static; depth of field
stays on her hands. Rain streaks the glass; kitchen ambience,
distant radio, one low thunder roll.
  • Jedna akcja podmiotu na klauzulę — „obraca się”, „przeciera”, „patrzy” to trzy uderzenia, które Veo wiernie odwzoruje.
  • Wyraźnie określ kamerę — „statyczna”, „powolne zbliżenie”. Cisza sprzyja dryfowaniu.
  • Nazwij, co nie powinno się ruszać — „głębia ostrości pozostaje na jej rękach” lepiej ustala ostrość niż nadzieja.
  • Zrób do tego ścieżkę dźwiękową — ambient, jedna wskazówka muzyczna lub warstwa pogodowa. Niesprecyzowany dźwięk domyślnie przyjmuje ton pomieszczenia.

Dialog, który przechodzi

Veo renderuje mowę z synchronizacją ust, a nawet kontrolą akcentu, jeśli ją określisz. Zachowaj linie poniżej dwunastu słów, umieść je w cudzysłowie i przypisz: On mówi: „Zamknij za sobą drzwi”. Twarze najlepiej wyglądają w średnim zbliżeniu lub ciaśniej; dialog w szerokim ujęciu marnuje tę funkcję.

Szybki to poziom look-dev

Struktura promptu przenosi się jeden do jednego między poziomami. Zablokuj ruch i synchronizację na poziomie Fast za 90 kredytów za przejście, a następnie uruchom to samo żądanie na poziomie Standard tylko dla ujęć, które przeszły selekcję.

Wybór długości

Cztery sekundy pasują do wstawek i pętli społecznościowych; sześć obsługuje pełny takt akcji; osiem mieści linię dialogu plus reakcję. Jeśli scena wymaga więcej, wygeneruj dwa ośmiosekundowe ujęcia z dopasowanymi klatkami (ta sama postać, inna kamera) i wytnij — Veo utrzymuje tożsamość między cięciami znacznie lepiej niż w przypadku jednej długiej generacji.

Rozwiązywanie problemów

  • Fizyka się popisuje — woda, tkanina i ogień to mocne strony Veo, ale potrzebują przestrzeni. Wąskie kadry wymuszają skróty; poszerz ujęcie zamiast spowalniać ruch.
  • Obiekt ignoruje obraz źródłowy — Twój prompt ponownie opisuje wygląd. Usuń przymiotniki dotyczące osoby; zachowaj tylko ruch i dźwięk.
  • Dialog brzmi jak dubbing — skróć kwestię i zaznacz sposób wypowiedzi („cicho”, „przez ramię”).
  • Osiem sekund opada w środku — dodaj jedną długotrwałą klauzulę ambientową (deszcz pada, szmer tłumu trwa), aby utrzymać środkowy takt.

Uruchom to na /tools/veo-3-1-fast dla szkiców i /tools/veo-3-1 dla finalnych wersji; automatyzacja odzwierciedla na żywo na /api/video-generators/veo-3-1-fast i /api/video-generators/veo-3-1.

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio