Як використовувати Veo 3.1 для фотореалістичного відео зі звуком
Veo 3.1 від Google — це еталон фотореалізму: фізика, що тримається, природні діалоги та 4/6/8-секундні кадри із синхронізованим звуком. Fast покриває чернетки за 90 кредитів; Standard — фінальні версії.
Veo 3.1 — це модель, до якої ви звертаєтеся, коли кліп має виглядати знятим, а не згенерованим: реальна фізика, правдоподібна шкіра та вода, а також найкращі природні діалоги в цій галузі. На ManifoldGen вона працює як перетворення зображення на відео у двох рівнях — Fast для ітерацій, Standard для фінальних версій — обидва із синхронізованим звуком.
| Маршрут | Роздільна здатність | Тривалість | Ціна |
|---|---|---|---|
| Veo 3.1 Fast (зображення) | 720p · 1080p | 4 · 6 · 8s | від 90 кредитів / 5с |
| Veo 3.1 Standard (зображення) | 720p · 1080p | 4 · 6 · 8s | від 240 кредитів / 5с |
Завжди починайте зі статичного зображення
Обидва маршрути ManifoldGen — це перетворення зображення на відео, і це все одно правильний робочий процес. Veo релігійно дотримується композиції, тому статичне зображення дає вам кастинг, кадрування та напрямок освітлення безкоштовно — тоді відеозапит має описувати лише рух та звук. Створіть свій кадр за допомогою будь-якої моделі зображень, виберіть дубль, який ви б зняли, і анімуйте його.
Пишіть рух як режисер, а не як підпис
The chef turns from the window, wipes her hands on her apron,
and looks back at the rain. Camera holds static; depth of field
stays on her hands. Rain streaks the glass; kitchen ambience,
distant radio, one low thunder roll.- Одна дія суб'єкта на речення — "повертається", "витирає", "дивиться" — це три такти, які Veo точно відтворить.
- Чітко вказуйте камеру — "статична", "повільне наближення". Мовчання призводить до відхилень.
- Називайте те, що не повинно рухатися — "глибина різкості залишається на її руках" краще фіксує фокус, ніж сподівання.
- Озвучте це — атмосфера, одна музична підказка або шар погоди. Невизначений звук за замовчуванням буде фоновим шумом кімнати.
Діалог, який проходить
Veo відтворює мову з синхронізацією губ і навіть контролем акценту, якщо ви його вкажете. Тримайте репліки до дванадцяти слів, беріть їх у лапки та вказуйте автора: Він каже: "Зачини двері за собою". Обличчя найкраще читаються при середньому крупному плані або ближче; діалог у широкому кадрі марнує цю функцію.
Структура підказки передається один до одного між рівнями. Зафіксуйте рух і таймінг на Fast за 90 кредитів за прохід, потім повторно запустіть ідентичний запит на Standard лише для тих кадрів, які пройшли відбір.
Вибір тривалості
Чотири секунди підходять для вставок та соціальних циклів; шість охоплюють повний такт дії; вісім вміщують репліку діалогу плюс реакцію. Якщо сцена потребує більше, згенеруйте два восьмисекундні дублі з відповідними кадрами (той самий кадр персонажа, інша камера) і виріжте — Veo зберігає ідентичність між вирізками набагато краще, ніж протягом однієї довгої генерації.
Вирішення проблем
- Фізика вражає — вода, тканина та вогонь є сильними сторонами Veo, але їм потрібен простір. Тісні кадри змушують йти на компроміси; розширюйте кадр замість того, щоб уповільнювати рух.
- Суб'єкт ігнорує вихідне зображення — ваша підказка переописує зовнішність. Видаліть прикметники про людину; залиште лише рух та звук.
- Діалог звучить дубльовано — скоротіть репліку та позначте подачу ("тихо", "через плече").
- Вісім секунд провисають посередині — додайте одну тривалу фонову фразу (дощ продовжується, гомін натовпу не вщухає), щоб підтримати середній такт.
Запускайте його на /tools/veo-3-1-fast для чернеток та /tools/veo-3-1 для фінальних версій; автоматизація відображає живе на /api/video-generators/veo-3-1-fast та /api/video-generators/veo-3-1.
Try these prompts on your own shot.
Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.