GUIDES · August 24, 2026 · 6 MIN READ

Cara Menggunakan Veo 3.1 untuk Video Fotorealistis dengan Suara

Veo 3.1 dari Google adalah tolok ukur fotorealisme: fisika yang masuk akal, dialog asli, dan pengambilan 4/6/8 detik dengan audio tersinkron. Fast untuk draf dengan 90 kredit; Standard untuk final.

Veo 3.1 adalah model yang Anda gunakan saat klip harus terlihat seperti difilmkan, bukan dibuat: fisika dunia nyata, kulit dan air yang meyakinkan, serta dialog asli terbaik di bidangnya. Di ManifoldGen, model ini berjalan sebagai image-to-video dalam dua tingkatan — Fast untuk iterasi, Standard untuk final — keduanya dengan suara tersinkron.

RuteResolusiDurasiHarga
Veo 3.1 Fast (gambar)720p · 1080p4 · 6 · 8smulai 90 kredit / 5 detik
Veo 3.1 Standard (gambar)720p · 1080p4 · 6 · 8smulai 240 kredit / 5 detik

Mulai dari gambar diam, selalu

Kedua rute ManifoldGen adalah image-to-video, dan itu memang alur kerja yang benar. Veo mengikuti komposisi dengan ketat, jadi gambar diam memberi Anda arahan casting, framing, dan pencahayaan secara gratis — lalu prompt video hanya perlu menggambarkan gerakan dan suara. Buat bingkai Anda dengan model gambar apa pun, pilih pengambilan yang akan Anda syuting, dan animasikan.

Tulis gerakan seperti sutradara, bukan keterangan foto

The chef turns from the window, wipes her hands on her apron,
and looks back at the rain. Camera holds static; depth of field
stays on her hands. Rain streaks the glass; kitchen ambience,
distant radio, one low thunder roll.
  • Satu aksi subjek per klausa — "berbalik", "mengelap", "menatap" adalah tiga ketukan yang akan Veo urutkan dengan setia.
  • Sebutkan kamera secara eksplisit — "statis", "dorongan lambat". Keheningan mengundang drift.
  • Sebutkan apa yang tidak boleh bergerak — "kedalaman bidang tetap di tangannya" mengunci fokus lebih baik daripada berharap.
  • Beri skor — ambience, satu isyarat musik, atau lapisan cuaca. Audio yang tidak ditentukan akan default ke room tone.

Dialog yang berhasil

Veo menghasilkan ucapan dengan sinkronisasi bibir dan bahkan kontrol aksen jika Anda menyebutnya. Jaga kalimat di bawah dua belas kata, letakkan dalam tanda kutip, dan atribusikan: Dia berkata, "Kunci pintu di belakangmu." Wajah terbaca paling baik pada medium close-up atau lebih dekat; dialog dalam wide shot menyia-nyiakan fitur ini.

Fast adalah tingkat look-dev

Struktur prompt berpindah satu-ke-satu antar tingkat. Kunci gerakan dan waktu di Fast dengan 90 kredit per percobaan, lalu jalankan ulang permintaan yang sama di Standard hanya untuk pengambilan yang lolos seleksi.

Memilih durasi

Empat detik cocok untuk sisipan dan loop media sosial; enam menangani satu ketukan aksi penuh; delapan cocok untuk satu baris dialog plus reaksi. Jika adegan membutuhkan lebih, buat dua pengambilan delapan detik dengan gambar diam yang cocok (bingkai karakter sama, kamera berbeda) dan potong — Veo menjaga identitas antar potongan jauh lebih baik daripada dalam satu generasi panjang.

Pemecahan Masalah

  • Fisika yang menonjol — air, kain, dan api adalah kekuatan Veo, tetapi mereka butuh ruang. Bingkai yang ketat memaksa jalan pintas; lebarkan bidikan alih-alih memperlambat gerakan.
  • Subjek mengabaikan gambar sumber — prompt Anda mendeskripsikan ulang penampilan. Hapus kata sifat tentang orang tersebut; pertahankan hanya gerakan dan audio.
  • Dialog terdengar seperti sulih suara — perpendek kalimat dan tandai cara penyampaian ("dengan pelan", "dari belakang bahu").
  • Delapan detik terasa kendur di tengah — tambahkan satu klausa suasana yang berkelanjutan (hujan terus berlanjut, gumaman kerumunan tetap ada) untuk mengisi bagian tengah.

Jalankan di /tools/veo-3-1-fast untuk draf dan /tools/veo-3-1 untuk final; otomatisasi mencerminkan langsung di /api/video-generators/veo-3-1-fast dan /api/video-generators/veo-3-1.

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio