GUIDES · August 24, 2026 · 6 MIN READ

Como Usar Veo 3.1 para Vídeo Fotorrealista com Som

Veo 3.1 do Google é o benchmark do fotorrealismo: física consistente, diálogo nativo e tomadas de 4/6/8 segundos com áudio sincronizado. O modo Rápido cobre rascunhos por 90 créditos; o Padrão cobre os finais.

Veo 3.1 é o modelo que você procura quando o clipe precisa parecer filmado em vez de gerado: física do mundo real, pele e água críveis, e o melhor diálogo nativo do mercado. No ManifoldGen, ele funciona como imagem para vídeo em duas camadas — Rápido para iteração, Padrão para finais — ambos com som sincronizado.

RotaResoluçãoDuraçõesPreço
Veo 3.1 Rápido (imagem)720p · 1080p4 · 6 · 8sa partir de 90 créditos / 5s
Veo 3.1 Padrão (imagem)720p · 1080p4 · 6 · 8sa partir de 240 créditos / 5s

Sempre comece com uma imagem estática

Ambas as rotas do ManifoldGen são de imagem para vídeo, e esse é o fluxo de trabalho correto de qualquer forma. Veo segue a composição religiosamente, então uma imagem estática oferece direção de elenco, enquadramento e iluminação gratuitamente — então o prompt de vídeo só precisa descrever movimento e som. Gere seu quadro com qualquer modelo de imagem, escolha a tomada que você teria filmado e anime-a.

Escreva o movimento como um diretor, não como uma legenda

The chef turns from the window, wipes her hands on her apron,
and looks back at the rain. Camera holds static; depth of field
stays on her hands. Rain streaks the glass; kitchen ambience,
distant radio, one low thunder roll.
  • Uma ação do sujeito por cláusula — "vira", "limpa", "olha" são três batidas que o Veo sequenciará fielmente.
  • Declare a câmera explicitamente — "estática", "aproximação lenta". O silêncio convida à deriva.
  • Nomeie o que não deve se mover — "profundidade de campo permanece nas mãos dela" fixa o foco melhor do que esperar.
  • Pontue — ambiente, uma deixa musical ou uma camada climática. O áudio não especificado assume o tom ambiente.

Diálogo que passa

O Veo renderiza a fala com alinhamento labial e até controle de sotaque, se você o nomear. Mantenha as falas com menos de doze palavras, coloque-as entre aspas e atribua-as: Ele diz, "Tranque a porta ao sair." Rostos são melhor lidos em close-up médio ou mais fechado; o diálogo em um plano aberto desperdiça o recurso.

Rápido é o nível de desenvolvimento visual

A estrutura do prompt é transferida um-para-um entre os níveis. Bloqueie o movimento e o tempo no Rápido a 90 créditos por passagem, depois execute novamente a mesma solicitação no Padrão apenas para as tomadas que foram selecionadas.

Escolhendo durações

Quatro segundos serve para inserções e loops sociais; seis segundos para uma batida de ação completa; oito segundos para uma linha de diálogo mais uma reação. Se uma cena precisar de mais, gere duas tomadas de oito segundos com imagens estáticas correspondentes (mesmo quadro de personagem, câmera diferente) e corte — o Veo mantém a identidade entre os cortes muito melhor do que em uma única geração longa.

Resolução de problemas

  • Física em destaque — água, tecido e fogo são pontos fortes do Veo, mas precisam de espaço. Quadros apertados forçam atalhos; amplie a tomada em vez de diminuir o movimento.
  • O sujeito ignora a imagem de origem — seu prompt redescreve a aparência. Remova adjetivos sobre a pessoa; mantenha apenas movimento e áudio.
  • O diálogo parece dublado — encurte a fala e marque a entrega ("baixinho", "por cima do ombro").
  • Oito segundos caem no meio — adicione uma cláusula ambiente sustentada (a chuva continua, o murmúrio da multidão persiste) para sustentar a batida do meio.

Execute em /tools/veo-3-1-fast para rascunhos e /tools/veo-3-1 para finais; a automação espelha ao vivo em /api/video-generators/veo-3-1-fast e /api/video-generators/veo-3-1.

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio