GUIDES · August 24, 2026 · 6 MIN READ

Cómo usar Veo 3.1 para video fotorrealista con sonido

Veo 3.1 de Google es el referente del fotorrealismo: física consistente, diálogos nativos y tomas de 4/6/8 segundos con audio sincronizado. Fast cubre borradores por 90 créditos; Standard cubre finales.

Veo 3.1 es el modelo al que recurres cuando el clip debe parecer filmado en lugar de generado: física del mundo real, piel y agua creíbles, y el mejor diálogo nativo en el campo. En ManifoldGen funciona como imagen a video en dos niveles: Fast para iteración, Standard para finales, ambos con sonido sincronizado.

RutaResoluciónDuracionesPrecio
Veo 3.1 Fast (imagen)720p · 1080p4 · 6 · 8sdesde 90 créditos / 5s
Veo 3.1 Standard (imagen)720p · 1080p4 · 6 · 8sdesde 240 créditos / 5s

Empieza siempre con una imagen fija

Ambas rutas de ManifoldGen son de imagen a video, y ese es el flujo de trabajo correcto de todos modos. Veo sigue la composición religiosamente, por lo que una imagen fija te da dirección de casting, encuadre e iluminación de forma gratuita; luego, el prompt de video solo tiene que describir el movimiento y el sonido. Genera tu encuadre con cualquier modelo de imagen, elige la toma que habrías filmado y anímala.

Escribe el movimiento como un director, no como un pie de foto

The chef turns from the window, wipes her hands on her apron,
and looks back at the rain. Camera holds static; depth of field
stays on her hands. Rain streaks the glass; kitchen ambience,
distant radio, one low thunder roll.
  • Una acción por sujeto por cláusula — "gira", "limpia", "mira" son tres tiempos que Veo secuenciará fielmente.
  • Indica la cámara explícitamente — "estática", "acercamiento lento". El silencio invita a la deriva.
  • Nombra lo que no debe moverse — "la profundidad de campo se mantiene en sus manos" fija el enfoque mejor que la esperanza.
  • Puntúalo — ambiente, una pista musical o una capa de clima. El audio no especificado por defecto es el sonido ambiente.

Diálogo que pasa

Veo renderiza el habla con alineación labial e incluso control de acento si lo nombras. Mantén las líneas por debajo de doce palabras, ponlas entre comillas y atribúyelas: Él dice, "Cierra la puerta detrás de ti." Los rostros se leen mejor en un primer plano medio o más cerrado; el diálogo en un plano general desperdicia la función.

Fast es el nivel de desarrollo visual

La estructura del prompt se transfiere uno a uno entre los niveles. Bloquea el movimiento y el tiempo en Fast a 90 créditos por pasada, luego vuelve a ejecutar la solicitud idéntica en Standard solo para las tomas que pasaron el corte.

Eligiendo duraciones

Cuatro segundos son adecuados para inserciones y bucles sociales; seis manejan un ritmo de acción completo; ocho se ajustan a una línea de diálogo más una reacción. Si una escena necesita más, genera dos tomas de ocho segundos con imágenes fijas coincidentes (mismo fotograma de personaje, diferente cámara) y corta — Veo mantiene la identidad a través de los cortes mucho mejor que a través de una sola generación larga.

Resolución de problemas

  • La física se luce — el agua, la tela y el fuego son puntos fuertes de Veo, pero necesitan espacio. Los encuadres ajustados fuerzan atajos; amplía la toma en lugar de ralentizar el movimiento.
  • El sujeto ignora la imagen de origen — tu prompt redescribe la apariencia. Elimina los adjetivos sobre la persona; mantén solo el movimiento y el audio.
  • El diálogo suena doblado — acorta la línea y marca la entrega ("en voz baja", "por encima del hombro").
  • Ocho segundos se caen en el medio — añade una cláusula ambiental sostenida (la lluvia continúa, el murmullo de la multitud persiste) para mantener el ritmo central.

Ejecútalo en /tools/veo-3-1-fast para borradores y /tools/veo-3-1 para finales; la automatización se refleja en vivo en /api/video-generators/veo-3-1-fast y /api/video-generators/veo-3-1.

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio