Cómo convertir una foto en un video de IA
Convierte cualquier foto en un video de IA viviente: elige imágenes de origen que se animen bien, solicita un movimiento que pertenezca a la escena y mantén la identidad perfectamente estable.
La conversión de imagen a video es la característica de mayor apalancamiento en el video de IA: una buena fotografía entra, unos segundos de vida creíble salen. También es donde la mayoría de los intentos fallan, porque la gente pide un movimiento que la escena no puede soportar. Un retrato no necesita que la cámara orbite, necesita que una oreja se mueva y que el bokeh del fondo respire. Esta guía cubre cómo elegir una foto de origen que se anime limpiamente, cómo escribir indicaciones de movimiento que pertenezcan a la escena y cómo mantener al sujeto reconociblemente igual.
El ejemplo siguiente anima una sola foto de estilo personal en un clip de cuatro segundos. El mismo proceso funciona para retratos, mascotas, tomas de productos y paisajes en ManifoldGen.
Empieza con una foto hecha para el movimiento
El modelo solo puede mover lo que puede segmentar, por lo que la calidad de la fuente decide más que tu prompt:
- Sujeto nítido: ojos, pelaje o bordes con un enfoque nítido. El movimiento amplifica la suavidad hasta convertirla en una masa.
- Separación limpia del fondo: el sujeto claramente distinto del telón de fondo. Las escenas concurridas obligan al modelo a adivinar dónde termina el perro y comienza el parque.
- Sujeto único: una persona o animal por fotograma. Dos sujetos intercambian identidad a mitad del clip; los grupos son una técnica diferente.
- Algún movimiento ya implícito: cabello movido por el viento, luces de cadena, agua. El modelo extiende la energía existente mucho mejor de lo que inventa nueva energía.
- Resolución decente: aproximadamente 1024px en el lado largo. Escala primero si no; la animación no puede recuperar detalles que la fuente nunca tuvo.
Pide un movimiento que pertenezca a la escena
INPUT

PROMPT
Gentle breeze moves the fur and the grass around the blanket, ears lift as the dog tilts its head slightly toward camera, string lights twinkle softly, background bokeh breathes, natural handheld micro-movement, subtle and lifelike.OUTPUT — GENERATED WITH MANIFOLDGEN
· 4s
La imagen fija original fue generada con este prompt de imagen: "Foto espontánea de smartphone de un golden retriever sentado en una manta de picnic en un parque, con la lengua fuera, árboles y luces bokeh de fondo, destello de sol de la tarde, encuadre ligeramente imperfecto como una foto personal." Observa que cada cláusula de movimiento nombra algo ya presente en el encuadre: pelaje, hierba, orejas, luces, bokeh. Nada pide a la escena que gane un nuevo elemento.
Lee esa indicación como una lista de verificación de capas ambientales: ambiental (brisa en el pelaje y la hierba), expresiva (cabeza inclinada hacia la cámara), atmosférica (luces parpadeantes), óptica (bokeh que respira) y de cámara (micromovimiento de mano). Una cláusula por capa, cada una ligada a un elemento visible. Esa estructura es la razón por la que el resultado se lee como un momento vivo en lugar de una transformación.
Mantener la identidad estable
La deriva de identidad —caras que se remodelan, marcas que migran— es el modo de fallo que la gente nota primero. Tres defensas:
- Mantén el movimiento sutil por defecto. Cada unidad de movimiento es una oportunidad para redibujar el sujeto; "ligeramente", "suavemente" y "sutil" son palabras clave, no relleno.
- Nunca pidas cambios de pose más allá de los pequeños. Inclinaciones de cabeza, parpadeos, respiraciones, cambios de peso funcionan. Levantarse, darse la vuelta, irse no.
- Usa baja intensidad cuando esté disponible. Una menor intensidad de imagen fija la salida más cerca de los píxeles de origen a costa de menos movimiento, el equilibrio adecuado para caras y mascotas.
Si la primera generación se desvía de todos modos, reduce a la mitad el número de cláusulas de movimiento antes de tocar cualquier otra cosa. Las indicaciones sobrecargadas hacen que el modelo improvise.
Un esqueleto reutilizable de imagen a video
[Environmental motion] moves [ambient elements],
[small expressive action] as [subject] [micro-gesture toward camera],
[atmospheric layer] softly, background [optical layer] breathes,
natural handheld micro-movement, subtle and lifelike.La única regla detrás de cada buen clip de imagen a video: extiende el movimiento que existe en el encuadre, nunca introduzcas movimiento que requiera un nuevo objeto, extremidad o fuente de luz. Viento, parpadeo, respiración, centelleo, ondulación, y luego detente.
Resolución de problemas
- El sujeto se derrite o cambia de especie — demasiado movimiento solicitado. Reduce a dos cláusulas y añade "sutil".
- El clip parece un zoom estático — describiste la cámara pero no la escena. Reemplaza el lenguaje de la cámara con cláusulas de brisa, parpadeo y luz.
- Aparecen objetos nuevos (perros extra, hojas flotantes) — tu indicación introdujo elementos ausentes de la foto. Describe solo cosas visibles.
- El movimiento comienza fuerte y luego se congela — la duración del clip excede la energía de la indicación. Mantén 4 segundos o añade una cláusula ambiental sostenida como "el viento continúa constantemente".
- El fondo se deforma mucho — aumenta la intensidad de la imagen / disminuye la intensidad del movimiento para que el entorno permanezca fijo mientras el sujeto se mueve.
- La cara pierde parecido en los reintentos — regenera desde el archivo original cada vez, no desde un fotograma previamente animado.
Elige tres fotos de tu carrete, pásalas por el esqueleto anterior en Studio y quédate con el clip que merezca ser visto de nuevo; luego, prueba la misma fuente con diferentes preajustes en /tools/cinematic-cameras para comparar estilos de movimiento.
Try these prompts on your own shot.
Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.