GUIDES · July 27, 2026 · 9 MIN READ

Cómo mantener la coherencia de personajes y ubicaciones en tomas de IA

La consistencia entre tomas de IA es un problema de memoria: crea una ficha de personaje, pásala como referencia en cada toma, repite los descriptores textualmente, corrige el resto en la edición.

Cada video narrativo de IA se topa con el mismo muro: la toma uno te da un personaje perfecto, y para la toma cuatro ella tiene una cara, chaqueta y línea de cabello diferentes. Los modelos de video no tienen memoria entre generaciones. La consistencia no es algo que pidas, es un sistema que construyes alrededor del modelo: una imagen de referencia, un bloque de descriptores congelado y un pase de edición que absorbe el último veinte por ciento.

Esta guía construye ese sistema. El ejemplo principal es una botánica de campo que aparece en dos ubicaciones —una cueva de musgo bioluminiscente y un sendero en la jungla— generadas a partir de la misma ficha de personaje. Necesitas un modelo de imagen para la ficha de referencia y una herramienta de video que acepte referencias de imagen, como /studio.

La ficha de referencia es tu memoria

Antes de generar cualquier metraje, diseña el personaje una vez como una imagen fija de cuerpo completo. Esta única imagen se pasa como referencia en cada toma subsiguiente, lo que ancla la identidad mucho mejor que cualquier adjetivo de prompt. Escribe el prompt de la ficha como un casting: vestuario, cabello, accesorios, pose, fondo.

Full-body character design of a woman in her thirties,
a field botanist: olive field jacket with rolled sleeves,
round glasses, dark hair in a single braid, canvas satchel,
standing relaxed pose facing camera, neutral light-grey
studio background, soft even lighting, consistent character
reference sheet look.

Tres reglas para la ficha en sí. Fondo de estudio gris neutro para que ningún entorno se filtre en la referencia. Iluminación plana y uniforme para que el modelo de video lea la forma, no el estado de ánimo. Pose relajada de pie mirando a la cámara, porque las poses extremas contaminan cada generación posterior. Genera dos o tres candidatos y elige uno antes de continuar; nunca cambies de ficha a mitad de proyecto.

Una referencia, dos ubicaciones

ONE REFERENCE, TWO LOCATIONS

INPUT

Character sheet passed as reference
Character sheet passed as reference

PROMPT

The botanist kneels in a bioluminescent moss cave at night, lifting a glowing fern leaf toward her lantern, awe on her face, medium shot, cool teal glow against warm lantern light, gentle handheld drift.

OUTPUT — GENERATED WITH MANIFOLDGEN

Toma 1 — cueva de musgo · 4s

Toma 2 — sendero en la jungla · 4s

Ambas tomas adjuntan la misma ficha de personaje como referencia de imagen, mientras que los prompts solo cambian la ubicación, la acción y la luz. Prompt de la toma 2: "La botánica avanza por un sendero selvático iluminado por el sol, apartando hojas con una mano, toma de seguimiento desde el frente a paso de caminata, luz verde moteada, realismo documental, mismo personaje que la referencia." La identidad se mantiene porque proviene de la imagen, no del texto.

Observa qué cambió entre las tomas y qué no. La ubicación, la acción, el movimiento de la cámara y la iluminación son todos nuevos por toma. El vestuario, las gafas, la trenza y la cartera no aparecen en ningún prompt de las tomas; viajan en la imagen de referencia. Esa división del trabajo es toda la técnica: la imagen posee la identidad, el prompt posee la puesta en escena.

Repite los descriptores textualmente

La referencia hace la mayor parte del trabajo, pero el texto aún se filtra. Cuando un personaje debe describirse en prosa —primeros planos donde la ficha se recorta mal, o modelos sin soporte de referencia— copia el bloque de frase exacto cada vez:

  • Crea una cadena de descriptores canónica por personaje ("mujer de treinta y tantos, chaqueta de campo verde oliva con mangas remangadas, gafas redondas, cabello oscuro en una sola trenza, cartera de lona") y pégala sin editar en cada prompt que la nombre.
  • Nunca parafrasees. "Cabello oscuro trenzado" y "trenza única" producen personas diferentes a escala.
  • Coloca el descriptor inmediatamente después del nombre o pronombre del personaje, antes de los verbos de acción; la posición temprana en el prompt tiene más peso.
  • Haz lo mismo para los objetos recurrentes: la linterna, la cartera, el helecho. Los objetos con nombre también tienen frases fijas.
  • Guarda todas las cadenas fijas en un archivo de notas por proyecto. Cuando revises un personaje, revisa el archivo una vez y vuelve a generar.

Mantén una biblia de ubicaciones

Los personajes tienen imágenes de referencia; las ubicaciones tienen detalles nombrados. Una biblia de ubicaciones es una lista corta de características concretas y repetibles por escenario: la cueva de musgo tiene un estrecho pozo de entrada, una piscina poco profunda que refleja el resplandor y grupos de helechos en estantes de roca escalonados. Cada toma ambientada allí reutiliza esos sustantivos textualmente, exactamente como los descriptores de personajes.

Los detalles nombrados superan a las palabras de atmósfera porque sobreviven a la compresión del prompt. "Cueva bioluminiscente" se regenera de manera diferente cada vez; "piscina poco profunda que refleja un resplandor azul-verde bajo estantes de roca escalonados" reconstruye el mismo espacio de manera reconocible. Para las ubicaciones principales, genera una imagen fija de establecimiento por ángulo y úsala como referencia de imagen de la misma manera que usas la hoja de personaje, el mismo mecanismo, aplicado a los escenarios.

[Character name], [frozen descriptor block verbatim],
[action], [location with bible details],
[shot size], [camera move], [lighting],
[reference image attached].
Acepta el ochenta por ciento

Ningún proceso produce personajes idénticos en cada fotograma. Apunta a un ochenta por ciento de consistencia a partir de referencias más descriptores textuales, luego dedica tu esfuerzo a la edición: corta antes de que la desviación sea visible, ordena las tomas para que las coincidencias más débiles se sitúen entre las fuertes y calibra todos los clips hacia un mismo tratamiento de color. Buscar la perfección por generación cuesta más que arreglarlo en postproducción.

Cuando la identidad se desvía de todos modos

  • La cara cambia pero el vestuario se mantiene: la imagen de referencia se recortó demasiado. Vuelve a generar la hoja de cuerpo completo con espacio libre claro y manos visibles.
  • El vestuario cambia a mitad de escena: el bloque descriptor fue parafraseado u omitido. Restaura la cadena textual junto al nombre del personaje.
  • El personaje se ve bien pero la edad cambia de toma a toma: agrega la frase de edad al bloque fijo ("treinta y tantos") en lugar de confiar solo en la referencia.
  • El estilo de iluminación domina la identidad: el contraste de color extremo (verde azulado contra cálido) puede desdibujar los detalles faciales. Suaviza la clave o acorta los tiempos de retención en esas tomas.
  • La ubicación se ve diferente después de un corte: se omitieron los detalles de la biblia. Vuelve a pegar la lista de detalles nombrados en el prompt de la toma que regresa.
  • Casi todo funciona: deja de regenerar. Corta antes, intercala y calibra; la audiencia lee la secuencia, no los fotogramas.

Crea la hoja una vez, congela las cadenas descriptivas, registra tus ubicaciones y luego genera ambas tomas de prueba una al lado de la otra en Studio para verificar la coincidencia antes de producir una escena completa. Los ajustes preestablecidos de cámara cinematográfica en /tools/cinematic-cameras mantienen el lenguaje de movimiento tan disciplinado como el sistema de identidad.

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio