GUIDES · July 27, 2026 · 9 MIN READ

Comment maintenir la cohérence des personnages et des lieux dans les plans d'IA

La cohérence entre les prises de vue IA est un problème de mémoire : créez une fiche de personnage, utilisez-la comme référence pour chaque prise, répétez les descripteurs mot pour mot, et corrigez le reste au montage.

Chaque vidéo narrative IA se heurte au même mur : la première prise vous donne un personnage parfait, et à la quatrième prise, elle a un visage, une veste et une ligne de cheveux différents. Les modèles vidéo n'ont aucune mémoire entre les générations. La cohérence n'est pas quelque chose que vous demandez — c'est un système que vous construisez autour du modèle : une image de référence, un bloc de descripteurs figé, et une passe de montage qui absorbe les vingt derniers pour cent.

Ce guide construit ce système. L'exemple courant est une botaniste de terrain qui apparaît dans deux lieux — une grotte de mousse bioluminescente et un sentier de jungle — générés à partir de la même fiche de personnage. Vous avez besoin d'un modèle d'image pour la fiche de référence et d'un outil vidéo qui accepte les références d'image, tel que /studio.

La fiche de référence est votre mémoire

Avant de générer des séquences, concevez le personnage une fois comme une image fixe en pied. Cette image unique est utilisée comme référence pour chaque prise suivante, ce qui ancre l'identité bien mieux que n'importe quel adjectif de prompt. Rédigez le prompt de la fiche comme un appel de casting : garde-robe, cheveux, accessoires, pose, arrière-plan.

Full-body character design of a woman in her thirties,
a field botanist: olive field jacket with rolled sleeves,
round glasses, dark hair in a single braid, canvas satchel,
standing relaxed pose facing camera, neutral light-grey
studio background, soft even lighting, consistent character
reference sheet look.

Trois règles pour la fiche elle-même. Un fond de studio gris neutre pour qu'aucun environnement ne se mélange à la référence. Un éclairage plat et uniforme pour que le modèle vidéo lise la forme, pas l'ambiance. Une pose debout détendue face à la caméra, car les poses extrêmes contaminent chaque génération en aval. Générez deux ou trois candidats et choisissez-en un avant de continuer ; ne changez jamais de fiche en cours de projet.

Une référence, deux lieux

ONE REFERENCE, TWO LOCATIONS

INPUT

Character sheet passed as reference
Character sheet passed as reference

PROMPT

The botanist kneels in a bioluminescent moss cave at night, lifting a glowing fern leaf toward her lantern, awe on her face, medium shot, cool teal glow against warm lantern light, gentle handheld drift.

OUTPUT — GENERATED WITH MANIFOLDGEN

Prise 1 — grotte de mousse · 4s

Prise 2 — sentier de jungle · 4s

Les deux prises utilisent la même fiche de personnage comme référence d'image tandis que les prompts ne changent que le lieu, l'action et la lumière. Prompt de la prise 2 : "La botaniste se fraye un chemin sur un sentier de jungle ensoleillé, écartant les feuilles d'une main, plan de suivi de face à un rythme de marche, lumière verte tachetée, réalisme documentaire, même personnage que la référence." L'identité est maintenue car elle provient de l'image, pas du texte.

Remarquez ce qui a changé entre les prises et ce qui n'a pas changé. Le lieu, l'action, le mouvement de caméra et l'éclairage sont tous nouveaux pour chaque prise. La garde-robe, les lunettes, la tresse et la sacoche n'apparaissent nulle part dans les prompts des prises — ils proviennent de l'image de référence. Cette division du travail est toute la technique : l'image possède l'identité, le prompt possède la mise en scène.

Répétez les descripteurs mot pour mot

La référence fait la majeure partie du travail, mais le texte s'infiltre toujours. Lorsqu'un personnage doit être décrit en prose — gros plans où la fiche est mal recadrée, ou modèles sans support de référence — copiez le bloc de phrase exact à chaque fois :

  • Construisez une chaîne de descripteurs canonique par personnage ("femme d'une trentaine d'années, veste de terrain olive avec manches retroussées, lunettes rondes, cheveux foncés en une seule tresse, sacoche en toile") et collez-la sans modification dans chaque prompt qui la nomme.
  • Ne paraphrasez jamais. "Cheveux tressés foncés" et "tresse unique" produisent des personnes différentes à grande échelle.
  • Placez le descripteur immédiatement après le nom du personnage ou le pronom, avant les verbes d'action — une position précoce dans le prompt a plus de poids.
  • Faites de même pour les accessoires récurrents : la lanterne, la sacoche, la fougère. Les accessoires nommés ont aussi des phrases figées.
  • Stockez toutes les chaînes figées dans un fichier de notes par projet. Lorsque vous révisez un personnage, révisez le fichier une fois et régénérez.

Tenez un registre des lieux

Les personnages ont des images de référence ; les lieux ont des détails nommés. Un registre des lieux est une courte liste de caractéristiques concrètes et reproductibles par décor : la grotte moussue a un étroit puits d'entrée, une piscine peu profonde reflétant la lueur, et des touffes de fougères sur des étagères rocheuses étagées. Chaque plan qui s'y déroule réutilise ces noms au mot près, exactement comme les descripteurs de personnages.

Les détails nommés l'emportent sur les mots d'ambiance car ils survivent à la compression du prompt. Une "grotte bioluminescente" se régénère différemment à chaque fois ; une "piscine peu profonde reflétant une lueur bleu-vert sous des étagères rocheuses étagées" reconstitue un espace reconnaissable. Pour les lieux emblématiques, générez une image d'établissement par angle et utilisez-la comme référence d'image de la même manière que vous utilisez la fiche de personnage — même mécanisme, appliqué aux décors.

[Character name], [frozen descriptor block verbatim],
[action], [location with bible details],
[shot size], [camera move], [lighting],
[reference image attached].
Acceptez quatre-vingts pour cent

Aucun pipeline ne produit des personnages identiques sur chaque image. Visez une cohérence de quatre-vingts pour cent à partir des références et des descripteurs textuels, puis concentrez vos efforts sur le montage : coupez avant que la dérive ne devienne visible, ordonnez les plans de manière à ce que les correspondances plus faibles se situent entre les plus fortes, et étalonnez tous les clips vers un traitement de couleur unique. Poursuivre la perfection par génération coûte plus cher que de corriger en post-production.

Quand l'identité dérive quand même

  • Le visage change mais la garde-robe tient — l'image de référence était trop recadrée. Régénérez la fiche en corps entier avec une marge de tête claire et les mains visibles.
  • La garde-robe change en pleine scène — le bloc descripteur a été paraphrasé ou omis. Restaurez la chaîne textuelle à côté du nom du personnage.
  • Le personnage semble correct mais l'âge varie d'un plan à l'autre — ajoutez la phrase d'âge au bloc figé ("dans la trentaine") plutôt que de vous fier uniquement à la référence.
  • Le style d'éclairage l'emporte sur l'identité — un contraste de couleurs extrême (bleu-vert contre chaud) peut effacer les détails du visage. Adoucissez la lumière clé ou réduisez les temps de maintien sur ces plans.
  • Le lieu semble différent après une coupe — les détails du registre ont été omis. Recopiez la liste des détails nommés dans le prompt du plan de retour.
  • Tout fonctionne presque — arrêtez de régénérer. Coupez plus tôt, intercalez et étalonnez ; le public lit la séquence, pas les images.

Construisez la fiche une fois, figez les chaînes de descripteurs, enregistrez vos lieux, puis générez les deux plans de test côte à côte dans Studio pour vérifier la correspondance avant de produire une scène complète. Les préréglages de caméra cinématique dans /tools/cinematic-cameras maintiennent le langage de mouvement aussi discipliné que le système d'identité.

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio