GUIDES · July 27, 2026 · 9 MIN READ

如何在AI镜头中保持角色和地点的一致性

AI镜头间的一致性是个记忆问题:构建一张角色表,每次拍摄都作为参考传入,逐字重复描述词,其余在剪辑中修正。

每个叙事性AI视频都会遇到同样的难题:第一个镜头给你一个完美的角色,到第四个镜头时,她的脸、夹克和发际线都变了。视频模型在生成之间没有记忆。一致性不是靠要求得来的——而是你围绕模型构建的一个系统:一张参考图、一个固定的描述块,以及一次吸收最后百分之二十的剪辑流程。

本指南将构建这个系统。示例是一位野外植物学家,她出现在两个地点——一个生物荧光苔藓洞穴和一条丛林小径——由同一张角色表生成。你需要一个图像模型来生成参考表,以及一个支持图像参考的视频工具,例如 /studio。

参考表就是你的记忆

在生成任何素材之前,先将角色设计为一张全身静态图。这张单一图像会在后续每个镜头中作为参考传入,这比任何提示词形容词都能更好地锚定身份。像写选角通告一样编写角色表提示词:服装、发型、配饰、姿势、背景。

Full-body character design of a woman in her thirties,
a field botanist: olive field jacket with rolled sleeves,
round glasses, dark hair in a single braid, canvas satchel,
standing relaxed pose facing camera, neutral light-grey
studio background, soft even lighting, consistent character
reference sheet look.

角色表本身有三条规则。中性灰色摄影棚背景,避免环境渗入参考。平坦均匀的光线,让视频模型读取形状而非情绪。放松的站立姿势面向镜头,因为极端姿势会污染后续所有生成。生成两到三个候选,在继续之前选定一个;切勿在项目中途更换角色表。

一个参考,两个地点

ONE REFERENCE, TWO LOCATIONS

INPUT

Character sheet passed as reference
Character sheet passed as reference

PROMPT

The botanist kneels in a bioluminescent moss cave at night, lifting a glowing fern leaf toward her lantern, awe on her face, medium shot, cool teal glow against warm lantern light, gentle handheld drift.

OUTPUT — GENERATED WITH MANIFOLDGEN

镜头1——苔藓洞穴 · 4s

镜头2——丛林小径 · 4s

两个镜头都附加同一张角色表作为图像参考,而提示词只改变地点、动作和光线。镜头2提示词:“植物学家穿过阳光明媚的丛林小径,一只手拨开树叶,正面跟拍,步行速度,斑驳的绿色光线,纪实风格,与参考相同的角色。”身份得以保持,因为它来自图像而非文本。

注意镜头之间哪些变了,哪些没变。地点、动作、运镜和光线在每个镜头中都是新的。服装、眼镜、辫子和挎包没有出现在任何一个镜头提示词中——它们由参考图像承载。这种分工就是整个技巧:图像负责身份,提示词负责场景调度。

逐字重复描述词

参考图像完成了大部分工作,但文本仍然会渗入。当角色必须用文字描述时——比如特写镜头中角色表裁剪不佳,或模型不支持参考——每次都复制完全相同的短语块:

  • 为每个角色构建一个规范描述字符串(“三十多岁的女性,橄榄色田野夹克,袖子卷起,圆框眼镜,深色头发扎成单辫,帆布挎包”),并原封不动地粘贴到每个提到她的提示词中。
  • 切勿改写。“深色辫子”和“单辫”会产生不同的人。
  • 将描述词紧跟在角色名或代词之后,放在动作动词之前——提示词中靠前的位置权重更高。
  • 对重复出现的道具也这样做:灯笼、挎包、蕨类植物。命名道具同样使用固定短语。
  • 将每个项目的所有固定字符串存储在一个笔记文件中。修改角色时,只需修改一次文件并重新生成。

维护地点圣经

角色有参考图,地点有命名细节。地点圣经是每个场景中具体、可重复特征的简短列表:苔藓洞穴有狭窄的入口通道、反射光线的浅水池,以及层叠岩石架上的蕨类植物丛。每个在该场景拍摄的镜头都逐字复用这些名词,就像角色描述词一样。

命名细节优于氛围词汇,因为它们在提示词压缩中更持久。“生物发光洞穴”每次生成都会不同;而“层叠岩石架下反射蓝绿色光芒的浅水池”则能重建出可识别的相同空间。对于主要地点,为每个角度生成一张定场图,并像使用角色表一样将其用作图像参考——同样的机制,应用于场景。

[Character name], [frozen descriptor block verbatim],
[action], [location with bible details],
[shot size], [camera move], [lighting],
[reference image attached].
接受百分之八十

没有任何流程能在每一帧都生成完全一致的角色。目标是通过参考图和逐字描述词实现百分之八十的一致性,然后将精力花在剪辑上:在漂移变得明显之前切换镜头,将较弱的匹配镜头放在较强的镜头之间,并将所有片段统一到一种调色方案。追求每次生成的完美比在后期修复成本更高。

当身份仍然漂移时

  • 面部变化但服装保持——参考图裁剪过紧。重新生成全身图,留出清晰头部空间并露出双手。
  • 服装在场景中途变化——描述词块被改写或省略。在角色名旁恢复逐字字符串。
  • 角色看起来正确但年龄逐镜头变化——在固定块中添加年龄短语(如“三十多岁”),而不是仅依赖参考图。
  • 灯光风格压过身份——极端色彩对比(如青色对暖色)会冲淡面部细节。柔化主光或缩短这些镜头的保持时间。
  • 切出后地点看起来不同——地点圣经细节被丢弃。将命名细节列表重新粘贴到返回镜头的提示词中。
  • 一切几乎都正常——停止重新生成。提前剪切、交叉剪辑并调色;观众阅读的是序列,而不是单帧。

一次性构建角色表,冻结描述词字符串,记录地点,然后在Studio中并排生成两个测试镜头以检查匹配度,再制作完整场景。/tools/cinematic-cameras中的电影级摄像机预设能让运动语言与身份系统一样严谨。

Try these prompts on your own shot.

Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.

Open Studio