如何使用Kling 3.0制作电影级AI视频
Kling 3.0可将提示词和静态图片转化为多镜头电影级片段,并原生同步音频。本文将介绍如何编写提示词、选择哪个档位以及每项设置的费用。
Kling 3.0是Kling系列中叙事能力最强的版本:它能在一次生成中规划多个镜头,保持角色一致性,并原生输出同步音频——包括对话、环境音和音效——无需后期处理。在ManifoldGen上,它提供两个档位(标准版和专业版),每个档位都支持文生视频和图生视频。本指南将介绍每个档位何时物有所值、如何为多镜头场景编写提示词,以及真正影响输出的设置。
| 路线 | 分辨率 | 时长 | 价格 |
|---|---|---|---|
| Kling 3.0(标准版,文生视频) | 720p | 5秒或10秒 | 每5秒76积分起 |
| Kling 3.0 Pro(文生视频) | 720p · 1080p | 5秒或10秒 | 每5秒101积分起 |
| Kling 3.0图生视频 | 720p | 5秒或10秒 | 每5秒76积分起 |
按任务选择档位,而非按面子
- 标准版是草稿档位。相同的运动引擎,720p分辨率;适用于故事板、镜头列表以及任何你打算重新剪辑的内容。
- 专业版提供1080p输出,并在语音场景下显著提升唇形同步和面部保真度。适用于最终剪辑中保留的镜头。
- 图生视频是身份锁定。当角色必须完全一致时,先生成静态图(任何图像模型均可),然后将其动画化,而不是在文生视频中碰运气。
明确提示多镜头场景
Kling 3.0的标志性技巧是在一个片段中生成多个连贯镜头。它遵循编号镜头结构的能力远胜于散文式提示:
Shot 1: Wide — a lighthouse keeper climbs the iron stairs during a storm,
rain lashing the glass, lamp beam sweeping.
Shot 2: Close-up — her hands grip the railing; breath fogs in cold air.
Shot 3: Medium — she throws the switch; the lamp ignites and holds.
Audio: howling wind, creaking metal, thunder rolls, distant foghorn.三条规则让这变得可靠。给镜头编号,这样模型就不会模糊它们的边界。给每个镜头设定自己的摄影机距离(广角/特写/中景),而不是一个全局的摄影机运动。并且将音频作为单独的一行来指定——Kling 会生成配乐,所以告诉它世界应该听起来是什么样子。
对话和口型同步
对于台词,将话语放在引号内,并归属于它们所在的镜头,保持句子简短:"我们坚持到黎明,"她迎着风说。口型同步的质量与画面中脸部的大小成正比——对话属于特写镜头,而不是广角镜头。如果台词与片段长度冲突,先删减文字,再删减秒数;急促的讲话会显得像伪影。
Kling 3.0 总是渲染自己的配乐。描述声音场景(风、房间氛围、音乐风格)的方式与描述视觉场景相同,否则你会得到通用的氛围音,而不是特定的画面。
故障排除
- 镜头相互融合——你的镜头描述共享了动作。每个镜头一个主体、一个动作、一个摄影机。
- 脸部在镜头间漂移——将该角色切换到图像到视频,使用锁定的静态图像。
- 口型同步失败——让说话者靠近摄影机,并将台词缩短到八个字以内。
- 十秒感觉太拥挤——分成两个五秒的生成,使用不同的摄影机距离,然后剪辑在一起;这看起来像是有意的覆盖。
- 请求了1080p但画面柔和——源提示的细节,而不是放大,决定了感知的清晰度。添加镜头和光照的具体细节。
在 /tools/kling-3 打开工作流用于标准草稿,/tools/kling-3-pro 用于最终版,/tools/kling-3-image 用于需要保留的静态图像——每个的 API 镜像位于 /api/video-generators/kling-3 及类似路径。
Try these prompts on your own shot.
Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.