如何使用 Veo 3.1 生成带声音的逼真视频
Google 的 Veo 3.1 是逼真度的标杆:物理真实、原生对话、4/6/8 秒片段并同步音频。Fast 模式适合草稿,90 积分起;Standard 模式适合成片。
Veo 3.1 是当片段必须看起来像拍摄而非生成时的首选模型:真实世界的物理、可信的皮肤和水,以及业界最佳的原生对话。在 ManifoldGen 上,它以图生视频方式运行,分为两个层级——Fast 用于迭代,Standard 用于成片——两者都支持同步声音。
| 路线 | 分辨率 | 时长 | 价格 |
|---|---|---|---|
| Veo 3.1 Fast(图像) | 720p · 1080p | 4 · 6 · 8s | 90 积分起 / 5秒 |
| Veo 3.1 Standard(图像) | 720p · 1080p | 4 · 6 · 8s | 240 积分起 / 5秒 |
始终从静帧开始
ManifoldGen 的两条路线都是图生视频,这本来就是正确的工作流。Veo 严格遵循构图,所以静帧免费提供了选角、取景和灯光方向——然后视频提示只需描述运动和声音。用任何图像模型生成你的帧,挑选你本来会拍摄的镜头,然后让它动起来。
像导演一样写动作,而不是写说明文字
The chef turns from the window, wipes her hands on her apron,
and looks back at the rain. Camera holds static; depth of field
stays on her hands. Rain streaks the glass; kitchen ambience,
distant radio, one low thunder roll.- 每个分句一个主体动作——"转身"、"擦拭"、"注视"是Veo会忠实编排的三个节拍。
- 明确说明镜头——"固定"、"缓慢推进"。沉默会导致漂移。
- 指出不应移动的部分——"景深保持在她的手上"比期望更能锁定焦点。
- 配乐——环境音、一段音乐提示或天气层。未指定的音频默认为室内环境声。
对白要自然
Veo渲染语音时具有唇形同步,如果你指定口音,甚至可以控制口音。台词保持在十二个词以内,用引号括起来,并注明说话者:他说,"把门锁上。"面部在中近景或更紧的景别中表现最佳;远景中的对白会浪费该功能。
提示结构在各层级之间一对一转移。在Fast上以每次90积分锁定运动和时长,然后仅在Standard上对入选的镜头重新运行相同的请求。
选择时长
四秒适合插入镜头和社交媒体循环;六秒处理完整的动作节拍;八秒适合一句对白加一个反应。如果场景需要更多,生成两个八秒的镜头,并匹配静帧(相同角色画面,不同机位)进行剪辑——Veo在剪辑间保持身份一致性的能力远强于单次长生成。
故障排除
- 物理效果展示——水、布料和火是Veo的强项,但它们需要空间。紧凑的取景会迫使走捷径;加宽镜头而不是减慢运动。
- 主体忽略源图像——你的提示重新描述了外观。去掉关于人物的形容词;只保留运动和音频。
- 对白听起来像配音——缩短台词并标记表达方式("轻声"、"肩后")。
- 八秒在中间部分松弛——添加一个持续的环境从句(雨继续下,人群低语持续)来支撑中间节拍。
在/tools/veo-3-1-fast运行草稿,在/tools/veo-3-1运行最终版;自动化在/api/video-generators/veo-3-1-fast和/api/video-generators/veo-3-1实时镜像。
Try these prompts on your own shot.
Every example on this page was generated with ManifoldGen. Open the Studio and run the same structure on your idea.