驾驭扩散:Google Veo 3 提示词工程专家指南
引言:告别默片时代
Google DeepMind 推出的 Veo 3 是一款代表行业顶尖水平的多模态视频生成模型 (1)。其最核心的差异化优势在于能够原生、同步地生成视频与音频。这一突破性能力,被 DeepMind 首席执行官 Demis Hassabis 形容为标志着人工智能视频生成技术正式告别“默片时代” (3)。Veo 3 不仅能生成高达 4K 分辨率的高质量视频,还具备对复杂提示词的深刻理解、卓越的角色一致性维持能力以及电影级别的精细控制功能 (2)。
本报告的核心论点是:精通 Veo 3 的关键并非编写代码,而是学习如何通过精确、描述性和结构化的语言来“指导”一个人工智能模型。在这里,提示词(Prompt)既是剧本,也是分镜表,更是导演给出的全部指令。本指南将全面解析从基础构件到高级叙事技巧的全部内容,旨在为AI赋能的创作者提供一套完整、可行的 Veo 3 提示词工程方法论。
第一部分:精湛 Veo 3 提示词的剖析
本部分将解构一个高效提示词的基本构件,为与模型进行有效沟通建立核心词汇体系。内容综合了官方文档与社区的最佳实践。
1.1 基础结构:从官方核心要素到社区驱动的精细化
官方核心要素(SCAA框架)
根据 Google 在 Vertex AI 和 Gemini API 的官方文档,一个基础提示词应包含四个核心元素:主体(Subject)、情境(Context)、动作(Action)和风格(Style) (7)。这为初学者提供了一个清晰的起点。
- 主体 (Subject): 视频的核心对象,可以是人物、动物、物体或风景。
- 情境 (Context): 主体所处的背景或环境。
- 动作 (Action): 主体正在进行的活动。
- 风格 (Style): 视频的整体美学或类型。
示例: “一只老虎(主体)在丛林中(情境)奔跑(动作),采用电影感(风格)的拍摄手法。”
社区演化的结构(电影化镜头)
然而,实践出真知。在 X(前身为 Twitter)等平台上的资深创作者和电影制作人,已经自发地演化出一种更精细、更贴近电影制作流程的提示词结构 (7)。这种结构通常包含以下部分:
[镜头风格/视角], [主体 + 动作], [环境/场景细节], [光照/氛围], [音频提示], [影片风格]。
这种从官方的简洁框架到社区的复杂结构的演变,揭示了一个深层逻辑。Google 的官方文档旨在为包括非影视背景开发者在内的广大用户提供普适性和清晰度,因此 SCAA 框架是最佳选择。然而,创意专业人士的思维模式是围绕镜头、光影和声音设计展开的,他们的目标是“创作一个场景”,而不仅仅是“生成一个视频”。因此,他们自然地倾向于一种能够映射电影分镜表的提示词结构。最高效的提示词策略是一种混合模式:首先使用 SCAA 框架确保核心概念清晰,然后在其上层叠社区驱动的精细化电影元素。这种趋势甚至可能预示着未来AI视频工具的界面演进方向——从单一的文本输入框,发展为包含“镜头”、“机位移动”、“光照”等独立字段的结构化界面,从而将社区的实践标准正式化。
1.2 指导数字之眼:精通摄影机、构图与光照
Veo 3 对电影制作术语有着深刻的理解,这为创作者提供了直接而强大的控制力 (11)。
-
摄影机移动与视角 (Camera Movement & Perspective):
- 移动:
平移(pan left/right),倾斜(tilt up/down),推轨(dolly in/out),跟踪镜头(tracking shot),摇臂镜头(crane shot),航拍(aerial shot),无人机镜头(drone shot) (4)。 - 视角:
第一人称视角(POV shot),视平线(eye-level),低角度镜头(low-angle shot),高角度镜头(high-angle shot),俯拍(top-down shot),过肩镜头(over-the-shoulder shot) (9)。
- 移动:
-
构图与取景 (Composition & Framing):
- 景别:
建置镜头(establishing shot),远景(wide shot),中景(medium shot),近景(close-up),特写(extreme close-up) (9)。 - 构图元素:
三分法(rule of thirds),引导线(leading lines),负空间(negative space),角色偏离中心构图(character framed off-center) (16)。
- 景别:
-
光照与氛围 (Lighting & Ambiance):
- 关键词:
电影感光照(cinematic lighting),体积光(volumetric lighting),戏剧性阴影(dramatic shadows),柔和自然光(soft natural light),黄金时刻(golden hour),霓虹暮光(neon twilight),暖色调(warm tones),冷色调(blue tones) (10)。
- 关键词:
-
镜头与对焦效果 (Lens & Focus Effects):
- 镜头类型:
鱼眼镜头(fisheye),长焦压缩(telephoto compression),变形镜头光晕(anamorphic flares) (16)。 - 对焦效果:
浅景深(shallow depth of field),焦点转移(rack focus),移轴(tilt-shift),散景效果(bokeh effects) (1)。
- 镜头类型:
1.3 构筑音景:深度解析原生音频与对白提示
集成音频是 Veo 3 的标志性功能,它允许用户在单个提示词中生成音效、环境噪音、音乐和对白 (1)。
-
音频组件提示方法: 为获得最佳效果,建议在提示词中用独立的、清晰的句子明确请求不同的音频层 (17)。
- 音效 (SFX):
音频:洋葱下热锅时独特的滋滋声,音频:茶杯碰撞的清脆声音(1)。 - 环境音 (Ambient Sounds):
音频:森林的声音,远处的城市嗡鸣,咖啡馆里的背景谈话声(7)。 - 音乐 (Music):
音频:由木管乐器演奏的轻快管弦乐,营造好奇而乐观的氛围(7)。
- 音效 (SFX):
-
对白提示方法: 使用正确的语法来为角色分配对白。
- 语法:
角色名:“对白内容。”或戴红帽子的男人说:“兔子在哪里?”(9)。 - 注意事项: 如果不希望生成字幕,应避免在对白中使用引号或括号 (10)。
- 语法:
表1:Veo 3 核心提示词组件及示例
下表整合了官方文档和社区实践,为构建一个完整的 Veo 3 提示词提供了一份全面的速查参考。
第二部分:基础提示词策略
本部分将探讨构成高效视频生成基础的核心技术,从“提示词里写什么”转向“如何有效地写”。
2.1 明确性与细节的力量
基本原则是:模糊的提示词导致平庸或不可预测的结果;而详尽、描述性的提示词则能有效约束模型,产出更连贯、更精确的视频 (7)。
-
模糊 vs. 明确的对比:
- 模糊:
一辆车在行驶(12)。 - 明确:
一辆复古红色敞篷车在日落时分沿着蜿蜒的海岸公路行驶,右边是海洋,左边是悬崖,无人机从后方跟拍(12)。
- 模糊:
背后的原理在于,Veo 3 是一个基于潜在扩散(latent diffusion)的模型 (1),它在庞大的数据集中学习。明确的指令有助于模型在广阔的“潜在空间”中精确定位到最相关的区域,从而生成更符合预期的结果。因此,鼓励使用长而详细的提示词 (10)。
2.2 运用电影化语言:与模型母语对话
Veo 3 经过专门训练,能够理解专业的电影制作术语 (4)。使用这些术语是实现特定视觉效果最直接、最有效的方式。例如,使用
延时摄影 (timelapse) 或 慢动作 (slow motion) (12) 等术语,远比用日常语言描述“让云彩快速移动”要高效得多。
表2:Veo 3 电影术语速查表
这份词汇表旨在帮助创作者将艺术构想转化为模型能够理解的技术语言,弥合创意与执行之间的鸿沟。
2.3 迭代的艺术:系统化地优化生成结果
提示词工程是一个不断测试和优化的迭代过程 (14)。最佳实践是从一个基础提示词开始,每次只对一个变量进行微调 (7)。
-
工作流程:
- 构建一个能成功生成视频的基础提示词 (7)。
- 确定一个需要调整的元素(如光照、摄影机角度)。
- 仅修改提示词中与该元素相关的部分,然后重新生成。
- 比较结果,并重复此过程。
这种系统化的迭代方法背后存在着一个强烈的经济动因。使用 Veo 3 生成视频的成本不菲,例如在 fal.ai 平台上带音频的视频每秒收费 0.75 美元 (22),Google 自家平台也存在高额的积分消耗 (23),用户反馈称代币(tokens)消耗极快 (24)。高昂的生成成本使得“暴力破解”式的随机尝试变得不切实际。因此,每次只改变一个变量的迭代策略 (14) 通过精确分离每个改动带来的影响,最大限度地减少了资源浪费,实现了成本效益的最大化。这种经济压力也催生了对“提示词优化”工具和工作流的需求。用户已经开始普遍使用 ChatGPT 等大型语言模型,将简单的想法扩展成详尽、结构化的提示词,然后再提交给昂贵的 Veo 3 执行 (7)。这个“预计算”步骤是高昂生成成本的直接产物。此外,Google 推出成本更低的“Veo 3 fast”模型 (26),也表明其意识到了这一用户痛点,并提供了一个用于快速原型设计的低成本方案,以便在进行全质量渲染前进行验证。
第三部分:提升叙事与情感深度的高级技巧
本部分将探讨用于创作更复杂、更具情感共鸣和故事驱动性视频片段的精妙方法,从静态场景转向动态表演。
3.1 链接与序列化:指导复杂动作与情感弧线
Veo 3 能够处理单个提示词中的连续指令,通常被称为“先这样,再那样”的逻辑 (27)。这使得在单个片段中创造微型叙事成为可能。
-
技巧:链接情感 (Chaining Emotions): 指导角色经历一系列情感状态。
- 示例:
他仰头放声大笑,身体摇晃。笑声中,他突然停下,双眼因恐惧而睁大,面部表情凝固。(27)。
- 示例:
-
技巧:链接动作/姿态 (Chaining Actions/Gestures): 精心编排一系列身体动作。
- 示例:
他转身背对镜头开始走开。走了几步后。停下。回头瞥了一眼,仿佛在犹豫是否要返回。(27)。
- 示例:
-
技巧:定义起点和终点 (Defining Start and Stop Points): 通过明确指定一个清晰的开始和结束状态来制造戏剧张力。
- 示例:
开始时很平静。然后突然面露狰狞,向前猛冲。一秒后,他又恢复了镇定。整理了一下夹克。像什么都没发生一样微笑。(27)。
- 示例:
3.2 控制表演:高级对白、口型同步与语调
得益于与 Gemini 模型的整合,Veo 3 能够理解语调等细微差别 (17),创作者的描述可以影响角色的表演。
-
技巧:指定语调 (Specifying Tone): 使用副词和描述性短语来引导声音的表达方式。
- 示例:
獾紧张地结结巴巴地说(17)。 - 示例:
使用优美的英式口音,发音清晰,语气严肃而紧迫。(28)。
- 示例:
-
口型同步能力与挑战: Veo 3 提供了令人印象深刻的口型同步功能 (2),但用户也报告了一些问题,例如轻微的延迟 (31) 以及在多角色场景中对白归属错误 (7)。
当一个提示词包含多个角色的对白时,模型在正确地将 [对白A] 映射到 [角色A] 并将 映射到 的能力上会出现下降,导致角色口型错误或对白被镜头外的人说出 (7)。这是一个极其复杂的关联任务。社区发现了一个实用的变通方法:为AI简化问题。通过将每个视频片段限制为单个发言人,归属任务变得简单,从而大大提高了成功率。这个限制催生了一种特定的AI电影制作风格。创作者不得不放弃包含多个互动角色的“主镜头”(master shot),转而采用“正反打镜头”(shot/reverse shot)的剪辑技巧——为每个发言人生成独立的视频片段,然后在后期制作中将它们剪辑在一起。这使得 Final Cut 或 Capcut 等视频编辑软件 (7) 成为任何使用 Veo 3 进行叙事创作流程中不可或缺的一环。
3.3 导演的策略:运用模糊指令实现自然感
虽然明确性是控制的关键,但过度微观的管理可能导致表演僵硬、不自然。有时,故意使用更开放、更侧重情感的提示词,能让模型“即兴发挥”,从而产生更自然的效果 (27)。
-
技巧: 描述角色的内心状态或目标,而不是其精确的身体动作。
- 示例: 与其指令“左眉上扬15度,嘴唇收紧”,不如尝试
眯起眼睛。头微微倾斜,仿佛在试图理解一个难题。(27)。这为模型提供了一个目标,让它能生成与之匹配的、看起来更自然的表演。
- 示例: 与其指令“左眉上扬15度,嘴唇收紧”,不如尝试
这里存在一个“提示词悖论”:对控制的明确性需求与对创意解释的需求之间存在着直接的张力。高度明确的提示词如同给演员逐行写死的动作指令,结果精确但可能缺乏生命力。而模糊的情感提示词则像给演员提供角色动机,结果更不可预测,但可能感觉更真实。专家级的提示词工程师不会二选一,而是学会将两者融合。一个精湛的提示词可能会对摄影机和光照使用高度明确的指令(一个低角度镜头,温暖的灯光),但对角色的表演则采用模糊的指导(在一张古老而庞大的地图上仔细研究)。这表明,“提示词工程”正在演变为一门新的创作学科,它是编剧、摄影和方法派表演指导的混合体。成功与否,取决于能否将AI理解为一个需要引导的创意伙伴,而非一个等待命令的机器。
第四部分:掌握视觉一致性与控制力
本部分将直面用户遇到的最重大挑战,并为在多镜头项目中实现更强的输出控制提供可行的解决方案。
4.1 图生视频:锚定风格与建立视觉起点
Veo 3 支持输入图像来指导视频生成,这可以作为风格参考或动画的起始帧 (2)。这是影响最终输出的关键方法之一。其工作流程是提供一张图像,并附上描述期望动作的文本提示词 (17)。例如,提供一个特定角色的图像,并提示
该角色自然地四处走动。然而,需要注意的是,社区有报告称在某些界面中,图生视频功能目前仅支持 Veo 2,而不支持 Veo 3 (32),这可能是平台或版本的暂时性限制。
4.2 角色一致性挑战:策略与变通方案
在多个独立生成的视频片段中保持角色视觉身份(面部、服装、比例)的一致性,是包括 Veo 3 在内的所有AI视频模型面临的主要障碍 (24)。
-
官方解决方案 - 参考驱动生成: Veo 3 官方宣称支持使用参考图像来确保角色在不同场景中保持视觉一致 (2)。这是预设的解决方案。
-
社区变通方案:
- 超详细描述: 在每个提示词中都使用极其详细且一致的角色描述。这种方法取得了一定的成功,但并不可靠 (34)。
- 锁定种子 (Seed Locking): 在改变提示词其他部分的同时,为每次生成使用相同的
seed(种子)数值。这能确保初始噪声完全相同,从而有助于保持一致性 (32)。 - 命名ID: 一位高级用户报告称,Veo 3 具备将描述命名为ID(例如 ``)并重复使用的能力,这暗示了一个强大但可能未被官方文档记录的功能 (35)。
尽管官方提供了功能,但实现稳健的角色一致性仍然是一个重大挑战 (24)。社区中讨论的最可靠的解决方案,往往涉及一个包含多种AI工具的组合工作流 (37)。Veo 3 内部的参考系统尚不完美,一个“戴红帽子的男人”的提示词在不同片段中可能生成略有差异的男人或帽子。为了解决这个问题,创作者们正在将“角色定义”这一步骤外部化。
一个典型的多工具工作流如下:
- 第一步(角色创建): 使用专门的图像模型,如 Imagen 4 或第三方工具(如 Freepik 的 Flux Kontext),生成一份“角色设定集”——包含同一角色在不同角度下的多张图像 (37)。这些图像模型在维持静态图像一致性方面通常表现更佳。
- 第二步(视频生成): 将这些一致的角色图像导入 Veo 3 的图生视频功能中 (37)。
- 第三步(合成): 为了实现终极控制,一些用户会分别生成角色和背景,然后使用传统的视频编辑软件进行合成 (38)。
这一现象标志着一个“生成式AI制作管线”的出现。单一、全能工具的时代尚未到来。取而代之的是,一种新的技能组合变得至关重要:整合和“堆叠”多个专业AI工具(图像生成、视频生成、音频克隆、视频编辑)以达到专业级效果的能力。
4.3 负向提示词:通过排除法雕塑场景
大多数 Veo 3 界面都提供一个 negative_prompt(负向提示词)字段,用于指定不希望模型生成的内容 (8)。
-
黄金法则: 不要使用“不”或“不要”等指令性语言(例如,“不要墙壁”)。模型不理解否定概念。正确的做法是,通过列出关键词来描述不希望看到的内容(例如,
墙壁, 画框) (9)。 -
实际应用 - 移除字幕: 用户普遍抱怨的一个问题是,尤其是在包含对白时,模型会不请自来地生成字幕 (20)。解决方案就是使用负向提示词。
- 示例:
无字幕,无标题,无屏幕文字,文本叠加(17)。
- 示例:
表3:常见提示词问题排查指南
本表旨在为用户提供一个快速、可行的指南,以克服在使用 Veo 3 时最常遇到的问题。
第五部分:Veo 3 制作工作流与生态系统
本部分将提示词工程置于更广阔的实践背景下,概述如何将 Veo 3 从头到尾地整合进一个创意或开发流程中。
5.1 从概念到分镜表:构建多片段叙事
成功的创作者们采用的工作流程,其起点并非 Veo 3 本身,而是剧本和分镜表 (7)。一个高效的流程是利用像 Gemini 或 ChatGPT 这样的文本模型,将一个基本想法或剧本扩展成一系列详细、结构化的 Veo 3 提示词,每个提示词对应一个镜头 (7)。这相当于将撰写冗长描述性提示词的繁重任务外包给了另一个AI。此外,在 Google Flow 等工具中,可以使用“扩展”(Extend)功能来生成前一个片段的续集,这有助于保持叙事连贯性 (7)。
5.2 参数调优:技术的控制杠杆
除了文本提示词,API 和某些用户界面还提供了一些技术参数,用以影响输出结果 (8)。
-
关键参数:
aspect_ratio:16:9(横向)或9:16(纵向)。注意,Veo 3 的预览版可能不支持 9:16 (40)。seed_number: 一个介于 0 和 4294967295 之间的数字,用于实现确定性生成。使用相同的种子和提示词会产生相同的视频 (40)。durationSeconds: 视频时长,单次生成通常在 5 到 8 秒之间 (8)。person_safety_setting: 控制是否允许生成人物(allow_adult,disallow) (8)。
seed(种子)参数不仅仅是让视频生成变得确定 (40),它更是受控迭代的关键工具。在一个随机种子的世界里,即使提示词完全相同,每次生成的结果也会不同,这使得对提示词微小改动的 A/B 测试变得不可能。通过固定
seed 值,用户锁定了模型的初始随机状态。此时,如果用户在提示词中只改变一个词(例如,从“暖色光”变为“冷色光”),那么输出视频中的任何差异都可以直接归因于这个词的改变。这使得 seed 从一个简单的技术参数,转变为创意过程中至关重要的科学控制变量。它实现了系统化、可预测的迭代,考虑到高昂的生成成本,这是一种极其宝贵的专家级技术。
5.3 驾驭 Veo 3 生态系统:选择你的平台
Veo 3 并非单一产品,而是一个可以通过多个平台访问的模型,每个平台都有不同的功能、定价和目标用户。
- Google Flow: 主要的创意界面,专为电影制作者设计。它整合了 Veo 3、Imagen 4 和 Gemini,通过 Google AI Ultra 订阅计划访问 (1)。
- Vertex AI: Google Cloud 的企业级平台,面向开发者。它提供 API 访问,允许对参数进行更精细的控制,并能集成到定制化应用中 (18)。
- Gemini API: 一个以开发者为中心的 API,用于将 Veo 模型集成到应用程序中 (8)。
- 第三方 API (如 fal.ai): 提供更便捷的 Veo 3 API 访问的服务,通常采用不同的定价模型(如按秒计费) (16)。
平台的选择是一个至关重要的第一步,因为它定义了整个创意和技术工作流。一个在 Google Flow (2) 上的创意用户将能使用视觉时间线和场景构建器 (27) 等用户友好功能,这鼓励了一种叙事优先的方法。而一个使用 Vertex AI API (18) 的开发者则可以编程访问
seed 和 person_safety_setting 等参数,从而实现自动化、大规模或高度定制化的生成工作流。一个在 fal.ai (22) 等第三方平台上的用户,其主要动机可能是成本,采用按需付费模式来处理零星的项目。因此,理解这个生态系统对于任何严肃的实践者来说都是必不可少的。
结论:模拟叙事的黎明
本指南全面解析了驾驭 Google Veo 3 的提示词工程技术。核心策略可总结为:采用官方与社区结合的混合式提示词结构;熟练运用电影化语言进行直接控制;遵循“单人发言”原则以确保对白可靠性;通过多工具工作流解决角色一致性难题;以及利用种子锁定进行成本可控的系统化迭代。
尽管当前模型仍存在时长较短、一致性挑战和成本较高等局限性 (4),但其发展速度惊人。可以预见,未来的版本将集成视频内编辑(“inpainting”)和完善的角色锁定等功能 (24)。
最终,Veo 3 标志着一个从“视频生成”到“叙事模拟”(storytelling simulation)的范式转变 (38)。提示词工程师不再仅仅是用户,而是导演。他们掌握这种全新创意指令语言的能力,将定义下一个数字媒体时代。