元峰AI笔记 · AI绘画与视频

🎬 成片效果预览

<titleAI做视频|茅台MV实战全流程</title

AI做视频|茅台MV实战全流程

本文目标:通过一个完整的 MV 创作案例,让学员清晰了解 AI 视频制作的整体思路、工具链选择、关键问题的解决方式,以及人在整个过程中不可替代的核心作用。


🎬 成片效果预览

  • 视频名称:《赤水剑魂》
  • 主题:以茅台酒为背景,融合中国古代人物的摇滚 MV
  • 风格:国潮摇滚 + 男女对唱 + 快节奏 Rap
  • 时长:约 90 秒
  • AI 占比:约 90%(创作、生图、音乐、视频),人工占比约 10%(判断、剪辑、创意决策)
  • 制作周期:断断续续 3~4 天(周日全天 + 周一通宵到凌晨 3 点)

图片展示的是《赤水剑魂》MV的宣传图。画面中,五位身着古装的演员在舞台上表演,中间的男性演员穿着白色长袍,手持乐器,做出比心手势;两侧的女性演员分别穿着粉色和红色古装,手持乐器;两侧的男性演员分别穿着深色古装,手持乐器。背景灯光效果绚丽,舞台上有鼓等乐器。图片下方有“赤水剑魂”四个大字。该图与文档中介绍的《赤水剑魂》MV主题、风格等内容相呼应,体现了视频的国潮摇滚风格。

图片展示的是《赤水剑魂》MV的宣传图。画面中,一位身着白色长袍、手持长剑的男子和一位身着黑色长袍、手持古琴的男子在舞台上表演,背景有红色和蓝色灯光,舞台上方有金色的飞舞纸屑。画面下方大字“赤水剑魂”以金色呈现。该图与文档中“视频名称”“主题”“风格”等信息相呼应,直观呈现了视频的视觉风格和主题。

图片展示的是《赤水剑魂》MV中的一幕,画面中一位身着白色古装的男子侧身站立,手持麦克风,闭目沉浸在演唱中。他头戴黑色长辫,背景是舞台灯光效果,有蓝色、紫色的光斑点缀,营造出梦幻氛围。画面左下角有“赤水剑魂”字样。该图片与文档中AI做视频的茅台MV实战全流程上下文相关,是MV中呈现的场景之一,体现了视频的国潮摇滚风格。

图片展示的是《赤水剑魂》MV中的一幕场景。画面中一位身着白色长袍、长发束于脑后的女性,手持麦克风,正激情演唱。背景是红色灯光和大量飞舞的金色纸屑,两侧有熊熊燃烧的火焰,营造出热烈的氛围。画面右下角有“赤水剑魂”的字样。该图片与文档中对《赤水剑魂》MV的描述相契合,体现了视频中充满动感与国潮摇滚风格的场景。

图片展示的是《赤水剑魂》MV中的一幕。画面中一位身着白色古装的男子正在弹奏古筝,神情专注。背景为舞台布景,左侧有古风装饰,右侧灯光效果绚丽,营造出浓厚的国潮氛围。画面右上角有“赤水剑魂”字样。该图片与文档中“视频名称”“主题”“风格”等信息相呼应,直观呈现了视频中的人物形象及场景风格,体现了国潮摇滚+男女对唱+快节奏Rap的风格特点。

图片展示了一位身着古装的女性,背景为紫色烟雾效果。她头戴精致发饰,身着粉色古装,胸前有红色装饰,面带微笑。右上角有“赤水剑魂”字样。该图片与文档中“《赤水剑魂》”视频主题相关,可能是视频中的人物形象,体现了视频的国潮摇滚风格。

图片展示的是《赤水剑魂》MV中的一幕,画面中一位身着粉色古装、头戴金色发饰的女性正在打鼓,背景为紫色烟雾,右侧有“赤水剑魂”字样。该图片与文档中AI做视频的茅台MV实战全流程背景相关,是视频中呈现的场景之一,体现了视频的国潮摇滚风格,与文档中提到的以茅台酒为背景、融合中国古代人物的摇滚MV主题相契合。

图片展示的是《赤水剑魂》MV中的一个场景。画面中,一位长发人物正专注地敲打鼓组,背景为红色烟雾和白色光束,营造出一种激昂的氛围。左上角有“赤水剑魂”四个金色大字。该图片与文档中“视频名称”“主题”“风格”等信息相呼应,直观呈现了视频中融合中国古代人物的摇滚风格,体现了视频的视觉特色。

图片展示的是《赤水剑魂》MV中的一幕。画面中,一位身着传统服饰的男子跪坐在舞台上,手持茅台酒瓶,旁边放置着一把装饰有闪电图案的琵琶。背景为蓝色调,有闪电效果,营造出一种神秘氛围。画面右下角有“赤水剑魂”的字样。该图片与文档中对《赤水剑魂》MV的描述相契合,体现了视频中融合茅台酒背景与国潮摇滚风格的元素。

图片展示的是《赤水剑魂》MV中的一幕。画面中一位男子身着传统服饰,弹奏着一种类似琵琶的乐器,神情专注。背景为蓝色调,带有闪电效果,营造出一种激昂的氛围。画面右下角有“赤水剑魂”的字样。该图片与文档中对《赤水剑魂》MV的描述相契合,体现了视频中融合国潮摇滚风格的视觉元素。

图片展示的是MV《赤水剑魂》中的场景,一位身着古装、外搭护肩的男子正在舞台上弹奏电贝斯。他双眉紧锁,神情专注,身后是聚集的人群和闪烁的舞台灯光。“赤水剑魂”的金色字体置于画面左上方。此图与上文对《赤水剑魂》这一以茅台酒为背景的国潮摇滚MV的介绍相关,直观呈现了MV中融合古代人物与摇滚元素的风格。

图片展示的是《赤水剑魂》MV中的一幕。画面中一位长发男子身着黑色古装,手持电吉他,激情演奏,头发随音乐飞舞。舞台背景有红色激光和烟雾效果,营造出热烈的氛围。画面左下角有“赤水剑魂”字样。该图片与文档中“视频名称”“主题”“风格”等信息相呼应,直观呈现了视频中融合中国古代人物的摇滚风格。

图片展示的是《赤水剑魂》MV中的一位女性角色。她身着华丽的红色古装,头戴金色发饰,面带微笑,正对着麦克风。背景模糊,隐约可见观众和舞台灯光,营造出演唱会现场氛围。图片位于介绍该MV创作流程的文档中,与上下文提到的“以茅台酒为背景,融合中国古代人物的摇滚MV”相呼应,体现了视频中的人物形象与主题风格。

图片展示的是《赤水剑魂》MV中的一幕场景。画面中一位身着华丽红色古装的女性站在麦克风前,头戴金色发饰,背景为昏暗的舞台,灯光从上方照射下来,营造出庄重氛围。舞台两侧有观众席,观众们身着不同颜色的服装,有的鼓掌,有的专注观看。图片与文档中介绍的视频主题、风格等信息相契合,体现了视频中融合中国古代人物的国潮摇滚风格。


🛠️ 工具链总览

Gemini 3.0 Pro → Suno AI V5 → Nano Banana Pro → 可灵 AI → 剪映
  (总导演)         (音乐生成)    (图片生成)        (图转视频)  (最终剪辑)

图片展示了AI做视频《赤水剑魂》的制作工作流拆解,背景为红色和白色。画面左侧有“必火AI”标识。右侧以红色大字呈现“工作流拆解”,下方列出了参与工作的AI工具名称,包括Gemini 3.0 Pro、Nano Banana Pro、Suno AI V5、可灵AI、剪映。该图片与文档中“工具链总览”部分对应,直观呈现了视频制作过程中所用的AI工具及其角色和核心用途。

工具角色核心用途
Gemini 3.0 Pro总导演 / 大脑创意构思、歌词、分镜脚本、提示词生成
Suno AI V5音乐制作人根据歌词和风格描述生成完整音乐
Nano Banana Pro首席画师生成所有分镜图、角色图(Lovart / Flowith)
可灵 AI摄影/导演静态图片转动态视频、数字人对口型
剪映剪辑师素材拼接、特效添加、字幕制作

第一步:Gemini 3.0 Pro —— AI 总导演

图片展示了Gemini 3.0 Pro担任总导演的示例。画面以红色背景呈现“Gemini 3.0 Pro 总导演”标题,下方有三个黑色对话框,分别呈现了不同“茅台酒”背后的文化内涵、如何呈现“茅台酒”背后的文化内涵、如何呈现“茅台酒”背后的文化内涵的对话内容。这些对话内容与上下文紧密相关,直观呈现了Gemini 3.0 Pro具备的强大中文文化理解能力,能

为什么用 Gemini 担任"总导演"?

Gemini 3.0 Pro 具备强大的中文文化理解能力,能读懂"茅台酒"背后的文化内涵,能理解"李白"、"辛弃疾"、"赤水河"这些文化符号,并将它们组合成有逻辑、有美感的创作方案。它就像你的副导演,帮你把脑海里模糊的想法,变成具体可执行的创作计划。

1.2 完整创作流程

Step 1:确定主题与风格

首先把核心需求告诉 Gemini:

"我现在要做一个关于茅台酒的歌,需要有劲一点。帮我构思一下做什么类型比较好?大概 1 分半。"

Gemini 的输出:

  • 推荐了多个方向:国潮摇滚、硬核说唱、史诗电子等
  • 给出了具体歌名候选:酱香燃动、赤水云鸿、龙魂醉乾坤……
  • 直接规划了歌曲结构:前奏、主歌、副歌、间奏、尾声,并写出每段大意

💡 关键技巧:不需要专业的提示词,就像跟朋友聊天一样说出你的想法。Gemini 出手就是"王炸",会给你一个完整的框架。

图片展示的是Gemini AI平台界面,用户询问关于一个关于茅台的对话记录是否能导出为markdown文件。Gemini给出回复,认为对话记录适合用作视频开场段落,给出多个方向参考,如国潮摇滚、硬核说唱、史诗电子等,还列出具体歌名候选及歌曲结构结构,如前奏、主歌、副歌等,并写出每段大意。该图片与上下文紧密相关,是AI总导演Step 1中Gemini确定主题与风格的输出内容。


Step 2:歌词精修——控制"茅台味"的浓度

初版歌词"茅台元素太重",需要调整创作策略:

核心创作思路:茅台只是一个抛砖引玉的主题,不是主角。MV 的前 80% 画面里,观众根本不知道在讲茅台——直到最后才点出来。

调整后告诉 Gemini:重新构思歌词,以古代人物的豪情为主线,酒是氛围,不是主角。Gemini 随即产出了"水是骨骼"、"火是颜色"、"绣口一吐就是半个盛唐的云烟"这样的句子。

图片展示的是Gemini 3.0 Pro AI工具的对话界面。用户提出整体歌词中酒元素过多,应讲其他歌词但寓意是酒,表达内容会在mv视觉体现。Gemini给出的歌词方案是国潮史诗摇滚风格,主题为《沉默的火焰》(或《觉醒》),歌词以古代人物豪情为主线,避免“叫


Step 3:选定主角——古代人物 PK

让 Gemini 推荐适合"激情、摇滚"风格且"与酒有缘"的古代人物:

图片展示了Gemini 3.0 Pro AI工具推荐古代人物做主角的对话界面。用户询问做MV时给一个真实的中国古代人物做主角是否合适,AI推荐李白(狂放·剑仙版)、辛弃疾(热血·战神版)、曹操(宏大·枭雄版)等三位古代人物,分别代表三种“激情”风格。李白被选为首选,其狂放、剑仙气质与酒有不解之缘,且有“酒中仙剑中神”之称。AI还给出了李白的风格关键词、匹配度及MV画面构思建议。

候选人物风格定位推荐理由
李白(首选⭐)狂放·剑仙版诗人+剑客,摇滚明星气质,"酒中仙剑中神"
辛弃疾热血·战神版"醉里挑灯看剑",悲壮有力,适合大国脊梁感
曹操宏大·枭雄版"对酒当歌",史诗感强,贵气

这是一个非常棒的切入点!用一个具体的古代人物做“灵魂主角”,能瞬间把这首《沉默的火焰》那种“隐忍后爆发”的意境具象化,同时赋予茅台一种厚重的历史人格。 考虑到你的音乐风格是 “激情、摇滚、快节奏”,且时长只有90秒,这个人物必须具备“狂”、“豪迈”和“与酒有不解之缘” 这三个特质。 我为你推荐三位最合适的人选,分别代表三种不同的“激情”:

首选推荐:李白 —— 【狂放·剑仙版】

风格关键词: 潇洒、极致、天马行空、摇滚明星气质 匹配度: 🌟🌟🌟🌟🌟 推荐理由: 大家熟知的李白是诗人,但不要忘了他也是个剑客(“十五好剑术”)。在这个MV里,不要把他拍成文弱书生,要拍成 “酒中仙,剑中神” 。 他的气质最符合“摇滚”——不羁、狂妄、才华横溢。正如茅台,入口柔顺,入喉却有雷霆万钧之力。 MV画面构思(配合《沉默的火焰》):

  • 前奏(压抑/积蓄): 李白身着白衣,有些落魄地独坐山巅,周围是云海。手里拿着一个古朴的酒葫芦(暗示茅台的底蕴)。
  • 主歌(磨砺): 画面快切他练剑的背影,笔走龙蛇写诗的狂态,墨汁飞溅(对应歌词“水是骨骼”)。
  • 副歌(爆发): 高光时刻! 他仰头豪饮,酒液洒在脸上,随即拔剑起舞。画面出现“黄河之水天上来”的特效。古今交错,他手中的剑光一闪,转场变成现代茅台酒瓶的特写,金色的酒液如流光般旋转。
  • 寓意: 喝的不是酒,是盛唐的气象。

硬核推荐:辛弃疾 —— 【热血·战神版】

风格关键词: 悲壮、力量、家国情怀、硬汉 匹配度: 🌟🌟🌟🌟 推荐理由: “醉里挑灯看剑,梦回吹角连营。” 这一句词简直就是为你这首歌量身定做的。 辛弃疾是文武双全的将领,他的激情带有金属的撞击声和战场的硝烟味。如果你想强调茅台的**“国民高度”“大国脊梁”**,辛弃疾是最佳代言人。 MV画面构思(配合《沉默的火焰》):

  • 前奏(压抑): 深夜军帐,烛火摇曳。辛弃疾看着地图,眉头紧锁,旁边放着一碗烈酒。
  • 主歌(磨砺): 闪回战场厮杀、磨刀的特写(火星四溅,对应歌词“火是颜色”)、战马的嘶鸣。
  • 副歌(爆发): 他端起酒碗一饮而尽,摔碎酒碗(摇滚乐高潮点)。拔剑冲出帐篷,身后千军万马(特效)。画面叠化现代茅台工厂里,工人们热火朝天的制酒场景,寓意“匠心如将心”。
  • 寓意: 酒是英雄胆,致敬每一个奋斗者。

霸气推荐:曹操 —— 【宏大·枭雄版】

风格关键词: 权谋、沧桑、掌控全局、帝王之气 匹配度: 🌟🌟🌟🌟 推荐理由: “对酒当歌,人生几何。” 曹操本身就是酒的营销大师(“何以解忧,唯有杜康”)。他的形象代表了 “成功人士”、“格局”和“历史的厚度”。 这种风格适合那种史诗感强、交响乐铺底 的摇滚乐,显得非常贵气。 MV画面构思(配合《沉默的火焰》):

  • 前奏(压抑): 曹操站在长江船头,面对百万雄师,江风猎猎,披风飞舞。
  • 主歌(磨砺): 镜头扫过他沧桑的脸,那是岁月的痕迹(对应歌词“穿越了山川的脉搏”)。
  • 副歌(爆发): 他举起青铜爵,酹酒祭江。滔滔江水翻滚,化作赤水河的奔腾影像。画面定格在他挥斥方遒的手势,转场到现代商务宴请中,一只手举起茅台酒杯的特写。
  • 寓意: 只有经过时间的沉淀,才能掌舵风云。

💡 我的最终建议

如果是为了最“燃”、最贴合年轻人审美、视觉效果最炸裂,请选择 【李白】操作小贴士: 在视觉设计上,可以用 “水墨粒子” 特效来连接古代李白和现代茅台。

  • 比如:李白挥出的剑气变成水墨,水墨旋转凝聚,变成了红白金配色的茅台酒瓶
  • 这样既不生硬,又极其艺术。 你觉得这三位谁最符合你心中的那个“激情”形象?我可以根据你选的人,帮你细化那几个关键镜头的脚本。

最终决定:以李白为主角,并组建古代摇滚乐队:

  • 🎤 主唱:李白
  • 🥁 鼓手:李清照
  • 🎸 吉他手:杜甫
  • 🎸 贝斯手:苏轼
  • 🎙️ 女主唱(后加入):杨贵妃(后改为李清照演唱效果更佳)

图片展示了一位位身着白色古装的男子,手持麦克风,闭目侧头,似乎在演唱。他头戴黑色发带,背景有彩色光斑和烟雾效果,营造出舞台氛围。图片对应文档中“选定主角——古代人物PK”部分,最终决定以李白为主角,并组建古代摇滚乐队,此图直观呈现了李白作为主唱的形象,与上下文对李白作为主唱的描述相契合。

图片展示了一位身着粉色古装的女性在演奏鼓乐。她头戴金色发饰,面带微笑,专注地敲击着带有金色龙纹的鼓面。背景为紫色烟雾,营造出舞台氛围。图片与上下文紧密相关,是文档中“选定主角——古代人物PK”部分的内容,最终决定以李白为主角组建的古代摇滚乐队中,李清照作为鼓手的形象呈现。

图片展示了一位身着传统服饰的男子在舞台上弹奏乐器的场景。他穿着深蓝色长袍,袍内

图片展示了一位身着黑色古装、手持贝斯的男性,正在舞台上表演。他扎着高马尾,面带严肃表情,专注地弹奏着贝斯。舞台背景有烟雾效果,远处可见观众席,人群密集,部分观众举着手机拍摄。该图片与文档中“选定主角——古代人物PK”部分内容相关,直观呈现了以李白为主角组建的古代摇滚乐队中,贝斯手的表演场景。

图片展示了一位身着华丽古装的女性,她头戴金色发饰,面带精致妆容,身着红色带有金色花纹的服饰,手持麦克风,背景为模糊的观众和灯光,营造出演唱会现场氛围。该图片与文档中“选定主角——古代人物PK”部分内容相关,最终决定以李白为主角,并组建古代摇滚乐队,此图可能是其中一位乐队成员的呈现,体现了古代人物与现代摇滚元素的结合。


Step 4:生成分镜脚本

告诉 Gemini:

"综合以上信息,帮李白量身定制一个MV,歌词和画面都要匹配。"

Gemini 输出了完整分镜规划:

  • 氛围铺垫:李白登场
  • 李清照击鼓
  • 合照全景,蓄势待发
  • 每段歌词对应的画面描述
  • 每个角色的视觉形象关键词

图片展示了Gemini 3.0 Pro为《赤水剑魂》MV生成的脚本方案。方案中提到李白作为主角,配合潮流摇滚,打造一个不只会喝酒 addCriterion感谢


Step 5:生成图片提示词 & Suno 风格描述

"帮我单独提取出来歌词,去 Suno 里面生成音乐,请帮我写好歌词和提示词。"

Gemini 同时生成:

  1. 格式化歌词(带 Intro/Verse/Chorus/Rap 标签)
  2. Suno AI 的英文风格描述(如:Chinese Folk Rock, Nu-Metal, Male and Female Duet...)

图片展示的是Gemini 3.0 Pro生成图片提示词&Suno风格描述的界面。界面中显示了歌词格式化内容,包括[Verse]、[Chorus]等标签,以及Suno AI的英文风格描述,如Chinese addCriterion


第二步:Suno AI V5 —— 生成完整音乐

图片展示了Suno V5生成音乐的界面。左侧为Suno AI界面,有“Audio”“Lyrics”“Prompt”等选项,下方有“Create”按钮。右侧是生成的音乐列表,包含多首不同风格的音乐,如“Rap”“Rock”“Pop”等,每首音乐下方有播放按钮。

操作流程

将 Gemini 生成的歌词 + 风格描述直接复制粘贴进 Suno AI:

最终风格参数

Chinese Folk Rock, Nu-Metal, Male and Female Duet, Long Male Rap Verse,
Fast Flow Hip-Hop, Suona, Heavy Drums, Distortion Guitar,
Female Operatic Vocals, Epic, Heroic, High Energy, 150 BPM

迭代过程

图片展示的是Suno AI V5生成完整中,对“赤水河”MV音乐的迭代指令。上方是用户要求在标准国摇混滚版基础上,修改歌词,做到男女合唱,男唱一段,女唱一段,还要加一分钟左右的rap。下方是Suno AI给出的指令,包括强调Rap Rock风格,需突出男声Rapping和快节奏,突出中国风、重金属等元素,以及重新编排的歌词结构。该图片与上下文紧密相关,呈现了音乐生成过程中指令的制定过程。

  • 第一版:只有男声独唱 → 不满足
  • 第二版:加入男女对唱指令 → 效果提升
  • 最终版:加入"一分钟 Rap 段落",男女各唱一段,再加 Rap 高潮 → 完美

💡 关键技巧:Suno V5 可以对 [Verse] [Chorus] [Rap Verse] 等结构标签做出精准响应。全程就是复制粘贴,没有任何音乐创作能力也能完成。

[Intro]

(Suona Solo screaming)

(Heavy Bass Drop)

[Verse 1]

[Male Vocals]

(Raspy Rock Voice)

穿越了 山川的脉搏

在黑暗中 守住寂寞

听风声 呼啸而过

把滚烫 藏进魂魄

[Verse 2]

[Female Vocals]

(Ethereal, Soft)

一年四季 的雕琢

看那红色的河 依然清澈

水是 刚强的骨骼

火是 燃烧的颜色

[Chorus]

[Male and Female Duet]

(Explosive Power)

燃烧吧!这一场 旷世的相逢

唤醒 沉睡的龙

让 岁月 都在此 刻 翻涌

直冲 苍穹!

是 这一道 光荣!

[Rap Verse]

[Male Vocals]

(Fast Flow, Aggressive, Rhythmic)

(Beat switch to heavy Trap/Rock beat)

听着!

黄河之水天上来,奔流到海不复回

我仗剑走过赤水边,看惊雷炸响九天雷

端午踩曲那是魂,重阳下沙那是根

九次蒸煮的历练,才敢敲开这扇门

别问我 什么是江湖,手里这杯就是路

别问我 什么是孤独,醉里挑灯看剑舞

长安市上酒家眠,天子呼来不上船

绣口一吐,就是半个盛唐的云烟!

(Speed up)

三千里的云和月,八万里的路和尘

一滴入喉,吞下的是五千年的神

不是狂,是傲骨铮铮响当当

不是狂,是热血滚烫在胸膛

管他岁月多漫长,越是陈酿越疯狂

这一刻,拔剑起,斩断所有的彷徨

来!干了这一杯时光!

来!敬这不朽的东方!

[Chorus]

[Male and Female Duet]

(Grand Finale, Maximum Volume)

燃烧吧!这一场 旷世的相逢

唤醒 沉睡的龙

让 岁月 都在此 刻 翻涌

直冲 苍穹!

[Outro]

[Female Vocals]

(Operatic High Note fading out)

回味...

这 不朽的 梦。

(Suona ends)

图片展示了Suno AI V5生成完整音乐的界面。左侧为音频、人声、灵感等选项卡,当前选中“Create”选项卡,下方有音频、人声、灵感等设置区域,可选择风格、添加歌词等。右侧是工作空间,显示了多个音乐项目,如“茅台MV”等,右侧还展示了“茅台MV”的封面及部分歌词。该图片与上下文紧密相关,直观呈现了Suno AI V5生成音乐的界面操作及项目展示情况。


第三步:Nano Banana Pro —— 批量生图(分镜实现)

使用 Nano Banana 的工具平台

  • 主要在 Lovart 中运行 Nano Banana

Lovart 官网:https://www.lovart.ai/

图片展示了Lovart平台的。界面上方有“Lovart”标识及“必火AI”图标。中间部分呈现了多张生成的图片,包括舞台表演、人物演唱等场景,每张图片下方有对应文字说明。右侧有输入框,可输入提示词等信息。该图片与文档中 “Nano Banana Pro——批量生图(分镜实现)”中“使用Nano Banana的工具平台”部分内容相关,直观呈现了Lovart平台的界面及生成效果,辅助说明其在AI生图中的应用。

  • 部分图在 Flowith.io 生成

Flowith官网:https://flowith.io/

图片展示的是Flowith.io平台界面,界面中有多张小图片及文本框。小图片呈现出不同场景和人物画面,可能是AI生成的图像。界面下方有一个弹出菜单,显示出一些选项。该图片与上文提到的部分图在Flowith.io生成相呼应,体现了在该平台进行图像生成的情况,也直观展示了“抽卡”操作中同一个提示词生成多张图的成果,用户可从这些生成的图片中挑选满意的图像,用于茅台MV的分镜制作等。

两个平台可以互补,哪个出图理想用哪个

什么是"抽卡"?为什么重要?

抽卡 = 同一个提示词生成多张图,因为 AI 生图有随机性,需要多次生成才能找到满意的那一张。

工具时代平均抽卡次数
Midjourney / SD 时代需要生成 10 次以上
Nano Banana Pro通常 2~3 次,有时 1 次就中

Nano Banana 的核心优势:能真正理解中国文化。李白、李清照、赤水河、唢呐……这些中国元素它都能精准表达,不会出现"文化错位"。

图片展示了为茅台主题MV生成概念画面的提示内容。画面模拟由中国古代文人组成的摇滚乐队在现代举办万人演唱会现场,主角为李白、李清照、杜甫等,年龄设定在20多岁。以李白为例,提示为身着华丽汉服、头戴金冠,手持麦克风激情演唱,背景巨幕打出“赤水剑演”主题,有茅台酒瓶阴影。要求帮为音乐出MV画面人物,模仿乐队开演唱会现场,所有图片比例为16:9,参考图中风格。

核心操作原则:锚定"主图"

最关键的一步:先确定一张"最满意的主角图",后续所有图都以这张图为参考(垫图)。

流程示例(以李白为例)

  1. 先生成多张李白图 → 找到一张最符合心目中"剑仙型摇滚歌手"形象的

图片展示了在Nano Banana工具平台生成的多张李白图像。左侧整齐排列着不同姿态、场景的李白图,有表演性动作等。右侧界面有文字说明,强调将生成的图中最符合“剑仙型摇滚歌手”形象的图作为垫图,放入参考图位置,后续在此基础上生成李白弹吉他、唱Rap等图,以保证人物一致性。此图与上下文结合,是AI做视频流程中批量生图时确定主图操作的示例展示。

图片展示的是茅台MV中苏角色杜甫的形象。他身着传统蓝色长袍,手持毛笔,神情专注,背景为古色古香的建筑,两侧有红色窗帘,上方悬挂“茅台”牌匾。画面右侧有“茅台建设”字样。此图作为杜甫的主图,后续将用于生成杜甫弹弹吉他、沉思、侧面等不同场景下的形象,体现人物一致性。

图片展示的是茅台MV中中 image addCriterion图片位于“核心操作原则:锚定‘主图’”内容之后,是流程示例中以李白为例的图片。图片中,一位身着传统服饰的男子在台上表演,周围有几位同样着装的男子和女子在鼓掌,背景为雕花木屏风和悬挂的茅台标志。此图用于说明先生成多张李白图,找到一张最符合心目中“剑仙型摇滚歌手”形象>

图片展示

图片展示了一位男子吹奏唢呐的场景。他侧脸朝向画面右侧,专注地吹奏着唢呐,唢呐呈深棕色,表面有磨损痕迹,唢呐口处金色 自动生成

图片展示的是AI生成图片的对话界面。用户要求AI为音乐MV画出人物,模仿乐队在演唱会现场的场景。AI先分析参考图片风格,再创作新图片,确保人物手持乐器或话筒唱歌。图片中呈现了两幅参考图片,分别是“李白古筝演奏”和“李清照琵琶演唱”,均为古风人物演奏场景,背景有烟雾效果,人物服饰古朴。该图片与上下文紧密相关,直观呈现了AI生成图片的参考示例。

图片展示了

图片展示的是在Nano Banana Pro工具平台中生成的年轻版李白图。画面里20多岁的李白身着华丽汉服,长发飘逸,正专注地弹奏古琴,其面容热情奔放、充满青春活力,表演时情感充沛、动作激情四溢。这张图是在流程示例中,先生成多张李白图后,选出的符合“剑仙型摇滚歌手”形象的图,后续将作为垫图放入参考图位置,用于生成如李白弹吉他、唱Rap等其他画面,以保证人物一致性。

图片展示了AI生成的李白相关画面。上方是“白衣李白酒杯”画面,李白身着白色长袍,手持酒杯,背景有舞台灯光效果。下方是“白衣李白群像”画面,李白在舞台上,周围有其他人物,背景为舞台布景。该图片与上下文关系紧密,是流程示例中先生成多张李白图的示例画面,用于说明找到上下文提到的先生成多张李白图,再找到一张最符合心目中“剑仙型摇滚歌手”形象的主图这一操作步骤。

图片展示的是 addCriterion图片内容:

图片展示 addCriterion图片位于文档中“流程示例(以李白为例)”部分,是李白的主图示例。图中李白身着白色长袍,手持古筝,表情专注,背景有灯光和烟雾效果,营造出舞台氛围。此图作为垫图,后续生成李白弹吉他、唱Rap、在火焰中表演等场景时,将基于这张主图,人物一致性极强,就像同一个演员在不同场景中表演。

图片展示的是李白的主图,他身着白色长袍,腰间系着金色腰带,长发披肩,面带微笑,右手高举,左手自然下垂,姿态飘逸。背景为古风建筑,有木质结构和雕花屏风,周围有烟雾缭绕,灯光从上方照射下来,营造出一种仙气十足的氛围。此图作为垫图,后续生成李白弹吉他、唱Rap、在火焰中表演等场景时,将基于这张人物一致性极强的主图。

  1. 把这张图作为垫图,放入 Nano Banana 的参考图位置

  2. 后续生成:李白弹吉他、李白唱 Rap、李白在火焰中表演…… 全部基于这张主图

  3. 人物一致性极强,就像同一个演员在不同场景中表演

其他角色也同理

  • 李清照主图确定后 → 生成打鼓特写、远景、侧面……
  • 杜甫主图确定后 → 生成弹吉他、沉思、侧面……

图片

图片展示的是AI生成的李白演唱会主唱图。上方有描述,称其为25岁英俊的李白,身着飘逸的白色汉服,带有精致金色刺绣,手持麦克风,激情演唱。画面中,李白闭眼,神情专注,背景有观众挥动的荧光棒。下方标注“李白演唱会主唱完成”,并有画面特点说明,如人物造型、服装细节等。该图与上下文关系紧密,是李白角色主图生成示例,用于后续基于该主图生成更多相关场景图。 李白

图片展示了李清照作为鼓手的动态镜头,是AI根据描述生成的图像。画面中李清照身着粉色和红色传统汉服,面带微笑,头发随风matchCondition。她站在鼓台前,背景有鼓和打击乐器,舞台灯光柔和,营造出8K、细腻肌肤纹理、充满活力的氛围。该图与上下文紧密相关,是李清照主图确定后生成的多张图像之一,后续还会有李清照打鼓特写、远景、 李清照

图片展示的是杜甫吉他手特写生成效果。上方是描述,称其 杜甫

图片展示的是AI生成的苏轼贝斯手特写画面。画面中,25岁的苏轼身着汉服,弹奏着定制的电贝斯,背景为演唱会现场,观众席上人头攒动。苏轼面带微笑,眼神专注,身姿挺拔,营造出一种充满力量与激情的氛围。该图片是文档中“核心操作原则:锚定‘主图图片 苏轼

3.4 遇到的问题与解决方法

问题解决方法
初版生成"茅台味太重",画面充斥酒坛子修改提示词,强调"古代摇滚乐队"而非茅台广告
初版李白太"老态",不像摇滚歌手加入"年轻、英俊、白衣剑仙"等描述词
杜甫默认生成老人形象明确指定"年轻的杜甫,魏晋风骨,英气"
5 人合照难以生成先生成两人→三人→逐步添加,或换描述多次抽卡

图片展示的是AI做视频项目中Nano Banana Pro批量生图的界面。界面上方有“茅台MV分镜”标题及“flowith.io”标识。中间部分呈现多张生成图片,包括人物舞台表演场景等。右侧有用户评论,讨论分镜人物设定。底部有“Agent”按钮,可进行生成操作。图片与上下文紧密相关,直观呈现了使用Nano Banana Pro批量生成图片的界面情况,辅助说明了在遇到生成问题时

图片展示的是AI助手为音乐MV画面人物创作的分镜示例。画面中李白身着白色长袍,手持麦克风,背景为舞台灯光效果。上方有提示词“李白说唱特写”,并说明李白说唱时变换不同景别、动作,中景、远景等,人物一致性不能变。下方有“Nano Banana Pro”标识,分别呈现“超广角_舞台全景”和“广角_跳跃动作”两种镜头,展示了李白说唱时的不同场景和动作。该图片与上下文介绍的AI做视频中Nano Banana Pro批量生图(分镜实现)的内容相关,是分镜示例的具体呈现。

flowith.io

图片展示的是在flowith.io平台使用Nano Banana Pro为5位中国古代文人设计创意作品的对话界面。用户提出让5位文人摆出嘻哈手势,平台反馈模型因错误生成失败,但已重新生成了五位古文人嘻哈手势合照,画面中5人穿着古装,摆出嘻哈手势,背景有灯光效果。该图片与上下文紧密相关,直观呈现了平台反馈及生成结果,是遇到问题与解决方法中“5人合照难以生成”问题解决后的展示。

图片展示了 addCriterion addCriterion图片展示了在Nano Banana Pro中生成的分镜画面。画面中呈现了从高处俯瞰赤水河表面、红缨子高粱田、流动的红水、春季绿高粱幼苗、成熟的红高粱等场景。每个场景下方有对应的生成时间,如2023 - 03 - 03、2023 - 03 - 03、图片 20:10:03等。这些画面与上下文提到的在Nano Banana Pro中批量生图(分镜实现)的内容相关,直观呈现了生成的分镜效果。

图片展示了了 addCriterion图片展示了Nano Banana Pro生成的两组图片。左上角是“Cinematic close-up of raging fire flames in darkness”的描述,生成的图片为黑暗中燃烧的火焰特写,火焰呈橙色和金色,形成优雅的液态曲线和抽象形状 addCriterion图片展示了Nano Banana Pro生成的两组图片。左上角是“Cinematic close-up of raging fire flames in darkness”的描述,生成

图片展示图为AI生成的视频分镜图示例。上方为描述,要求生成一位穿着汉服(李清照)的女性鼓手剪影侧脸,背景为耀眼的舞台聚光灯,光束穿透舞台烟雾,她正击打鼓面,画面高对比度、单色带红色调,艺术构图、漫画风格。下方是生成的视频画面,呈现一位女性鼓手剪影,身着汉服,手持鼓棒,背景为舞台聚光灯效果。该图片与上下文介绍的AI视频分镜生成相关,展示了分镜实现效果。

图片展示了Nano Banana Pro生成的杜甫形象。上方为生成提示词,描述杜甫为严肃、英气的青年,身着深蓝色汉服,弹奏未来感电子琵琶,闭眼沉浸演奏,舞台灯光为深蓝紫色,营造赛博朋克氛围,烟雾环绕,8K高对比度。下方是生成的图片,显示一位身着深蓝色汉服的青年弹奏电子琵琶,背景有闪电和烟雾效果。该图片与上下文介绍的Nano Banana Pro批量生图功能相关,

图片展示了在Nano Banana Pro中生成的茅台酒瓶图片。上方为生成提示词,描述为“茅台酒瓶特写,放置在深色木桌,背景 addCriterion

图片展示了Nano Banana 自动生成GuidIdNano Banana Pro(US Pro)生成的图片,上半部分为生成提示词,包含“宏摄影、清澈液体倒入水晶杯、丝滑液体质感、表面形成珍珠状小气泡、高速摄影、

图片是AI生成的图片,展示了一位亚洲男性艺术家手持酒杯靠近鼻尖闻酒香的场景。画面中,男子闭眼沉浸,背景为现代风格的液体色彩流动效果,营造出超现实、梦幻氛围,有双曝光效果,画面柔和。图片上方有描述文字,强调男子为亚洲男性艺术家,画面背景为现代风格的液体色彩流动效果,有双曝光效果,氛围梦幻。图片右下角标注“Nano Banana Pro (AI Pro)”及“MV”标识,日期为25 - 12 - 04。

图片展示的是在flowith

图片展示了在Nano Banana Pro中生成的视频分镜图。画面中呈现了多个场景,包括舞台表演、人物互动等,如舞台上有乐队表演、人物在舞台上弹吉他、人物在舞台上唱歌等。右侧有用户界面,显示了“开始创作”按钮及“开始创作”按钮的放大图 addCriterion


第四步:可灵 AI —— 图片转视频

图片展示了可灵AI视频平台界面,上方标题为“可灵AI视频 | O1模型 | 视频2.6 | 数字人2.0”。界面左侧为分镜图列表,包含多张分镜图缩略图。右侧上方是视频播放区域,显示一位身穿红色古装、手持麦克风的女性在舞台上表演,背景有灯光效果。下方是视频编辑界面,有时间轴、剪辑工具等编辑选项。该图片与文档中介绍可灵AI - 图片转视频功能的内容相关,展示了平台操作界面。

三种核心用法

用法一:图生视频(Image to Video)

  • 将分镜图上传,写入动作描述提示词
  • 示例提示词:"演唱会前奏,镜头从远景慢慢推近聚焦到架子鼓,人物动作缓慢而有力"
  • 模型选择:可灵 2.6 模型(音画同步)

图片展示的是可灵AI界面,左侧为功能导航栏,有图片生成、视频生成、动作控制、数字人等选项。右侧上方显示“可灵AI”,下方有“图片生成”“视频生成”“动作控制”“数字人”等标签。中间部分展示了多张人物图片,图片中人物身着红色古装,背景有树木等自然景观。图片下方有“生成”按钮。该图片与上下文介绍的“图生视频(Image to Video)”功能相关,用于将分镜图上传并写入动作描述提示词后生成视频。

图片展示的是可灵AI - 图片转视频(Image to Video)的界面。左侧为功能导航栏,选中“生成”选项。中间上方有“图片生成”“视频生成”“动作控制”“数字人”等选项。中间部分显示视频预览图,提示音画同步暂不支持尾帧,下方有提示词“演奏者演奏电子古筝,表情自然,弹古筝的动作特别快,镜头上升推进”,并有音色、绿幕、位置、表情等编辑选项,底部有“1080p - 10s - 1”“音画同步”等设置,右下角有“6 100 生成”按钮。

图片展示的是可灵AI - 图片转视频的界面。界面顶部有“图片生成”“视频生成”“动作控制”“数字人”选项卡,当前选中“视频生成”。下方显示模型为“视频 2.6 音画同步生成,有声音更精彩”,并有音画同步暂不支持尾帧的提示。画面中呈现一位白衣男子手持红色标签酒瓶,向观众推荐,镜头缓慢环绕下移,同时有“来,与大家一起共饮!喝个痛快!”的讲话内容。底部有音色、特效、图层、位置、生成等操作按钮,以及1080p、5s - 1v、音画同步的设置选项,右下角有“50生成”按钮。

用法二:首尾帧(首尾帧技术)

图片展示了可灵AI - 图片转视频的界面。左侧为聊天窗口,显示用户与AI的对话,有“赤水河奔腾”“高粱地”等图片。中间是视频预览区域,呈现多帧视频画面,包括身穿红色古装的女性、身穿白色衣服的女性等。右侧有“全部”“图片”“视频”“我收藏的”选项卡,以及“生成”按钮。该图片直观呈现了使用可灵AI - - 图片转视频时的界面及视频预览效果,与上下文介绍的图片转视频功能相契合。

  • 指定视频的第一帧和最后一帧,让可灵生成中间的过渡
  • 案例:前一帧是"赤水河奔腾",后一帧是"高粱地",中间自动生成转场
  • 灵感来源:歌词"看那红色的河"→ 画面从红色江河自然过渡到高粱田

图片展示的是可灵AI - 图片转视频界面。界面上方有“视频生成”和“图片生成”选项,当前选中“图片生成”。下方有“图片/主体参考”“图生视频”“指令变换”“视频参考”“重置”等按钮。左侧有“图片/视频”选项,下方有“@图片1”“@图片2”两个图片标识。中间显示“@图片1 夸张的过渡到 @图片2”。底部有“视频 O1”“1080p 8s”等设置选项,右下角有“64 生成”按钮。该图片与上下文介绍的可灵AI - 图片转视频流程中图片转视频功能相关,展示了操作界面。

图片展示了可灵AI图片转视频的首尾帧技术案例。画面左侧是陶罐,右侧是刻有“贵州”字样的酒杯,两者间有红色丝带状物连接,丝带在空中飘动。背景模糊,呈现自然景观。此图与上下文介绍的首尾帧技术相关,即指定视频第一帧为陶罐,最后一帧为酒杯,可灵AI自动生成中间过渡,灵感来源于歌词“看那红色的河”,画面从红色江河自然过渡到高粱田。

图片展示了一幅古风插画,画面中一位身着华丽服饰的女子飘浮于云间,手持酒 addCriterion感谢您的反馈,我会注意的。

图片展示的是可灵AI首尾帧技术的转场效果。画面中火焰在黑色背景前舞动,火焰形态各异,颜色从橙黄渐变至深红,边缘有轻微的烟雾效果。该图片与文档中介绍可灵AI首尾帧技术的内容相关,用于说明指定视频第一帧和最后一帧后,可灵AI会自动生成中间过渡的效果,此图展示了其生成的转场画面,直观呈现了转场时火焰从首帧到尾帧的自然过渡。

图片展示的是可灵AI首尾帧技术的示例视频画面。画面中,黑色背景上,多处水花飞溅,形态各异,有的向上高sp;有的向两侧喷射,水花晶莹剔透,闪烁着光芒。该图片与上下文紧密相关,是用法二“首尾帧(首尾帧技术)”案例的视频画面,前一帧是“赤水河奔腾”,后一帧是“高粱地”,中间自动生成转场,灵感来源为歌词“看那红色的河”→画面从红色江河自然过渡到高粱田。

用法三:数字人对口型(Lip Sync)

图片展示的是可灵AI平台的界面,左侧为功能导航栏,有图片生成、视频生成、动作控制、数字人等选项。右侧上方是“形象库”标签,下方呈现多个角色形象缩略图,包括不同人物在不同场景下的形象,如主持人、演员等。界面中还显示了角色“李清照”的角色图及对应歌曲音频,下方有“生成”按钮。该图片与文档中介绍可灵AI数字人对口型(Lip Sync)用法的内容相关,用于展示平台角色库及生成角色视频的操作界面。

  • 上传角色图 + 输入对应人物歌曲音频
  • 可灵自动生成角色"说话/唱歌"的视频
  • 案例:贵妃唱女声部分段落

图片展示的是可灵AI - 图片转视频的界面。界面上方有图片生成、视频生成、动作控制ool控制、数字人等选项卡。中间部分显示上传的清晰面部图,下方有“形象库”和“AI生图”按钮。配音内容为“赤水剑魂rap部分”,并有“替换音频”选项。角色表现处有描述文字。底部有“1080P + 30FPS”选项和“208 生成”按钮。该图片与上下文介绍的用法三:数字人对口型(Lip Sync)相关,展示了上传角色图、输入音频后可生成角色视频的操作界面。

图片展示的是可灵AI - 图片转视频界面。左侧有“生成”“全部工具”等选项,右侧上方有“图片生成”“视频生成”“动作控制”“数字人”等标签。中间部分可上传清晰面部图,下方有“李清照唱歌1.WAV”音频文件,可替换箭头指向的“替换音频”按钮。底部有“1080P + 30FPS”选项和“104 生成”按钮。该图片与上下文介绍的用法三:数字人对口型(Lip Sync)相关,展示了上传角色图+输入对应人物歌曲音频后可灵自动生成角色“说话/唱歌”的视频操作界面。

使用的模型与场景

可灵模型特点使用场景
可灵 2.6支持直接输入台词生成说话视频角色说台词、唱歌镜头
可灵 O1强大的图片编辑与转场能力图生视频、首尾帧过渡、镜头推拉
可灵数字人精准对口型角色配合音频唱歌

特殊情况处理

问题:5 个角色同时在舞台上唱 Rap 的场景,可灵多次尝试效果不佳。

解决方案:改用 Veo 3.1 生成该段视频,其余 99% 仍用可灵。

💡 核心思路:没有一个工具是万能的,遇到瓶颈就换工具,哪个出效果用哪个。

图片展示的是可灵AI - 图片转视频的界面。图片 addCriterion addCriterion,用于生成视频。界面中显示“正在根据您提供的图片和描述生成视频”,下方有“您的视频已准备好”的提示,视频画面呈现五位身着古装的男子在舞台上表演,其中中间男子在rap,其他人各自进行表演。画面右上角有“PRO”标识及

关于"抽卡"

视频生成同样需要抽卡。同一个提示词可能生成多次才能找到满意的动态效果。判断标准完全来自创作者本人,AI 无法替你判断"好不好看"。


第五步:剪映 —— 最终剪辑成片

图片展示了剪映软件界面,呈现了视频剪辑过程。画面中显示“吞下的是五千年的神”字幕,背景为一位女性在打鼓。左侧是视频素材库,有多个视频缩略图。右侧是剪辑界面,下方时间轴上有多个视频片段。该图片与文档中“剪映——最终剪辑成片”部分相关,直观呈现了剪辑时的软件操作界面及视频内容,辅助说明剪辑过程中添加特效、制作字幕等操作。

剪辑的核心工作

  • 将所有视频素材按歌词节奏排列
  • 添加特效(炫光、粒子、转场)
  • 制作字幕
  • 调整色调,整体统一风格
  • 在 Rap 段落使用"快切"剪辑:交替出现李白和其他角色,营造动感

⚠️ 重要提示:剪辑是整个流程中最需要人工技能的环节。需要一定的剪辑功底(镜头感、节奏感、审美),无法被 AI 完全替代。

版本迭代

  • 1.0 版本:初剪,发给多位朋友收集意见
  • 2.0 版本:根据反馈加入合照镜头(观众视角看乐队全景)
  • 3.0 版本(最终版):与闫虎老师反复讨论,加入更多细节,完成定稿

核心思考:人 + AI 的边界在哪里?

图片以白色为底色,上方有红色横条,中间用红色大字写着“与AI一起做得更好”,下方以灰色小字标注“期待一键出成片” 。图片位于文档“核心思考:人+AI的边界在哪里?”内容之后,与上下文讨论人在AI辅助下进行视频制作的主题相契合,传达出在AI助力下能取得更好成果以及对便捷AI视频制作的期待,是对人+AI协作理念的一种视觉呈现。

你不能指望 AI 做到的事

很多人会问:能不能做个智能体,一键出片?

答案是:目前不能。

原因有三:

  1. 审美判断:同一个提示词可能生成 3 张图,好坏由你来判断,AI 不能替你判断
  2. 创意灵感:MV 里那个"河流过渡到高粱地"的首尾帧,是在剪辑过程中灵光一现才想到的,不是事先规划好的
  3. 动态调整:杜甫第一次生成出来是个老头,需要人为发现问题并修改方向

AI 是你的"员工团队"

把每个 AI 工具理解为一名有专长的员工:

AI 员工专长
Gemini 3.0 Pro策划、编剧、文案
Suno AI音乐制作
Nano Banana概念插画师
可灵 AI摄影、特效导演
剪映后期剪辑助理

你的角色:总导演。负责战略决策、审美把关、灵感激发、最终定稿。

做好 AI 视频的三个核心能力

图片以白色为 addCriterion背景为主,上方有红色横条,左上角有“必火AI”标识。画面中央左侧是一个黄色灯泡图标,右侧大字“创 意”醒目呈现。该图片位于介绍做好AI视频三个核心能力之一的“创意(Creativity)”部分,用以强调创意在AI addCriterionAI视频制作中的重要性,与上下文关于主题确定、创意灵感等内容相呼应,直观传达了创意这一核心能力。

  1. 创意(Creativity)

    • 你的主题是什么?你想表达什么?
    • AI 只是实现工具,没有你的创意,AI 无从下手
    • 案例:茅台酒为何选李白?为何做成摇滚风?这是人的判断

图片展示的是“审美”相关内容,背景为白色,上方有红色边框,左上角有“必火AI”标识。画面中央左侧是一个相机图标,右侧是红色大字“审美”。该图片位于文档中“审美(Aesthetics)”部分,与上下文紧密相关,是对审美这一核心思考内容的形象呈现,强调审美在AI做视频创作中的重要性。

  1. 审美(Aesthetics)

    • 同样的提示词,你能从 3 张图里选出最好的那一张吗?
    • 审美没有标准答案,但可以通过大量欣赏优质内容来提升
    • 多看好作品,慢慢建立"我的审美标准"

图片展示 addCriterion

  1. 灵感(Inspiration)

    • 灵感来自过程中的发现,而不是事先想好的
    • 建议:先把所有素材生成好,拼成初版,再去找灵感修改
    • 可以邀请朋友一起看、给反馈,往往能碰出好想法

📋 完整制作 SOP(标准流程)

图片展示了视频制作制作流程,分为5个阶段。Stage 1为创意构思,灵感阶段;Stage 2是多工具协作;Stage 3为视频生成,AI视频引擎;Stage 4是剪映,剪辑合成,专业剪辑;Stage 5是成品输出,高质量交付。底部还强调了多模态融合、高效工作流、专业级质量。该图与文档中“视频制作AI工具链”内容相关,直观呈现了视频制作的完整流程,帮助理解AI在视频制作中的应用步骤。

1. 用 Gemini 确定主题 + 风格
   ↓
2. 用 Gemini 生成歌词框架 + 风格描述
   ↓
3. 用 Suno AI 生成音乐(迭代 2~3 次)
   ↓
4. 用 Gemini 生成分镜脚本 + 图片提示词
   ↓
5. 用 Nano Banana Pro 生成所有角色主图(确定主图)
   ↓
6. 以主图为垫图,生成所有分镜图(大量抽卡)
   ↓
7. 用可灵 AI 将分镜图转为视频片段(图生视频 / 首尾帧 / 数字人)
   ↓
8. 用剪映完成剪辑、特效、字幕
   ↓
9. 发给朋友收集意见 → 迭代修改 → 最终成片

❓ 常见问题 Q&A

Q:我不会写歌词,也不懂音乐,能做吗?
A:完全可以。整个过程几乎全是"复制粘贴"。歌词是 Gemini 写的,音乐是 Suno 生成的,你只需要告诉 AI 你想要什么感觉。

Q:角色一致性怎么保证?
A:先确定一张最满意的"主图",后续所有图都把这张图作为参考图(垫图)放入 Nano Banana,人物一致性会非常高。

Q:可灵和即梦哪个更好?
A:基于实际使用体验,可灵在视频生成质量和功能完整性上更优,尤其是它的 2.6 模型(支持台词生成)和 O1 模型(支持首尾帧)。

Q:整个流程要花多少钱?
A:主要是各 AI 工具的订阅费用。Gemini、Suno、Nano Banana、可灵都有付费计划。建议先用免费额度试水,满意后再订阅。

Q:有没有可能做到"一键出片"?
A:目前阶段不可能。高质量视频仍需人工介入判断、修改、创意决策。工具是辅助,创作者是核心。


🎯 总结

做一个 AI 视频 MV,本质上是:

用 AI 把你脑海里的画面"言出法随"地呈现出来。

你负责想象力、创意和判断;AI 负责执行、生成和实现。

工具会越来越强,难度会越来越低,但有创意、有审美、敢尝试的人,永远能做出更好的作品。