本文目标:通过一个完整的 MV 创作案例,让学员清晰了解 AI 视频制作的整体思路、工具链选择、关键问题的解决方式,以及人在整个过程中不可替代的核心作用。
🎬 成片效果预览
- 视频名称:《赤水剑魂》
- 主题:以茅台酒为背景,融合中国古代人物的摇滚 MV
- 风格:国潮摇滚 + 男女对唱 + 快节奏 Rap
- 时长:约 90 秒
- AI 占比:约 90%(创作、生图、音乐、视频),人工占比约 10%(判断、剪辑、创意决策)
- 制作周期:断断续续 3~4 天(周日全天 + 周一通宵到凌晨 3 点)














🛠️ 工具链总览
Gemini 3.0 Pro → Suno AI V5 → Nano Banana Pro → 可灵 AI → 剪映
(总导演) (音乐生成) (图片生成) (图转视频) (最终剪辑)

| 工具 | 角色 | 核心用途 |
|---|---|---|
| Gemini 3.0 Pro | 总导演 / 大脑 | 创意构思、歌词、分镜脚本、提示词生成 |
| Suno AI V5 | 音乐制作人 | 根据歌词和风格描述生成完整音乐 |
| Nano Banana Pro | 首席画师 | 生成所有分镜图、角色图(Lovart / Flowith) |
| 可灵 AI | 摄影/导演 | 静态图片转动态视频、数字人对口型 |
| 剪映 | 剪辑师 | 素材拼接、特效添加、字幕制作 |
第一步:Gemini 3.0 Pro —— AI 总导演

为什么用 Gemini 担任"总导演"?
Gemini 3.0 Pro 具备强大的中文文化理解能力,能读懂"茅台酒"背后的文化内涵,能理解"李白"、"辛弃疾"、"赤水河"这些文化符号,并将它们组合成有逻辑、有美感的创作方案。它就像你的副导演,帮你把脑海里模糊的想法,变成具体可执行的创作计划。
1.2 完整创作流程
Step 1:确定主题与风格
首先把核心需求告诉 Gemini:
"我现在要做一个关于茅台酒的歌,需要有劲一点。帮我构思一下做什么类型比较好?大概 1 分半。"
Gemini 的输出:
- 推荐了多个方向:国潮摇滚、硬核说唱、史诗电子等
- 给出了具体歌名候选:酱香燃动、赤水云鸿、龙魂醉乾坤……
- 直接规划了歌曲结构:前奏、主歌、副歌、间奏、尾声,并写出每段大意
💡 关键技巧:不需要专业的提示词,就像跟朋友聊天一样说出你的想法。Gemini 出手就是"王炸",会给你一个完整的框架。

Step 2:歌词精修——控制"茅台味"的浓度
初版歌词"茅台元素太重",需要调整创作策略:
核心创作思路:茅台只是一个抛砖引玉的主题,不是主角。MV 的前 80% 画面里,观众根本不知道在讲茅台——直到最后才点出来。
调整后告诉 Gemini:重新构思歌词,以古代人物的豪情为主线,酒是氛围,不是主角。Gemini 随即产出了"水是骨骼"、"火是颜色"、"绣口一吐就是半个盛唐的云烟"这样的句子。

Step 3:选定主角——古代人物 PK
让 Gemini 推荐适合"激情、摇滚"风格且"与酒有缘"的古代人物:

| 候选人物 | 风格定位 | 推荐理由 |
|---|---|---|
| 李白(首选⭐) | 狂放·剑仙版 | 诗人+剑客,摇滚明星气质,"酒中仙剑中神" |
| 辛弃疾 | 热血·战神版 | "醉里挑灯看剑",悲壮有力,适合大国脊梁感 |
| 曹操 | 宏大·枭雄版 | "对酒当歌",史诗感强,贵气 |
这是一个非常棒的切入点!用一个具体的古代人物做“灵魂主角”,能瞬间把这首《沉默的火焰》那种“隐忍后爆发”的意境具象化,同时赋予茅台一种厚重的历史人格。 考虑到你的音乐风格是 “激情、摇滚、快节奏”,且时长只有90秒,这个人物必须具备“狂”、“豪迈”和“与酒有不解之缘” 这三个特质。 我为你推荐三位最合适的人选,分别代表三种不同的“激情”:
首选推荐:李白 —— 【狂放·剑仙版】
风格关键词: 潇洒、极致、天马行空、摇滚明星气质 匹配度: 🌟🌟🌟🌟🌟 推荐理由: 大家熟知的李白是诗人,但不要忘了他也是个剑客(“十五好剑术”)。在这个MV里,不要把他拍成文弱书生,要拍成 “酒中仙,剑中神” 。 他的气质最符合“摇滚”——不羁、狂妄、才华横溢。正如茅台,入口柔顺,入喉却有雷霆万钧之力。 MV画面构思(配合《沉默的火焰》):
- 前奏(压抑/积蓄): 李白身着白衣,有些落魄地独坐山巅,周围是云海。手里拿着一个古朴的酒葫芦(暗示茅台的底蕴)。
- 主歌(磨砺): 画面快切他练剑的背影,笔走龙蛇写诗的狂态,墨汁飞溅(对应歌词“水是骨骼”)。
- 副歌(爆发): 高光时刻! 他仰头豪饮,酒液洒在脸上,随即拔剑起舞。画面出现“黄河之水天上来”的特效。古今交错,他手中的剑光一闪,转场变成现代茅台酒瓶的特写,金色的酒液如流光般旋转。
- 寓意: 喝的不是酒,是盛唐的气象。
硬核推荐:辛弃疾 —— 【热血·战神版】
风格关键词: 悲壮、力量、家国情怀、硬汉 匹配度: 🌟🌟🌟🌟 推荐理由: “醉里挑灯看剑,梦回吹角连营。” 这一句词简直就是为你这首歌量身定做的。 辛弃疾是文武双全的将领,他的激情带有金属的撞击声和战场的硝烟味。如果你想强调茅台的**“国民高度”和“大国脊梁”**,辛弃疾是最佳代言人。 MV画面构思(配合《沉默的火焰》):
- 前奏(压抑): 深夜军帐,烛火摇曳。辛弃疾看着地图,眉头紧锁,旁边放着一碗烈酒。
- 主歌(磨砺): 闪回战场厮杀、磨刀的特写(火星四溅,对应歌词“火是颜色”)、战马的嘶鸣。
- 副歌(爆发): 他端起酒碗一饮而尽,摔碎酒碗(摇滚乐高潮点)。拔剑冲出帐篷,身后千军万马(特效)。画面叠化现代茅台工厂里,工人们热火朝天的制酒场景,寓意“匠心如将心”。
- 寓意: 酒是英雄胆,致敬每一个奋斗者。
霸气推荐:曹操 —— 【宏大·枭雄版】
风格关键词: 权谋、沧桑、掌控全局、帝王之气 匹配度: 🌟🌟🌟🌟 推荐理由: “对酒当歌,人生几何。” 曹操本身就是酒的营销大师(“何以解忧,唯有杜康”)。他的形象代表了 “成功人士”、“格局”和“历史的厚度”。 这种风格适合那种史诗感强、交响乐铺底 的摇滚乐,显得非常贵气。 MV画面构思(配合《沉默的火焰》):
- 前奏(压抑): 曹操站在长江船头,面对百万雄师,江风猎猎,披风飞舞。
- 主歌(磨砺): 镜头扫过他沧桑的脸,那是岁月的痕迹(对应歌词“穿越了山川的脉搏”)。
- 副歌(爆发): 他举起青铜爵,酹酒祭江。滔滔江水翻滚,化作赤水河的奔腾影像。画面定格在他挥斥方遒的手势,转场到现代商务宴请中,一只手举起茅台酒杯的特写。
- 寓意: 只有经过时间的沉淀,才能掌舵风云。
💡 我的最终建议
如果是为了最“燃”、最贴合年轻人审美、视觉效果最炸裂,请选择 【李白】。 操作小贴士: 在视觉设计上,可以用 “水墨粒子” 特效来连接古代李白和现代茅台。
- 比如:李白挥出的剑气变成水墨,水墨旋转凝聚,变成了红白金配色的茅台酒瓶。
- 这样既不生硬,又极其艺术。 你觉得这三位谁最符合你心中的那个“激情”形象?我可以根据你选的人,帮你细化那几个关键镜头的脚本。
最终决定:以李白为主角,并组建古代摇滚乐队:
- 🎤 主唱:李白
- 🥁 鼓手:李清照
- 🎸 吉他手:杜甫
- 🎸 贝斯手:苏轼
- 🎙️ 女主唱(后加入):杨贵妃(后改为李清照演唱效果更佳)





Step 4:生成分镜脚本
告诉 Gemini:
"综合以上信息,帮李白量身定制一个MV,歌词和画面都要匹配。"
Gemini 输出了完整分镜规划:
- 氛围铺垫:李白登场
- 李清照击鼓
- 合照全景,蓄势待发
- 每段歌词对应的画面描述
- 每个角色的视觉形象关键词

Step 5:生成图片提示词 & Suno 风格描述
"帮我单独提取出来歌词,去 Suno 里面生成音乐,请帮我写好歌词和提示词。"
Gemini 同时生成:
- 格式化歌词(带 Intro/Verse/Chorus/Rap 标签)
- Suno AI 的英文风格描述(如:Chinese Folk Rock, Nu-Metal, Male and Female Duet...)
第二步:Suno AI V5 —— 生成完整音乐

操作流程
将 Gemini 生成的歌词 + 风格描述直接复制粘贴进 Suno AI:
最终风格参数:
Chinese Folk Rock, Nu-Metal, Male and Female Duet, Long Male Rap Verse,
Fast Flow Hip-Hop, Suona, Heavy Drums, Distortion Guitar,
Female Operatic Vocals, Epic, Heroic, High Energy, 150 BPM
迭代过程

- 第一版:只有男声独唱 → 不满足
- 第二版:加入男女对唱指令 → 效果提升
- 最终版:加入"一分钟 Rap 段落",男女各唱一段,再加 Rap 高潮 → 完美
💡 关键技巧:Suno V5 可以对
[Verse][Chorus][Rap Verse]等结构标签做出精准响应。全程就是复制粘贴,没有任何音乐创作能力也能完成。
[Intro]
(Suona Solo screaming)
(Heavy Bass Drop)
[Verse 1]
[Male Vocals]
(Raspy Rock Voice)
穿越了 山川的脉搏
在黑暗中 守住寂寞
听风声 呼啸而过
把滚烫 藏进魂魄
[Verse 2]
[Female Vocals]
(Ethereal, Soft)
一年四季 的雕琢
看那红色的河 依然清澈
水是 刚强的骨骼
火是 燃烧的颜色
[Chorus]
[Male and Female Duet]
(Explosive Power)
燃烧吧!这一场 旷世的相逢
唤醒 沉睡的龙
让 岁月 都在此 刻 翻涌
直冲 苍穹!
是 这一道 光荣!
[Rap Verse]
[Male Vocals]
(Fast Flow, Aggressive, Rhythmic)
(Beat switch to heavy Trap/Rock beat)
听着!
黄河之水天上来,奔流到海不复回
我仗剑走过赤水边,看惊雷炸响九天雷
端午踩曲那是魂,重阳下沙那是根
九次蒸煮的历练,才敢敲开这扇门
别问我 什么是江湖,手里这杯就是路
别问我 什么是孤独,醉里挑灯看剑舞
长安市上酒家眠,天子呼来不上船
绣口一吐,就是半个盛唐的云烟!
(Speed up)
三千里的云和月,八万里的路和尘
一滴入喉,吞下的是五千年的神
不是狂,是傲骨铮铮响当当
不是狂,是热血滚烫在胸膛
管他岁月多漫长,越是陈酿越疯狂
这一刻,拔剑起,斩断所有的彷徨
来!干了这一杯时光!
来!敬这不朽的东方!
[Chorus]
[Male and Female Duet]
(Grand Finale, Maximum Volume)
燃烧吧!这一场 旷世的相逢
唤醒 沉睡的龙
让 岁月 都在此 刻 翻涌
直冲 苍穹!
[Outro]
[Female Vocals]
(Operatic High Note fading out)
回味...
这 不朽的 梦。
(Suona ends)

第三步:Nano Banana Pro —— 批量生图(分镜实现)
使用 Nano Banana 的工具平台
- 主要在 Lovart 中运行 Nano Banana
Lovart 官网:https://www.lovart.ai/

- 部分图在 Flowith.io 生成
Flowith官网:https://flowith.io/

两个平台可以互补,哪个出图理想用哪个
什么是"抽卡"?为什么重要?
抽卡 = 同一个提示词生成多张图,因为 AI 生图有随机性,需要多次生成才能找到满意的那一张。
| 工具时代 | 平均抽卡次数 |
|---|---|
| Midjourney / SD 时代 | 需要生成 10 次以上 |
| Nano Banana Pro | 通常 2~3 次,有时 1 次就中 |
Nano Banana 的核心优势:能真正理解中国文化。李白、李清照、赤水河、唢呐……这些中国元素它都能精准表达,不会出现"文化错位"。

核心操作原则:锚定"主图"
最关键的一步:先确定一张"最满意的主角图",后续所有图都以这张图为参考(垫图)。
流程示例(以李白为例):
- 先生成多张李白图 → 找到一张最符合心目中"剑仙型摇滚歌手"形象的












-
把这张图作为垫图,放入 Nano Banana 的参考图位置
-
后续生成:李白弹吉他、李白唱 Rap、李白在火焰中表演…… 全部基于这张主图
-
人物一致性极强,就像同一个演员在不同场景中表演
其他角色也同理:
- 李清照主图确定后 → 生成打鼓特写、远景、侧面……
- 杜甫主图确定后 → 生成弹吉他、沉思、侧面……

李白
李清照
杜甫
苏轼
3.4 遇到的问题与解决方法
| 问题 | 解决方法 |
|---|---|
| 初版生成"茅台味太重",画面充斥酒坛子 | 修改提示词,强调"古代摇滚乐队"而非茅台广告 |
| 初版李白太"老态",不像摇滚歌手 | 加入"年轻、英俊、白衣剑仙"等描述词 |
| 杜甫默认生成老人形象 | 明确指定"年轻的杜甫,魏晋风骨,英气" |
| 5 人合照难以生成 | 先生成两人→三人→逐步添加,或换描述多次抽卡 |


flowith.io










第四步:可灵 AI —— 图片转视频

三种核心用法
用法一:图生视频(Image to Video)
- 将分镜图上传,写入动作描述提示词
- 示例提示词:
"演唱会前奏,镜头从远景慢慢推近聚焦到架子鼓,人物动作缓慢而有力" - 模型选择:可灵 2.6 模型(音画同步)



用法二:首尾帧(首尾帧技术)

- 指定视频的第一帧和最后一帧,让可灵生成中间的过渡
- 案例:前一帧是"赤水河奔腾",后一帧是"高粱地",中间自动生成转场
- 灵感来源:歌词"看那红色的河"→ 画面从红色江河自然过渡到高粱田





用法三:数字人对口型(Lip Sync)

- 上传角色图 + 输入对应人物歌曲音频
- 可灵自动生成角色"说话/唱歌"的视频
- 案例:贵妃唱女声部分段落


使用的模型与场景
| 可灵模型 | 特点 | 使用场景 |
|---|---|---|
| 可灵 2.6 | 支持直接输入台词生成说话视频 | 角色说台词、唱歌镜头 |
| 可灵 O1 | 强大的图片编辑与转场能力 | 图生视频、首尾帧过渡、镜头推拉 |
| 可灵数字人 | 精准对口型 | 角色配合音频唱歌 |
特殊情况处理
❗ 问题:5 个角色同时在舞台上唱 Rap 的场景,可灵多次尝试效果不佳。
解决方案:改用 Veo 3.1 生成该段视频,其余 99% 仍用可灵。
💡 核心思路:没有一个工具是万能的,遇到瓶颈就换工具,哪个出效果用哪个。

关于"抽卡"
视频生成同样需要抽卡。同一个提示词可能生成多次才能找到满意的动态效果。判断标准完全来自创作者本人,AI 无法替你判断"好不好看"。
第五步:剪映 —— 最终剪辑成片

剪辑的核心工作
- 将所有视频素材按歌词节奏排列
- 添加特效(炫光、粒子、转场)
- 制作字幕
- 调整色调,整体统一风格
- 在 Rap 段落使用"快切"剪辑:交替出现李白和其他角色,营造动感
⚠️ 重要提示:剪辑是整个流程中最需要人工技能的环节。需要一定的剪辑功底(镜头感、节奏感、审美),无法被 AI 完全替代。
版本迭代
- 1.0 版本:初剪,发给多位朋友收集意见
- 2.0 版本:根据反馈加入合照镜头(观众视角看乐队全景)
- 3.0 版本(最终版):与闫虎老师反复讨论,加入更多细节,完成定稿
核心思考:人 + AI 的边界在哪里?

你不能指望 AI 做到的事
很多人会问:能不能做个智能体,一键出片?
答案是:目前不能。
原因有三:
- 审美判断:同一个提示词可能生成 3 张图,好坏由你来判断,AI 不能替你判断
- 创意灵感:MV 里那个"河流过渡到高粱地"的首尾帧,是在剪辑过程中灵光一现才想到的,不是事先规划好的
- 动态调整:杜甫第一次生成出来是个老头,需要人为发现问题并修改方向
AI 是你的"员工团队"
把每个 AI 工具理解为一名有专长的员工:
| AI 员工 | 专长 |
|---|---|
| Gemini 3.0 Pro | 策划、编剧、文案 |
| Suno AI | 音乐制作 |
| Nano Banana | 概念插画师 |
| 可灵 AI | 摄影、特效导演 |
| 剪映 | 后期剪辑助理 |
你的角色:总导演。负责战略决策、审美把关、灵感激发、最终定稿。
做好 AI 视频的三个核心能力

-
创意(Creativity)
- 你的主题是什么?你想表达什么?
- AI 只是实现工具,没有你的创意,AI 无从下手
- 案例:茅台酒为何选李白?为何做成摇滚风?这是人的判断

-
审美(Aesthetics)
- 同样的提示词,你能从 3 张图里选出最好的那一张吗?
- 审美没有标准答案,但可以通过大量欣赏优质内容来提升
- 多看好作品,慢慢建立"我的审美标准"

-
灵感(Inspiration)
- 灵感来自过程中的发现,而不是事先想好的
- 建议:先把所有素材生成好,拼成初版,再去找灵感修改
- 可以邀请朋友一起看、给反馈,往往能碰出好想法
📋 完整制作 SOP(标准流程)

1. 用 Gemini 确定主题 + 风格
↓
2. 用 Gemini 生成歌词框架 + 风格描述
↓
3. 用 Suno AI 生成音乐(迭代 2~3 次)
↓
4. 用 Gemini 生成分镜脚本 + 图片提示词
↓
5. 用 Nano Banana Pro 生成所有角色主图(确定主图)
↓
6. 以主图为垫图,生成所有分镜图(大量抽卡)
↓
7. 用可灵 AI 将分镜图转为视频片段(图生视频 / 首尾帧 / 数字人)
↓
8. 用剪映完成剪辑、特效、字幕
↓
9. 发给朋友收集意见 → 迭代修改 → 最终成片
❓ 常见问题 Q&A
Q:我不会写歌词,也不懂音乐,能做吗?
A:完全可以。整个过程几乎全是"复制粘贴"。歌词是 Gemini 写的,音乐是 Suno 生成的,你只需要告诉 AI 你想要什么感觉。
Q:角色一致性怎么保证?
A:先确定一张最满意的"主图",后续所有图都把这张图作为参考图(垫图)放入 Nano Banana,人物一致性会非常高。
Q:可灵和即梦哪个更好?
A:基于实际使用体验,可灵在视频生成质量和功能完整性上更优,尤其是它的 2.6 模型(支持台词生成)和 O1 模型(支持首尾帧)。
Q:整个流程要花多少钱?
A:主要是各 AI 工具的订阅费用。Gemini、Suno、Nano Banana、可灵都有付费计划。建议先用免费额度试水,满意后再订阅。
Q:有没有可能做到"一键出片"?
A:目前阶段不可能。高质量视频仍需人工介入判断、修改、创意决策。工具是辅助,创作者是核心。
🎯 总结
做一个 AI 视频 MV,本质上是:
用 AI 把你脑海里的画面"言出法随"地呈现出来。
你负责想象力、创意和判断;AI 负责执行、生成和实现。
工具会越来越强,难度会越来越低,但有创意、有审美、敢尝试的人,永远能做出更好的作品。