大家好,我是 Al 破局俱乐部的初创合伙人 Link 羊羊, 破局行动的 AI 视频教练,也是小林战队的核心队员之一。 首先非常感谢 洋哥的带领 和 AI 破局的生态 , 只有在这么一个友善、利他的环境下, 我才能认识更多志同道合的 AI 视频的朋友, 才能在欣欣向荣的环境中更快的学习技术和进步。 欢迎大家链接我,我的微信是:linkerself
最后感谢潘达老师的建议,说起我进步和成长,归根到底,还是因为破局的生态圈好,在破局结识的朋友非常棒。




(为保护隐私,其他朋友的信息已打码处理)
回到《AI 我华夏》视频本身。
央视发的《AI 我中华》视频非常精致,尤其是把 deforum 和 SD 光影艺术字融入了 AI 视频。
鉴于此,我们做了 3 天,学习和摸清了整个工作流,从时间角度(历史朝代顺序)也来做了一个 AI 视频。
制作过程也是非常开心。最后希望大家喜欢~
接下来我讲给大家复盘一下这次的制作过程:
现在 AI 视频的工作流还是 4s 时代,剧本分镜-音乐-出图-出视频-剪辑
一、写剧本做分镜
1、写剧本
首先,要确定创作内容。这次我打算创作关于所有朝代的内容。我先让 GPT 列出了近 20 个朝代,并对每个朝代进行了简要描述。

接下来,我将针对每个朝代展现其特色。
朝代的顺序当然是按时间顺序排列,首先从最早的夏、商、西周开始。
我计划将这三个朝代合并讲述,因为它们的内容不是特别多,主要涉及青铜器和甲骨文等著名元素。
之后,我将对每个朝代进行单独描述,然后是春秋和战国。
由于春秋和战国的内容较多,我将分别讲述这两个时期。
春秋时期可以讲述诸侯争霸和孔子周游列国的故事,而战国时期则可以讲述七雄争霸和铁器的新奇故事。
接着,我将依次介绍后续的所有朝代,直至元、明、清,最后再介绍新中国。
整个展示将采用光影艺术字,然后展示每个朝代的特色内容,再过渡到下一个时代,光影艺术字也将尽量与时代契合。
2、做分镜
接下来,我需要对这些朝代有更详细的了解。
为此,我可以直接询问 GPT,了解每个朝代的特色和故事。初步计划是为每个朝代挑选两个特色点或故事,每个故事选取两幅画面,从而确定整个故事的走向。

此外,我还需要控制整个视频的节奏。这里就需要 AI 音乐了。
二、做音乐
音乐分为三个部分:BGM 背景音乐、音效、旁白配音。
1、AI 背景音乐
背景音乐我用的是 Suno
首先,需要访问 Suno 的官方网站:https://app.suno.ai/。
为了使用 Suno,需要拥有 Discord、谷歌或微软中的至少一个账号。确保你的网络环境稳定,以便顺利使用该平台。
简单介绍一下 suno 的订阅信息:
- 免费用户,Suno 为免费用户提供每天 50 积分,每首歌消耗 5 积分,因此每天可以创作 10 首歌曲, 但是每次点击生成都会生成两首歌曲。如果你有多个账号,可以白嫖来创作更多的音乐作品。
- Pro 用户,每个月 2500 点数(大约 500 首歌): 按月来算每个月 10 美元, 按年来的话, 每个月 8 美元, 每年 96 美元。
- Premier 用户**,**每个月 10000 点数(大约 2000 首歌): 按月来算每个月 30 美元, 按年来的话, 每个月 24 美元, 每年 288 美元。
🌟注意:服务器爆满的时候,免费用户可能不能创作歌曲,起码得 pro 以上的用户才可以创作。

**操作页面:**Suno 的操作页面设计直观,即使是音乐创作的新手也能快速上手。你输入自己的歌词,选择器乐选项来创作纯音乐,或者在音乐风格中选择流行、抒情、摇滚等多种风格。

1 探索页:可以发现别人制作的音乐
2 创作页:自己创作音乐
3 图书馆页:管理自己的音乐作品
4 自己剩余积分 和 订阅套餐的地方

1 个性化开关,当前是关闭
2 歌曲的描述: 可以写大概歌词是什么样子的,也可以写曲风是什么样的
3 器乐开关
4 模型选择,选择 v3 就好

1 开启个性化定制
2 具体的歌词可以,可以点下面按钮创建随机歌词
3 曲风, 可以输入温柔的男声,甜美的女声等
4 标题,设置自己喜欢的就好
**生成歌曲:**在设定好所有参数后,点击“create”按钮,Suno 将开始生成歌曲。请注意,一旦生成,将扣除相应积分,且无法修改。
**下载和删除歌曲:**生成的歌曲可以通过点击下载按钮来保存到你的设备上。如果你不再需要某首歌曲,可以将其移至“垃圾箱”中,或者选择永久删除。


这里我使用 suno 生成音乐,因为对应《AI 我华夏》的感觉,音乐风格应轻快、柔和,并具有中国风的感觉。

生成音乐后,我可以在几个选项中选择一个,或者选择两到三个音乐片段并将它们剪辑在一起,但必须注意保持节拍一致。
2、音效
接下来是音效的选择,音效可以从音效网或者剪映资源中获取。

3、AI 旁白配音
至于人物背景声音,我使用睿声来克隆。

首先找到我想要的声音,然后上传声音,会自动制作好这个声音模型。
(这里可以提前去下载 原声,然后用剪映适当剪辑一下,导出音频即可)
然后生成自己想要的文本,并将文本输入到软件工具中,使用这个音色训练出模型,从而生成所需的语音文案。
但需要注意的是,每句话的时间间隔,需要自己在剪辑软件中进行调整。
当然还可以使用 elevenlabs 来配音:
- 打开这个官网:https:/elevenlabs.io/,点 sign in 登录(淘宝购买的直接输入登录即可)
- 点击 voices
- 点击 add generative or cloned voices
- 点击 instant voice cloning
- 给项目随意命个名,把 25 个切割音频拖入,add voice
- 等待几分钟音频克隆完成,选择 use
- 在文本框输入文字脚本,voice settings 可以对克隆的声音进行设置
三 、出图和视频
完成以上步骤后,就可以开始正式制作图片和视频了。 这次制作的图片和视频将包括三个部分:正常的图片和视频、光影艺术字的图片和视频,以及“瞬息全宇宙”的图片和视频。
1、MJ 图片和视频
这里需要提前用 gpt 生成类似的提示词,然后批量把提示词翻译成英文,因为 MJ 对英文提示词的语意理解更强一些。

当然我们还可以使用 GPTS:
Mid Journey V6 Prompt Creator( https://chat.openai.com/g/g-vd364I1Zi-mid-journey-v6-prompt-creator)
这是一个专门输出 MJ 提示词的 GPTS, 朋友们也可以在 GPTS 商店中查找到。

我们可以通过告诉他,如果我使用 MJ, 那么我应该需要什么样的提示词, 这里他会很方便的把提示词告诉你。
2、光影艺术字
这里需要用到 SD 的 controlnet, 然后这里要上传你需要的图片,这里需要提前制作好黑底白字,或者说白底黑字的照片。

制作底图的方式有很多种,这里提供几种方式:
1)美图秀秀(优点:中文字体比较多)




首先进入美图秀秀 APP,点击图片美化,接着是制作壁纸,可以点击黑色的底图或者白色的底图,接着点击文字,这里选择自己喜欢的字体样式等等即可
2)Photoshop(优点:定制化内容比较多)




3)剪映(优点:方便电脑,方便剪辑)


4)Word 或者 PPT(优点:大家电脑都有)

这个就不多介绍了,PPT 和 Word 肯定大家都会,简单做出文字底图就行
5)controlnet 参数调整
在点击启用之后,请选择“控制类型”,在这里选择“Canny 硬边缘”。接下来,选择预处理器,需要注意的是,对于黑底白字或白底黑字的处理是不同的。然后,选择与预处理器相对应的模型,选择默认的即可。
这里有一个关键点就是调整控制权重。控制权重越高,文字就会越明显;控制权重越低,文字就会越不明显。因此,这也是一个需要不断尝试和调整的过程。刚开始,可以先将控制权重设为 1,然后根据抽卡的结果来适当地调整。
当你觉得效果还不够满意时,可以尝试让权重更偏向于提示词语,或者更偏向于图片。


这里有一个小技巧就是,刚开始可以将分辨率设置得低一些,这样便于快速抽卡,选择出自己感觉比较满意的效果。
如果你选中了自己认为还不错的效果参数,再将分辨率设置得高一些,以便输出终稿。但需要注意的是,长宽比例也要与原图片相同,这样生产出来的图片才不会被剪裁,从而确保字体显示的完整性。
6)下面是图片成品



7)接着用 runway 转视频
效果如下:
3、瞬息全宇宙
1)参数介绍
这里要用到 SD 的 deforum 技术,最重要的参数一共有两个:
首先是引导关键帧,这里需要启用图像引导模式,然后输入 JSON 字段。
注意 JSON 对象由花括号括起来的逗号分割的成员构成,成员是字符串键和上文所述的值由逗号分割的键值对组成。
最后一个键值对没有逗号!
一定要检查格式问题,不然不能正确执行。
这里 0 代表第 0 帧开始引导。

这里路径记得要使用“//”或者“\”,不然不能正确识别。

这里是输入关键词的地方,每个关键词建议对应前面引导的图像,这样才能保证比较稳定的变化,一定要注重关键词,这是是否能生成优质 deforum 视频 的关键。
2)下面是成品
当然在剪辑的时候,可以进行变速处理。
四、剪辑
等我们所有的分镜视频制作完成后,就到了剪辑,
字体是否商用,字幕校对,这两个剪辑的时候很重要,要发表作品的时候,记得认真检查。

1、变速技巧

AI 技术处理的视频在前 4 秒特别稳,所以剪辑时可以倒着放,然后加个速度变化,让画面一开始就很有动感,先是快然后慢慢变慢。接下来,用点特效转场,让视频更流畅。有些大场景我们也可以加入闪进变速,使得画面更具冲击力,先快后慢。

2、转场技巧
在我们将分镜对齐完成之后,我们只需要根据原片的转场,添加对应的转场即可,比如闪黑、叠化、叠加
闪黑一般用在不同场景的切换,叠化叠加一般用在同场景的切换、或者是回忆、想法的过渡转场。
其中也会有一些高速切换的分镜无需转场,最终效果如下

3、音效技巧
音乐处理也很关键,开始时音量小点,然后慢慢变大,这样观众听起来会很自然。视频结束时,音量再慢慢减小,给观众留个回味的空间,不至于太突兀。然后在一些地震的场景上,添加轻微抖动的特效,让画面看起来更生动立体。

如果视频里有别人的声音,可以用技术手段提取出来去掉,然后加上自己的声音,或者用自己处理过的声音替代,这样视频就更有自己的风格了。
4、字幕
在某些黑幕文字转场时,我们也添加相应的文字,调整文字样式、入场、出场动画。
字幕也可以批量进行操作,统一调整字幕的大小,尽量小一点,然后放到离底部边缘近的地方,这样可以显得整个片子质感更高

5、封面设计
封面设计也特别重要,尤其是像小红书和 B 站这样的平台。小红书的封面是竖着的,B 站的是横的,所以要根据平台要求来设计。封面要能突出视频的主题,字体大小要适中,既不能太大也不能太小。
到这里,整个 AI 视频《AI 我华夏》短片的剪辑流程就已经全部结束了。

六、总结
坦率的讲,我们这次的 AI 视频《AI 我华夏》,还是有很多可以优化的地方了。
但是朋友有一句话说的很好:
我们每个人当下的每一步都不是最完美的,但是都在进步,朝着完美的方向去努力!
人生又何尝不是缺憾的艺术呢。
最后感谢洋哥、潘神、西堂、小石、水月等朋友的陪伴。 以前我就是个普普通通的研究生,埋头苦学,但眼光不够远。是洋哥的文字给了我向上爬的动力,让我想去看看外面的世界。
我永远相信,AI 视频一定会成为 2024 年最闪亮的一颗星🌟
风雨同舟,愿与诸君共勉。
谢谢大家!