全能AI数字人制作指南 1.0
hello,大家好。
今天我们迎来了全新的数字人2.0时代--全能数字人。
还记得第1代 AI 数字人吗?那时候我们必须先拍摄大量的视频素材,让数字人"学会"我们的动作、表情,才能让它张嘴说话。说白了,就是给视频加了个"数字替身",换了个嘴巴。
现在的全能AI数字人,可以让数字人的场景、人物、动作、服装、表情,统统都由 AI 凭空生成。这就是 2.0 时代最革命性的突破——你的数字分身终于获得了"自由"。
首先要了解全能数字人工作流是怎样的流程:
- 对目标人脸采样+训练
- 训练【人脸模型】
- 目标场景转化
- 生成AI人物视频
- 剪辑数字人样本
- 训练数字人形象
- 训练数字人声音
- 生成数字人视频
一、如何开始训练模型呢?
要制作全能数字人视频,我们需要先借助AI视频工具进行“人物捏造”。
这里用到的是可灵AI这个工具,最近推出了一个新功能,就是它的人脸模型。先看一段视频,你就明白了。
可灵AI的视频人脸模型到底是什么呢?
简单来说,用户可以在可灵 1.5 模型上上传多段多角度的高清视频,自己训练出一个独特的人脸模型。训练完成后,你就能用这个人脸模型生成多个短视频,5 秒、10 秒都可以制作。这种自由度真是太赞了,相当于给创作者开了一扇新世界的大门,随心所欲地塑造角色。
可灵AI官网:https://klingai.kuaishou.com/
第1步:AI模型定制
打开【功能入口】Web端首页侧边栏 > AI创作 > AI定制模型。
目前此功能优先面向钻石和铂金会员开放,定制训练专属人脸模型「限时5折」

第2步:同意并使用
点击AI定制模型后进入功能使用须知界面,点击同意并使用按钮完成操作。

第3步:上传一个正面的视频
上传一段正面人脸视频(10-15s,1080p,横竖屏均可),在①的位置输入模型名字点保存,然后点击下一步。

遇到错误,根据提示去调整

比如这里问题分辨率不对,就去剪映里面重新导出一遍标准的视频分辨率格式。

- 比例选择 9:16
- 时长控制在 10-15秒之间
- 导出时选择 1080P
检查自己的分辨率是不是 1080*1920

视频要求
- 竖屏视频:1080*1920 分辨率
- 横屏视频:1920*1080 分辨率
如果不会操作,右边有小姐姐手把手教你应该上传什么样的视频。

第4步:补充多角度的视频
需要补充 10-30 段同一人物的更多动作/表情视频(每段视频 10-15s,1080p),上传至少10个视频之后,就可以开始训练了。 每一个模型需要消耗 999 个可灵值,且用且珍惜。


同样的,小姐姐也会做演示应该上传什么样的视频。

等待 1小时左右之后,我们的视频人脸模型就炼好了。训练完成之后就会给我们一个 5 秒的模型效果视频,这逼真程度,已经非常 Nice 了。

二、AI人物模型视频制作
第1步:文生视频
然后我们接着使用 **【文生视频】**时,输入提示词后就可以选择人物模型了。
选择好人物模型之后,自动会添加到提示词后面,等待几分钟生成AI视频,正面本条视频会调用此人物模型。

可设置自己需要的参数之后在生成。

**生成模式:**高品质
**生成时长:**5秒和10秒可选(5秒消耗35可灵值,10秒消耗70可灵值),建议是选择10秒
**视频比例:**做短视频,建议9:16
**生成数量:**可以一次出1-4条(可灵值会叠加)
提示词: @元峰(人脸模型的名称) “一个穿着橙色西装的男子,戴着橙色眼镜,坐在蓬松的白色云朵上,手里拿着一台相机。周围是绚丽的鲜花,背景是深邃的蓝色星空。这是一张梦幻又富有想象力的画面。”
点击立即生成,大约等20分钟,AI视频就生成好了。
第2步:AI视频下载
对已经生成好的数字人视频下载(可下载有水印或无水印),这里下载的是无水印。

数字人视频效果视频。
视频案例1(16:9比例)
视频案例1(9:16比例)
四、数字人训练
大家有没有发现,可灵直接出来的视频形象场景已经很Nice了,但人物是没有开口讲话的,下一步我们就可以通过数字人软件,让“活”起来,开始讲话。
用到的数字人软件是悟空AI数字人。
悟空AI网址 手机端:https://m.wukoai.com 电脑端:https://wukoai.com 购买悟空AI数字人软件,可以添加元峰微信,gptfeng,备注:悟空AI。
第1步:形象克隆
可灵生成好的数字人视频上传悟空AI克隆数字人分身。

视频要求
视频方向:横向或纵向
文件格式:mp4、mov
视频时长:5秒~30分钟
分辨率:360p~4K
文件大小:小于500MB

第2步:声音克隆
点击声音克隆,选择克隆声音模式
- 基础版:免费
- 高保真:付费


音频要求;文件格式:mp3、m4a、wav,音频时长:5秒~3分钟 基础版声音克隆限时免费的,消耗的积分也少,但声音的质量相对高保真效果会差一点。

高保真声音克隆流程:
音频格式;支持mp3、m4a、wav文件格式,音频文件大小不超过20M。
高保真消耗积分很大,但音质比基础版好。因此再克隆高保真声音时,确保原音频无损坏。


第3步:数字人口播视频制作
生成数字人口播有两种驱动方式:
- ①文本驱动(可输入台词,数字人根据提供的台词进行匹配口型)
- ②音频驱动(上传已准备好的音频,数字人会通过音频内容进行匹配口型)。
选择刚刚克隆好的形象,点击**【去创作】。**

文本驱动
输入台词,选择已训练克隆好的声音,可鼠标滑动选取文本内容, 进行逐句试听, 最多选取300字,点击插入停顿在光标处调整文字之间的停顿时长。

音频驱动
如果觉得AI声音不够生动,可以直接录音,然后上传 mp3 音频文件,这样出来的视频声音会完全还原自己的声音。

第4步:数字人口播视频效果
点击提交,等待几分钟之后,数字人视频就制作好了。
然后我们下载之后来看看效果。
五、数字人唱歌🎤
如果唱歌的,直接上传唱歌的mp3音频文件上去进行音频驱动。音乐从抖音,QQ音乐,网易云音乐找即可。

六、剪辑AI数字人视频
剪辑工具:剪映、开拍等等。
第1步:这里用剪映剪辑
打开剪映点击首页,在点开始创作,进入剪辑界面。

第2步:视频剪辑
导入数字人视频之后进行剪辑,添加字幕,标题,背景音乐等。

第3步:对剪辑好的数字人进行保存

OK,以上就是完整的制作一个全能数字人视频的整体过程。