元峰AI笔记 · AI数字人

全能AI数字人制作指南 1.0

hello,大家好。

全能AI数字人制作指南 1.0

hello,大家好。

今天我们迎来了全新的数字人2.0时代--全能数字人。

还记得第1代 AI 数字人吗?那时候我们必须先拍摄大量的视频素材,让数字人"学会"我们的动作、表情,才能让它张嘴说话。说白了,就是给视频加了个"数字替身",换了个嘴巴。

现在的全能AI数字人,可以让数字人的场景、人物、动作、服装、表情,统统都由 AI 凭空生成。这就是 2.0 时代最革命性的突破——你的数字分身终于获得了"自由"。

首先要了解全能数字人工作流是怎样的流程:

  1. 对目标人脸采样+训练
  2. 训练【人脸模型】
  3. 目标场景转化
  4. 生成AI人物视频
  5. 剪辑数字人样本
  6. 训练数字人形象
  7. 训练数字人声音
  8. 生成数字人视频

一、如何开始训练模型呢?

要制作全能数字人视频,我们需要先借助AI视频工具进行“人物捏造”。

这里用到的是可灵AI这个工具,最近推出了一个新功能,就是它的人脸模型。先看一段视频,你就明白了。

可灵AI的视频人脸模型到底是什么呢?

简单来说,用户可以在可灵 1.5 模型上上传多段多角度的高清视频,自己训练出一个独特的人脸模型。训练完成后,你就能用这个人脸模型生成多个短视频,5 秒、10 秒都可以制作。这种自由度真是太赞了,相当于给创作者开了一扇新世界的大门,随心所欲地塑造角色。

可灵AI官网:https://klingai.kuaishou.com/

第1步:AI模型定制

打开【功能入口】Web端首页侧边栏 > AI创作 > AI定制模型。

目前此功能优先面向钻石和铂金会员开放,定制训练专属人脸模型「限时5折」

图片展示了可灵AI官网首页界面。左侧导航栏中,红色箭头分别指向“首页”“AI定制模型”“AI图片”“AI视频”等选项。右侧以“新一代AI创意生产力平台”为标题,展示“AI图片”“AI视频”“视频剪辑”等功能板块,下方有多个视频缩略图。该图片对应文档中“如何开始训练模型”步骤中的第1步,即打开【功能入口】Web端首页侧边栏>AI创作>AI定制模型,直观呈现了操作入口位置。

第2步:同意并使用

点击AI定制模型后进入功能使用须知界面,点击同意并使用按钮完成操作

图片展示的是可灵AI“人脸模型”功能使用须知界面。界面上方有“【可灵AI】「人脸模型」功能使用须知”标题,下方详细列出了与可灵AI网站、个人头像、用户权益相关的联系方式等信息。底部有“不同意并返回”和“同意并使用”两个按钮,其中“同意并使用”按钮被红色箭头突出指向。该图片与上文“第2步:同意并使用”内容对应,用于指导用户点击同意并使用按钮完成操作。

第3步:上传一个正面的视频

上传一段正面人脸视频(10-15s,1080p,横竖屏均可),在①的位置输入模型名字点保存,然后点击下一步。

图片展示的是可灵AI平台的视频上传界面。左侧显示视频录制时长为0:00/1:04,提示上传一段正脸人后视频格式为1080*1920(1080p,1080p,编码码率4M)。中间是视频录制窗口,画面中人物穿着白色T恤,背景为室内环境。右侧是视频预览区,有多个视频缩略图,其中“视频预览”缩略图被绿色框突出显示。该图片与文档中如何开始训练模型的内容相关,展示了上传视频的界面及操作情况。

遇到错误,根据提示去调整

图片展示的是一个视频上传界面,提示上传一段正面人脸视频(5 - 15秒,1080p,横竖屏均可)。右侧有一个红色的“X”图标,旁边有红色文字“视频分辨率过低,短边需要≥1080像素”,表明当前视频分辨率不符合要求。该图片与上下文紧密相关,上下文提到遇到问题时需根据提示调整,此图即为提示中“分辨率不对”问题的示例,指导用户解决视频分辨率过低的问题。

比如这里问题分辨率不对,就去剪映里面重新导出一遍标准的视频分辨率格式。

图片展示了全能AI数字人制作平台的界面及操作示例。左侧是视频剪辑界面,标注“时长:10 - 15秒之间”。中间是视频预览窗口,显示一位男士正在讲解。右侧是视频导出窗口,提示“导出视频的分辨率,选择1080P”。画面中还突出显示了视频分辨率设置为1080P,以及视频时长控制在10 - 15秒之间的内容。该图片与文档中关于视频制作要求的上下文对应,直观呈现了视频制作的相关操作和设置。

  • 比例选择 9:16
  • 时长控制在 10-15秒之间
  • 导出时选择 1080P

检查自己的分辨率是不是 1080*1920

图片展示了视频文件“可灵模型训练素材1.mp4”的属性界面,其中关键信息为视频的分辨率,宽度为1080,高度为1920。该图片与文档中“视频要求”部分内容相关,用于说明视频分辨率应为1080*1920,以符合竖屏视频的格式要求,若分辨率不符,需在剪映中重新导出标准格式视频。

视频要求

  • 竖屏视频:1080*1920 分辨率
  • 横屏视频:1920*1080 分辨率

如果不会操作,右边有小姐姐手把手教你应该上传什么样的视频。

图片展示了视频制作时的视频要求及常见问题示例。上方标题为“视频要求”,下方有示例视频,显示“仅有1人,正面镜头,人脸占比超过1/4,表情自然”,并有绿色对勾标识。下方列出不应出现的情况,包括大面积遮挡、光线昏暗、视频模糊、人脸太小、画面有字幕、多个人脸等,每个情况旁有红色叉号标识。该图片与文档中视频要求的内容相关,直观呈现了视频制作时的规范及常见问题示例。

第4步:补充多角度的视频

需要补充 10-30 段同一人物的更多动作/表情视频(每段视频 10-15s,1080p),上传至少10个视频之后,就可以开始训练了。 每一个模型需要消耗 999 个可灵值,且用且珍惜。

图片展示的是一个视频制作平台界面,用于补充多角度视频以训练模型。界面上方有“返回”“元解”“上传正面视频”“补充多角度视频”等选项。中间部分提示需补充10 - 30段同一人物的更多动作/表情视频(每段10 - 15s,1080p),并列出上传视频、训练视频效果等步骤。下方有一个视频预览框,显示一位长发女性在草地上,框内有“我知道了”按钮。该图片与文档中关于补充多角度视频以训练模型的内容相关,直观呈现了操作界面及要求。

图片展示的是可灵AI平台界面,用于补充多角度视频以训练模型。界面上方显示“光鲜”及“上传注视视频”“补充多角度视频”选项。中间部分有多个视频窗口,呈现不同角度的同一人物视频,如在室内、户外等场景。右侧有“我视频需求”“我视频反馈”“我视频操作记录”等板块,显示视频状态及操作记录。该图片与上下文介绍的补充多角度视频以训练模型的内容相关,直观呈现了上传视频的操作界面。

同样的,小姐姐也会做演示应该上传什么样的视频。

图片展示了视频制作要求及动作示例。要求人物仅1人,五官清晰,不戴帽子或口罩,多视频同日拍摄,避免外貌变化;每段视频10 - 15秒,1080p,建议更换背景,光线良好,镜头固定或稳定,避免画面晃动,对焦人脸。动作示例包括手部大幅运动、打招呼、左右转头、微笑、上下抬头低头、蹲下起立、朗读文字、哭泣等,每条视频一个动作,录制多条,多样化人像视频,尽量包含特写、近景、中景和远景等不同人脸大小,以提升模型训练效果。

等待 1小时左右之后,我们的视频人脸模型就炼好了。训练完成之后就会给我们一个 5 秒的模型效果视频,这逼真程度,已经非常 Nice 了。

图片展示的是人脸模型详情界面。左侧显示模型名称为“元峰”,创建时间为2024 - 10 - 30,还有一张人物头像。右侧有“生成视频”按钮,旁边有三个点的图标。下方是模型效果示例,展示了一位篮球运动员在比赛中的场景。该图片与上文提到的训练完成并生成5秒模型效果视频的内容相关,直观呈现了训练完成后的模型效果。

二、AI人物模型视频制作

第1步:文生视频

然后我们接着使用 **【文生视频】**时,输入提示词后就可以选择人物模型了。

选择好人物模型之后,自动会添加到提示词后面,等待几分钟生成AI视频,正面本条视频会调用此人物模型。

图片展示的是AI视频生成界面。左侧为参数设置区域,有“文生视频”“图生视频”选项,当前选中“文生视频”。下方有提示词输入框,示例提示词为“一个穿着橙色西装的男子,戴着橙色眼镜,坐在蓬松的白色云朵上,手里拿着一台相机”。右侧是生成的视频预览图,画面中男子穿着橙色西装,戴着橙色眼镜,坐在云朵上,背景是星空和花朵。底部有“立即生成”按钮。该图片与上下文介绍的AI人物模型视频制作中“文生视频”步骤相关,展示了视频生成的设置界面及预览效果。

可设置自己需要的参数之后在生成。

图片展示的是KLING Creative Space平台的AI视频文生视频界面。画面中突出显示了“创意描述”区域,内有提示词“@元峰(人脸模型的名称)“一个穿着橙色西装的男子,戴着橙色眼镜,坐在蓬松的白色云朵上,手里拿着一台相机。周围是绚丽的鲜花,背景是深邃的蓝色星空,这是一张梦幻又富有想象力的画面。”下方有“134/500”字数提示。界面还设有“参数设置”“立即生成”等操作按钮,以及“灵感值消耗明细”下拉选项。该图片与文档中“文生视频”步骤的上下文对应,用于说明AI视频生成时的提示词填写等内容。

**生成模式:**高品质

**生成时长:**5秒和10秒可选(5秒消耗35可灵值,10秒消耗70可灵值),建议是选择10秒

**视频比例:**做短视频,建议9:16

**生成数量:**可以一次出1-4条(可灵值会叠加)

提示词: @元峰(人脸模型的名称) “一个穿着橙色西装的男子,戴着橙色眼镜,坐在蓬松的白色云朵上,手里拿着一台相机。周围是绚丽的鲜花,背景是深邃的蓝色星空。这是一张梦幻又富有想象力的画面。”

点击立即生成,大约等20分钟,AI视频就生成好了。

第2步:AI视频下载

对已经生成好的数字人视频下载(可下载有水印或无水印),这里下载的是无水印。

图片展示的是AI视频制作平台的界面,左侧为视频生成界面,有“文生视频”选项,下方有输入框及参数设置区域,如视频清晰度、视频时长等。右侧是生成的视频效果,画面中人物坐在云朵上,背景为星空,周围有花朵。右下角有“有水印下载”“无水印下载”按钮,以及分享、收藏、下载等操作按钮。该图片与上下文介绍的AI人物模型视频制作中“文生视频”步骤相关,展示了视频生成效果及操作选项。

数字人视频效果视频。

视频案例1(16:9比例)

视频案例1(9:16比例)

四、数字人训练

大家有没有发现,可灵直接出来的视频形象场景已经很Nice了,但人物是没有开口讲话的,下一步我们就可以通过数字人软件,让“活”起来,开始讲话。

用到的数字人软件是悟空AI数字人

悟空AI网址 手机端:https://m.wukoai.com 电脑端:https://wukoai.com 购买悟空AI数字人软件,可以添加元峰微信,gptfeng,备注:悟空AI。

第1步:形象克隆

可灵生成好的数字人视频上传悟空AI克隆数字人分身。

图片展示了悟空AI平台上的多个数字分身形象,画面中有不同装扮、姿态和背景的数字人,如穿礼服的女性、穿正装的男性等。这些数字分身排列整齐,界面左上角有“我的数字分身(40)”字样,提示数字分身数量。此图片位于“全能AI数字人制作指南1.0”中“数字人训练”部分,与视频、音频要求及声音克隆等内容相关,可能是展示可用于训练的数字人形象资源。

视频要求

视频方向:横向或纵向

文件格式:mp4、mov

视频时长:5秒~30分钟

分辨率:360p~4K

文件大小:小于500MB

图片展示的是全能AI数字人制作平台的数字分身页面。左侧为平台导航栏,有声音克隆、视频制作等选项。中间部分显示多个数字分身缩略图,如“杨超越数字分身”“AI数字人科技主播”等。右侧为“复刻杨宁分身”详情,有数字分身名称输入框、上传视频、上传音频等操作选项,还展示了视频预览画面。该图片与文档中数字人训练部分的视频要求及声音克隆操作说明相关,直观呈现了数字分身的展示与操作界面。

第2步:声音克隆

点击声音克隆,选择克隆声音模式

  • 基础版:免费
  • 高保真:付费

图片展示了悟空AI平台的个人声音克隆功能界面。左侧导航栏有“数字分身”“声音克隆”“作品管理”“个人中心”选项,当前选中“声音克隆”。右侧主界面中,“个人声音克隆(3)”板块内有“声音克隆”选项,其旁有“快速克隆”按钮,下方标注“上传音频,打造专属个人声音”。图片中红色箭头指向“声音克隆”选项,与上下文介绍的点击声音克隆选择克隆声音模式的内容相呼应,直观呈现操作位置。

图片展示了全能AI数字人制作中声音克隆的模式选择界面。界面上方显示“模式选择”,下方有“声音克隆 - 基础版”和“声音克隆 - 高保真”两个选项。基础版可上传5 - 30S音频,快速克隆个人声音;高保真可上传5 - 30S音频,高度还原真人音色特点、说话风格、口音和声学环境。图片中用红色箭头分别指向两个模式选项,与上下文介绍的高保真付费、基础版免费且声音质量相对差一点的内容相呼应。

音频要求;文件格式:mp3、m4a、wav,音频时长:5秒~3分钟 基础版声音克隆限时免费的,消耗的积分也少,但声音的质量相对高保真效果会差一点。

图片展示了全能AI数字人制作中声音克隆的界面。界面上方有“声音克隆”标题,下方有“声音名称”输入框,示例输入为“a3”,并有红色箭头指向。中间部分为“参考音频”区域,有音频播放按钮及进度条,下方有“重新上传”按钮。底部有“我已阅读并同意《使用者承诺须知》”勾选框,以及“限时免费”标识,还设有“取消”和“确定”按钮,其中“确定”按钮被红色箭头突出显示。该图片与上下文介绍的高保真声音克隆流程相关,展示了操作步骤中的关键界面。

高保真声音克隆流程:

音频格式;支持mp3、m4a、wav文件格式,音频文件大小不超过20M。

高保真消耗积分很大,但音质比基础版好。因此再克隆高保真声音时,确保原音频无损坏。

图片展示的是全能AI数字人制作中高保真声音克隆流程。主要内容有:一是上传参考音频,要求音频时长在10 - 30s,质量上需单人说话、低底噪、音量语速稳定等,内容上提前确定风格且情绪饱满;二是预览效果,不满意可修改,有2次修改机会;三是积分消耗,每个声音克隆需10000积分。图中有数字序号标识步骤,还有“下一步”按钮。此图与上文高保真声音克隆流程的文字说明相匹配,详细说明了操作要求。

图片展示了高保真声音克隆的界面。上方有“声音克隆 - 高保真”标题,下方有“声音名称”输入框,已输入“a3”。中间部分有“参考音频”按钮,下方显示音频格式为mp3、m4a、wav,时长5秒~3分钟,大小小于20MB。下方有进度条,可重新上传音频。底部有“开始克隆”按钮,旁边显示消耗10000积分,剩余免费次数为0。该图片与上下文介绍的高保真声音克隆流程相关,直观呈现了操作界面及要求。

第3步:数字人口播视频制作

生成数字人口播有两种驱动方式:

  • ①文本驱动(可输入台词,数字人根据提供的台词进行匹配口型)
  • ②音频驱动(上传已准备好的音频,数字人会通过音频内容进行匹配口型)。

选择刚刚克隆好的形象,点击**【去创作】。**

图片展示的是“我的数字分身(41)”页面,左侧有“数字分身”“声音克隆”“作品管理”“个人中心”选项。右侧上方显示“4K超清数字人 AI颜值天花板”。中间有“数字分身”板块,标注“上传视频 快速复刻数字分身”,并有“快速复刻”按钮。右侧有一个视频缩略图,显示“AI数字人元峰科技正装3_40秒”,下方有“去创作”按钮,该按钮被红色箭头指向突出显示。此图与上文数字人口播视频制作流程中“点击提交,等待几分钟之后,数字人视频就制作好了”相呼应,展示了视频制作完成后的呈现效果。

文本驱动

输入台词,选择已训练克隆好的声音,可鼠标滑动选取文本内容, 进行逐句试听, 最多选取300字,点击插入停顿在光标处调整文字之间的停顿时长。

图片展示的是数字人口播视频制作界面。左侧显示“我的数字分身”和“公用数字分身”选项,其中“我的数字分身”下有多个视频缩略图。右侧上方有“文本驱动”和“音频驱动”选项,当前选中“文本驱动”。下方“台词”区域有输入框,示例台词为一段英文。声音部分有“公共”和“我的”选项,当前选中“我的”,下方有“元峰基础”和“元峰”两个声音选项,其中“元峰”被红色框突出显示。底部有“提交”按钮。

音频驱动

如果觉得AI声音不够生动,可以直接录音,然后上传 mp3 音频文件,这样出来的视频声音会完全还原自己的声音。

图片展示的是全能AI数字人制作平台中数字人口播视频制作的音频驱动界面。左侧有“我的数字分身”和“公用数字分身”选项,右侧音频驱动区域显示可上传mp3、m4a、wav格式的录音文件,支持5秒 - 30分钟的音频时长,有播放、暂停、上传录音文件等操作按钮,以及“提交”按钮。该图片与上下文紧密相关,直观呈现了音频驱动下数字人口播视频制作的具体操作界面。

第4步:数字人口播视频效果

点击提交,等待几分钟之后,数字人视频就制作好了。

然后我们下载之后来看看效果。

五、数字人唱歌🎤

如果唱歌的,直接上传唱歌的mp3音频文件上去进行音频驱动。音乐从抖音,QQ音乐,网易云音乐找即可。

图片展示的是剪辑AI数字人视频的创建视频界面。左侧有“我的数字分身”和“公用数字分身”选项,可选择歌手形象。右侧有“文本驱动”和“音频驱动”两个驱动方式,当前选中“音频驱动”。下方有音频需求说明,支持mp3、m4a、wav格式,需5秒~30分钟。中间有音频上传区域,显示已上传16秒音频。底部有“重新上传”按钮和“提交”按钮。该图片与上下文介绍的剪辑AI数字人视频制作流程相关,展示了创建视频时的音频驱动选择及上传操作步骤。

六、剪辑AI数字人视频

剪辑工具:剪映、开拍等等。

第1步:这里用剪映剪辑

打开剪映点击首页,在点开始创作,进入剪辑界面。

图片展示了全能AI数字人制作平台的界面。左侧为用户头像及个人信息区域,有“个人主页”“模板”等选项。右侧上方有“开始创作”按钮,下方有“首页”“视频翻译”“智能裁剪”等板块,以及“创作脚本”“营销成片”等选项。图片中红色箭头分别指向“首页”和“开始创作”按钮,对应文档中“用AI制作做短视频,轻松获取海量客户_元峰.mp4”视频剪辑及数字人制作的开始操作步骤,直观呈现操作入口。

第2步:视频剪辑

导入数字人视频之后进行剪辑,添加字幕,标题,背景音乐等。

图片展示的是数字人视频制作软件界面,左侧为素材库,有多个视频片段。中间是视频预览窗口,显示数字人正在操作电脑,画面背景有“用AI制作短视频轻松获取海量客户”等文字。右侧是特效、滤镜等设置区域。底部是时间轴,有多个视频片段排列。该图片与文档中“对剪辑好的数字人进行保存”步骤相关,直观呈现了数字人视频制作的界面情况。

第3步:对剪辑好的数字人进行保存

图片展示了全能AI数字人制作中对剪辑好的数字人进行保存的界面。左侧是数字人视频缩略图,中间是视频信息栏,右侧是视频设置区域,包括视频输出、AI视频、AI视频效果等选项。关键信息是视频输出部分,有清晰度、分辨率、编码、格式、帧率等设置,其中清晰度为4K,分辨率4K,编码为H.264,格式为mp4,帧率30fps。下方有“取消”和“保存”按钮,箭头分别指向“保存”按钮和“视频输出”区域。

OK,以上就是完整的制作一个全能数字人视频的整体过程。