元峰AI笔记 · AI数字人

Sadtalk 数字人使用

文章 copy自 <cite docid"Sel1dnrFgoKZrzxN2Grc7tYqnwW" filetype"docx" title"实战:使用SD创建虚拟数字人" type"doc"</cite

Sadtalk 数字人使用

文章 copy自

其他数字人工具:

前段时间heygen可谓是只需3步便能生成虚拟数字人。那么免费的Stable diffusion当然也不能落下,今天带给大家的是让stable diffusion + sadTalk 插件的方式来生成虚拟数字人,并让其开口说话和唱歌。本次着重讲解在本地部署方式,如果大家想直接体验可去抱脸网。大家去官网摸索可能需要一段时间才能成功,下面带着大家实战一把,文章中并穿插讲解每一步的作用,坑我已经帮大家踩过了。现在实战只需要几分钟

第一步:安装扩展插件SadTalker

打开stable diffusion webui选择extensions-》从URL安装,安装地址填写:

https://github.com/OpenTalker/SadTalker.git (用于风格化音频驱动单图像说话人脸动画的真实 3D动画)

如果安装扩展过程中总是提示 无权限访问,则可以在启动webui-user.bat中添加额外的启动参数 --enable-insecure-extension-access

第二步:下载sadTalker插件所需要的模型与离线包文件

在我们第一步安装插件后,大家重启webui便能看到SadTalker的tab选项,如下所示:

图片展示了Stable Diffusion界面中的SadTalker选项卡。界面上方显示SadTalker相关论文信息及Arxiv、Homepage、Github等链接。左侧有“Upload image”区域,展示了一张古装女性的头像图片;下方是“Upload OR TTS”区域。右侧为设置区域,有“Pose style”滑动条,“face model resolution”“preprocess”等选项。此图与上下文关系为:上下文提到安装插件后重启webui能看到SadTalker的tab选项,此图即展示了该选项卡界面。

但是sadtalker的插件的运行需要我们下载两部分内容,一部分是checkpoint,一部分是GFPGAN模型.

checkpoint文件下载和配置

**checkpoint : 指的是运行sadtalker插件需要的基础模型,如:预训练模型、构造脸部说话姿势等工具模型。**下面提供两种下载地址:

1、网页端下载,请按下图红框框出来的模型下载

首先打开网址:https://github.com/OpenTalker/SadTalker/releases。

先下载这4个文件

图片展示的是在https://github.com/OpenTalker/SadTalker/releases网页端下载SadTalker插件所需checkpoint文件的部分界面。图中红框圈出了首先要下载的4个文件,分别为mapping_0019 - model.pth.tar(149 MB)、mapping_00229 - model.pth.tar(148 MB)、SadTalker_V0.0.2_256.safetensors(691 MB)、SadTalker_V0.0.2_512.safetensors(691 MB)。这是文档中介绍checkpoint文件下载和配置时,网页端下载方式里首先要下载的部分内容,之后还需继续下滑界面下载另外8个文件。

当前界面一直往下滑,再下载8个文件:

图片展示的是在https://github.com/OpenTalker/SadTalker/releases网页端下载SadTalker插件checkpoint文件的部分内容。画面中“Assets”下有多个文件,其中被红框突出显示的有audio2exp_00300-model.pth、audio2pose_00140-model.pth等共8个文件。这些文件是运行SadTalker插件所需基础模型的一部分。结合上下文,在该网页先下载4个文件,再下滑下载图中这8个文件,一共12个文件,下载完成后需将其放到指定路径D:\2023\ai\resource\stable-diffusion-webui\extensions\SadTalker\checkpoints下。

一共12个文件。

2、百度网盘下载链接方式:

https://pan.baidu.com/s/1P4fRgk9gaSutZnn8YW034Q?pwd=sadt

大家任选一种方式下载,完成后将下载的12个文件放到如下路径下:

D:\2023\ai\resource\stable-diffusion-webui\extensions\SadTalker\checkpoints

如果没有checkpoints 文件夹可手动创建,注意的是别忘了解压hub.zip文件,如下我的目录可参考。

图片展示的是将下载的SadTalker插件所需checkpoint文件放置后的文件夹目录。目录路径为D:\2023\ai\resource\stable-diffusion-webui\extensions\SadTalker\checkpoints ,其中包含名为hub的文件夹,以及audio2exp_00300 - model.pth、audio2pose_00140 - model.pth等多个文件,文件类型有PTH、WinRAR压缩文件、SAFETENSORS文件、DAT文件等。该图片与上文提到的将下载的12个checkpoint文件放置到指定路径的内容相呼应,可作为参考目录。

GFPGAN模型下载

GFPGAN是一种人脸增强模型,而sadTalker插件也训练了自己的人脸增强模型,下载地址如下:

1、网页下载方式

https://drive.google.com/file/d/19AIBsmfcHW6BRJmeqSFlG5fL445Xmsyi?usp=sharing

2、百度网盘下载地址

https://pan.baidu.com/s/1kb1BCPaLOWX1JJb9Czbn6w?pwd=sadt

下载并解压,一共4个模型文件放到如下目录中:

D:\2023\ai\resource\stable-diffusion-webui\extensions\SadTalker\gfpgan\weights

如果上述目录没有,请在SadTalker目录中自行创建

如下:

图片展示了应放置GFPGAN模型文件的目录“D:\2023\ai\resource\stable-diffusion-webui\extensions\SadTalker\gfpgan\weights”中的内容,有4个模型文件,分别是alignment_WFLW_4HG.pth、detection_Resnet50_Final.pth、GFPGANv1.4.pth、parsing_parsenet.pth,文件类型均为PTH文件,修改日期为2023年4月17日或6月30日,大小各不相同。此图片与上文提到的将下载并解压后的4个GFPGAN模型文件放到指定目录的内容相呼应。

第三步:下载并安装ffmpeg

这一步的作用是语音格式的各种转换,虚拟数字人能开口说话,需要我们上传自己的语音,如果格式不符合会自动转换。

Windows下安装使用ffmpeg

官网下载并安装: http://ffmpeg.org/download.html

图片展示的是在Windows下从ffmpeg官网下载ffmpeg的操作界面。界面中有“More downloading options(更多下载选项)”和“Get packages & executable files(获取软件包和可执行文件)”等标题。下方有分别代表Linux、Windows、Mac系统的下载图标,其中Windows图标被红色框线突出显示。下方“Windows EXE Files”区域中,“Windows builds from gyan.dev”选项也被红色框线标出,并有红色箭头指向,它是Windows系统下下载ffmpeg的一个来源链接。此图与文档中“Windows下安装使用ffmpeg”部分内容对应,用于指导下载操作。

图片展示了在Windows下下载ffmpeg的界面。画面中上方显示最近构建更新时间为2023-06-29,下次构建更新时间为2023-07-03。左侧有“Sections”菜单,其中包含“git master builds”等选项。右侧内容区中,红框突出显示“git master builds”区域,下方箭头所指处为“ffmpeg-git-full.7z”下载选项。这张图片与文档中“Windows下安装使用ffmpeg”部分内容对应,直观呈现了官网下载ffmpeg文件的具体位置和操作指引。

点击后下载,将下载的文件拷贝到C盘根路径下,解压后并重新命名为ffmpeg

图片展示了Windows系统下C盘根路径中的ffmpeg文件夹内容。文件夹内有bin、doc、presets等子文件夹,以及LICENSE、README等文件,修改日期均为2023年6月29日19:32。该图片与文档中“Windows下安装使用ffmpeg”部分内容相关,对应将官网下载的ffmpeg文件拷贝到C盘根路径下,解压后重新命名为ffmpeg这一步骤,直观呈现了文件放置后的目录结构情况。

配置环境变量

快捷键 win + R ,输入:SYSTEMPROPERTIESADVANCED ,回车

图片展示的是Windows系统“运行”对话框界面,对话框顶部显示“运行”,下方提示“Windows将根据你所输入的名称,为你打开相应的程序、文件夹、文档或Internet资源”。“打开(O)”后的输入框中已填入“SYSTEMPROPERTIESADVANCED”。该图片对应文档中“配置环境变量”步骤里,使用快捷键win+R后输入“SYSTEMPROPERTIESADVANCED”回车这一操作说明,是配置环境变量操作中的一个关键步骤图示。

点击环境变量-》选择path-》编辑-》新建-》填入:C:\ffmpeg\bin

检查ffmpeg是否安装成功,如下则成功

图片展示的是在命令行中检查ffmpeg是否安装成功的界面。画面中命令行窗口输入了“ffmpeg -version”指令,下方反馈了ffmpeg的版本信息,显示为2023 - 06 - 27 - git - 9b6d191a66 - full_build - www.gyan.dev等内容,还包括编译使用的gcc版本、配置选项以及各组件的版本号等。该图片与上文配置环境变量后检查ffmpeg安装情况的上下文对应,若出现此类反馈信息,则表明ffmpeg安装成功。

第四步:生成虚拟数字人视频

打开sadtalker上传图片和语音,设定参数,按如下设定即可,语音可用手机自带的录音,图片可选一个您使用stable diffudion生成过的图片,当然也可选择你自己训练的头像等。如下:

图片展示了Sadtalker生成虚拟数字人视频的操作界面。左侧上传了一张古装女性头像图片,下方有音频上传区域,显示一段时长为0:10的音频。右侧是参数设置区域,包括Pose style(姿态风格)滑动条、face model resolution(面部模型分辨率)选择(256和512,提示512低配置慎用)、preprocess(预处理方式)选项(crop等),还有“GFPGAN as Face enhancer”勾选框。底部有橙色的“生成”按钮。此图与上下文内容对应,为生成虚拟数字人视频时的参数设定示例。

生成后的效果:

大家可以看到,美女这牙还不错。还自带陶醉的表情,

图片展示了绘世2.7.0软件运行中的界面,背景为黑色,界面上有大量白色的代码和文字信息。其中显示了Python版本为3.10.11等相关信息,还有关于启动参数、模型加载等内容,如加载ControlNet v1.1.419、加载Stable - diffusion相关模型等,以及生成视频的相关路径和名称信息。该图片与上文生成虚拟数字人视频相关,可能是生成过程中的运行日志界面。

图片展示的是Sadtalker生成虚拟数字人视频的界面。左侧为上传音频区域,已上传一段时长49秒的音频,进度条显示在0:00处。上方为一张人物图片,可能是待生成虚拟数字人所使用的头像。右侧是参数设定区,可设置姿态样式、脸部模型分辨率、预处理方式、静止模式、生成的单批数量等参数,当前脸部模型分辨率选择256,预处理选择裁剪,生成的单批数量为2,还可选择是否使用GFPGAN增强面部,下方橙色“生成”按钮醒目。该图与文档中第四步生成虚拟数字人视频的内容对应。