元峰AI笔记 · AI数字人

3 步让 AI 照片开口唠嗑,比真人还能说!

还记得我上篇跟大家聊的那个用 Flux 搞定高质量人物图的文章吗?结果呢,发出去之后不少小伙伴都跟我说:"哎呀,就光看图有啥意思啊?能不能整点儿高级的,让这人动起来,还能张嘴整两句?

3 步让 AI 照片开口唠嗑,比真人还能说!

还记得我上篇跟大家聊的那个用 Flux 搞定高质量人物图的文章吗?结果呢,发出去之后不少小伙伴都跟我说:"哎呀,就光看图有啥意思啊?能不能整点儿高级的,让这人动起来,还能张嘴整两句?

我一听,这不简单吗。今天,我就来满足你们这帮好奇宝宝的愿望!咱们一起来瞧瞧怎么通过简单 3 步把 AI 生成的静态照片变成会说话的视频!

是不是就是你想想中的样子?

这个视频制作,其实非常简单,仅仅 3 步,保证让你了解到从静到动、从哑巴到话唠的所有秘诀!

第1步:获得高质量人物形象

画图我用的就是 Flux,具体的使用方法,上篇文章我写了好多种方法。👉

我使用仙宫云的 ComfyUI 来生成这些图像。乍一看,这玩意儿确实有点高深莫测。但是别怕!只要你敢尝试,就会发现它其实挺好上手的。而且,用起来特别得心应手,想怎么画就怎么画,还是挺爽的!

图片展示了可灵工具中生成视频的流程。左侧是可灵界面,有多个参数设置区域,如Lora、CLIP、VC等,还设有“Save Image with Gen”“Save Image with Gen2”等节点。右侧是生成视频的示例,显示一位女性在演讲,下方有“Video”“Audio”“Text”等选项。该图与上下文紧密相关,直观呈现了使用可灵将图像转换为视频的操作步骤和界面情况。

第2步:将图像转换为视频

既然咱们已经搞定了图片,是不是该让它们动起来了?想把这些静态美图变成动态的视频吗?这里我们需要挑个趁手的工具!

我给你推荐三个超级好用的:可灵、Luma AIGen3。这三个工具随便选一个就可以让你的图片动起来!

图片展示的是可灵AI的界面,左侧为“KLING Creative Space”板块,有“图文视频”“图文生成”“视频生成”选项,下方是生成视频的提示结构示例,包括人物、场景、动作等信息。右侧是生成的视频画面,一位女士手持麦克风,面带微笑,谈话时用手比划,背景有“VIP”等标识。该图片与上下文介绍的可灵AI生成视频功能相契合,直观呈现了其生成效果。

这里我用的是可灵,可以使用此提示结构来获得高质量的结果。

a woman smiling as she talks, using her hands as she talks

一位女士在交谈时面带微笑,谈话时还用手比划着。

第3步:让视频开口讲话

使用数字人软件,上传刚刚动起来的视频,有两种选择,可以编写脚本并选择声音,也可以直接上传音频文件。

就是这样:

图片展示的是“创建视频”界面,用于制作让图片开口讲话的数字人短视频。左侧有“我的数字分身”和“公用数字分身”选项卡,下方展示多个数字分身头像。右侧上方有“文本驱动”和“音频驱动”选项卡,当前选中“文本驱动”。下方“台词”区域显示一段台词内容,下方“声音”区域有多个声音选项,底部有“提交”按钮。该图片与上文提到的只需几分钟即可制作完成让图片开口讲话的数字人短视频的内容相契合。

只需几分钟,一条让图片开口讲话的数字人短视频就做好了。