元峰AI笔记 · AI数字人

图片说话届的王者来了,微软刚刚发布 VASA-1,比 EMO 效果还好

Microsoft 刚刚推出了 VASA1,效果炸裂,比 EMO 那个效果还好

图片说话届的王者来了,微软刚刚发布 VASA-1,比 EMO 效果还好

Microsoft 刚刚推出了 VASA-1,效果炸裂,比 EMO 那个效果还好

这是一种新的人工智能模型,仅需一张肖像照和一段语音,即可实时生成极其逼真的讲话头像视频,视频中的唇形与声音同步精确,面部表情生动,头部动作自然。

图片展示了VASA-1模型生成的逼真对话头像视频,包括一张单人肖像照和一段音频片段,以及可选的控制信号。图片中展示了不同人物的面部表情和头部动作,与音频同步精确,面部表情生动自然。该模型能够基于单一静态图像及语音片段,生成仿佛真人般的对话面孔及富有表现力的视觉情感技能(VAS)。图片在上下文中起到直观展示模型效果的作用,帮助读者理解VASA-1模型如何通过简单的输入生成逼真的对话视频。

https://www.microsoft.com/en-us/research/project/vasa-1/

我们提出了VASA框架,该框架能基于单一静态图像及语音片段,生成仿佛真人般的对话面孔及富有表现力的视觉情感技能(VAS)。VASA-1 作为我们的首款产品,不仅实现了唇部运动与音频的精准同步,还能够捕捉到丰富的面部细节和自然头部动作,增强了作品的真实感和生动感。核心创新在于我们开发的一个全面的面部动态及头部运动生成模型,此模型在面部潜空间中进行操作,并利用视频资料开发了这一表达力强和高度解耦的面部潜空间。

通过大量的实验和新指标的评估,我们证明了我们的方法在多个维度上明显优于以往的技术。我们的技术不仅提供高质量的视频输出和逼真的面部及头部动态,还能支持实时生成 512x512 分辨率的视频,帧率可达 40 FPS,启动延迟几乎为零,为实时与仿真人类对话行为的虚拟化身互动提供了可能。

(注:本页面所有肖像均为虚构身份,由StyleGAN2或DALL·E-3生成,蒙娜丽莎除外。)

真实感和生动感

我们的技术不仅能精确同步唇音,还能捕捉到丰富的情感和表情细微差别及自然的头部动作,这些都有助于对真实感和生动感的感知。此外,我们的扩散模型可根据可选的信号(如眼睛注视方向、头部距离和情感偏移)来控制生成过程。

一分钟的场长视频案例

一些比较短的案例

生成的可控性

我们的扩散模型接受可选信号作为条件,如主要眼神方向和头部距离,以及情感偏移。

在不同主视线方向下的生成效果(依次为正面、向左、向右及向上)

在不同头部距离尺度下的生成效果

在不同情感偏移下的生成效果(分别对应中性、快乐、愤怒和惊讶)

超越训练数据的泛化能力

我们的技术能处理超出训练数据分布的图片和音频输入。例如,它可以处理艺术照、唱歌音频和非英语语音。这些类型的数据在训练集中没有出现。

解耦的力量

我们的潜在表征能解耦外观、三维头部姿势及面部动态,从而实现对生成内容的属性独立控制和编辑。

使用相同的照片进行不同动作序列的生成示例(左侧两个案例),以及使用相同动作序列但不同照片的生成示例(右侧三个案例)

姿势与表情编辑示例(原始生成效果,仅改变姿势的效果,仅改变表情的效果,以及结合旋转姿势的表情效果)

实时性能

在离线批处理模式下,我们的方法能以 45fps 的速度生成 512x512 视频帧,在线流模式下则能支持高达 40fps,前置延迟仅为 170 毫秒,此项测试是在一台装有 NVIDIA RTX 4090 GPU 的台式电脑上进行的。

使用 AI 的风险与责任

我们的研究致力于为虚拟AI头像创造视觉情感表达能力,目标是积极应用这些技术。我们明确表示,这些技术并非用于制作误导或欺骗性内容。与此同时,我们也清楚,类似的内容生成技术可能被误用于模仿真人。我们坚决反对任何制作误导或损害真实人物的内容,并且我们也在探索如何利用这些技术帮助提高伪造内容的检测能力。目前,这种方法生成的视频虽然还包含一些可识别的瑕疵,且距离达到真实视频的真实度还有一段距离。

我们承认这种技术的误用风险,但也必须看到其巨大的正面潜力。这些技术带来的好处多种多样,从增强教育公平,到提高交流障碍者的可访问性,再到为需要帮助的人提供陪伴或治疗支持,这些都凸显了我们研究的重要性和其他相关技术的探索价值。我们致力于负责任地发展AI技术,以推动人类福祉的进步。