元峰AI笔记 · AI绘画与视频

AI 视频神器:**Stable Video Diffusion**

<titleAI 视频开源神器,Stable Video Diffusion 来了!</title

AI 视频开源神器,Stable Video Diffusion 来了!

大家好,我是元峰,13 颗 AI 之心持有者。

前天,AI 制作视频的另外一款神器**稳定视频扩散(Stable Video Diffusion)**发布了,没错,就是 SD 那家公司,也开始进军视频领域了。下面是其宣传片,一睹为快!

AI 视频神器:Stable Video Diffusion

这周,大家可能都在关注 OpenAI 的“吃瓜大戏”,但在 AI 行业,其他公司并没有被这些新闻影响,而是忙于自己的产品开发。

以 Stability AI 为例,他们最近推出了一款名为**稳定视频扩散(Stable Video Diffusion)**的 AI 模型。这款模型是在他们的图像模型 Stable Diffusion 基础上开发的首个视频生成基础模型,可以将静态图片转化为动态视频。它基于 Stability AI 现有的文字转图像技术“Stable Diffusion”,在开源和商业应用领域,都是少有的视频生成模型之一。

图片展示的是Stability AI发布稳定视频扩散的推文。内容提到这是基于图像模型Stable Diffusion的首个生成人工智能视频的基础模型,代码、权重和研究论文已提供。还邀请注册候补名单以访问新网络体验,该体验具文本转视频界面。下方有“Ice dragon in the mountains”字样的视频,时长15秒,背景是雪山和蓝龙。该图片与上下文紧密相关,直观呈现了Stability AI发布稳定视频扩散模型的宣传内容。

但,目前并非人人都能随意使用。

目前,Stability AI 正在开发的稳定视频扩散技术主要应用于科研领域,还未在现实生活和商业领域投入使用。对这项技术感兴趣的用户可以登记加入等待名单,抢先体验。Stability 为这个平台特设了一个将文字转换为视频的界面。

使用这项技术的用户需要遵守一些特定条件。这些条件规定了模型适用的场景,比如作为**“教育或创意工具”、“设计与艺术创作”,同时也指出了不适合使用的场合,例如“真实或精确地描述人物或事件”**。

根据 Stability AI 发布的外部评估报告,对 Stability AI 的技术与 Runway、Pika Labs 等文本到视频平台进行了比较。在用户偏好调研方面已经超越了市场上其他领先的封闭源模型。

图片展示了Stable Video Diffusion(SVD)和SVD-XT与Runway、Pika Labs等平台在用户偏好调研方面的比较。左侧为SVD(14帧)与竞争平台的对比,右侧为SVD-XT(25帧)与竞争平台的对比。图中SVD和SVD-XT以紫色柱状图呈现,Runway和Pika Labs以黑色柱状图呈现。SVD和SVD-XT在用户偏好调研方面均胜出,且SVD-XT在25帧时表现更优。该图与上下文提到的Stability AI技术评估报告相呼应,直观呈现了其技术优势。

实际上,Stable Video Diffusion 包含两种模型:SVD 和 SVD-XT

  • SVD 能将静态图像转化为 576×1024 分辨率、14 帧的视频;
  • SVD-XT 在相同架构下,帧数提升至 24 帧。这两种模型均可创建每秒 3 到 30 帧的视频

图片展示的是Stable Video Diffusion模型中SVD和SVD-XT的下载代码。左侧代码部分定义了模型版本、类型路径、SV和SV2AT的URL,以及下载函数,还包含检查点目录创建和下载操作。右侧显示了下载版本为SVD_xt,提示下载将花费几分钟,并列出相关参考链接。该图片与上下文介绍的Stable Video Diffusion包含SVD和SVD-XT两种模型相呼应,直观呈现了模型下载操作。

根据白皮书,SVD 和 SVD-XT 这两款技术最初是在一个包含数百万视频的庞大数据库上进行训练的,之后又在规模稍小的几十万至百万视频集中进行了进一步的精细调整。不过,这些视频的具体来源还不太清楚——文件中暗示这些视频大多来源于公开的研究数据库,所以很难判断是否存在版权问题。如果真的涉及版权问题,那么对于 Stability 公司及其使用视频扩散技术的用户来说,可能会面临法律和道德上的挑战。对于这个问题,我们还需要时间来验证。

图片展示了Stable Video Diffusion生成的视频片段画面。左上角是一辆绿色经典跑车在林间小路上行驶;右上角是雨中街道旁的火车;左下角是一位戴着牛仔帽的黑人男子;右下角是一个绿色机器人躺在床上。这些画面体现了Stable Video Diffusion在不同场景下的生成效果,从车辆、自然景观到人物、机器人,展示了其在视频生成方面的多样性和创意。

图片展示了Stable Video Diffusion生成的视频片段画面。左上角是火箭发射场景,火箭从发射台升空,尾部有白色烟雾;左下角是夜晚的小镇,房屋灯光闪烁;右上角是地球景象,能看到地球表面的山脉、云层和海洋;右下角是海边日落景象,天空有大片云彩,海面波光粼粼。这些画面体现了Stable Video Diffusion在不同场景下的生成效果。

图片来源:Stability AI

从视频样本来看,质量还是相当不错的,足以和其他生成系统竞争。但据公司介绍,这套系统也存在一些限制,比如它只能制作最长不超过4秒的短视频,还达不到完美的照片级真实感,相机的动作只限于慢速平移,而且无法控制文本内容,生成的文字清晰度不够。在人物和面部的生成方面也可能存在不足。

上手体验

聊了这么多,是不是觉得手痒痒,想要亲自上阵?

Twitter 上的大牛 @mkshing 已经破解了代码,现在可以直接在 Colab 中免费试用体验这一魔法。Let's go!

图片展示的是Twitter用户mkshing发布的关于Stable Video Diffusion的推文。推文提到即使想早点接触Stable Video Diffusion,但不清楚资源或如何尝试,因此在Colab的免费计划中进行了破解,鼓励大家尝试。下方配有视频,展示了一幅富士山夜景,天空中绽放着红色烟花,画面底部有“0:01”标识。该图片与上下文紧密相关,直观呈现了Stable Video Diffusion生成的视频效果,辅助说明其功能。

Google Colab 链接

https://colab.research.google.com/github/mkshing/notebooks/blob/main/stable_video_diffusion_img2vid.ipynb

图片展示的是Stable Video Diffusion (image-to-video) Demo的Colab笔记本界面。界面顶部显示文件、编辑、视图等菜单选项,右上角有分享、登录等按钮。中间部分介绍该Demo为Stability AI的新型图像到视频模型Stable Video Diffusion,可从Colab免费计划获取,作者是mkshing,还列出了代码库、GitHub、许可证及论文链接。下方是一张夜空下山峰前绽放的烟花图片。此图与上下文紧密相关,是上手体验Stable Video Diffusion工具时展示的Colab笔记本界面。

下面将展示如何使用这款强大的视频生成工具。

  • 进入 Colab 的笔记本界面。
  • 点击界面顶部的**“代码执行程序 -> 全部运行”**按钮。

如下图所示:

图片展示了Stable Video Diffusion的代码界面,突出显示了“全部运行”选项,其位于代码执行程序菜单下,箭头指向该选项。该图片与上下文紧密相关,上下文提到第一次使用时代码需下载模型等资源,10分钟后屏幕上将出现链接和上传图片区域,此图则是在介绍代码执行相关操作,表明在代码执行程序中选择“全部运行”是下一步操作步骤,以确保代码顺利运行。

第一次使用时,代码需要下载模型等资源,这可能需要一些时间。请耐心等待,大概10分钟后,所有代码框全部执行完毕之后,屏幕上将出现一个链接,以及一个用于上传图片的区域。

如下图所示:

图片展示了Stable Video Diffusion的代码界面,上方有代码编辑区域,下方有“Run”按钮。图片中用红圈突出显示了“点击这里上传”区域,提示用户上传图片。该图片与上下文紧密相关,上下文提到第一次使用时代码需下载模型等资源,10分钟后屏幕上会出现一个链接及上传图片区域,此图直观呈现了上传图片的操作位置,帮助用户明确操作步骤。

点击这个链接可以打开一个新的页面,这个独立的页面会使操作过程更加方便。

以一张之前使用 Midjourney 画的电影风格图片为例,进行测试。

图片展示了一辆棕色保时捷敞篷跑车在海边公路上行驶的场景。阳光从画面左上方洒下,照亮了车辆和道路,远处是连绵的山脉和海面,右侧是岩石山崖,左侧有护栏。这与上下文提到的使用Stable Video Diffusion进行AI视频生成的测试内容相关,以一张之前使用Midjourney画的电影风格图片为例,进行测试时,可上传类似此图的图片进行操作。

使用特别简单,只需上传图片并点击**“Run”**按钮。然后耐心等待视频生成。如下图所示:

图片展示的是Stable Video Diffusion工具界面,用于将图片转换为视频。画面中是一辆棕色跑车在沿海公路上行驶的图片。下方有“Run”按钮,可启动视频生成。此外,还有“Advanced options”区域,可调整生成设置,如“number of frames”(帧数)、“number of steps”(步骤数)、“seed”(种子)等参数,以及“number of frames decoded at a time”(一次解码的帧数)。该图片与上下文介绍的Stable Video Diffusion工具操作流程相关,展示了操作界面及可调整的设置。

调整生成设置(可选)

此工具提供了额外的功能,允许您自定义视频生成的参数:

  • 帧数(number of frames):默认为 25 帧。
  • 步数(number of steps):默认为 30 步。
  • 种子(seed):可以设为整数或选择“随机”,默认为随机。
  • 一次解码的帧数:默认为 2 帧。

调整这些设置可以影响视频的生成效果和质量。

出视频大概需要 5分钟。

图片展示的是Stable Video Diffusion的视频生成界面。画面中是一辆黑色跑车在夕阳下行驶的场景,背景是山海相接的景色。界面顶部有“video to optimal size”输入框,下方是“Run”按钮。底部有“Advanced options”下拉菜单,当前选中“generate video”。该图片与上下文紧密相关,直观呈现了Stable Video Diffusion在视频生成方面的操作界面及效果展示。

直接生成的视频可能质量一般,画面略显模糊。此时,可以使用视频增强工具,如 Vmake (这款是收费的,大家如果有免费的,欢迎评论区留言),来提升视频质量。这样可以让视频看起来更加清晰和高清。

图片展示的是Vmake平台的视频画质增强功能页面。页面上方有平台标志及导航栏。中间部分对比了增强前后的视频效果,左侧为原视频,右侧为增强后视频,均展示一辆车在山路上行驶的场景。右侧还提示可点击或拖拽上传文件,一次最多可上传3个文件。下方有“已购买”按钮及“下载3分钟视频预览”选项,显示2560p * 1440p的视频信息。该图片与上下文介绍的视频画质增强功能相关,直观呈现了功能效果。

另外的测试案例。

图片展示了Stable Video Diffusion的界面,上方有“Run”按钮,下方是视频预览区域,显示了夜晚富士山前的烟花场景,烟花色彩斑斓,有紫色、粉色、蓝色等。画面底部有“Run”按钮和“Cancel”按钮,右下角有“Save as AVI”和“Save as MP4”选项。该图片与文档中介绍Stable Video Diffusion上手体验的内容相关,直观呈现了其视频生成效果。

注意,目前上传图片时使用横图,竖图的会改变原始比例为横图。

其他 AI 生成视频工具推荐

  1. Runway https://runwayml.com/
  2. Genmo https://www.genmo.ai/
  3. Moonvalley https://moonvalley.ai/
  4. Pika Lab 这个跟 Midjourney 一样,要在 Discord 中使用。这是邀请链接 https://discord.gg/pika
  5. Stable Diffusion 的 text2video 插件和 Deforum 插件

上面 4 个属于AI生成视频。

下面几个属于是根据提示词找网络上已有的片段来合成视频。

  1. InVideo 这个功能也不错,但是非会员会有水印。https://ai.invideo.io/
  2. GPT4 中的 CapCut(国外版剪映)插件
  3. GPT4 中的 Visla 插件
  4. 剪映,百度的度加剪辑这两个也有 AI 功能

Runway 的运动画笔

最近几天 Runway 的 Gen-2 平台也推出了其创新的运动画笔 Motion Brush 功能。

这一版本与以往不同,简化了视频创作流程,用户无需进行复杂的文字输入和深度编辑,就能轻松制作出高质量的视频。其独有的**“Motion Brush”**功能更是一大亮点,使用户能够通过简单的手势控制视频中的元素动态,无论是自然界的水流、云彩、火焰和烟雾,还是视频中的角色,都能随手势即刻改变,为视频创作带来了前所未有的灵活性和创意空间。

下面我们简单体验一下。

图片展示了Runway平台的Motion Brush功能界面。画面中是一辆停在海边悬崖边的跑车,背景是日落景色。界面下方有三个参数设置区域,分别是Horizontal(水平方向移动)、Vertical(垂直方向移动)、Positivity(正向移动),每个参数右侧都有滑块可调整数值,当前数值均为50。该图片与上下文紧密相关,直观呈现了Motion Brush功能的操作界面及参数设置情况,辅助说明了其在AI视频创作中的应用。

三个参数分别是:左右方向移动,上下方向移动,向前向后移动。

还有一个随手测试,让人物主题前进,背景后移。

最后的话

AI 视频生成技术正在自媒体、娱乐、广告、教育和虚拟现实等众多领域掀起创新浪潮。也许,普通人也能创造好莱坞大片的产品正在酝酿中,但是按目前 AI 技术的发展,我相信这一天不会太远了,让我们拭目以待吧!

参考链接:

https://stability.ai/news/stable-video-diffusion-open-ai-video-model

https://x.com/mk1stats/status/1727207950434083017?s=20