元峰AI笔记 · AI绘画与视频

图生视频

<title《动物参加高考》视频制作步骤</title

《动物参加高考》视频制作步骤

🎉报个喜,9 号那天,通过可灵的内测之后,马不停蹄做了一个高考话题的视频,结果没想到,它居然被可灵AI的快手和视频号官方账号转发分享了!

图片展示了快手和微信平台上的两条视频作品。左侧快手视频显示,用户“可灵AI”发布了一条关于动物参加高考的视频,点赞数达2.0万,评论数20,转发数36。中间微信视频也呈现了动物参加高考的内容,点赞数1772,评论数26。右侧是“可灵AI”在快手平台发布的视频作品列表,该视频点赞数2.0万,评论数1772,转发数36,发布于2024年6月8日15:06。这些视频作品均与动物参加高考主题相关,展示了视频在不同平台的传播情况。

之所以能吃到第一批螃蟹,很大原因是运气好,另一方面也是因为我足够的 AI 嗅觉,看到信息的第一时间,就申请了内测,另外,可灵大模型足够强,出素材非常精准,基本都是一条过,出来的视频就是我想要的,指哪打哪,大大降低了视频创作的门槛!

目前还没通过的伙伴也不要着急,只能耐心等待,再无他法。

这个片子,昨天破局官方团队已经发了这是视频完整版了,大家可以点击此链接过去查看:https://t.zsxq.com/LAt3n

有很多伙伴问我,有没有教程!说实话,操作简单到我不知道如何去写这个教程,因为就是输入提示词,等出片,完事!就和把大象放入冰箱需要几步一模一样。

我简单的讲一下这个片子的思路吧。

第一步:先确定下主题,要画什么

因为昨天正好是6月7日,高考的日子。那么,最应景的便是高考了。但是画真人就有点单调了,于是我就想到了让动物来参加高考。所以,这里我用 ChatGPT 帮我生成了一些分镜脚本。

图片展示的是“疯狂动物园园”动物参加高考的分镜头脚本。脚本包含编号、画面内容、话外音、运镜、台词、音乐、剪辑手法等信息。如编号1的画面内容是动物们的全员,阳光明媚,各种动物在园内活动,话外音为“欢迎来到疯狂动物园,今天是特别的一天......”,运镜为缓慢推入,台词无,音乐为轻快欢快的背景音乐,剪辑手法为交叉剪辑等。该脚本与上文提到的用ChatGPT生成分镜脚本相呼应,为视频制作提供了具体指导。

图片展示的是《动物参加高考》视频制作中分镜头脚本的描述。内容包含5个镜头,每个镜头对应一段描述。镜头1展示动物园全景,阳光明媚,动物中动物在园内活动;镜头2是长颈鹿在树下看书;镜头3是大象在地上写字;镜头4是猴子们讨论问题;镜头5是狮子在书桌前做题。这些描述与上下文提到的用ChatGPT生成分镜脚本,为视频制作提供参考思路相契合。

第二步:进入 快影,输入提示词出片

可灵是在快手的剪辑软件 快影 里面的,大家下载完 APP 之后,进入到 AI玩法-> AI 生视频 里面。目前都还是内测阶段,没有全面开放。还没通过的伙伴只能在耐心等一等,再没有其他办法了。

图片展示了快影APP中AI创作的相关界面。左侧显示“AI生视频”页面,有“生成视频”“立体制作”等选项。中间是“AI创作”页面,有“AI生视频”“AI舞王”“AI小快转漫画”等创作类型,部分选项有“立体制作”按钮。右侧是“AI生视频”页面,可选择“文生视频”或“图生视频”,输入文字描述,下方有“灵感参考”板块,展示多张图片。该图片与上下文介绍的在快影输入提示词出片的内容相关,直观呈现了操作界面。

进来之后,直接输入提示词即可,没有任何多余操作。然后等待 3 分钟,一个短片就完成了,目前支持的片段都只有 5 秒。

图片展示的是快影APP中AI生视频界面,呈现了三段视频片段。画面1是长颈鹿在树下专注看书;画面2是三只猴子手舞足蹈讨论问题;画面3是大象在地上写字。每段视频下方有“去无水印导出并分享”按钮,以及播放进度条。该图片与上文提到的在快影输入提示词出片后等待3分钟,生成的5秒短片内容相呼应,直观呈现了生成的视频片段样式。

画面1: 长颈鹿站在一棵大树下,树叶为它提供了阴凉。长颈鹿低头看着摊开的书,眼神专注,脖子微微弯曲,显得非常认真。

画面2:一群猴子聚在一起,手舞足蹈地讨论问题。它们的表情丰富,有的眉头紧锁,有的手指着书本,显得非常活跃和热烈。

画面3:大象坐在地上,用长鼻子卷着一支笔,在地上的纸上写字。大象的眼神专注,笔尖在纸上移动,显得非常用心。

出来的 80% 的画面都是非常满意的,一步到位。但是肯定不是 100%,有一些还是需要调整的。比如下面这个长颈鹿和大象对答案的画面,第一次出来的是卡通漫画风格,很明显和其他写实风格画面是不一致的,所以在提示词中我加了“写实风格”重新出了一个片段,就符合预期了。

图片展示了快影APP中生成的长颈鹿和大象对答案的画面。画面分为左右两部分,左侧为卡通漫画风格,长颈鹿和大象手突出部分;右侧为写实风格,长颈鹿低头看着试卷,大象用鼻子指着答案。画面下方有播放进度条、下载按钮及“启用无水印导出并分享”按钮。该图片与上文提到的长颈鹿和大象对答案画面相呼应,直观呈现了视频制作中不同风格画面的对比效果。

画面4:长颈鹿和大象站在一起,手里拿着试卷,互相对着答案。长颈鹿低头看着试卷,大象则用鼻子指着某个答案,两人讨论得热火朝天。

还有一些画面是自己编的,直接大白话写提示词就行了。

图片展示了在快影中生成的视频片段画面。画面1为极光出现时老虎拼搏奋斗的特写,画面2是极光出现时老虎看书奋斗的特写,画面3是动物园环境从白天到夜晚的场景。每个画面下方有播放进度条、去编辑、无水印导出并分享等操作按钮。该图片与上文提到的视频制作步骤中,进入快影输入提示词出片的内容相关,直观呈现了生成的视频画面样式。

画面5:一道极光出现,老虎拼搏奋斗的特写

画面6:动物园的环境从白天到夜晚

第三步:剪辑

剪辑就是把这些个 5 秒的视频片段拼接在一起,这里需要的就是剪辑功底了,要想精细化剪辑,肯定得需要人工。如果满分100💯的话,有一些 AI 也是可以快速剪辑的,但在我看来只能达到 30-40 分吧。

图片展示的是视频剪辑软件界面,画面中显示了一只老虎的图片,上方有“数典论:为梦想而战”字样。界面左侧有视频素材列表,包含多个视频片段。右侧是时间轴,显示了不同视频片段的时长及位置。底部是素材库,展示了更多视频素材。该图片与文档中“剪辑就是把这些个5秒的视频片段拼接在一起”的内容相关,直观呈现了视频剪辑时的界面及素材情况。

ok,这就是可灵的使用,简单到没法写教程。最后,希望大家都尽快通过内测,早点用到可灵来出大片。

昨天中午,我正准备眯个午觉,突然手机震个不停,一看,群里消息跟疯了似的,几百条一眨眼就冒出来了。仔细一瞧,原来是因为可灵新出的**“图生视频”和“视频续写”**功能,这消息一出来,大家就炸锅了。

图片展示了可灵新功能,包括图生视频、视频续写、多尺寸支持。图生视频可实时解析图像,生成合模运动、遵循物理规律的动画效果;视频续写能续写多次视频,最长可达3分钟,合理且自然的动画,文本控制续写,丝滑场景转换;多尺寸支持文生视频多比例选择,提供16:9、1:1、9:16三种尺寸,满足更多创作可能。该图片与上下文紧密相关,是对可灵新功能的详细介绍,为视频制作提供新工具。

图生视频

上传任意图片,生成5秒精彩视频。支持添加提示词控制图像运动。

图片展示的是AI生视频创作界面。上方显示时间为6:45,有“AI生视频”标题。下方有“创作类型”选项,可选择“文生视频”或“图生视频”,当前选中“图生视频”。上传图片区域显示一张人物照片,下方有“让他们三打起来”字样。推荐素材部分有多个选项,如“女孩转过身背...”“天使展开了他...”等。底部有一个黑色的“生成视频”按钮。该图片与上下文介绍的AI生视频制作流程相关,展示了图生视频的创作界面及操作选项。

这里的提示词很简单,就是让他们 3 打起来。

让这个表情包老哥再一次亮瞎你的眼。

这一届网友真是太有才了,让玉帝哥哥也经不起诱惑了。

这个更狠,直接让 C 罗从嘴里面喝进去,头顶喷出来。

可灵是懂这位国外小哥的,渣男气质拿捏的死死的。

视频续写

对生成视频一键续写4~5秒,支持多次续写(最长3分钟),可通过微调提示词进行续写视频创作。

这里我用昨天晚上拍摄的一段视频做了个测试,完美的帮我实现了延时摄影的拍摄。

图片展示的是“AI生视频”界面,显示时间为6:42,有“AI生视频”标识及“去剪辑”按钮。画面中呈现了夜空下的城市景观,有高楼大厦和树木。下方有视频播放进度条,当前播放时间为00:02,总时长00:05。画面左下角有“重新生成”和“延长视频”按钮,右下角有“导出并分享”按钮。该图片与上下文介绍的“AI生视频”功能相关,展示了其生成的视频内容及操作界面。

图片展示的是“AI生视频”界面,显示时间为6:49,有“AI生视频”标识及“去剪辑”按钮。画面中呈现的是夜晚城市夜空延时摄影视频,云在动,画面下方有播放进度条,当前播放时间为00:03,总时长00:09。底部有“重新生成”“延长视频”按钮,以及“导出并分享”红色按钮,还有下载图标。该图片与上下文介绍的文生视频功能相关,展示了AI生成视频的界面及操作按钮。

修改比例

文生视频多比例选择:文生视频新增9:16和1:1视频尺寸选择,提供更多创作可能。

图片展示的是AI生视频创作界面。上方显示时间为7:03,有“AI生视频”标题。创作类型有“文生视频”和“图生视频”选项,当前选中“文生视频”。文字描述区域可输入文字,示例为“未来星球上,赛博朋克风格的深海环境中,巨大的画板悬浮在水中,显示着动态的绘画过程,画面绚丽多彩,仿佛置身于一个梦幻世界。”下方有氛围光照、极简风格、冬天等选项,视频比例有16:9、9:16、1:1可选,灵感参考部分有三张图片示例。底部有“生成视频”按钮。

你可以看到这个示例视频中的时间一致性非常好。

AI 视频中的时间一致性是指视频生成模型在时间上创建一致且逻辑连接的帧序列的能力。

这意味着模型应该能够保持一致的叙述,保持相同的场景或设置,并确保场景中的物体的动作和运动在时间上是连贯且合理的。

AI 视频的有多卷?

这话我都快说烂了,但还得提一嘴:AI 一天,人间十年。瞅瞅最近 AI 视频产品的进展,就知道这个领域竞争多激烈了。

17 号晚上,Runway 的 Gen-3 模型亮相了,看了宣传片,效果只能用炸裂来形容了。

图片展示的是Runway发布的Gen - 3 Alpha模型宣传内容。上方有Runway标志及“跑道”字样,下方文字介绍该模型是Runway用于视频生成的新基础模型,能创建具有复杂场景变化、广泛电影选择和详细艺术指导的高度详细的视频。图片下方是一段55秒的视频,画面中有一座被烟雾笼罩的建筑,视频下方有“RUNWAY”标识。该图片与上下文紧密相关,直观呈现了Gen - 3 Alpha模型的视频生成效果,呼应了上下文对AI视频领域竞争的描述。

就在同一天,Luma AI 也不甘示弱,推出了他们的 Dream Machine,真是梦想机器,就是价格有点让人望而却步。

图片展示的是Luma AI发布的关于发布扩展视频的推文。推文内容介绍扩展是一个先进的系统,能了解视频中发生情况并以一致方式扩展以遵循指令,分享创作可获Dream Machine Pro一个月。下方配有色彩斑斓的眼睛视频片段,该视频是Luma AI“图生视频”功能的示例。图片与上下文紧密相关,直观呈现了Luma AI在AI视频领域的最新进展,与上下文提到的AI视频领域竞争激烈、新模型不断发布等内容相呼应。

你可能都没想到,可灵的文生视频才在 8 号发布,热乎劲儿还没过 3 天,就被其他 AI 模型给盖过去了。不过今天,因为“图生视频”功能一开,又重新回到了大众视野。

图片展示的是Kling AI在Twitter上发布的关于其自研AI模型“Kling”的推文。推文标题为“AI带来的《疯狂动物城》? - 中国的克林人工智能”,内容提到快手自主研发的AI模型“Kling”现已上线快影App,只需输入文字即可生成创意视频,所有视频片段均由Kling生成。图片中有一只骑自行车的长颈鹿,其身上有数字“01”,背景为道路和草地。该图片与上下文紧密相关,直观呈现了Kling AI模型生成的创意视频效果。

AI 视频领域的卷,也许没有比下面这张图更形象的了,老大的王座是以天为单位来交换的!

图片展示了AI视频领域竞争的场景。画面中有两个王座,上方分别标注“Runway”和“可灵AI”,王座旁各有一人。下方是众多AI模型,如LUMA、PIKA、Dreamina、MOKI、Pixiverse、Sora等,它们或跪或坐,显得十分卑微。图片上方标注了公历日期“2024.6.17”和“2024.6.21”,并有“Runway”和“可灵AI”字样。该图形象地反映了AI视频领域竞争激烈,不同AI模型地位悬殊的现状。

可灵与 Sora 的比较如何?

再简单介绍一下可灵,它是快手公司推出的一款新型 AI 视频模型,根据官方的介绍,可灵能够制作出长达 120 秒的视频,并且支持每秒 30 帧的流畅播放,分辨率达到 1080P,视频比例可以根据需求自由调整。更厉害的是,它能够准确深入地理解物理原理,准确模拟出复杂的运动场景。

但这里有一个有趣的事实:Sora 需要八个 NVIDIA A100 图形处理单元(GPU)运行超过三个小时才能生成一分钟的视频片段。一个 NVIDIA A100 的价格超过 1 万美元。因此,可灵可能需要双倍的计算能力来生成两分钟的视频。

模拟影响世界状态的动作是 AI 视频生成器面临的最大挑战之一。例如,画家可以在画布上留下新的笔触,这些笔触会随着时间的推移而保留,或者一个男人可以吃汉堡,留下咬痕。

Sora 和 可灵都能做到这一点。那为什么不把它们放在一起对比下呢?看看这个吃汉堡的视频案例:

图片展示了一位戴眼镜的中年男子正在吃汉堡的场景。他穿着红色上衣,双手捧着一个带有芝麻的汉堡,汉堡里有生菜等食材。背景模糊,隐约可见室内环境,有灯光和一些模糊的物体。该图片与上下文提到的“吃汉堡的视频案例”相关,用于直观呈现视频中男子吃汉堡的细节,帮助读者理解上下文所描述的视频效果。

图片展示了一个戴眼镜的中国男孩在快餐店内吃芝士汉堡的场景。男孩穿着红色外套,双手紧握汉堡,汉堡表面有芝麻装饰,背景模糊,可见餐厅环境。该图片用于对比Sora和可灵在制作视频方面的效果,以展示Sora在主题细节和光照条件方面表现更好,但咬痕方面稍逊于可灵的特点。

可灵提示词:一个戴眼镜的中国男孩在快餐店内闭眼享受美味的芝士汉堡

嗯,这两个结果都令人惊叹。乍一看,很容易被迷惑,认为这些不是真实的视频。

但是仔细观察这些示例,你会发现 Sora 的结果在主题细节和光照条件方面更好,但是咬痕方面却差点意思。