元峰AI笔记 · AI绘画与视频

国产AI视频模型海螺2.0 VS 可灵2.1 VS 即梦3.0 Pro,谁才是真正的王者?

大家好,我是元峰,累计获得过36颗AI之心。

国产AI视频模型海螺2.0 VS 可灵2.1 VS 即梦3.0 Pro,谁才是真正的王者?

图片为“AI破局俱乐部”的标志,背景为黑色,中间以蓝色线条构成类似科技感的图案,线条间有类似电路板的元素。图案两侧各有一行白色文字,左侧为“AI”,右侧为“破局俱乐部”。该图片位于文档中介绍视频模型海螺2.0部分,起到分割上下文、强调主题的作用,与文档中对海螺2.0的介绍相呼应。

大家好,我是元峰,累计获得过36颗AI之心。

最近一周,MiniMax一口气更新了三个重磅产品:

  • 视频模型海螺2.0
  • 推理模型MiniMax-M1
  • 还有一个通用智能体 MiniMax Agent

图片展示的是MiniMax Agent的宣传图。背景为蓝色,中间大圆内有“MiniMax Agent”及“Minimize Effort, Maximize Intelligence”字样,下方有“Try MiniMax Agent”按钮。图片位于介绍MiniMax一口气更新的三个重磅产品之一的通用智能体MiniMax Agent的上下文之后,与上下文紧密相关,直观呈现了MiniMax Agent的品牌标识及宣传语,引导用户尝试该产品。

图片展示了MiniMax新推出的四大模型。左侧是MiniMax海螺02视频模型,可实现4K80fps指令跟随,具备物理建模能力;中间是MiniMax M1测试模型,全球领先80K CoT长度、IM Token输入,性能顶级;右侧是MiniMax语音模型MiniMax Speech 02,可实现零样本生成,引领AI语音生成新纪元;最右侧是MiniMax MCP Server,提供视频、图像、语音生成及语音克隆工具。图片与上文介绍MiniMax一口气更新三个重磅产品相呼应,直观呈现了新模型的特性。

好玩具太多,今天我们先聊聊海螺2.0这个视频模型,因为它真的太离谱了!

这款模型直接把其他AI视频产品按在地上摩擦,在指令跟随方面简直无敌,能够完美处理极端物理效果和复杂动作!

什么意思?就是说它甚至能生成完美的杂技和体操动作!别人家的AI还在学走路,咱们的已经会翻跟头了!中国速度,恐怖如斯!

海螺2.0同时支持文生视频和图生视频两种模式,都已经在官网上线,6秒768p视频需要25积分,10秒视频需要50积分,想要1080p高清的话,目前只支持6秒视频,需要80积分!

海螺2.0视频模型官方视频

文生视频测试

先说文生视频,这才是海螺2.0最恐怖的地方。

案例1:体操运动员

我先测了个高难度的:让一个穿中国队红色队服的女子体操运动员完成跳马动作。

主体(Subject): 身穿中国队红色队服的女子体操运动员 情境(Context): 跳马器械前的助跑道,远处是观众看台 动作(Action): 踏板起跳后手撑跳马,空中完成前手翻转体180度 风格(Style): 连续镜头记录从助跑到落地的完整过程

结果直接把我看傻了!助跑、起跳、空中翻转、落地,一气呵成,动作流畅自然,就像看奥运会直播一样!

同样的提示词,再来一条,效果依旧可以,这个连贯性动作,目前除了海螺AI,其他的视频模型都根本无法完成。

可灵2.1这个就差点意思了,前面助跑还可以,但是到了跳马的时候,就开始找不到东南西北了。

即梦3.0 Pro 表现也是一般,没法完成连贯动作。

这个案例估计是最能引起大家共鸣的,动物跳水,动作还那么完美。

案例2:杂技表演老虎跳火圈

接着,我又试了一个耍杂技的,让东北虎跳火圈的场景。

主体(Subject): 一只雄壮的东北虎和驯兽师 情境(Context): 马戏团铁笼表演区,周围设置安全护栏 动作(Action): 老虎助跑后纵身跃过直径2米的燃烧火圈 风格(Style): 野性与驯服的对比,火光映照虎纹的震撼效果

你敢信?一只威武的老虎真的助跑、腾空、穿越火圈,全程行云流水!

可灵的老虎,竟然直接跳到火圈上面去了,不过整体动作还挺帅的。

即梦3.0 Pro

案例3:大脚怪和雪人在雪山上烧烤

甚至连"大脚怪和雪人在雪山上烧烤"这种魔幻场景,海螺2.0都能完美呈现!

主体(Subject): 一只体型庞大、毛发蓬松的白色雪人(Yeti),一只来自"BigfootVlogs"频道的大脚怪(Bigfoot) 情境(Context): 被雪覆盖的松树林,厚重的积雪地面,背景中崎岖壮丽的山脉轮廓,用松树枝搭建的噼啪作响的篝火作为聚焦点 动作(Action): 两个角色蹲在篝火旁,用木棍烤制野莓和多汁牛排,用烤肉棍碰杯庆祝的动作 风格(Style): 真实的YouTube vlog风格,非电影化或过度精致

海螺2.0

可灵2.1 大师版

即梦3.0 Pro

海螺2.0和可灵2.1大师版的表现各有千秋,而即梦因为只能输入500个字符,提示词不完整,效果也就一言难尽了。

案例4:第一人称在战场

第一人称视角拍摄,写实风格。现代女战地记者身着黑色西服,黑色的西服上衣露出里面白色的衬衫,头戴现代耳麦,手持金属自拍杆、发丝凌乱、满脸尘土,眼神害怕神情紧张,正对镜头报道。背景展现赤壁之战失败后,魏军于山间仓皇撤退:狭窄崎岖的山间小道上,魏军士兵盔甲歪斜,有的拄着兵器蹒跚前行,有的背着受伤同伴艰难跋涉;半山腰处,战马嘶鸣,骑兵牵着缰绳小心翼翼下山;远处山间升起袅袅炊烟,似是有零星营火;天空阴沉,厚重的乌云笼罩,整个画面充满压抑与慌乱的战败氛围。

海螺2.0

可灵2.1大师版

案例5:切草莓 ASMR

可灵2.1 大师版

海螺2.0

我还测了最近曝光的切草莓ASMR的场景,这次可灵和海螺都差点意思,要说效果最好,还是得看Veo3。

通过以上案例,我们会发现,海螺2.0也不是完美无缺。和所有AI一样,偶尔也会出现一些奇怪的动作、伪影和失真,但这根本不是事儿!

最让我欣慰的是AI视频的纵向进步。从"有明显瑕疵"到"偶尔有小缺陷",这意味着AI视频已经跨过了"可用"的门槛,正在向"好用"甚至"专业级"狂奔!

回想一下,仅仅一年前,AI生成的视频是什么样子?

扭曲的人脸、诡异的动作、闪烁的画面...无论你怎么调参数,都会有明显瑕疵,基本无法用于商业项目。

而今天呢?海螺2.0生成的视频,在很多场景下已经可以媲美真人拍摄了!

这不是简单的进步,而是质的飞跃!

图生视频测试

好了,接下来咱们聊聊图生视频。这个对我来说特别重要,因为我一直在做数字人视频。

想看看海螺2.0、可灵2.1和即梦3.0 Pro哪家强?

图片展示了一段聊天记录。用户与“元峰AGI”交流,询问是否为数字人,得到回复称是纯AI虚拟人。用户表示惊讶,并询问是否有原图参考,得到回复称没有。最后用户提到先文生图,再图生视频,必火AI克隆形象匹配嘴型。聊天背景为“元峰AGI”头像,下方有“今天来一个轻松有意思的话题”字样。该图片与上下文关于AI虚拟形象的讨论相关,展示了用户与AI的互动内容。

我拿了一个超级真实的虚拟AI美女形象来测试。这个形象是我昨天做的一条爆款视频里的主角,纯AI生成,经过我反复打磨,才有了这么真实的效果。

先来看第一组测试:真人口播图生视频

我用同一张照片,让三个模型生成"正在讲话,直视镜头"的效果。

文生图的提示词是这样的:

是直接AI文生图生成的,没有用任何垫图。

外貌特征:一位中国年轻美女 面容精致,皮肤白皙,五官立体,双眼清澈,直视镜头,似乎正在讲话或表达某些内容。 服装特点:她穿着一件浅米色或白色的长袖上衣,衣服上有精致的蕾丝或刺绣设计,带有复古风格。 上衣的正面有小纽扣装饰,袖子略显蓬松,增添了优雅感。 环境描述背景环境:装饰温馨,光线充足。 背景中有大面积的绿色植物。 右侧靠近窗户,窗外似乎有自然光透进来,窗框为深木色,增添了温暖的氛围。

第一组生成视频的时候,直接用了文生图的提示词。

即梦3.0 Pro

可灵2.1

海螺2.0

测试结果一目了然:

即梦3.0 Pro:只是在那晃动身体,没有任何讲话的感觉,不适合做数字人形象

可灵2.1:完美还原真人说话状态,嘴型准确,眼神自然

海螺2.0:面部表情还行,但头部晃动太夸张,看着不太自然

我知道很多朋友在做数字人时最头疼的就是手势问题。一个不自然的手势,分分钟暴露AI的身份。所以我又做了两组对比测试。

第一组是无手势动作:

一个女人正在讲话,直视镜头,手部不动,无手势动作

即梦3.0 Pro

可灵 2.1

海螺2.0

第二组是手势动作少或者自然:

一个女人正在讲话,直视镜头,手势动作少 | 自然

即梦3.0 Pro

可灵 2.1

海螺2.0

即梦3.0 Pro:手势表现比较流畅

可灵2.1:手势流畅自然,就像真人在表达,完全看不出是AI

海螺2.0:手势夸张且不协调,显得有点假

第二组测试:卡通人物口播

除了真人形象,我还测试了卡通形象。用了一个我自己的卡通版"元峰"形象(是不是挺可爱的?)。

图片展示的是AI视频模型测试中,可灵2.1生成的卡通人物口播视频的图片生成界面。左侧为参数设置区域,有风格、人物、场景等选项,当前风格为“卡通”。右侧是生成的多张图片,人物穿着红色连帽衫,背景有彩色灯光效果。图片下方有“生成视频”按钮。该图片与上下文介绍的第二组测试内容相关,是对可灵AI生成卡通人物口播视频的图片生成部分展示。

图片依旧是可灵AI生成,后面PS了一下,把里面的字母换为了“元峰”。

图片展示了一位年轻男孩,他穿着红色连帽衫,戴着眼镜,背景为模糊的彩色灯光。图片右下角有“元峰”字样。该图片对应文档中第二组测试“卡通人物口播”的内容,是即梦3.0 Pro生成的视频画面,提示词为“年轻男孩穿着红色连帽衫,自然地对着镜头进行口播,动作自然,固定镜头”。

图片展示了一位年轻男孩,他穿着红色连帽衫,衣领处有白色“元峰”字样,双手自然下垂,站在一个带有蓝色和红色灯光的走廊里。男孩戴着眼镜,表情自然,背景灯光营造出科技感氛围。该图片与文档中第二组测试“卡通人物口播”的内容相关,是即梦3.0 Pro生成的视频画面,用于展示其生成人物形象的效果。

提示词很简单:

年轻男孩穿着红色连帽衫,自然地对着镜头进行口播,动作自然,固定镜头。

即梦3.0 Pro

可灵2.1

海螺2.0

即梦3.0 Pro:镜头不稳定,摇摇晃晃,而且几乎没有手势动作

可灵2.1:这是我比较满意的,也是最终选择的视频,完全符合我想要的口播效果

海螺2.0:手部动作很奇怪,像是不知道手该放哪里一样

大家发现没,做AI视频一定要多测试!不要指望一次就能出完美效果。

总的来说,在图生视频这个赛道上,三大模型已经不分伯仲了!它们在口型同步、表情自然度、动作流畅度上都达到了相当高的水平。

对我们创作者来说,这简直是天大的好消息!意味着你有了多种高质量的选择,不再受制于单一平台。

不过我个人还是更喜欢用可灵AI来做数字人,它在细节上更胜一筹。

如何让AI形象变为真实的数字人?

接下来,我要教大家一个超实用的技能:如何把这些AI生成的形象变成会说话的数字人。

第1步:将AI视频克隆为数字人形象

  1. 登录必火AI数字人平台:https://www.bihuoai.com/workspace/welcome?inviteCode=metafeng

图片展示的是必火AI数字人平台的首页。背景为红色,上方有平台名称“必火AI”及导航栏。中间大标题为“用必火,一定火”,副标题是“AI数字人一站式创作平台”。下方有“数字人一键生成”“场景自由定制”“多语种智能配音”“视频快速出片”等选项。再往下是“数字人应用场景”板块,列举了短视频拍摄、个人IP打造、品牌宣传、课程制作等场景,并配有对应图片。该图片与上文“登录必火AI数字人平台”及后续克隆数字人形象等内容相关,直观呈现了平台界面。

  1. 点击【创建数字人】,进入【形象】,点击【快速克隆】

上传我们刚刚在可灵做好的美女动起来的10秒形象视频,并为此形象取一个好听的名字,比如【Anna】

图片展示的是必火AI数字人平台的形象页面。页面左侧有导航栏,中间显示一个女性形象,下方有“复制数字形象”按钮。右侧弹出窗口显示“复制数字形象”标题,下方有“复制身份信息”按钮,视频预览区域播放着一段视频,下方有“一键克隆”按钮。该图片与上下文紧密相关,是“第1步:将AI视频克隆为数字人形象”步骤中上传视频并取名的页面展示,直观呈现了操作界面。

第2步:克隆一个合适的和此形象匹配的AI声音

这一步超关键!好的声音能让整个数字人更加真实,瞬间提升一个档次。

进入声音克隆页面,点击【快速克隆】,上传我们提前录制好的一段声音即可完成克隆。

图片展示了必火AI平台的“声音克隆”页面。左侧红色框突出显示“声音克隆”选项,下方有多个声音克隆示例。右侧弹出窗口中,可输入声音名称、选择性别、设置音色等信息,下方有“预览试听声音”按钮,可选择预览声音1 - 3。该图片与上下文紧密相关,直观呈现了声音克隆功能的操作界面,帮助用户了解如何在必火AI平台进行声音克隆操作。

这是真人录制的声音。

这是上面这段声音克隆后的AI声音,怎么样,是不是基本一模一样?再加上背景音乐,会更加难以分辨。

第3步:合成数字人视频

通过前面的几个步骤,我们把形象和声音都准备好了,下一步就是把AI形象和AI声音“珠联璧合”。

  1. 在数字人形象列表中找到刚刚克隆好的【Anna】形象,并点击【去创作】。

  1. 选择【文本驱动】,输入下面的文案

  1. 选择形象
  2. 选择【文本驱动】
  3. 选择合适的声音
  4. 输入对应的短视频文案
  5. 可以先试听语音效果,确保没错别字,不通顺的语句
  6. 选择合适的数字人合成模型,选择**【超清进阶】**模型,这样嘴型匹配效果最好
  7. 点击生成视频,最终就可以合成视频了

我用前面爆款视频中的文案:

"当你把领导当狗养,上班就会变得很有意思。第一,每天见到狗狗,要学会微笑,跟狗狗打个招呼。喊一喊它的名字,比如主管经理、科长主任等等。当然别指望狗狗会回应你啊,因为狗不会说话,所以它顶多会冲你点点头。第二,不定时给狗狗投一点小零食水果,给它添点茶水,稍微照顾一下它的生活。因为狗没什么自理能力,适当的照顾,可以增进你们的感情。第三,狗狗有时候情绪不稳定,喜欢汪汪叫。这时候不管狗狗说什么,你都耐心的听它讲完,然后答应它。好的。你需要做的就是心平气和,一个耳朵进,一个耳朵出。给予狗狗足够的宽容,很多问题也就迎刃而解了。"

视频生成好之后,我们就可以下载视频去剪辑了。

情感声音-数字人最小匹配效果更真实

早安声音-数字人口型没有匹配

你看,上面我用同一个形象,同样的数字人软件,出来的数字人效果是完全不一样的。

有个小技巧要分享:同一个形象配不同的声音,效果差别巨大!我发现有些声音和形象特别匹配,嘴型同步度简直完美;而有些声音就差很多。 所以一定要多试几个声音,找到和形象最匹配的那个!

第4步:视频剪辑,让内容更专业

最后,别忘了视频剪辑这一步!当你有了会说话的数字人后,最后一步就是进行专业的视频剪辑,让整个内容更加完整和专业。

图片展示了剪映软件界面,用于后期剪辑处理视频。左侧是视频剪辑轨道,有多个视频片段排列,下方有音频波形图。右侧是视频预览窗口,上方显示视频标题“上班要学会把领导当狗养”,下方有两张图片,一张是人物与狗的插画,另一张是穿着白色上衣的女性。该图片与文档中“如何让AI形象变为真实的数字人”内容相关,展示了使用剪映进行后期剪辑处理的场景,可添加背景音乐、视频标题、字幕等提升视频专业感。

我使用剪映进行后期剪辑处理,可以添加:

  • 好听的背景音乐(氛围感立刻提升)
  • 醒目的视频标题(抓住观众眼球)
  • 同步的字幕效果(提高观看体验)
  • 流畅的转场动画(专业感up!)
  • 相关的画中画素材(增加信息量)

这些小细节看似简单,但能让你的视频从业余秒变专业!

我用同样的流程,也做了一条3D卡通元峰的数字人视频,效果出乎意料的好!卡通形象反而更容易做得自然,因为观众对卡通的容忍度更高。

图片展示的是MiniMax发布海螺2.0模型后,AI视频剪辑的最终成片。画面左侧是视频编辑软件界面,显示了多个视频片段和时间轴,下方有红色的视频片段标识。右侧是成片展示,画面中一位戴眼镜的男子身穿红色上衣,背景为城市夜景,上方有“MiniMax发布海螺2.0模型 AI视频可以耍杂技了”的标题,下方文字为“中国速度恐怖如斯 元峰”。该图片与上下文介绍的AI视频剪辑内容相契合,直观呈现了最终效果。

最终成片展示。

总结一下,AI视频模型的进步真的让人惊叹。海螺2.0在文生视频方面确实领先一步,特别是处理复杂动作和场景时;而在图生视频方面,三大模型各有千秋,但都已经达到了相当不错的水平。

对于想做数字人的朋友,我个人强烈推荐可灵+必火AI的组合,这套"组合拳"真的香!这也是我一直用的。强烈推荐!

⚠️数字人出镜人验证

但是,视频号对于口播类视频有出镜人验证这个限制。所以,不建议这类虚拟数字人发视频号,可以发抖音,快手等平台,甚至做海外平台。 我自己发是因为我自己账号是几年前注册的,时间比较久了,没有出镜人验证这个限制。 这一点给大家打个预防针。

图片内容:图片显示了一个视频号团队的公告,提醒用户在发表内容时需要完成出镜人身份验证。公告中提到,如果内容涉及真人出镜,用户需要通过身份验证,否则可能会限制视频和直播推荐。公告还提供了反馈渠道,用户可以通过创作者中心提交问题咨询。图片中还显示了三个日期,分别是7月5日、7月6日和7月9日,分别对应不同的公告内容。 图片作用:图片中的公告内容与上下文中提到的“数字人出镜人验证”紧密相关,强调了在使用视频号时,尤其是涉及真人出镜内容时,必须完成身份验证以确保内容的真实性和合规性。这与上下文中提到的“如何让AI形象变为真实的数字人”相呼应,提醒用户在使用AI生成内容时也需遵守相关验证规定。

图片内容:图片显示了一个名为“出镜人身份验证”的界面,界面上方有“验证实名信息”和“验证出镜人身份”两个选项。下方有一个绿色的“去验证”按钮。图片的作用:在文章中提到的“数字人出镜人验证”部分,图片展示了用户需要进行身份验证的步骤,强调了实名信息验证的重要性,帮助用户理解在使用数字人技术时需要完成的身份验证流程。

图片内容:图片显示了一个实名信息填写界面,要求用户填写真实姓名和身份证号,并提供一个“确定”按钮。界面上方有“实名信息”的标题,提示用户填写自己的实名信息。 图片作用:在文章中,该界面出现在“数字人出镜人验证”部分,说明在使用AI数字人时需要进行实名验证,以确保用户身份的真实性。

今天这篇文章的测评,不一定全面,但也是花了真金白银实打实的跑出来的案例,仅仅是我个人使用体验,希望对大家有帮助。

海螺视频套餐价格

即梦AI套餐价格

可灵AI套餐价格

说实话,这篇测评花了我不少真金白银。看看这些套餐价格就知道了——海螺、即梦、可灵,月套餐加起来要花几百块钱!

可能有人会问我:"元峰,你为啥要同时开三家的会员?这不是烧钱吗?"

哈哈,因为对我来说,这些AI工具就像是我的"员工"。要想让他们干活,我得先知道他们各自擅长什么、不擅长什么。今天的测评就像是一场面试,我得摸清楚他们的底细。

这样当我需要用到他们的时候,就能第一时间知道该选谁来干活最合适。比如,我要做动作幅度大的视频,毫不犹豫选海螺;要做数字人形象,直接找可灵不考虑其他。

ok,以上就是今天的分享。如果大家觉得有帮助,记得帮我点点赞!谢谢大家。