Hello,各位AI破局的伙伴们,大家好!我是元峰。
上周末,我受AI破局官方邀请,为圈友们带来了一场**《Sora 2深度实操及精选案例解析》**的直播分享。这也是我第一次系统性地把 Sora 的实战经验整理成完整课件——说来惭愧,这个想法其实早就有了,但一直因为"懒癌"没动手。
这次借着官方邀请的契机,总算把这套PPT给"逼"出来了。
错过直播的伙伴不用遗憾,点击下方链接扫海报即可收听完整回放。从账号注册到高级技巧,从提示词优化到案例拆解,我都做了详细的演示和讲解。


同时,为了方便大家快速查阅和收藏,我把整个PPT的核心内容以图文版的形式重新梳理了一遍。无论你是想系统学习,还是需要随时查找某个知识点,这篇文章都能帮到你。
文章开头这段15秒的自我介绍视频,就是用Sora 2生成的——这也是我今天要分享的众多案例之一。

我本人是AI破局行动家,也是可灵AI的超级创作者和必火AI的联合创始人,在AI破局数字人行动营里也多次担任教练,累计获得了30多颗AI之心。

今天,咱们不搞虚的,只讲实战。
我们今天的内容主要分这四块:首先,我们得搞明白Sora 2到底为什么这么强;接着,我会手把手带大家过一遍Sora 2的实操,看看怎么开始用;然后,我们会深入讲解它最核心的玩法——Cameo出镜秀;最后,我们会分享几个真正落地的优秀案例和应用场景。
第一部分:Sora 2为什么如此之强?

好,咱们进入第一部分。Sora 2为什么如此之强?

咱们得从Sora 1说起。2024年2月15日,OpenAI发布了Sora 1,当时还不能用。但它一出来就震惊了世界,为什么?因为它能连续生成长达17秒的视频,包含高度详细的场景、复杂的摄像机运动和多个情感丰富的角色。
当时最出圈的,就是这个"东京雪景"案例。你看这个提示词,写得非常细:"美丽的、下雪的东京城市熙熙攘攘...摄像机穿过繁忙的城市街道,跟随几个人...漂亮的樱花瓣和雪花一起在风中飞舞。"当时的视频模型 Runway、Pika 都只能生成几秒的视频,Sora 1居然都给它实现了。

这事儿当时闹得非常大,连CCTV 1的晚间新闻都报道了,标题是"OpenAI发布首个视频生成模型"。

到了2024年底,12月10日,Sora 1终于开放给用户使用了。这时候,它已经不只是文生视频,它还能让图像栩栩如生,也就是图生视频,或者扩展、混音、融合你已有的视频。
但真正的"王炸",是2025年10月1日发布的Sora 2。

Sora 1顶多算个"技术演示",Sora 2才是真正的"稳定发布"版本。官方说,"Sora 2能够完成先前视频生成模型难以做到的事情"。
它强在哪?它在"物理准确性"和"真实感"上更加出色,是"可控性"方面的一大飞跃,而且,它还配备了"同步音频"。

咱们看这个总结。Sora 2带来了四大核心进步:更精确的物理模拟、更清晰的现实主义、同步音频生成,以及显著增强的可控性与风格范围。
这里面, 最大的差异化、最大的杀手锏,就是这个"同步音频能力" 。它能生成与画面内容,甚至是口型相匹配的对话、音效和环境音。

这还不是全部。如果你只把Sora 2当成一个视频制作工具,那就想简单了。
Sora 2在发布时,是伴随一个独立的iOS社交应用发布的,大家看这个界面,它长得特别像TikTok。
这就暴露了OpenAI的真正意图。Sora 2具有双重身份: 表面上 ,它是一个创作工具; 内涵里 ,它是OpenAI杀入社交领域的"特洛伊木马",目的是什么?收集海量用户数据。
它的战略意图有两个:
- 当一个"行为显微镜",捕捉大家到底喜欢什么样的视觉内容,理解那种只可意会的"Vibe模式";
- 布局"社交电商",构建一个"内容发现(Sora) → 交易完成(ChatGPT)"的闭环生态。

所以咱们总结一下,Sora 2的核心能力有三块:
第一块:物理模拟与现实主义。早期的AI视频搞不定物理交互,但Sora 2能真实展示"篮球未投中,从篮板反弹"的轨迹。这说明它真的理解动量、惯性这些物理规律。
第二块:音画同步,这是杀手锏。模型一次性生成包含同步对话、音效的视频。这对创作者来说太香了,省去了繁琐的后期配音和拟音工作。
第三块:Cameo出镜秀。允许用户创建自己的数字"演员",包含声音与肖像。这个功能不是为了好玩,它就是为了服务于Sora 2的社交战略。
第二部分:Sora 2实操指南

好,搞懂了它为什么强,咱们马上进入实操环节。
首先,怎么才能用上?大家看这个官网界面 ,它不是一个复杂的创作工具,而是像TikTok一样的"For you"信息流。

Sora 官网:https://sora.chatgpt.com (需要🪜)

Sora 2目前是可以免费使用的,免费额度: Pro用户每天100次,其他人每天30次。
但是有严格的邀请制,需要邀请码才能使用。
邀请码获取途径:
- 官方会优先给ChatGPT Plus和Pro的订阅用户发邀请码。
2. 社群裂变: 早期用户会收到额外4个用于分享的邀请码。很多社群的伙伴,就是靠这种方式在评论区里互相"裂变"激活的。

邀请码在哪?
电脑网页端: 点击左下角的**"Invite friends 邀请朋友"**。
手机APP端: 点击头像进入个人页面,点左上角的**"邀请"**。
接下来看网页版怎么用。它的操作界面非常简洁,核心操作就这几步:

第一步:输入提示词,在底下的输入框打字。注意,这里可以@人物出镜秀,比如@sama,这就是我们后面要讲的Cameo功能。
第二步:打开控制开关,点那个"设置"图标,会弹出更多选项。
第三步:选择比例,Orientation,是横版16:9还是竖版9:16。
第四步:选择时长,Duration,目前是10秒或15秒。
第五步:上传图片,点"+"号,可以"图生视频",但注意,目前还不支持出现真人人脸的图片。
第六步:开始生成,点击那个带箭头的"发送"按钮。
Sora2 文生视频

怎么写提示词?Sora 2的提示词可不是简单的一句话。下面我们先看几个案例:
案例分享1:
标题: "中国女人时尚杂志的拍摄现场"
语言: "中文普通话"
时长: "10 秒"
场景:
- 时间:"0s-3s"
内容:|
摄影师在白色地平线的摄影棚中拍摄年轻美丽的时尚模特
台词:摄影师说"稍微改变一下动作"
摄像机运动:拍摄时尚模特时,摄影师背后的视角
音效:摄像机的快门声,以及监视拍摄的团队成员们的"可爱"
氛围:严肃且充满紧张感的时尚杂志拍摄现场
- 时间: "3s-7s"
内容: |
每秒切换画面,时尚模特姿势的变化
台词: "怎么样?就这样?"
相机:时尚模特的胸部特写视角。静态
音效:每次画面切换时,相机的快门声
字幕:用时尚字体动态显示的「Amazing!!」
- 时间:"7s-10s"
内容: |
时尚杂志拍摄结束后,模特回家的场景
台词: "今天也拍得很好啊!"
摄像机: 以广角镜头捕捉整个拍摄现场。静态
音效:工作人员在工作室的拍摄场景、设备收拾时的声音
氛围:与拍摄中紧张的氛围不同,是和谐的氛围
玩法一:结构化脚本。这是一个非常专业的写法。你看这个案例1,它把一个10秒的视频,按时间(0s-3s, 3s-7s, 7s-10s)拆分成了三个镜头。每个镜头都详细定义了: 内容 ,摄影师在干嘛; 台词 ,摄影师说"稍微改变一下动作";摄像机运动,摄影师背后的视角; 音效 ,相机的快门声;以及 氛围,严肃且充满紧张感。这是"导演式"提示词,你给的指令越清晰,Sora 2的执行就越精准。
案例分享2:

一段用手机拍摄的视频,前景中捕捉到汽车窗框的边缘,背景中则是一个极端肥胖的秃顶男子,留着黑色胡须,身穿鲜艳的花卉连衣裙,正在公路上骑着一辆极其小巧的摩托车,身旁还有一只猫坐在他的腿上,猫的爪子也抓握着车把,他们骑在车上在公路的车流中穿梭,看上去惊险刺激,还不时的将摩托车车头翘起,动感十足。这是一张充满动感的街头视频,背景中有运动模糊效果,构图自然随意
Sora效果最好,无论是画面、音效还是人物讲话。
可灵,有音效,但是没有任何旁白。
即梦,只有画面,没有声音。
玩法二:散文式描述。这种玩法就是"大力出奇迹"。你不用写脚本,而是用非常细腻、生动的文字,把画面的所有细节都描绘出来。你看这个案例:"极端肥胖的秃顶男子...身穿鲜艳的花卉连衣裙...骑着一辆极其小巧的摩托车...身旁还有一只猫坐在他的腿上...还不时的将摩托车车头翘起..."这是"小说家式"提示词,考验的是你的文字功底和想象力。
案例分享3:

参考图片:
玩法三:图生视频(分镜图)。这是一个进阶玩法。你甚至可以不写字,直接 喂给它一张"分镜图" 。你看这个案例,用户上传了一张包含9个格子的漫画分镜图,然后告诉Sora 2:**"帮我生成一支薯片的广告,镜头按图中分镜所示"。**Sora 2就能理解这张分镜图的"起承转合",并把它变成一支完整的视频广告。

案例分享4:
使用特定的人脸或者角色。这是后面第三部分我们要讲的出镜秀客串的玩法。
@metafeng 采访@sama ,Sora2 这次提升为什么效果这么好,单独出 APP 是什么出于什么考虑,以及为什么选择在中国国庆节发布。
@metafeng 骑着@metafeng.daisydonke 悠闲地走在大街上,并悠闲的唱着歌,我有一直小毛驴,我从来也不骑。
Sora2图生视频,目前还不支持出现真人人脸的图片
注意:
- 没有创建角色,在没有创建自己的人物形象的情况下,想要生成人物的口播视频,可以将自己的照片变成素描照片(gemini可以实现),但是存在生成人物和照片不太像的情况。
- 创建角色:如需保持人物一致性,下载Sora2的手机端app拍摄自己的视频,创建角色,那样就可以保证在不同场景下人物都不会改变。
解决办法:可以上传这种线稿图
提示词:生成人物坐在茶桌前,桌上有热茶,口播正能量的视频,鼓励大家自信面对生活。




视频生成后,会先进到你的"Drafts(草稿)"。你有三个选项:
Post(帖子) ,把这个视频发布到Sora 2的社交平台,让别人能看到。
Download(下载) ,把视频保存到本地;
Delete(删除) ,删除这条视频。

这里要特别讲一下 Remix(再创作)功能,这是个被严重低估的功能 。它不是简单的"合拍",而是 "视频续写" 或 "跟拍" 。
如何操作?首先,你得生成一个视频。然后,你必须 Post(发布) 它,在草稿里是没法 Remix 的。在发布后的视频下面,点击 Remix(跟拍) 按钮。然后你再 描述下一个场景 。
比如第一个视频是"@metafeng在喝酒",你Remix时输入"后面 @metafeng.bladewheel 也加入了酒局"。Sora 2就会在第一个视频的基础上,接着往下生成第二个视频。这就是Sora 2制作**"连续剧"**的能力。
@metafeng.pandamaxsk 正在喝 @metafeng 一起对酒当歌,干杯并说 Cheers!
Remix(再创作):
后面 @metafeng.bladewheel 也加入了酒局
官方《Sora 2 提示词指南》

**官方《Sora 2 提示词指南》:**https://cookbook.openai.com/examples/sora/sora2_prompting_guide
OpenAI官方也出了一份《Sora 2提示词指南》。它给出了一个核心理念:"想象一下,你就像在给一个没见过你故事板的摄影师做简报 "。你给的细节越多,Sora 2的可控性和一致性就越强。同时,"将你的提示视为一个创意愿望清单,而不是一份合同 "。什么意思?就是说,Sora 2也有"创意自由度",同一个提示词多生成几次,结果可能会不一样,这很正常。

这是官方给出的 黄金提示词框架 ,建议大家收藏:
【散文式场景描述。请用平实的语言描述角色、服装、布景、天气和其他细节。尽可能详细,以便生成符合您设想的视频。】 镜头: 镜头:【景别和角度,例如:广角全景镜头,平视】 氛围:【整体基调,例如:电影感的紧张,俏皮的悬疑,奢华的期待】 动作:
- 【动作 1:一个清晰、具体的节拍或手势】
- 【动作 2:片段中的另一个清晰节拍】
- 【动作 3:另一个动作或对白】 对白: 【如果镜头中有对白,请在此处添加简短自然的台词,或将其作为动作列表的一部分。保持简短,以匹配片段长度。】
你看这个"锦衣卫"的案例,就是用这个框架写的,非常专业,有电影感。
一名身着暗红色飞鱼服的锦衣卫,正站在一座古老寺庙的荒芜庭院中。时值黄昏,天色阴沉,冷风卷起地上的枯叶。他的斗笠压得很低,遮住了大半张脸,只露出紧抿的嘴唇和一道浅浅的刀疤。他腰间的绣春刀刀柄上缠着黑色布条。
镜头: 镜头:中景,平视(Eye level) 氛围:肃杀、压抑、充满悬念
动作:
- 他缓缓抬起戴着皮质护手的左手,接住一片飘落的枯叶。
- 他(用手)碾碎了叶子,任凭碎屑从指缝飘落。
- 他的头微微一偏,仿佛在倾听远处传来的马蹄声,右手不自觉地按在了刀柄上。
对白: (自言自语,声音低沉沙哑)“……时候到了。”
Sora 2的提示词不仅能控制"内容",还能精准控制"风格"、"镜头"和"灯光"。

风格: 1970年代浪漫剧情片风格。使用35毫米胶片拍摄,带有自然眩光、柔焦和温暖的光渗(halation)。轻微的胶片门抖动(gate weave)和手持微抖动,营造出复古的亲密感。受柯达启发的温暖色调;灯泡上有轻微光渗;胶片颗粒感和柔和的暗角以增加时代真实感。
黄金时刻,一个砖砌廉租公寓的屋顶变成了一个小小的舞台。晾衣绳上挂着的白床单随风摇曳,捕捉着最后一缕阳光。几串不成套的小彩灯在头顶微弱地亮着。一位穿着飘逸红丝绸连衣裙的年轻女子正赤脚跳舞,她的卷发在渐逝的光线中闪耀。她的伴侣——袖子卷起,吊带松垮——正跟着节拍鼓掌,笑容灿烂而不加掩饰。下方,城市在汽车喇叭声、地铁的震动和远处的笑声中嗡鸣。
镜头:
摄影机:中全景(medium-wide shot),从平视角度缓慢向前推进(Dolly-in)
镜头:40毫米球面镜头;浅景深(浅焦),将这对情侣从天际线中分离出来
灯光:金色的自然光作为主光(Key light),辅以钨丝灯反光(Bounce);小彩灯提供边缘光(Edge light)
氛围:怀旧的、温柔的、电影感的
动作:
- 她旋转着;裙摆飞扬,捕捉到阳光。
- 女人(笑着说):“看到了吗?今晚连这座城市都在和我们一起跳舞。”
- 他走上前,抓住她的手,带她下腰旋入一片阴影中。
- 男人(微笑着):“那只是因为有你带领。”
- 床单飘过画面,短暂地遮住了天际线,然后再次分开。
背景音:
只有自然环境音:微弱的风声、布料飘动的声音、街道噪音、隐约的音乐声。没有额外配料。
比如这个案例,它定义了"1970年代浪漫剧情片风格"、"35毫米胶片拍摄"、"柯达启发的温暖色调"、"40毫米球面镜头"等专业术语。
风格: 手绘2D/3D混合动画风格,具有柔和的笔刷纹理、温暖的钨丝灯光和一种可触摸的定格动画感。美学风格唤起了2000年代中期的故事书动画感——舒适、不完美、充满机械魅力。微妙的水彩渲染和绘画般的纹理;色调在冷暖之间取得平衡;电影感的动态模糊(motion blur)以实现动画的真实感。
在一个杂乱的工作室里,架子上堆满了齿轮、螺栓和泛黄的蓝图。正中央,一个小小的圆形机器人坐在一张木凳上,它凹陷的身体上打着不匹配的金属补丁和陈旧的漆层。当它紧张地摆弄着一个嗡嗡作响的灯泡时,它那双发光的大眼睛闪烁着淡蓝色的光。空气中弥漫着安静的机械转动声,雨点敲打着窗户,背景中时钟在稳定地滴答作响。
镜头:
摄影机:中近景(medium close-up),从悬挂的工具间缓慢推进(push-in),带有轻微的视差效果(parallax)
镜头:35毫米虚拟镜头;浅景深(shallow depth of field),以柔化背景的杂乱
灯光:来自头顶实用灯具(practical)的暖主光(key light);来自窗户的冷补光(spill)以形成对比
氛围:温柔的、异想天开的、带一点点悬念
动作:
- 机器人敲了敲灯泡;火花噼啪作响。
- 它猛地一缩,灯泡掉落,眼睛随之睁大。
- 灯泡慢动作翻滚下落;它在最后一刻及时抓住了它。
- 一股蒸汽从它的胸口喷出——既是松了口气,又带着自豪。
- 机器人轻声说:“差点丢了……但我抓住了!”
背景音:
雨声、时钟滴答声、轻柔的机械嗡鸣声、微弱的灯泡嘶嘶声。
另一个案例甚至定义了"手绘2D/3D混合动画风格"、"2000年代中期的故事书动画感"、"35毫米虚拟镜头"等。这说明Sora 2的专业上限非常高。
第三部分:Cameo出镜秀核心玩法

接下来,是第三部分,这是Sora 2最核心、最独特的玩法——Cameo出镜秀 。

什么是Cameo?你看这个视频,@gavenlin和@metafeng两个真实的Sora 的数字人形象,一起在泰山之巅切磋武艺。
@gavenlin 和@metafeng 两个人正在泰山之巅切磋武艺,展现中国武术。
定位: 这是Sora 2社交应用的核心,也是它区别于其他所有模型的最独特功能。
本质定义:说白了,Cameo就是一个"经过你同意的、可复用的个人'Deepfake(深度换脸)'" 。它不只是复刻你的"脸",它是一个包含你 "肖像+声音" 的数字模型。
核心玩法: 就是**"替换角色"(Swap Characters)**,你可以把你自己,或者你的朋友,"扔"进任何一个Sora 2生成的视频场景里。
如何创建你自己的"个人Cameo"?
目前(2025年11月5日)还有点门槛:
个人Cameo 的形象采集只能在手机上直接用摄像头拍摄,电脑网页端无法直接上传视频。 但是创建好之后,可以在电脑网页端调用。

硬性条件: 必须是苹果手机或iPad,安卓目前无法下载。 苹果 ID: 需要美区苹果ID,中国区ID的搜索不到 Sora。 网络条件:🪜美区梯子。 App: 搜索"Sora by OpenAl"下载。


录制过程其实非常简单,全程3分钟搞定。进入个人主页,点击"编辑Cameo出镜秀"。
念3个数字 ,这是为了采集你的声音特征。
向左或者向右转头 ,向下低头或者向上抬头 ,这是为了采集你脸部的3D数据。
等待1分钟上传视频,完成。

录制虽然简单,但质量很关键。Sora 2只能生成它"见过"的你。这里有几个 高质量Cameo创作的秘笈 :
第一:光照,这是最重要的。千万别在光线平平、均匀的室内光下录。最好是在能产生**清晰阴影的自然光**下录制,比如窗边,这样模型才能更好地理解你的五官轮廓。
第二:环境。确保背景干净,房间安静无回声。
第三:动作。按照提示缓慢转头,确保下颚线和发际线都被录进去。
第四:表情,这是关键。一定要使用夸张的面部表情! 比如大笑、悲伤、愤怒、困惑。原理是什么?模型无法生成它没有"看"过的表情。如果你录的时候面无表情,那Sora 2以后也生成不了你生气的样子。
第五:声音。持续地、富有表现力地说话,而不只是干巴巴地念数字,这有助于模型捕获你的声音特征。
官方的介绍,使用 Cameos 生成内容:https://help.openai.com/zh-hans-cn/articles/12435986-generating-content-with-cameos

录好了Cameo,你肯定会担心隐私问题。Sora 2提供了详细的权限选项。你可以设置为: 只有我 、我批准的人 、互关 (好友)、每个人 。你也可以随时删除。删除后,该Cameo将无法用于新视频,但已生成的视频不变。OpenAI会在30天内删除相关上传内容。
除了在官方这边使用,在任何第三方的API产品里面也可以使用。
如果你已经在iOS手机端制作了自己的 出镜秀,并公开给大家访问,便可以在这里 @人名 (注意 @人名 和后面文字需要有空格,)来制作视频。

✅电影拍摄现场,@metafeng 正在四处乱逛,表现很惊讶,竖版
❌电影拍摄现场,@metafeng正在四处乱逛,表现很惊讶,横版 里面的人物不是我( @人名 和后面文字需没有空格)
✅电影拍摄现场,@gavenlin 和 @metafeng 正在四处乱逛,表现很惊讶,横版
创建角色 (Character) Cameo

角色 Cameo在电脑网页端和手机端都可以创建和使用。
Sora 2不仅能复刻"人",还能复刻"角色"。 "角色Cameo"是专门给"物体"或"宠物"用的 。
重要限制: 此功能不适用于真人。录真人必须走"个人Cameo"流程。比如,你可以把你的宠物狗、或者一个可爱的熊猫手办,做成一个可复用的角色。
比如下面这个卡通熊猫形象,我用可灵 AI画的,把它创建为一个 Sora角色。

可灵画卡通熊猫
图片转为视频

如何创建"角色Cameo"?
在个人资料页,点击"查看角色",然后"新建角色"。
你可以选择**"拍摄视频"或"上传视频"**,比如你提前画好的卡通熊猫视频。
裁剪视频: 系统会让你裁剪出最好的3秒钟。
设置角色个人资料:
描述您的角色: 这里要详细描述它的特征,比如"Turbo Bamboo是一只爱冒险的城市熊猫..."
用户名: 比如metafeng.turbobambo。
显示名称: 比如Turbo Bamboo。

角色创建好了,怎么用?标记角色: 在Sora 2的提示词编辑器中,直接 @这个角色的用户名 或显示名称就行了。
组合使用: 你可以在同一个场景中,组合多个Cameo。
@metafeng.pandamaxsk 从一无所有,到现在腰缠万贯
@metafeng.pandamaxsk正在和@metafeng一起对酒当歌,干杯并说Cheers!
看这个案例:提示词**“@metafeng.pandamaxsk正在和@metafeng一起对酒当歌,干杯并说Cheers!”**
结果就是,Sora 2把"角色Cameo"(熊猫)和"个人Cameo"(真人)完美地融合在了同一个视频里,实现了跨次元的互动。角色Cameo的权限与你的个人Cameo是完全分开的,你同样可以设置谁能使用它。
Cameo功能这么强,OpenAI显然不是做慈善,这就是它的商业化核心 。你看OpenAI高管Bill Peebles在 10月31日发的帖子,他透露了Sora 2的商业化路径:

第一步:付费生成。他说每天30个免费 gen 根本不够重度用户玩,所以推出了付费购买功能,比如10个视频 $4.00,让专业创作者能**"按需付费"**。
第二步:打造"Sora经济"。
终极形态:"我们想象一个世界,权利持有者(比如IP方)可以选择为喜爱角色的Cameo和人物收取额外费用 " 。说白了:以后迪士尼、漫威可以把"米老鼠"、"钢铁侠"做成官方Cameo。
你想在你的视频里用它?可以,付费!这也为新一代的Sora创作者提供了赚钱的方式。
第四部分:优秀案例与应用场景

最后一部分,咱们来看几个真正落地的优秀案例和应用场景。
案例1:"混合实验"——导演的特效工具箱

https://youtu.be/XS1S1N08IgU?si=hi-kF4cU9hhwuSsQ
这个短片《CAMEO》在圈内非常火。创作者是Tim Simmons。它不是一个100%由Sora 2生成的视频。它采用的是**"混合实验"(Hybrid Experiment)** 的工作流:
创作者自己拍摄了"真人实景"的镜头,比如人站在酒店门口的镜头。然后,他用Sora 2去生成那些 昂贵的VFX(视觉特效)、B-Roll(补充镜头)或无法拍摄的超现实场景 ,比如一个破车开过来。最后,他把这两种素材"混合剪辑"在一起。
这是目前比较有意思、最成熟的工作流程。Sora 2不会取代导演,而是成为了导演的"超级工具箱"。
案例2:"终极实战"——全自动UGC广告流水线

这个案例,是Sora 2在商业领域"终极实战"的形态。目标是:打造一个全自动的"UGC广告生成机" 。
你看这个流程:
步骤一(图片): 营销人员只需要准备一张产品图片,比如这个 labubu 玩偶。

步骤二(文本): 把这张图片扔给视觉模型,比如Gemini 2.5 Pro。AI会自动分析产品,"构思"一个最适合带货的网红人设,并围绕这个人和产品,自动编写N个不同风格的UGC广告脚本。
SCRIPT 1: Excited Discovery The energy: Caffeinated, buzzing, pure joy of a new toy What they say to camera (with timestamps): [0:00-0:02] "Okay, so like, you guys..." [0:02-0:09] "Look at this little guy! I just got my hands on the Fuzzy Bunny Dude, and he's literally everything. The details, you know? Like, his glasses, the fuzzy hood, the little vest patches. Obsessed, honestly." [0:09-0:12] "Seriously, you have to see him up close, it's wild." Shot-by-Shot Breakdown: Overall Technical Details: Phone orientation: Vertical Filming method: Selfie mode, Charlie holding phone in right hand. Dominant hand: Right hand holds phone, left hand interacts with product. Location specifics: Charlie's home studio desk area. Mid-afternoon, natural window light from the left. Desk is cluttered with sketchbooks, colored pens, and a half-empty coffee mug. Audio environment: Quiet room, faint sounds of ambient street noise from outside. SECOND 0-1: Camera position: Phone held at chest height, pointed slightly up, wobbling. Camera movement: Shaky, moving right as Charlie shuffles slightly. What's in frame: Fuzzy Bunny Dude fills 80% of frame, held in Charlie's left hand. Charlie's chin and neck visible at the very bottom edge. Background is a cluttered desk with sketchbooks and a coffee mug, out of focus. Lighting: Natural window light from the left, slightly overexposing the white of the toy's vest. Creator action: Charlie walking into frame, holding the toy up, looking excited off-camera. Product visibility: Fuzzy Bunny Dude is the immediate focus, almost too close. Audio cue: "Okay, so like, you guys..." SECOND 1-2: Camera position: Phone pulled back slightly, now at eye level. Camera movement: Steadying briefly, then a natural hand shake begins. What's in frame: Charlie's face (wearing round, thick-framed glasses, soft caramel hair slightly messy) appears in the top half, smiling broadly. Fuzzy Bunny Dude is held up in his left hand, centered. Creator action: Charlie turns his head to look directly at the phone camera, eyes wide with excitement. Product visibility: Fuzzy Bunny Dude is now clearly visible from head to chest. Audio cue: "...Look at this little guy!" SECOND 2-3: Camera position: Phone held stable but still with natural hand shake, eye level. Camera movement: A slight tilt downwards, Charlie shifts his weight. What's in frame: Charlie's upper body and the Fuzzy Bunny Dude, held closer to his chest. Background is his art-filled wall with a framed print. Focus point: Focus slightly shifts from Charlie's face to the toy, then back to his face. Creator action: Charlie brings the Fuzzy Bunny Dude slightly closer to the camera. Product visibility: Fuzzy Bunny Dude now takes up about 40% of the frame, clear view of its face and upper body. Audio cue: "I just got my hands on the Fuzzy Bunny Dude, and he's..." SECOND 3-4: Camera position: Phone pivots slightly to the left, still eye level. Camera movement: A natural bob to the left as Charlie gestures with his right hand (the one holding the phone). What's in frame: Fuzzy Bunny Dude in his left hand, Charlie's right hand briefly comes into view near the lens, nearly brushing it. Creator action: Charlie wiggles the toy slightly, as if presenting it. His right hand makes a small, enthusiastic gesture. Product interaction: He gently rotates the Fuzzy Bunny Dude to show its side profile. Audio cue: "...literally everything. The details, you know? Like, his..." SECOND 4-5: Camera position: Phone moves closer, digital zoom subtly engages. Camera movement: Minor shakiness as the phone gets closer to the toy. What's in frame: Close-up on the Fuzzy Bunny Dude's face, specifically the black-framed glasses and the fuzzy hood. Charlie's thumb briefly covers the top right corner of the lens for a split second. Creator action: Charlie's left thumb gently traces the edge of the glasses. Product interaction: Zoomed in view emphasizes the toy's facial features. Physical details: The texture of the fuzzy hood and the black frames of the glasses are clear. Audio cue: "...glasses, the fuzzy hood, the little vest..." (muffled by thumb briefly) SECOND 5-6: Camera position: Phone pulls back slightly, still zoomed in, but less. Camera movement: Readjusting focus, slight pan down. What's in frame: Fuzzy Bunny Dude's chest area, showing the white vest with its colorful patches/pins. Charlie's fingers hold the toy at the waist. Creator action: Charlie uses his left index finger to point at one of the small, embroidered patches on the vest. Product highlight: The colorful, intricate patches on the white vest are highlighted. Audio cue: "...patches. Obsessed, honestly." SECOND 6-7: Camera position: Phone pulls back to eye level, slightly wider shot. Camera movement: Natural swaying as Charlie shifts his weight, still holding the phone in his right hand. What's in frame: Charlie's smiling face again (60% of frame), Fuzzy Bunny Dude held in his left hand at chest level, slightly off-center. Background shows a print on his wall. Creator action: Charlie looks from the toy to the camera, a big, genuine smile. Product visibility: Fuzzy Bunny Dude is still the hero, clearly visible. Audio cue: "Seriously, you have to see him up close," SECOND 7-8: Camera position: Tilts slightly downward, still handheld. Camera movement: A quick, natural jiggle as Charlie adjusts his grip on the phone. What's in frame: Fuzzy Bunny Dude held up, almost eye level with the camera. Charlie's left hand is supporting it from below. Creator action: Charlie slightly rotates the Fuzzy Bunny Dude, showing it from another angle. Product visibility: Good overall view of the toy's front again. Audio cue: "it's wild." (Charlie's voice is full of enthusiasm) SECOND 8-9: Camera position: Phone moves closer to the toy again, slight digital zoom. Camera movement: Subtle shaky zoom-in, focus hunts for a moment between the toy's eyes and the glasses. What's in frame: Close-up on the Fuzzy Bunny Dude's face, specifically its mischievous smile and small teeth. Charlie's eye visible briefly in top corner. Creator action: Charlie leans in slightly, as if sharing a secret with the toy. Product interaction: Emphasizes the toy's unique expression. Audio cue: (A small, satisfied "Mmm-hmm" from Charlie) SECOND 9-10: Camera position: Phone pulls back abruptly, returning to chest height. Camera movement: A quick, slightly jerky movement. What's in frame: Charlie's chest and shoulders, Fuzzy Bunny Dude held casually in his left hand, almost resting against his chest. His thick-framed glasses are visible. Creator action: Charlie relaxes his posture, still smiling broadly at the camera. Product visibility: Fuzzy Bunny Dude is still visible, but less prominently. Audio cue: "I mean, look at this little dude," (trails off slightly) SECOND 10-11: Camera position: Steady-ish at chest height, but still natural handheld shake. Camera movement: Minimal movement, settling. What's in frame: Charlie's face in the upper half, Fuzzy Bunny Dude in his left hand, lower half of frame. His pendant necklace is visible. Creator action: Charlie gives a little nod, looking at the Fuzzy Bunny Dude, then back at the camera. Product visibility: Last clear view of Fuzzy Bunny Dude held casually. Audio cue: "so much character, you know?" SECOND 11-12: Camera position: Same level, might drift slightly downward. Camera movement: Natural settling, possibly starting to lower phone. What's in frame: Charlie's face, partial product view as it dips out of frame. His hand might start to move down. Creator action: Charlie gives a quick, knowing smile, starts to lower the phone. How it ends: Cuts off as Charlie starts to lower the phone. Final audio: "Yeah, definitely get one." (Cut off mid-word "one")
步骤三(视频): 把这些AI生成的脚本,批量提交给Sora 2。Sora 2就会自动生成几十个不同版本的广告视频,比如下面这些不同网红拿着 labubu 讲解的广告视频,供你测试投放。
这个流程,让品牌在几分钟内,就能从"一张产品图"变为"数十个可测试的UGC视频广告"。
这标志着AI视频创作,正式从"玩具"走向了"工厂" 。
案例3:Sora2&n8n自动生成短视频分镜画中画

前两天脑子里突然蹦出个想法。
你说现在AI这么强,Sora2又这么好用,能不能让它帮我批量生成短视频的画中画素材?
这个念头一出来就停不下来了。索性周末也没啥事,干脆动手试试。
结果还真让我搞出来了,跑了一个n8n工作流。

下面是最终剪辑好的短视频和中间 Sora 生成的画中画素材片段。
这事儿是怎么开始的
做短视频的朋友应该都懂,画中画素材真的太重要了。
它能让你的内容更丰富,节奏更紧凑,观众看着也不容易腻。
但问题就来了:
去素材网站找吧,翻半天不一定能找到合适的,还浪费时间。
自己拍吧,成本高不说,效率也低得要命。
用AI生成?这倒是个好主意。但如果我需要10个、20个不同场景的素材呢?难道一个个去写提示词?那不还是很麻烦吗?
Sora2确实厉害,基本上你说啥它就能给你生成啥。但关键是,我不想一个个去"说"啊。
所以我就在想,能不能把这个过程自动化?
就是那种,我只需要输入一个主题,然后AI自动帮我:
- 写好脚本
- 拆好分镜
- 生成提示词
- 调用Sora2出视频
- 最后还能自动归档
一键搞定,多爽。这就是我想解决的问题。
思路其实挺简单的
有了想法,接下来就是验证能不能做。

我的思路是这样的:
第一步,让Claude帮我写脚本。
我就输入一个主题,比如"AI如何改变教育",然后让Claude Sonnet 4.5帮我生成一段短视频文案。这个它很擅长,基本上一次就能出个八九不离十的稿子。
第二步,让Gemini帮我拆分镜。
把Claude写好的文案丢给Gemini 2.5 Pro,让它帮我拆成多个镜头。我设置的是最多5个镜头,每个镜头都要有场景描述、时长、还有关键元素。这样后面生成视频的时候才有依据。
第三步,自动生成Sora的提示词。
这步很关键。Gemini会根据每个分镜,写出专业的Sora 2提示词。你别小看这个,提示词写得好不好,直接决定了视频质量。
第四步,批量调用Sora2生成视频。
工作流会自动循环处理每个分镜,一个个提交给Sora 2去生成。然后每隔30秒查询一次状态,看看生成好了没有。全程不用我盯着,该干嘛干嘛去。
第五步,自动归档整理。
视频生成好了之后,自动上传到飞书云空间。同时把所有信息——文案、提示词、视频地址——全都存到飞书多维表格里。这样我的素材库就自动建好了。
第六步,用必火 AI数字人视频。
视频素材准备好了,但还缺一个核心——主讲人。这时候就该必火AI登场了。
必火AI是我们团队的数字人生成平台,现在已经能很快速的制作数字人了。你只需要把第一步Claude写好的文案复制进去,选择一个之前克隆好的数字人形象,然后点击生成,3分钟就能出片。
第七步,把数字人和这些画中画素材剪辑在一起。
现在,所有素材都齐了:必火AI生成的数字人主讲视频,加上Sora 2生成的多个画中画素材。接下来就是最后一步——剪辑拼接。
整个流程下来,从输入一个主题,到最终拿到一条可以直接发布的短视频成品,全程不超过30分钟,而且90%的工作都是AI自动完成的。
这就是我说的**"AI视频创作的工厂化生产"**。你不需要是专业的导演、剪辑师,甚至不需要懂太多技术,只要你有创意、有想法,剩下的交给必火AI和这套自动化工作流就行了。
实际跑起来效果怎么样
周末两天时间,我基本上就把这个流程搭出来了。
刚开始主要是理思路,把整个流程在脑子里过一遍,然后画出来。然后才开始动手写节点,一个个调试。

说实话,中间确实踩了几个坑:
Sora2的API经常不稳定,老是各种报错,需要把错误处理的更优雅些。飞书的文件上传也有点麻烦,得先上传云空间获得文件 Token,再把Token存入多维表格才行。还有多维表格的字段映射,一开始总是json错误,调了好几次。

不过好在,整个流程最后还是跑通了。
我拿几个主题测试了一下:
- "AI如何改变教育"
- "人工智能如何影响传统的电影拍摄"
- "多和正能量的人在一起"

Sora2视频生成比较慢,平均每一条5分钟左右,每个主题大概30分钟左右就能生成完整的视频素材。质量的话,还算不错,大部分是能用的。
这是另外的2个案例,整体效果已经非常不错了。
当然了,现在这个版本还是MVP阶段,很多地方还不够完善:
提示词的质量还能再优化,分镜的逻辑也可以更智能一些,错误处理机制也还不够完善。
但核心功能已经验证了,这就够了。剩下的就是慢慢打磨的事儿。
在当时直播的过程中,我注意到评论区非常热闹,很多伙伴都在问:"元峰老师,这个工作流能不能分享一下?"甚至已经有好几位伙伴直接在直播间表示愿意付费购买这套完整的自动化方案。
说实话,这让我挺受鼓舞的,因为这恰恰证明了一件事:当你把技术真正变成产品、变成解决方案的时候,它就有了商业价值,就能成为生产力。否则,再牛的技术也只是"玩具"而已。
关于这个工作流,我先把核心思路和框架分享给大家了。至于具体的工作流配置文件、详细的步骤拆解,我会专门写一篇保姆级教程文章,手把手教大家怎么搭建。
为什么不是今天就直接放出来呢?有两个原因:
第一,它现在还是个"半成品"。 虽然主流程已经跑通了,但还有很多细节需要优化,比如错误处理、异常重试、素材去重等等。我不想给大家一个"能用但不好用"的东西,那不是我的风格。
第二,只有工作流文件,很多伙伴会一脸懵逼。 你拿到一个n8n的JSON文件,里面几十个节点,不知道从哪改起,也不知道哪些参数需要替换成自己的。所以必须要有详细的文档说明、参数配置指南、常见问题解答,这样大家才能真正用起来。
如果你对这个自动化工作流感兴趣,请在评论区扣"1"或者留言"想要"。 人多的话,我就优先把这个教程赶出来,争取下周就发布。
最后,我想再讲下今天分享的核心思想:
AI时代,拼的不是你会用多少个工具,而是你能不能把这些工具"串"起来,变成一个自动化的生产线。
你看我今天这个案例,从一个主题到一条成品短视频,全程90%工作 AI化,30分钟搞定。而且已经有人愿意为它付费了,这就说明它不是"炫技",它是真正有市场需求的解决方案。
所以,我希望大家不要只是"学工具",而是要**"用工具思维去思考产品" 。问问自己:我能用这些AI工具,解决谁的什么问题?我能为谁创造什么价值?**
想明白这两个问题,就不只是一个"AI玩家",就是一个"AI创业者"**了。
AI洞察16:sora2带来的各行各业红利
最后,是洋哥在 Sora2 刚刚发布的时候,在破局分享的洞察。Sora 2的出现,会给各行各业带来巨大红利,建议大家再重新读一下,里面也分享了不少 Sora 的应用方向。

https://wx.zsxq.com/group/15552545485212/topic/4842428512451128
核心改变:
第一:短视频生态的底层改变。现在各个平台对AI内容有限制,但当Sora 2让AI内容和真人内容越来越分不清时,平台大概率会解除限制。
第二:AI内容成为主流。未来,AI生成的视频、甚至是直播,将慢慢成为主流。
第三:新的AI视频社交平台崛起。Sora 2自己就在干这个事。
实战成绩:咱们俱乐部已经有圈友抓住这波红利了。比如"莫西"同学,他的AI账号5天涨粉近1000,跑出了60万的流量,还出了一个20万+的小爆款 。这说明什么?说明红利期就在眼前,谁先行动,谁就能吃到肉。

Sora 2带来的不仅是技术革命,更是对内容生产、社交方式和商业模式的彻底重构。更多Sora 2的进阶玩法,我们一起探索!

感谢大家观看!如果对你有帮助,可以在星球中对本篇文章点个赞,谢谢。