元峰AI笔记 · AI绘画与视频

第一部分:Sora 2为什么如此之强?

<title玩转Sora 2——深度实操教程与精选案例解析</title

玩转Sora 2——深度实操教程与精选案例解析

Hello,各位AI破局的伙伴们,大家好!我是元峰。

上周末,我受AI破局官方邀请,为圈友们带来了一场**《Sora 2深度实操及精选案例解析》**的直播分享。这也是我第一次系统性地把 Sora 的实战经验整理成完整课件——说来惭愧,这个想法其实早就有了,但一直因为"懒癌"没动手。

这次借着官方邀请的契机,总算把这套PPT给"逼"出来了。

错过直播的伙伴不用遗憾,点击下方链接扫海报即可收听完整回放。从账号注册到高级技巧,从提示词优化到案例拆解,我都做了详细的演示和讲解。

图片是一张宣传海报,内容为“玩转Sora 2——深度实操教程与精选案例解析”直播预告。海报上方有“破局私域官”及“韩亮”字样,下方文字介绍Sora 2火爆,11月2日晚8点将邀请嘉宾元峰开展线上视频创作实用闭门会,涵盖快速上手Sora 2、深入实战“Cameo出镜秀”功能等内容,还提及专属福利、学习群等信息。海报底部有直播时间“11月2日 20:00 - 22:00”及二维码。该图片与文档中介绍的Sora 2直播活动预告内容相契合。

https://t.zsxq.com/zEHsr

图片展示了一只手握着手机,手机屏幕上显示着蓝色云朵图案的Sora 2应用图标。背景中隐约可见“OpenAI”字样。图片上方有“大模型俱乐部”标志及网址。图片下方文字为“Sora 2深度实操及精选案例解析”。该图片与文档中介绍Sora 2深度实操教程及精选案例解析的内容相关,直观呈现了Sora 2应用的界面,辅助说明文档主题。

同时,为了方便大家快速查阅和收藏,我把整个PPT的核心内容以图文版的形式重新梳理了一遍。无论你是想系统学习,还是需要随时查找某个知识点,这篇文章都能帮到你。

文章开头这段15秒的自我介绍视频,就是用Sora 2生成的——这也是我今天要分享的众多案例之一。

图片展示了一位名为元峰的人物介绍。左侧是元峰的照片,他穿着印有“AI破局 一年顶十年”字样的黑色上衣,背景为“2024 AI破局合伙人大会”相关画面。右侧以粉色和红色为背景,标明元峰著有《AI破局和数字人帮我实现了最疯狂的逆袭》,并列举其身份:AI破局行动家、必火AI联合创始人、可灵AI超级创作者、AI破局数字人行动营教练,还提及他在AI破局累计获得30多颗AI之心。图片与上下文相呼应,介绍了作者身份背景。

我本人是AI破局行动家,也是可灵AI的超级创作者和必火AI的联合创始人,在AI破局数字人行动营里也多次担任教练,累计获得了30多颗AI之心。

图片为文档目录页,背景为深色渐变,配有彩色光斑。目录内容分为四部分:01为Sora 2介绍,为何这么强?02为Sora 2实操,如何开始使用?03为个人Cameo出镜秀、角色Cameo出镜秀,04为优秀案例及应用场景分享。该图片位于文档开头,是对后续内容的纲要呈现,为读者明确接下来将学习和了解Sora 2的相关知识和应用。

今天,咱们不搞虚的,只讲实战。

我们今天的内容主要分这四块:首先,我们得搞明白Sora 2到底为什么这么强;接着,我会手把手带大家过一遍Sora 2的实操,看看怎么开始用;然后,我们会深入讲解它最核心的玩法——Cameo出镜秀;最后,我们会分享几个真正落地的优秀案例和应用场景。

第一部分:Sora 2为什么如此之强?

图片背景为渐变的红色和紫色,左上角有Sora 2的标志,标志为蓝色背景,内有白色卡通形象。图片中间以黄色大字突出显示“为什么如此之强?”右侧是白色数字“01”。图片位于介绍Sora 2为何如此之强的文档开头部分,起到引出下文对Sora 2强大之处的阐述的作用,与上下文紧密相关。

好,咱们进入第一部分。Sora 2为什么如此之强?

图片展示了OpenAI于2024年2月15日发布的Sora,强调其能生成长达17秒的视频,包含详细场景、复杂摄像机运动和多情感角色。左侧是Sora的介绍界面,右侧是一幅雪景图,画面中有樱花树、行人和摊位,体现了Sora生成视频的能力。该图片与上下文紧密相关,直观呈现了Sora发布时的亮点,呼应了上文对Sora震惊世界的描述。

咱们得从Sora 1说起。2024年2月15日,OpenAI发布了Sora 1,当时还不能用。但它一出来就震惊了世界,为什么?因为它能连续生成长达17秒的视频,包含高度详细的场景、复杂的摄像机运动和多个情感丰富的角色。

当时最出圈的,就是这个"东京雪景"案例。你看这个提示词,写得非常细:"美丽的、下雪的东京城市熙熙攘攘...摄像机穿过繁忙的城市街道,跟随几个人...漂亮的樱花瓣和雪花一起在风中飞舞。"当时的视频模型 Runway、Pika 都只能生成几秒的视频,Sora 1居然都给它实现了。

图片展示的是央视新闻报道Sora发布的画面。画面左上角有“CCTV 1”标识,下方是“晚间新闻”字样。画面右上角有“CCTV.com”标识。画面下方红底白字显示“晚间新闻”,并有“美国 OpenAI发布首个视频生成模型”字样。画面底部还有“OpenAI于2024年2月15日发布Sora”的文字。该图片与上下文紧密相关,直观呈现了央视新闻对OpenAI发布首个视频生成模型Sora的报道内容。

这事儿当时闹得非常大,连CCTV 1的晚间新闻都报道了,标题是"OpenAI发布首个视频生成模型"。

图片展示了Sora的诞生与定位相关内容。画面左侧是Sora相关的社交媒体界面截图,右侧是Sora操作界面,显示多帧视频画面。图片上方以红色字体突出显示“2024年12月10日 Sora首次开放给用户使用”。这与文档上下文提到的Sora 1于2024年12月10日开放给用户使用的信息相呼应,直观呈现了Sora开放这一重要事件及其应用场景。

到了2024年底,12月10日,Sora 1终于开放给用户使用了。这时候,它已经不只是文生视频,它还能让图像栩栩如生,也就是图生视频,或者扩展、混音、融合你已有的视频。

但真正的"王炸",是2025年10月1日发布的Sora 2。

图片展示了2025年10月1日Sora 2正式发布的内容。左侧是Sora 2的界面,显示用户上传的视频片段,下方有“Save”“Edit”“Share”等操作按钮。右侧是一场冰上表演的视频,表演者在冰面上旋转,背景有观众席和广告牌。图片与上下文紧密相关,直观呈现了Sora 2发布时的场景,体现了其在AI视频生成领域的应用。

Sora 1顶多算个"技术演示",Sora 2才是真正的"稳定发布"版本。官方说,"Sora 2能够完成先前视频生成模型难以做到的事情"。

它强在哪?它在"物理准确性"和"真实感"上更加出色,是"可控性"方面的一大飞跃,而且,它还配备了"同步音频"。

图片展示了Sora 2的诞生与定位。2025年Sora 2标志着AI视频从“技术演示”正式迈入“确定发布”阶段。其四大核心进步为更精确的物理模拟、更清晰的现实主义、同步音频生成、显著增强的可控性与风格范围。最大差异化是同步音频能力,能生成与画面内容(包括口型)相匹配的对话、音效和环境音。该图与上下文紧密相关,直观呈现了Sora 2的核心进步及最大差异化。

咱们看这个总结。Sora 2带来了四大核心进步:更精确的物理模拟、更清晰的现实主义、同步音频生成,以及显著增强的可控性与风格范围。

这里面, 最大的差异化、最大的杀手锏,就是这个"同步音频能力" 。它能生成与画面内容,甚至是口型相匹配的对话、音效和环境音。

图片展示了Sora 2作为社交平台的相关信息。左侧文字说明Sora 2发布时伴随独立iOS社交应用(类TikTok),具有创作工具的表面身份和作为战略性“特洛伊木马”收集海量用户数据的内涵,战略意图包括捕捉人类冲动和偏好、布局“社交电商”等。右侧展示了该iOS应用界面,有用户头像、关注数等信息,以及类似TikTok的视频浏览界面,还呈现了手机中应用列表,突出其社交应用属性,与上下文提到的Sora 2附带社交应用相呼应。

这还不是全部。如果你只把Sora 2当成一个视频制作工具,那就想简单了。

Sora 2在发布时,是伴随一个独立的iOS社交应用发布的,大家看这个界面,它长得特别像TikTok。

这就暴露了OpenAI的真正意图。Sora 2具有双重身份: 表面上 ,它是一个创作工具; 内涵里 ,它是OpenAI杀入社交领域的"特洛伊木马",目的是什么?收集海量用户数据。

它的战略意图有两个:

  • 当一个"行为显微镜",捕捉大家到底喜欢什么样的视觉内容,理解那种只可意会的"Vibe模式";
  • 布局"社交电商",构建一个"内容发现(Sora) → 交易完成(ChatGPT)"的闭环生态。

图片展示了Sora 2的核心能力,分为物理模拟与现实主义、音画同步(杀手锏)、Cameo(出镜秀)三部分。物理模拟与现实主义突破了早期AI视频在物理交互上的不足,如篮球未投中从篮板反弹的轨迹;音画同步功能可一次性生成同步对话、音效和背景环境的视频,优势在于创作者无需后期配音和Foley工作;Cameo功能允许用户创建数字“演员”,服务于社交战略。该图与上文总结Sora 2核心能力的内容相呼应,直观呈现其三大能力。

所以咱们总结一下,Sora 2的核心能力有三块:

第一块:物理模拟与现实主义。早期的AI视频搞不定物理交互,但Sora 2能真实展示"篮球未投中,从篮板反弹"的轨迹。这说明它真的理解动量、惯性这些物理规律。

第二块:音画同步,这是杀手锏。模型一次性生成包含同步对话、音效的视频。这对创作者来说太香了,省去了繁琐的后期配音和拟音工作。

第三块:Cameo出镜秀。允许用户创建自己的数字"演员",包含声音与肖像。这个功能不是为了好玩,它就是为了服务于Sora 2的社交战略。

第二部分:Sora 2实操指南

图片为Sora 2入门教程中“如何开始使用”的封面图。背景为渐变的红色、粉色、紫色和蓝色,左上角有Sora的标志。图片上方文字为“Sora 2入门”,下方文字为“如何开始使用”,右侧有数字“02”。该图片位于介绍Sora 2实操指南的文档中,作为第二部分“Sora 2实操指南”教程的封面,引导读者进入Sora 2的使用学习。

好,搞懂了它为什么强,咱们马上进入实操环节。

首先,怎么才能用上?大家看这个官网界面 ,它不是一个复杂的创作工具,而是像TikTok一样的"For you"信息流。

图片展示了Sora 2官网界面,呈现了其信息流形式。左侧有战斗机图片,中间是身着紫色礼服的女性,右侧是两位人物,下方还有多人聚会场景。界面底部有“Add name”等选项,右侧弹出“Orientation”“Duration”等设置菜单。该图与上下文紧密相关,直观呈现了Sora 2官网界面特点,帮助读者理解其“像TikTok一样的"For you"信息流”这一特性。

Sora 官网https://sora.chatgpt.com (需要🪜)

图片展示了Sora官网的邀请码获取途径。左侧文字说明初期免费但需使用邀请码,Pro用户每天100次,其他人每天30次。下方框内标注“机制”为严格的邀请制。右侧手机界面显示Sora仅限邀请,需输入邀请码,下方有“邀请好友”按钮。底部文字提示有码伙伴可发评论区激活码,激活后分享。该图与上下文紧密相关,直观呈现了Sora的免费使用条件及邀请码获取方式。

Sora 2目前是可以免费使用的,免费额度: Pro用户每天100次,其他人每天30次。

但是有严格的邀请制,需要邀请码才能使用

邀请码获取途径:

  1. 官方会优先给ChatGPT Plus和Pro的订阅用户发邀请码。

2. 社群裂变: 早期用户会收到额外4个用于分享的邀请码。很多社群的伙伴,就是靠这种方式在评论区里互相"裂变"激活的。

图片展示了Sora2邀请码获取途径及位置。电脑网页端,点击左下角“Invite friends邀请朋友”;手机APP端,点击头像进入个人页面,点左上角“邀请”。图片还呈现了电脑网页端点击“Invite friends”后弹出的邀请界面,以及手机APP端点击“邀请”后显示“您已没有剩余的邀请了”的界面。图片与上下文紧密相关,直观说明了邀请码获取的具体操作步骤。

邀请码在哪?

电脑网页端: 点击左下角的**"Invite friends 邀请朋友"**。

手机APP端: 点击头像进入个人页面,点左上角的**"邀请"**。

接下来看网页版怎么用。它的操作界面非常简洁,核心操作就这几步:

图片展示了Sora 2网页版的使用界面及操作步骤。左侧是Sama的个人资料,可@人物出镜秀。右侧是视频生成界面,有Orientation(横版16:9、竖版9:16)和Duration(10秒、15秒)选项。下方有“上传图片”按钮,提示不能出现真人脸。底部列出操作步骤:输入提示词、打开控制开关、选择比例、选择时长、上传图片、开始生成。该图与上文介绍Sora 2操作界面核心操作步骤的内容相呼应,直观呈现操作界面及步骤。

第一步:输入提示词,在底下的输入框打字。注意,这里可以@人物出镜秀,比如@sama,这就是我们后面要讲的Cameo功能。

第二步:打开控制开关,点那个"设置"图标,会弹出更多选项。

第三步:选择比例,Orientation,是横版16:9还是竖版9:16。

第四步:选择时长,Duration,目前是10秒或15秒。

第五步:上传图片,点"+"号,可以"图生视频",但注意,目前还不支持出现真人人脸的图片。

第六步:开始生成,点击那个带箭头的"发送"按钮。

Sora2 文生视频

图片展示了Sora2文生视频的相关内容。左侧为一位身着白色礼服的女性,背景为“Sora”标志。右侧是两位男士,一位骑着机械马,另一位站在旁边。图片上方文字说明了Sora2文生视频的标题、语言、时长、场景、内容等信息,如标题为“中国人气时尚杂志的拍摄现场”,语言为中文普通话,时长10秒等。该图片与上下文介绍Sora2文生视频的提示词等内容相关,直观呈现了视频场景。

怎么写提示词?Sora 2的提示词可不是简单的一句话。下面我们先看几个案例:

案例分享1:

标题: "中国女人时尚杂志的拍摄现场"

语言: "中文普通话"

时长: "10 秒"

场景:

  • 时间:"0s-3s"

内容:|

摄影师在白色地平线的摄影棚中拍摄年轻美丽的时尚模特

台词:摄影师说"稍微改变一下动作"

摄像机运动:拍摄时尚模特时,摄影师背后的视角

音效:摄像机的快门声,以及监视拍摄的团队成员们的"可爱"

氛围:严肃且充满紧张感的时尚杂志拍摄现场

  • 时间: "3s-7s"

内容: |

每秒切换画面,时尚模特姿势的变化

台词: "怎么样?就这样?"

相机:时尚模特的胸部特写视角。静态

音效:每次画面切换时,相机的快门声

字幕:用时尚字体动态显示的「Amazing!!」

  • 时间:"7s-10s"

内容: |

时尚杂志拍摄结束后,模特回家的场景

台词: "今天也拍得很好啊!"

摄像机: 以广角镜头捕捉整个拍摄现场。静态

音效:工作人员在工作室的拍摄场景、设备收拾时的声音

氛围:与拍摄中紧张的氛围不同,是和谐的氛围

玩法一:结构化脚本。这是一个非常专业的写法。你看这个案例1,它把一个10秒的视频,按时间(0s-3s, 3s-7s, 7s-10s)拆分成了三个镜头。每个镜头都详细定义了: 内容 ,摄影师在干嘛; 台词 ,摄影师说"稍微改变一下动作";摄像机运动,摄影师背后的视角; 音效 ,相机的快门声;以及 氛围,严肃且充满紧张感。这是"导演式"提示词,你给的指令越清晰,Sora 2的执行就越精准。

案例分享2:

图片展示了Sora addCriterion2

一段用手机拍摄的视频,前景中捕捉到汽车窗框的边缘,背景中则是一个极端肥胖的秃顶男子,留着黑色胡须,身穿鲜艳的花卉连衣裙,正在公路上骑着一辆极其小巧的摩托车,身旁还有一只猫坐在他的腿上,猫的爪子也抓握着车把,他们骑在车上在公路的车流中穿梭,看上去惊险刺激,还不时的将摩托车车头翘起,动感十足。这是一张充满动感的街头视频,背景中有运动模糊效果,构图自然随意

Sora效果最好,无论是画面、音效还是人物讲话。

可灵,有音效,但是没有任何旁白。

即梦,只有画面,没有声音。

玩法二:散文式描述。这种玩法就是"大力出奇迹"。你不用写脚本,而是用非常细腻、生动的文字,把画面的所有细节都描绘出来。你看这个案例:"极端肥胖的秃顶男子...身穿鲜艳的花卉连衣裙...骑着一辆极其小巧的摩托车...身旁还有一只猫坐在他的腿上...还不时的将摩托车车头翘起..."这是"小说家式"提示词,考验的是你的文字功底和想象力。

案例分享3:

图片展示了Sora2图生视频的玩法,左侧是一群人在沙发上围坐,手中传递着一包零食,背景为室内环境。右侧是该视频的分镜图,呈现了不同角度和场景的黑白画面,包括室内场景、人物特写等。该图片与上下文“玩法三:图生视频(分镜图)”相关,直观呈现了Sora2根据分镜图生成视频的功能效果。

参考图片:

玩法三:图生视频(分镜图)。这是一个进阶玩法。你甚至可以不写字,直接 喂给它一张"分镜图" 。你看这个案例,用户上传了一张包含9个格子的漫画分镜图,然后告诉Sora 2:**"帮我生成一支薯片的广告,镜头按图中分镜所示"。**Sora 2就能理解这张分镜图的"起承转合",并把它变成一支完整的视频广告。

图片展示了一张包含9个格子的漫画分镜图,用于生成薯片广告。分镜图中,人物在沙发上看电视,画面切换至电视画面、人物吃薯片、薯片特写等场景。该图片与上下文紧密相关,上下文提到用户可不写字,直接喂给Sora 2一张分镜图,Sora 2能理解分镜图的“起承转合”,并将其变成完整的视频广告,此图即为分镜图示例。

案例分享4:

使用特定的人脸或者角色。这是后面第三部分我们要讲的出镜秀客串的玩法。

@metafeng 采访@sama ,Sora2 这次提升为什么效果这么好,单独出 APP 是什么出于什么考虑,以及为什么选择在中国国庆节发布。

@metafeng 骑着@metafeng.daisydonke 悠闲地走在大街上,并悠闲的唱着歌,我有一直小毛驴,我从来也不骑。

Sora2图生视频,目前还不支持出现真人人脸的图片

注意:

  • 没有创建角色,在没有创建自己的人物形象的情况下,想要生成人物的口播视频,可以将自己的照片变成素描照片(gemini可以实现),但是存在生成人物和照片不太像的情况。
  • 创建角色:如需保持人物一致性,下载Sora2的手机端app拍摄自己的视频,创建角色,那样就可以保证在不同场景下人物都不会改变。

解决办法:可以上传这种线稿图

提示词:生成人物坐在茶桌前,桌上有热茶,口播正能量的视频,鼓励大家自信面对生活。

图片为一张手绘风格的肖像画,画中人物为一名戴眼镜的男性,面带微笑,双臂交叉于胸前。他穿着一件印有“AIPOJU”字样的长袖上衣。画面背景简洁,以浅色调为主,人物轮廓和衣物细节通过线条勾勒,整体风格清新自然。该图片位于介绍Sora2图生视频功能的文档中,用于展示目前Sora2图生视频还不支持出现真人人脸的图片这一内容。

图片为一张手绘素描,描绘了一位女性。她有着卷曲的长发,眼神直视前方,表情略显严肃。她穿着深色上衣,双手正拉扯着衣领。背景为竖条纹状,整体色调偏灰,线条细腻,人物面部和衣物的阴影处理较为丰富,表现出一定的立体感。此图位于介绍Sora2图生视频功能的上下文后,可能用于展示其生成的图像效果。

图片展示的是Sora2图生视频案例分享3。上方大图呈现多人围坐沙发,一人递零食的场景,右侧有视频播放界面。下方是参考图片,由9张黑白图组成,包含人物、物品等元素。该图片与上文提到的Sora2图生视频功能相关,展示了视频生成效果及参考图片,直观呈现了Sora2图生视频的创作成果。

图片展示了Sora2网页版使用时的草稿界面。左侧为用户界面,显示头像、用户名“Metafeng”及一些数据指标。中间是“Drafts”区域,有两张图片,一张是夜晚城市景观,另一张是戴着熊猫头套的人。右侧是生成的视频画面,一只戴着蓝色帽子的熊猫在滑板上滑行,背景是城市夜景。右侧还列出视频操作选项:Post发布、Download下载、Delete删除。该图与上文视频生成后先进入“Drafts(草稿)”的内容相呼应。

视频生成后,会先进到你的"Drafts(草稿)"。你有三个选项:

Post(帖子) ,把这个视频发布到Sora 2的社交平台,让别人能看到。

Download(下载) ,把视频保存到本地;

Delete(删除) ,删除这条视频。

图片展示了Sora 2的Remix功能示例。左侧为夜晚城市夜景,右侧为男子在烛光前微笑的场景。中间是Sora 2社交平台界面,显示“metafeng cameoed metafeng.pandamask”等内容,下方有“Remix”按钮。底部文字说明如何操作:生成一个视频,Post发布,选择Remix原拍,描述下一个场景/重复,最后点击Post发布。该图与上下文介绍的Remix功能被低估,可编辑视频相呼应,直观呈现其操作及效果。

这里要特别讲一下 Remix(再创作)功能,这是个被严重低估的功能 。它不是简单的"合拍",而是 "视频续写""跟拍"

如何操作?首先,你得生成一个视频。然后,你必须 Post(发布) 它,在草稿里是没法 Remix 的。在发布后的视频下面,点击 Remix(跟拍) 按钮。然后你再 描述下一个场景

比如第一个视频是"@metafeng在喝酒",你Remix时输入"后面 @metafeng.bladewheel 也加入了酒局"。Sora 2就会在第一个视频的基础上,接着往下生成第二个视频。这就是Sora 2制作**"连续剧"**的能力。

@metafeng.pandamaxsk 正在喝 @metafeng 一起对酒当歌,干杯并说 Cheers!

Remix(再创作):

后面 @metafeng.bladewheel 也加入了酒局

官方《Sora 2 提示词指南》

图片展示了OpenAI官方《Sora 2提示词指南》的网页内容。页面上方标题为“《Sora 2提示词指南》”,下方网址为“https://cookbook.openai.com/examples/sora/sora2_prompting_guide”。主要内容是关于创作成功的视频提示的指南,包括在提示之前、提示中、提示后三个部分,分别介绍了如何想象给没见过你故事板的摄影师做简报,以及如何使用提示词来引导模型生成视频等。该图片与上下文紧密相关,是对上下文提到的《Sora 2提示词指南》内容的直观呈现。

**官方《Sora 2 提示词指南》:**https://cookbook.openai.com/examples/sora/sora2_prompting_guide

OpenAI官方也出了一份《Sora 2提示词指南》。它给出了一个核心理念:"想象一下,你就像在给一个没见过你故事板的摄影师做简报 "。你给的细节越多,Sora 2的可控性和一致性就越强。同时,"将你的提示视为一个创意愿望清单,而不是一份合同 "。什么意思?就是说,Sora 2也有"创意自由度",同一个提示词多生成几次,结果可能会不一样,这很正常。

图片展示了官方提示词框架示例,用于指导生成符合设想的视频。画面中一名身着暗红色鱼鳞纹铠甲的武士,站在古寺庭院中,背景有飞檐翘角的建筑。武士斗笠压得很低,露出紧抿的嘴唇和刀疤,腰间插着长刀。画面配有详细提示词,包括场景描述、镜头、动作、对白等内容,如场景为古寺庭院,天气阴沉,动作有拔刀、对白等,对白为“时候到了”。此图与上下文介绍的Sora2图生视频创作相关,提供具体示例。

这是官方给出的 黄金提示词框架 ,建议大家收藏:

【散文式场景描述。请用平实的语言描述角色、服装、布景、天气和其他细节。尽可能详细,以便生成符合您设想的视频。】 镜头: 镜头:【景别和角度,例如:广角全景镜头,平视】 氛围:【整体基调,例如:电影感的紧张,俏皮的悬疑,奢华的期待】 动作:

  • 【动作 1:一个清晰、具体的节拍或手势】
  • 【动作 2:片段中的另一个清晰节拍】
  • 【动作 3:另一个动作或对白】 对白: 【如果镜头中有对白,请在此处添加简短自然的台词,或将其作为动作列表的一部分。保持简短,以匹配片段长度。】

你看这个"锦衣卫"的案例,就是用这个框架写的,非常专业,有电影感。

一名身着暗红色飞鱼服的锦衣卫,正站在一座古老寺庙的荒芜庭院中。时值黄昏,天色阴沉,冷风卷起地上的枯叶。他的斗笠压得很低,遮住了大半张脸,只露出紧抿的嘴唇和一道浅浅的刀疤。他腰间的绣春刀刀柄上缠着黑色布条。

镜头: 镜头:中景,平视(Eye level) 氛围:肃杀、压抑、充满悬念

动作:

  • 他缓缓抬起戴着皮质护手的左手,接住一片飘落的枯叶。
  • 他(用手)碾碎了叶子,任凭碎屑从指缝飘落。
  • 他的头微微一偏,仿佛在倾听远处传来的马蹄声,右手不自觉地按在了刀柄上。

对白: (自言自语,声音低沉沙哑)“……时候到了。”

Sora 2的提示词不仅能控制"内容",还能精准控制"风格"、"镜头"和"灯光"。

图片展示了Sora2图生视频案例,分为两 addCriterion图片

风格: 1970年代浪漫剧情片风格。使用35毫米胶片拍摄,带有自然眩光、柔焦和温暖的光渗(halation)。轻微的胶片门抖动(gate weave)和手持微抖动,营造出复古的亲密感。受柯达启发的温暖色调;灯泡上有轻微光渗;胶片颗粒感和柔和的暗角以增加时代真实感。

黄金时刻,一个砖砌廉租公寓的屋顶变成了一个小小的舞台。晾衣绳上挂着的白床单随风摇曳,捕捉着最后一缕阳光。几串不成套的小彩灯在头顶微弱地亮着。一位穿着飘逸红丝绸连衣裙的年轻女子正赤脚跳舞,她的卷发在渐逝的光线中闪耀。她的伴侣——袖子卷起,吊带松垮——正跟着节拍鼓掌,笑容灿烂而不加掩饰。下方,城市在汽车喇叭声、地铁的震动和远处的笑声中嗡鸣。

镜头:

摄影机:中全景(medium-wide shot),从平视角度缓慢向前推进(Dolly-in)

镜头:40毫米球面镜头;浅景深(浅焦),将这对情侣从天际线中分离出来

灯光:金色的自然光作为主光(Key light),辅以钨丝灯反光(Bounce);小彩灯提供边缘光(Edge light)

氛围:怀旧的、温柔的、电影感的

动作:

  • 她旋转着;裙摆飞扬,捕捉到阳光。
  • 女人(笑着说):“看到了吗?今晚连这座城市都在和我们一起跳舞。”
  • 他走上前,抓住她的手,带她下腰旋入一片阴影中。
  • 男人(微笑着):“那只是因为有你带领。”
  • 床单飘过画面,短暂地遮住了天际线,然后再次分开。

背景音:

只有自然环境音:微弱的风声、布料飘动的声音、街道噪音、隐约的音乐声。没有额外配料。

比如这个案例,它定义了"1970年代浪漫剧情片风格"、"35毫米胶片拍摄"、"柯达启发的温暖色调"、"40毫米球面镜头"等专业术语。

风格: 手绘2D/3D混合动画风格,具有柔和的笔刷纹理、温暖的钨丝灯光和一种可触摸的定格动画感。美学风格唤起了2000年代中期的故事书动画感——舒适、不完美、充满机械魅力。微妙的水彩渲染和绘画般的纹理;色调在冷暖之间取得平衡;电影感的动态模糊(motion blur)以实现动画的真实感。

在一个杂乱的工作室里,架子上堆满了齿轮、螺栓和泛黄的蓝图。正中央,一个小小的圆形机器人坐在一张木凳上,它凹陷的身体上打着不匹配的金属补丁和陈旧的漆层。当它紧张地摆弄着一个嗡嗡作响的灯泡时,它那双发光的大眼睛闪烁着淡蓝色的光。空气中弥漫着安静的机械转动声,雨点敲打着窗户,背景中时钟在稳定地滴答作响。

镜头:

摄影机:中近景(medium close-up),从悬挂的工具间缓慢推进(push-in),带有轻微的视差效果(parallax)

镜头:35毫米虚拟镜头;浅景深(shallow depth of field),以柔化背景的杂乱

灯光:来自头顶实用灯具(practical)的暖主光(key light);来自窗户的冷补光(spill)以形成对比

氛围:温柔的、异想天开的、带一点点悬念

动作:

  • 机器人敲了敲灯泡;火花噼啪作响。
  • 它猛地一缩,灯泡掉落,眼睛随之睁大。
  • 灯泡慢动作翻滚下落;它在最后一刻及时抓住了它。
  • 一股蒸汽从它的胸口喷出——既是松了口气,又带着自豪。
  • 机器人轻声说:“差点丢了……但我抓住了!”

背景音:

雨声、时钟滴答声、轻柔的机械嗡鸣声、微弱的灯泡嘶嘶声。

另一个案例甚至定义了"手绘2D/3D混合动画风格"、"2000年代中期的故事书动画感"、"35毫米虚拟镜头"等。这说明Sora 2的专业上限非常高。

第三部分:Cameo出镜秀核心玩法

图片背景为渐变的红色、粉色、橙色和黑色,左上角有蓝色方块图标,内有白色卡通形象。图片上方文字为“个人Cameo出镜秀”“角色Cameo出镜秀”,下方大号数字“03”。该图片位于介绍Sora 2最核心、最独特玩法“Cameo出镜秀”的上下文之后,起到承上启下的作用,明确指出接下来的内容将围绕个人和角色的Cameo出镜秀展开。

接下来,是第三部分,这是Sora 2最核心、最独特的玩法——Cameo出镜秀

图片左侧为介绍Cameo出镜秀的内容,定义其为可复用的“同意型Deepfake”,本质是经过用户同意的、可复用的个人Deepfake,包含用户肖像和声音的数字模型,功能基础为Remix和Collaborate & Play,核心玩法是“替换角色”,将自己或朋友置入他人的视频作品中。右侧是@gavenlin和@metafeng在泰山之巅切磋武艺的视频画面,展示了中国武术,与上文介绍的Cameo出镜秀玩法相呼应。

什么是Cameo?你看这个视频,@gavenlin@metafeng两个真实的Sora 的数字人形象,一起在泰山之巅切磋武艺。

@gavenlin 和@metafeng 两个人正在泰山之巅切磋武艺,展现中国武术。

定位: 这是Sora 2社交应用的核心,也是它区别于其他所有模型的最独特功能。

本质定义:说白了,Cameo就是一个"经过你同意的、可复用的个人'Deepfake(深度换脸)'" 。它不只是复刻你的"脸",它是一个包含你 "肖像+声音" 的数字模型。

核心玩法: 就是**"替换角色"(Swap Characters)**,你可以把你自己,或者你的朋友,"扔"进任何一个Sora 2生成的视频场景里。

如何创建你自己的"个人Cameo"?

目前(2025年11月5日)还有点门槛:

个人Cameo 的形象采集只能在手机上直接用摄像头拍摄,电脑网页端无法直接上传视频。 但是创建好之后,可以在电脑网页端调用。

图片展示了创建个人Cameo(人类肖像)的流程及硬性条件。左侧为Sora by OpenAI应用界面,显示用户信息及新功能。中间是录制界面,有“Cameo”选项。右侧是录制提示,需念数字、转头、低头或抬头,录制3分钟上传视频,全程3分钟搞定。右侧还列出硬性条件,包括苹果手机/Pad、美区苹果ID、美区梯子及搜索“Sora by OpenAI”。该图与上文介绍的创建个人Cameo的硬性条件及录制过程等内容相呼应。

硬性条件: 必须是苹果手机或iPad,安卓目前无法下载。 苹果 ID: 需要美区苹果ID,中国区ID的搜索不到 Sora。 网络条件:🪜美区梯子。 App: 搜索"Sora by OpenAl"下载。

图片展示的是苹果手机App Store的界面,显示时间为7:05。在排行榜中,Sora by OpenAI排在第一位,类别为免费App,下方有“打开”按钮;Google Gemini排在第二位,类别为付费App,有“打开”按钮;ChatGPT排在第三位,类别为付费App,有“打开”按钮。该图片与上文提到的在苹果手机或iPad上创建“个人Cameo”并可在电脑网页端调用的内容相关,直观呈现了在App Store中搜索Sora by OpenAI等应用的场景。

图片展示的是苹果手机应用商店中Sora by OpenAI应用的页面。页面显示该应用需美区苹果ID,版本为1.2025.272,有新功能更新,包括Bug修复和小改进。页面下方有“新功能”“预览”“今日”“游戏”“App”“Arcade”等导航栏,其中“App”图标被红色框突出显示。该图片与上下文关系紧密,直观呈现了在苹果手机应用商店下载Sora by OpenAI应用的操作界面,帮助用户了解应用下载的相关信息。

录制过程其实非常简单,全程3分钟搞定。进入个人主页,点击"编辑Cameo出镜秀"。

念3个数字 ,这是为了采集你的声音特征。

向左或者向右转头向下低头或者向上抬头 ,这是为了采集你脸部的3D数据。

等待1分钟上传视频,完成。

图片展示了高质量Cameo创作的取景与动作要点。左侧为手拿相机的卡通形象,右侧文字说明模型只能生成所“见过”的内容,展示得越充分效果越好。取景方面,相机保持眼睛水平,确保整张脸在画面中,脸部填满画面,避免距离太远。表情与动作需使用夸张表情,以正常速度移动,做表情时慢慢左右转动头部,稍微上下倾斜,以覆盖下颌线和发际线。口型要持续且富有表现力地说话。

录制虽然简单,但质量很关键。Sora 2只能生成它"见过"的你。这里有几个 高质量Cameo创作的秘笈

第一:光照,这是最重要的。千万别在光线平平、均匀的室内光下录。最好是在能产生**清晰阴影的自然光**下录制,比如窗边,这样模型才能更好地理解你的五官轮廓。

第二:环境。确保背景干净,房间安静无回声。

第三:动作。按照提示缓慢转头,确保下颚线和发际线都被录进去。

第四:表情,这是关键一定要使用夸张的面部表情! 比如大笑、悲伤、愤怒、困惑。原理是什么?模型无法生成它没有"看"过的表情。如果你录的时候面无表情,那Sora 2以后也生成不了你生气的样子。

第五:声音。持续地、富有表现力地说话,而不只是干巴巴地念数字,这有助于模型捕获你的声音特征。

官方的介绍,使用 Cameos 生成内容https://help.openai.com/zh-hans-cn/articles/12435986-generating-content-with-cameos

图片展示了“Cameo”的权限与规则。左侧列出权限选项,包括仅联本人、我批准的人、互关好友、所有人;还说明青少年账户可能仅限于“仅自己”或“我批准的人”。关于删除,删除后角色无法用于新视频,OpenAI会在30天内删除相关上传内容。右侧是手机界面,显示个人资料中Cameo规则的权限设置选项,有“只有我”“我批准的人”“互关”“每个人”等,当前选中“只有我”。该图与上下文介绍Cameo权限设置相关,直观呈现了权限设置界面。

录好了Cameo,你肯定会担心隐私问题。Sora 2提供了详细的权限选项。你可以设置为: 只有我我批准的人互关 (好友)、每个人 。你也可以随时删除。删除后,该Cameo将无法用于新视频,但已生成的视频不变。OpenAI会在30天内删除相关上传内容。

除了在官方这边使用,在任何第三方的API产品里面也可以使用。

如果你已经在iOS手机端制作了自己的 出镜秀,并公开给大家访问,便可以在这里 @人名 (注意 @人名 和后面文字需要有空格,)来制作视频。

图片展示了Sora AI生成个人Cameo的界面。左侧为AI视频生成流程,有“AI视频生成”“视频剪辑”“视频预览”等步骤,其中“AI视频生成”步骤被红色箭头突出显示。右侧是视频生成界面,上方有“生成中”提示,下方展示了两张视频预览图,一张是两人在舞台上的背影,另一张是两人在舞台上的正面。右侧还显示了视频生成的参数设置,如视频时长、视频格式等。该图片与上下文介绍的Sora AI生成个人Cameo的操作流程相契合。

✅电影拍摄现场,@metafeng 正在四处乱逛,表现很惊讶,竖版

❌电影拍摄现场,@metafeng正在四处乱逛,表现很惊讶,横版 里面的人物不是我( @人名 和后面文字需没有空格)

✅电影拍摄现场,@gavenlin 和 @metafeng 正在四处乱逛,表现很惊讶,横版

创建角色 (Character) Cameo

图片展示了Sora 2中创建角色(Character)Cameo的相关信息。画面右侧是一只戴着蓝色帽子、背着红色背包、骑着滑板的熊猫形象。左侧文字说明角色Cameo允许通过一段物体或宠物的短视频创建可重复使用的“角色”,创建后可由他人在视频中标记,与个人Cameo分开,拥有独立名称、账号、说明和权限设置。下方还标注了重要限制,此功能仅限于物体和动物,不适用于真人。

角色 Cameo在电脑网页端和手机端都可以创建和使用。

Sora 2不仅能复刻"人",还能复刻"角色"。 "角色Cameo"是专门给"物体"或"宠物"用的

重要限制: 此功能不适用于真人。录真人必须走"个人Cameo"流程。比如,你可以把你的宠物狗、或者一个可爱的熊猫手办,做成一个可复用的角色。

比如下面这个卡通熊猫形象,我用可灵 AI画的,把它创建为一个 Sora角色。

图片展示的是可灵画卡通熊猫,它戴着蓝色帽子,背着红色背包,骑着滑板,背景是夜晚的城市街景,高楼大厦灯火通明,街道上有行驶的车辆和行人。该图片与文档中“创建角色(Character)Cameo”部分内容相关,可能是作为示例,展示通过Cameo出镜秀创建角色时可呈现的卡通形象。

可灵画卡通熊猫

图片转为视频

图片展示了如何创建“角色Cameo”的操作步骤。首先在“查看角色”界面点击“新建角色”;接着上传视频;然后裁剪视频最好的3秒;之后设置角色个人资料;最后修改角色描述。每一步操作均有对应界面展示,如上传视频时显示“创建一个角色以便一同出演你的视频”,裁剪视频时有熊猫角色图案,设置角色资料时有熊猫头像等。该图片与上文“如何创建‘角色Cameo’”的内容紧密相关,直观呈现创建流程。

如何创建"角色Cameo"?

在个人资料页,点击"查看角色",然后"新建角色"。

你可以选择**"拍摄视频"或"上传视频"**,比如你提前画好的卡通熊猫视频。

裁剪视频: 系统会让你裁剪出最好的3秒钟。

设置角色个人资料:

描述您的角色: 这里要详细描述它的特征,比如"Turbo Bamboo是一只爱冒险的城市熊猫..."

用户名: 比如metafeng.turbobambo

显示名称: 比如Turbo Bamboo

图片展示了如何在视频中使用“角色 Cameo”的操作指南。左侧是Sora 2的提示词编辑器界面,显示了“创建视频”选项及部分角色头像。右侧文字说明了标记角色、组合使用及效果不佳时的优化方法,如在Sora 2编辑器中搜索显示名称标记角色,同一场景可组合多个Cameo,效果不佳时可优化描述、改善光线等。该图片与上文介绍角色创建后如何使用的内容相呼应,为用户提供了具体操作指引。

角色创建好了,怎么用?标记角色: 在Sora 2的提示词编辑器中,直接 @这个角色的用户名 或显示名称就行了。

组合使用: 你可以在同一个场景中,组合多个Cameo。

@metafeng.pandamaxsk 从一无所有,到现在腰缠万贯

@metafeng.pandamaxsk正在和@metafeng一起对酒当歌,干杯并说Cheers!

看这个案例:提示词**“@metafeng.pandamaxsk正在和@metafeng一起对酒当歌,干杯并说Cheers!”**

结果就是,Sora 2把"角色Cameo"(熊猫)和"个人Cameo"(真人)完美地融合在了同一个视频里,实现了跨次元的互动。角色Cameo的权限与你的个人Cameo是完全分开的,你同样可以设置谁能使用它。

Cameo功能这么强,OpenAI显然不是做慈善,这就是它的商业化核心 。你看OpenAI高管Bill Peebles在 10月31日发的帖子,他透露了Sora 2的商业化路径:

图片左侧是OpenAI高管Bill Peebles的帖子,介绍付费购买Sora生成视频功能,称每天30个免费gen不够重度用户玩,推出付费购买功能,如10个视频$4.00。右侧是Sora生成视频界面,显示剩余可生成视频指数为29,可释放创意潜能,有“了解更多”和“购买”按钮。图片与上下文紧密相关,直观呈现了Sora商业化路径中付费购买功能的介绍及操作界面,强调了其商业化核心。

第一步:付费生成。他说每天30个免费 gen 根本不够重度用户玩,所以推出了付费购买功能,比如10个视频 $4.00,让专业创作者能**"按需付费"**。

第二步:打造"Sora经济"

终极形态:"我们想象一个世界,权利持有者(比如IP方)可以选择为喜爱角色的Cameo和人物收取额外费用 " 。说白了:以后迪士尼、漫威可以把"米老鼠"、"钢铁侠"做成官方Cameo。

你想在你的视频里用它?可以,付费!这也为新一代的Sora创作者提供了赚钱的方式。

第四部分:优秀案例与应用场景

图片背景为深色渐变,带有模糊的光斑效果。左侧白色大字显示“优秀案例及应用场景分享”,右侧是大号白色数字“04”。该图片位于文档“优秀案例与应用场景”部分开头,起到引出下文优秀案例及应用场景分享的作用,与上下文介绍优秀案例和应用场景的内容相呼应。

最后一部分,咱们来看几个真正落地的优秀案例和应用场景。

案例1:"混合实验"——导演的特效工具箱

图片展示了CAMEO - Sora 2短片,被誉为“天才”。画面中,一位穿着红色西装的男子站在一辆绿色汽车旁,与一位穿黑色连衣裙的女子交谈,旁边还有两位身穿正式服装的男子。画面右下角有字幕“car engine, it's your car”及“这车发动机关,这是你的车吗?”。图片左侧文字介绍该短片由Tim Simmons创作,探讨AI开始统治生活后的场景,称其为“混合实验”。还提到Sora 2在短片中作为代表角色,成为导演工具箱的一部分,用于生成VFX超现实特效等。

https://youtu.be/XS1S1N08IgU?si=hi-kF4cU9hhwuSsQ

这个短片《CAMEO》在圈内非常火。创作者是Tim Simmons。它不是一个100%由Sora 2生成的视频。它采用的是**"混合实验"(Hybrid Experiment)** 的工作流:

创作者自己拍摄了"真人实景"的镜头,比如人站在酒店门口的镜头。然后,他用Sora 2去生成那些 昂贵的VFX(视觉特效)、B-Roll(补充镜头)或无法拍摄的超现实场景 ,比如一个破车开过来。最后,他把这两种素材"混合剪辑"在一起。

这是目前比较有意思、最成熟的工作流程。Sora 2不会取代导演,而是成为了导演的"超级工具箱"。

案例2:"终极实战"——全自动UGC广告流水线

图片展示了“终极实战”——全自动UGC广告流水线的案例2相关内容。左侧为流程图,呈现从准备产品图片到生成视频的步骤;右侧是真人手持labubu玩偶的场景,labubu玩偶为白色兔子形象,戴眼镜,穿着白大褂。该图片与上下文紧密相关,直观呈现了营销人员只需准备产品图片,视觉模型分析产品后,生成视频的全流程,是案例2“打造全自动UGC广告生成机”目标的可视化呈现。

这个案例,是Sora 2在商业领域"终极实战"的形态。目标是:打造一个全自动的"UGC广告生成机"

你看这个流程:

步骤一(图片): 营销人员只需要准备一张产品图片,比如这个 labubu 玩偶。

图片展示的是一个可爱的玩偶,头戴白色毛绒兔耳朵帽子,戴着黑色大框眼镜,脸上有粉色腮红,穿着蓝色带有卡通图案的外套和短裤。玩偶站在蓝粉相间的背景前,脚边有粉色和蓝色的球。该图片对应文档中“步骤一”内容,营销人员只需准备一张如图所示的labubu玩偶图片,作为视觉模型Gemini 2.5 Pro分析产品、构思带货网红人设及编写UGC广告脚本的素材。

步骤二(文本): 把这张图片扔给视觉模型,比如Gemini 2.5 Pro。AI会自动分析产品,"构思"一个最适合带货的网红人设,并围绕这个人和产品,自动编写N个不同风格的UGC广告脚本。

SCRIPT 1: Excited Discovery The energy: Caffeinated, buzzing, pure joy of a new toy What they say to camera (with timestamps): [0:00-0:02] "Okay, so like, you guys..." [0:02-0:09] "Look at this little guy! I just got my hands on the Fuzzy Bunny Dude, and he's literally everything. The details, you know? Like, his glasses, the fuzzy hood, the little vest patches. Obsessed, honestly." [0:09-0:12] "Seriously, you have to see him up close, it's wild." Shot-by-Shot Breakdown: Overall Technical Details: Phone orientation: Vertical Filming method: Selfie mode, Charlie holding phone in right hand. Dominant hand: Right hand holds phone, left hand interacts with product. Location specifics: Charlie's home studio desk area. Mid-afternoon, natural window light from the left. Desk is cluttered with sketchbooks, colored pens, and a half-empty coffee mug. Audio environment: Quiet room, faint sounds of ambient street noise from outside. SECOND 0-1: Camera position: Phone held at chest height, pointed slightly up, wobbling. Camera movement: Shaky, moving right as Charlie shuffles slightly. What's in frame: Fuzzy Bunny Dude fills 80% of frame, held in Charlie's left hand. Charlie's chin and neck visible at the very bottom edge. Background is a cluttered desk with sketchbooks and a coffee mug, out of focus. Lighting: Natural window light from the left, slightly overexposing the white of the toy's vest. Creator action: Charlie walking into frame, holding the toy up, looking excited off-camera. Product visibility: Fuzzy Bunny Dude is the immediate focus, almost too close. Audio cue: "Okay, so like, you guys..." SECOND 1-2: Camera position: Phone pulled back slightly, now at eye level. Camera movement: Steadying briefly, then a natural hand shake begins. What's in frame: Charlie's face (wearing round, thick-framed glasses, soft caramel hair slightly messy) appears in the top half, smiling broadly. Fuzzy Bunny Dude is held up in his left hand, centered. Creator action: Charlie turns his head to look directly at the phone camera, eyes wide with excitement. Product visibility: Fuzzy Bunny Dude is now clearly visible from head to chest. Audio cue: "...Look at this little guy!" SECOND 2-3: Camera position: Phone held stable but still with natural hand shake, eye level. Camera movement: A slight tilt downwards, Charlie shifts his weight. What's in frame: Charlie's upper body and the Fuzzy Bunny Dude, held closer to his chest. Background is his art-filled wall with a framed print. Focus point: Focus slightly shifts from Charlie's face to the toy, then back to his face. Creator action: Charlie brings the Fuzzy Bunny Dude slightly closer to the camera. Product visibility: Fuzzy Bunny Dude now takes up about 40% of the frame, clear view of its face and upper body. Audio cue: "I just got my hands on the Fuzzy Bunny Dude, and he's..." SECOND 3-4: Camera position: Phone pivots slightly to the left, still eye level. Camera movement: A natural bob to the left as Charlie gestures with his right hand (the one holding the phone). What's in frame: Fuzzy Bunny Dude in his left hand, Charlie's right hand briefly comes into view near the lens, nearly brushing it. Creator action: Charlie wiggles the toy slightly, as if presenting it. His right hand makes a small, enthusiastic gesture. Product interaction: He gently rotates the Fuzzy Bunny Dude to show its side profile. Audio cue: "...literally everything. The details, you know? Like, his..." SECOND 4-5: Camera position: Phone moves closer, digital zoom subtly engages. Camera movement: Minor shakiness as the phone gets closer to the toy. What's in frame: Close-up on the Fuzzy Bunny Dude's face, specifically the black-framed glasses and the fuzzy hood. Charlie's thumb briefly covers the top right corner of the lens for a split second. Creator action: Charlie's left thumb gently traces the edge of the glasses. Product interaction: Zoomed in view emphasizes the toy's facial features. Physical details: The texture of the fuzzy hood and the black frames of the glasses are clear. Audio cue: "...glasses, the fuzzy hood, the little vest..." (muffled by thumb briefly) SECOND 5-6: Camera position: Phone pulls back slightly, still zoomed in, but less. Camera movement: Readjusting focus, slight pan down. What's in frame: Fuzzy Bunny Dude's chest area, showing the white vest with its colorful patches/pins. Charlie's fingers hold the toy at the waist. Creator action: Charlie uses his left index finger to point at one of the small, embroidered patches on the vest. Product highlight: The colorful, intricate patches on the white vest are highlighted. Audio cue: "...patches. Obsessed, honestly." SECOND 6-7: Camera position: Phone pulls back to eye level, slightly wider shot. Camera movement: Natural swaying as Charlie shifts his weight, still holding the phone in his right hand. What's in frame: Charlie's smiling face again (60% of frame), Fuzzy Bunny Dude held in his left hand at chest level, slightly off-center. Background shows a print on his wall. Creator action: Charlie looks from the toy to the camera, a big, genuine smile. Product visibility: Fuzzy Bunny Dude is still the hero, clearly visible. Audio cue: "Seriously, you have to see him up close," SECOND 7-8: Camera position: Tilts slightly downward, still handheld. Camera movement: A quick, natural jiggle as Charlie adjusts his grip on the phone. What's in frame: Fuzzy Bunny Dude held up, almost eye level with the camera. Charlie's left hand is supporting it from below. Creator action: Charlie slightly rotates the Fuzzy Bunny Dude, showing it from another angle. Product visibility: Good overall view of the toy's front again. Audio cue: "it's wild." (Charlie's voice is full of enthusiasm) SECOND 8-9: Camera position: Phone moves closer to the toy again, slight digital zoom. Camera movement: Subtle shaky zoom-in, focus hunts for a moment between the toy's eyes and the glasses. What's in frame: Close-up on the Fuzzy Bunny Dude's face, specifically its mischievous smile and small teeth. Charlie's eye visible briefly in top corner. Creator action: Charlie leans in slightly, as if sharing a secret with the toy. Product interaction: Emphasizes the toy's unique expression. Audio cue: (A small, satisfied "Mmm-hmm" from Charlie) SECOND 9-10: Camera position: Phone pulls back abruptly, returning to chest height. Camera movement: A quick, slightly jerky movement. What's in frame: Charlie's chest and shoulders, Fuzzy Bunny Dude held casually in his left hand, almost resting against his chest. His thick-framed glasses are visible. Creator action: Charlie relaxes his posture, still smiling broadly at the camera. Product visibility: Fuzzy Bunny Dude is still visible, but less prominently. Audio cue: "I mean, look at this little dude," (trails off slightly) SECOND 10-11: Camera position: Steady-ish at chest height, but still natural handheld shake. Camera movement: Minimal movement, settling. What's in frame: Charlie's face in the upper half, Fuzzy Bunny Dude in his left hand, lower half of frame. His pendant necklace is visible. Creator action: Charlie gives a little nod, looking at the Fuzzy Bunny Dude, then back at the camera. Product visibility: Last clear view of Fuzzy Bunny Dude held casually. Audio cue: "so much character, you know?" SECOND 11-12: Camera position: Same level, might drift slightly downward. Camera movement: Natural settling, possibly starting to lower phone. What's in frame: Charlie's face, partial product view as it dips out of frame. His hand might start to move down. Creator action: Charlie gives a quick, knowing smile, starts to lower the phone. How it ends: Cuts off as Charlie starts to lower the phone. Final audio: "Yeah, definitely get one." (Cut off mid-word "one")

步骤三(视频): 把这些AI生成的脚本,批量提交给Sora 2。Sora 2就会自动生成几十个不同版本的广告视频,比如下面这些不同网红拿着 labubu 讲解的广告视频,供你测试投放。

这个流程,让品牌在几分钟内,就能从"一张产品图"变为"数十个可测试的UGC视频广告"。

这标志着AI视频创作,正式从"玩具"走向了"工厂"

案例3:Sora2&n8n自动生成短视频分镜画中画

图片展示了案例3中S addCriterionSora2&nn8n自动生成短视频分镜画中画的相关内容。图片

前两天脑子里突然蹦出个想法。

你说现在AI这么强,Sora2又这么好用,能不能让它帮我批量生成短视频的画中画素材?

这个念头一出来就停不下来了。索性周末也没啥事,干脆动手试试。

结果还真让我搞出来了,跑了一个n8n工作流。

图片展示了Sora2&n8n自动生成短视频分镜画中画的流程及生成的画中画素材。左侧为流程图,包含“生成视频”“生成画中画”“生成视频”“生成画中画”等步骤,还涉及“视频转帧”“视频转帧”等环节。右侧是生成的画中画素材列表,呈现了多个画中画素材的名称、创建时间、状态等信息。该图片与上下文紧密相关,直观呈现了案例中Sora2&n8n自动生成短视频分镜画中画的操作流程及生成结果。

下面是最终剪辑好的短视频和中间 Sora 生成的画中画素材片段。

这事儿是怎么开始的

做短视频的朋友应该都懂,画中画素材真的太重要了。

它能让你的内容更丰富,节奏更紧凑,观众看着也不容易腻。

但问题就来了:

去素材网站找吧,翻半天不一定能找到合适的,还浪费时间。

自己拍吧,成本高不说,效率也低得要命。

用AI生成?这倒是个好主意。但如果我需要10个、20个不同场景的素材呢?难道一个个去写提示词?那不还是很麻烦吗?

Sora2确实厉害,基本上你说啥它就能给你生成啥。但关键是,我不想一个个去"说"啊。

所以我就在想,能不能把这个过程自动化?

就是那种,我只需要输入一个主题,然后AI自动帮我:

  • 写好脚本
  • 拆好分镜
  • 生成提示词
  • 调用Sora2出视频
  • 最后还能自动归档

一键搞定,多爽。这就是我想解决的问题。

思路其实挺简单的

有了想法,接下来就是验证能不能做。

图片展示了Sora2&n8n自动生成短视频分镜画中画的流程。左侧是Claude Sonnet 4.5,右侧是Gemini 2.5 Pro。Claude Sonnet 4.5生成视频脚本和规则,Gemini 2.5 Pro分析视频脚本和规则划分分镜,生成分镜脚本提示词,最后输出split_prompts1。流程中还涉及Chat Model、Memory、Tool等组件,以及Parse Storyboard、Scenes等步骤。该图与上下文紧密相关,直观呈现了案例中生成短视频分镜画中画的步骤和工具使用情况。

我的思路是这样的:

第一步,让Claude帮我写脚本。

我就输入一个主题,比如"AI如何改变教育",然后让Claude Sonnet 4.5帮我生成一段短视频文案。这个它很擅长,基本上一次就能出个八九不离十的稿子。

第二步,让Gemini帮我拆分镜。

把Claude写好的文案丢给Gemini 2.5 Pro,让它帮我拆成多个镜头。我设置的是最多5个镜头,每个镜头都要有场景描述、时长、还有关键元素。这样后面生成视频的时候才有依据。

第三步,自动生成Sora的提示词。

这步很关键。Gemini会根据每个分镜,写出专业的Sora 2提示词。你别小看这个,提示词写得好不好,直接决定了视频质量。

第四步,批量调用Sora2生成视频。

工作流会自动循环处理每个分镜,一个个提交给Sora 2去生成。然后每隔30秒查询一次状态,看看生成好了没有。全程不用我盯着,该干嘛干嘛去。

第五步,自动归档整理。

视频生成好了之后,自动上传到飞书云空间。同时把所有信息——文案、提示词、视频地址——全都存到飞书多维表格里。这样我的素材库就自动建好了。

第六步,用必火 AI数字人视频。

视频素材准备好了,但还缺一个核心——主讲人。这时候就该必火AI登场了。

必火AI是我们团队的数字人生成平台,现在已经能很快速的制作数字人了。你只需要把第一步Claude写好的文案复制进去,选择一个之前克隆好的数字人形象,然后点击生成,3分钟就能出片。

第七步,把数字人和这些画中画素材剪辑在一起。

现在,所有素材都齐了:必火AI生成的数字人主讲视频,加上Sora 2生成的多个画中画素材。接下来就是最后一步——剪辑拼接

整个流程下来,从输入一个主题,到最终拿到一条可以直接发布的短视频成品,全程不超过30分钟,而且90%的工作都是AI自动完成的。

这就是我说的**"AI视频创作的工厂化生产"**。你不需要是专业的导演、剪辑师,甚至不需要懂太多技术,只要你有创意、有想法,剩下的交给必火AI和这套自动化工作流就行了。

实际跑起来效果怎么样

周末两天时间,我基本上就把这个流程搭出来了。

刚开始主要是理思路,把整个流程在脑子里过一遍,然后画出来。然后才开始动手写节点,一个个调试。

图片展示了Sora2&n8n自动生成短视频分镜画中画的流程图。从左至右依次为手动触发、工作流配置、分析脚本和计划、解析故事板场景、生成场景提示、调用Sora2 API生成视频、保存至Notion数据库。其中“Analyze Script and Plan...”步骤有红色感叹号,提示存在错误;“Generate Prompt for Scene”步骤也有红色感叹号,同样提示错误。该图与上下文紧密相关,直观呈现了案例中实际跑起来时遇到的错误情况。

说实话,中间确实踩了几个坑:

Sora2的API经常不稳定,老是各种报错,需要把错误处理的更优雅些。飞书的文件上传也有点麻烦,得先上传云空间获得文件 Token,再把Token存入多维表格才行。还有多维表格的字段映射,一开始总是json错误,调了好几次。

图片展示的是Sora2&n8n自动生成短视频分镜画中画的流程图。流程从“等待30秒”开始,经“ 自动生成视频状态”判断视频生成中,若生成中则循环等待,若完成则进入“生成视频完成”;若不生成中则执行“获得视频”“上传视频到云空间”“表格数据”“回写结果并标记完成”等操作。该图与上下文紧密相关,直观呈现了视频生成及后续操作的逻辑关系,帮助理解整个流程。

不过好在,整个流程最后还是跑通了。

我拿几个主题测试了一下:

  • "AI如何改变教育"
  • "人工智能如何影响传统的电影拍摄"
  • "多和正能量的人在一起"

图片展示的是一个工作台界面,显示了多个AI视频生成任务的列表。任务主题包括“AI如何改变教育”“人工智能如何影响传统的电影拍摄”等。每条任务记录了AI视频生成的开始时间、最后更新时间、AI模型、AI视频ID、AI视频地址等信息。其中,任务“AI如何改变教育”生成失败,失败原因显示为“此内容可能违反了我们...”,且有红色箭头指向该任务。该图片与上下文紧密相关,直观呈现了实际跑通流程后,对多个主题进行测试时AI视频生成任务的执行情况。

Sora2视频生成比较慢,平均每一条5分钟左右,每个主题大概30分钟左右就能生成完整的视频素材。质量的话,还算不错,大部分是能用的。

这是另外的2个案例,整体效果已经非常不错了。

当然了,现在这个版本还是MVP阶段,很多地方还不够完善:

提示词的质量还能再优化,分镜的逻辑也可以更智能一些,错误处理机制也还不够完善。

但核心功能已经验证了,这就够了。剩下的就是慢慢打磨的事儿。

在当时直播的过程中,我注意到评论区非常热闹,很多伙伴都在问:"元峰老师,这个工作流能不能分享一下?"甚至已经有好几位伙伴直接在直播间表示愿意付费购买这套完整的自动化方案。

说实话,这让我挺受鼓舞的,因为这恰恰证明了一件事:当你把技术真正变成产品、变成解决方案的时候,它就有了商业价值,就能成为生产力。否则,再牛的技术也只是"玩具"而已。

关于这个工作流,我先把核心思路和框架分享给大家了。至于具体的工作流配置文件、详细的步骤拆解,我会专门写一篇保姆级教程文章,手把手教大家怎么搭建。

为什么不是今天就直接放出来呢?有两个原因:

第一,它现在还是个"半成品"。 虽然主流程已经跑通了,但还有很多细节需要优化,比如错误处理、异常重试、素材去重等等。我不想给大家一个"能用但不好用"的东西,那不是我的风格。

第二,只有工作流文件,很多伙伴会一脸懵逼。 你拿到一个n8n的JSON文件,里面几十个节点,不知道从哪改起,也不知道哪些参数需要替换成自己的。所以必须要有详细的文档说明、参数配置指南、常见问题解答,这样大家才能真正用起来。

如果你对这个自动化工作流感兴趣,请在评论区扣"1"或者留言"想要"。 人多的话,我就优先把这个教程赶出来,争取下周就发布。

最后,我想再讲下今天分享的核心思想:

AI时代,拼的不是你会用多少个工具,而是你能不能把这些工具"串"起来,变成一个自动化的生产线。

你看我今天这个案例,从一个主题到一条成品短视频,全程90%工作 AI化,30分钟搞定。而且已经有人愿意为它付费了,这就说明它不是"炫技",它是真正有市场需求的解决方案

所以,我希望大家不要只是"学工具",而是要**"用工具思维去思考产品" 。问问自己:我能用这些AI工具,解决谁的什么问题?我能为谁创造什么价值?**

想明白这两个问题,就不只是一个"AI玩家",就是一个"AI创业者"**了。

AI洞察16:sora2带来的各行各业红利

最后,是洋哥在 Sora2 刚刚发布的时候,在破局分享的洞察。Sora 2的出现,会给各行各业带来巨大红利,建议大家再重新读一下,里面也分享了不少 Sora 的应用方向。

图片展示的是“AI洞察16:sora2带来的各行各业红利”相关内容。画面中呈现了“知识星球”界面,显示了“AI赋能商业启示”群组的聊天记录。其中,莫西分享了AI账号的天服近1000、60w流量,产出20w+的小爆款,获得“优秀”评价。该图片与上下文紧密相关,是对Sora 2给各行各业带来红利这一观点的实例呈现,直观展示了AI在商业领域的应用成果。

https://wx.zsxq.com/group/15552545485212/topic/4842428512451128

核心改变:

第一:短视频生态的底层改变。现在各个平台对AI内容有限制,但当Sora 2让AI内容和真人内容越来越分不清时,平台大概率会解除限制。

第二:AI内容成为主流。未来,AI生成的视频、甚至是直播,将慢慢成为主流。

第三:新的AI视频社交平台崛起。Sora 2自己就在干这个事。

实战成绩:咱们俱乐部已经有圈友抓住这波红利了。比如"莫西"同学,他的AI账号5天涨粉近1000,跑出了60万的流量,还出了一个20万+的小爆款 。这说明什么?说明红利期就在眼前,谁先行动,谁就能吃到肉。

图片背景为深色渐变,带有模糊的彩色光斑。画面中央以白色大字显示“更多玩法,我们一起探索”。该图片位于文档结尾处,是对上文内容的总结与展望,呼应了文档中提到的Sora 2带来的技术革命、内容生产、社交方式和商业模式重构等话题,鼓励读者一起探索更多玩法,与文档主题相契合。

Sora 2带来的不仅是技术革命,更是对内容生产、社交方式和商业模式的彻底重构。更多Sora 2的进阶玩法,我们一起探索!

图片为一段视频的结尾画面,背景为夜晚城市街景,画面中央是一只戴着蓝色帽子、背着书包、手持滑板的卡通熊猫,熊猫张开嘴巴,显得非常开心。画面左侧有蓝色的“Sora”标志,右侧大字显示“Thank You 感谢观看”。该图片位于文档结尾处,是对观看视频的感谢,与文档中“感谢大家观看!如果对你有帮助,可以在星球中对本篇文章点个赞,谢谢”的内容相呼应,起到结束语的作用。

感谢大家观看!如果对你有帮助,可以在星球中对本篇文章点个赞,谢谢。