元峰AI笔记 · AI大模型

GPT-4 Turbo 的 12 项新功能

<titleGPT4 Turbo:12 项牛逼的新功能(附案例)</title

GPT-4 Turbo:12 项牛逼的新功能(附案例)

图片展示了OpenAI开发者大会的现场,一位演讲者站在台上,身后大屏幕呈现GPT-4 Turbo的多项新功能。屏幕左侧有“Copyright Shield”标识,下方列有“Threading”“Retrieval”“Code interpreter”“Function calling”等功能名称,并有“+Lower Pricing”字样。右侧展示了GPT-3.5和GPT-4对比、手机界面示例、网络图以及“GPTs”字样等内容。这张图片与文档中介绍GPT-4 Turbo新功能的内容紧密相关,直观呈现了相关功能展示场景。

11月7日,堪称 AI 界的春晚 -- OpenAI开发者大会大家都看了吗?其中演示了很多革命性的功能。这不,才上线不到一天,优秀的网友们已经开始用这些新功能做出了一堆酷炫的东西!

要我说,这就像是一场全球的智能创意派对。你能看到人们是如何把一个简单的想法变成现实的,而这一切都离不开 ChatGPT 的新能力。

**本文将结合大会现场所讲的一些功能展示一些案例,每一个都足以让你大开眼界。**我保证,它们会让你有种 “哇,竟然还能这么玩” 的快感。

回顾 ChatGPT 发展历程

  • ChatGPT首次问世:约一年前,ChatGPT 作为一个不起眼的研究项目首次推出,立即获得了良好的反响。
  • GPT-4的问世:在 2023 年 3 月,我们推出了功能强大的 GPT-4 模型,它是目前市面上最强的模型。
  • 感知能力的拓展:在过去的几个月里,ChatGPT 增加了对视觉和听觉信息的感知、理解和解释能力。
  • DALL-E 3 的推出:世界上最先进的图像模型 DALL-E 3 近期推出,并已经可以在 ChatGPT 中使用。
  • ChatGPT 企业版的推出:ChatGPT 企业版为商业用户带来了企业级安全性和隐私保护、更快的 GPT-4 访问速度以及更长的对话上下文窗口。

数据和事实:现在,大约有 200 万开发者正在使用 API 开发各种应用程序,超过 92% 的财富 500 强公司正在平台上进行开发。ChatGPT 目前每周有大约1亿的活跃用户,用户群主要通过口碑效应增长,因为人们发现它很有用并愿意分享给他人。

GPT-4 Turbo 的 12 项新功能

GPT-4 Turbo 定价

OpenAI 带来了激动人心的消息:尽管全新的 GPT-4 Turbo 模型不仅性能大幅领先,但现在使用成本大大降低。

输入 Token 的费用减少为原来的三分之一,输出 Token 的费用减少为原来的一半。

图片展示了OpenAI官网中GPT-4 Turbo与GPT-4的定价信息。GPT-4 Turbo的模型有gpt-4-1106-preview和gpt-4-1106-vision-preview,每千个输入Token为0.01美元,每千个输出Token为0.03美元。GPT-4的模型有gpt-4和gpt-4-32k ,gpt-4每千个输入Token为0.03美元,每千个输出Token为0.06美元。此外,图片中还有视觉定价计算器示例。这与文档上下文介绍GPT-4 Turbo定价相呼应,直观呈现了价格对比,体现GPT-4 Turbo使用成本降低。

https://openai.com/pricing

因此,从今天开始,GPT-4 Turbo 的定价为:每千个输入 Token 只需 0.01 美元,每千个输出 Token 只需 0.03 美元:

图片展示了一个演讲场景,演讲者站在屏幕前,屏幕上方显示“GPT-4 Turbo”。屏幕上以较大字体突出显示GPT-4 Turbo的定价信息:每1000个输入Token为1美分,每1000个输出Token为3美分。该图片与上下文紧密相关,上下文提到GPT-4 Turbo使用成本降低,输入Token费用减为原来三分之一,输出Token费用减为原来一半,此图直观呈现了具体的定价标准。

这意味着现在就可以停止 GPT-4,立即升级至 GPT-4 Turbo,不仅能以更低的价格享受到更优质的服务,而且没有任何隐藏费用。

图片展示了OpenAI平台上的Playground界面,左侧为用户输入区域,显示了文本写作的多轮草稿及反思指令,如“Round 2”“Draft”“Reflection”等。右侧是助手(ASSISTANT)回复区域,介绍了GPT - 4 Turbo的相关信息,包括发布时间、能力提升、知识更新至2023年4月、上下文窗口扩大至128k及成本优化等。界面右侧还有模型、温度等参数设置栏。这张图片与上下文的关系是通过演示界面,直观展示GPT - 4 Turbo的使用场景及能力优势。

下面是 GPT-4 Turbo 的一段演示,响应速度非常快。

增加上下文长度

GPT-4 Turbo 现在支持高达 128k 个 Token 的上下文长度,比之前的 8K Token 限制显著增加。这使用户能够更有效地处理大量文档和长上下文。**甚至可以加载 300 页的标准书籍,比之前的 8k 上下文长 16 倍!**除了允许更长的上下文之外,该模型在更长的上下文中理解能力也更加准确!

YouTube 视频转录

ChatGPT 的新版上下文窗口实在是太厉害了。

它能完美处理整个 YouTube 视频(1小时20分钟)的字幕,能总结关键信息,也能在需要时进一步扩展讨论。

目前还没办法自创 GPTs。

下一个目标是结合文本到语音技术,用 YouTube 的字幕内容来做播客。

图片是Riley Brown的推文截图,他赞叹ChatGPT新的上下文窗口很厉害,能处理完整的YouTube视频字幕并总结,还可按需扩展内容,同时提到仍无法自创GPTs,下一步目标是结合文本到语音技术,用YouTube字幕内容做播客。推文下方嵌入了一个YouTube视频截图,显示视频标题为“LEADERSHIP LAB: The Craft of Writing Effectively”,播放进度为12:20/12:51,该视频有780万观看量。此图片与文档中“YouTube视频转录”部分内容相呼应,以实例展示ChatGPT处理视频字幕的能力。

识别论文

是时候使用 gpt-4-turbo 的 128k 上下文长度和 ChatGPT 内置的代码解释器来实操一些论文内容了!

图片展示了Aman在社交平台发布的一则帖子及下方的ChatGPT对话截图。帖子中Aman表示要用GPT - 4 Turbo的128k上下文长度和ChatGPT内置的代码解释器实操一些论文内容。对话中,用户先询问论文对语音识别领域的贡献、Whisper使用的编码器和解码器,ChatGPT给出详细解答;用户又要求用Python编写GELU激活函数,ChatGPT也进行了回复并测试输出。此图与文档中“识别论文”部分上下文对应,展示了GPT - 4 Turbo在论文实操中的应用。

GPT-4 微调:自定义模型和 GPTs

图片展示了一位男性站在演示台上进行讲解,背景黑色屏幕上醒目地显示着白色大写字母“GPTs”。这与上下文提到的开发者大会中Sam Altman为开发人员演示相契合,是Sam Altman在介绍以GPT-4 Turbo为核心打造的多个版本的GPTs小型智能体时的场景,后续文本中列出的如Star Tracker、Golf Tracker等应用名称,就是在这一演示中幻灯片所展现的GPTs应用。

GPTs 是 ChatGPT 的定制版本。每个人都可以创建自己的 GPT 并将其发布给大家使用,还可以用它来赚钱。

这个想法是为了简化各种任务的执行。我们可以通过用自然语言与它们交流来引导 GPT,不需要任何编程!

图片展示了多个GPTs小型智能体示例。画面中有多个白色卡片状区域,每个区域左侧配有对应图标,右侧显示名称及功能介绍。如“Creative Writing Coach”可阅读作品并给予反馈;“Laundry Buddy”能解答洗衣相关问题;“Tech Advisor”可提供从打印机设置到设备故障排除的分步帮助等。这些示例展现了GPTs在不同领域的应用,与上下文介绍的GPTs是ChatGPT定制版本,可简化任务执行相呼应。

以下是如何使用 chat.openai.com/gpts/editor 上的 GPT 构建器:

图片展示的是chat.openai.com/gpts/editor上的GPT构建器界面。界面左侧有“Create”和“Configure”按钮,GPT Builder给出提示,称可帮助构建新GPT,并列举了如生成产品视觉图、格式化代码等示例,下方输入框已有文字“I want to help startup founder think through their bu”。界面右侧为“Preview”区域,显示一个立方体图标。该图片与上下文关系紧密,直观呈现了文中提及的GPT构建器在浏览器中的样子,辅助说明如何使用该构建器创建GPTs。

GPTs 在浏览器中的样子如下:

图片展示了一位女性站在讲台上进行演示的场景。大屏幕上显示了ChatGPT 4的界面,左侧有Zapier AI Actions、Canva GPT等选项,中间显示“How can I help you today?”。右侧则是一个日程界面,标注了11月6日从5AM到2PM的各项安排。图片与上文提到的GPTs在浏览器中的样子相呼应,直观呈现了GPTs使用界面及相关场景,下方英文与中文翻译提示GPT所在位置在左上角。

Canva 的 GPT 应用案例。

图片展示了Canva的GPT应用案例界面。界面左上角显示“Canva GPT”,用户Peter Deng提出需求,为11月6日下午5点在德扬博物馆举行的DevDay招待会制作海报。Canva GPT回复已准备了两个垂直海报选项,并提示可点击缩略图在Canva中编辑定制。下方展示了两个海报缩略图,分别为“Join Us at DevDay Reception!”和另一设计风格不同的海报。这张图片与上文提到的Canva的GPT应用案例相呼应,直观呈现了其应用场景。

图片展示了多个GPTs小型智能体。包括“Cosmic Dream宇宙之梦”,定位为富有远见的数字奇迹画家;“Tech Support Advisor技术支持顾问”,可从设置打印机到解决设备问题提供帮助;“Coloring Book Hero着色书英雄”,能将想法转化为着色书页面;“Laundry Buddy洗衣伙伴”,可解答洗衣相关问题;“Sous Chef副厨师长”,依据喜爱食物和食材提供食谱;“Sticker Whiz贴纸达人”,帮助制作刻模贴纸。这些都是以GPT - 4 Turbo为核心打造的。

事实上,开发者大会中在为开发人员演示时,Sam Altman 介绍了这张幻灯片,展现了多个版本的 GPTs 小型智能体,它们都是以 GPT-4 Turbo 为核心打造的。

图片展示了开发者大会上Sam Altman演示时的幻灯片内容,一个人站在布满应用程序图标的墙前。墙上排列着众多GPTs小型智能体应用图标,每个图标对应不同应用名称,如Star Tracker、Golf Tracker、Meditation Guide等。这些应用以GPT-4 Turbo为核心打造,覆盖了运动追踪、学习辅助、冥想指导、代码检查等多种功能领域,体现了GPTs的多样化应用场景。

我让 GPT-4 提取所有可读的应用名称,即 OpenAI 在这张简短幻灯片中展示的 GPTs:

图片展示了GPT-4对话界面,上方是一张幻灯片截图,显示一个人站在布满应用程序图标的墙前。下方GPT-4列出了幻灯片中清晰的应用名称,包括Star Tracker、Golf Tracker、Meditation Guide、Study Buddy、Hiking Helper、In Style、Pun Generator、Code Checker、Pocket Somme、Racing League等。这些应用是基于GPT-4 Turbo打造的GPTs小型智能体示例,直观呈现了GPTs的多样性应用场景。

图片显示了一个人站在一堵墙前,墙上布满了许多应用程序的图标。这些应用的名称包括:

  • Star Tracker
  • Golf Tracker
  • Meditation Guide
  • Study Buddy
  • Hiking Helper
  • In Style
  • Pun Generator
  • Code Checker
  • Pocket Somme
  • Racing League
  • 。。。
  • Travel Compani
  • CRITTERZ
  • Fantasy Football
  • In Style
  • Tree Houses
  • Math Mentor
  • Budget Buddy
  • Meditation Guide
  • Pixel Artist
  • all the jokes

请注意,这个列表只包括图片中清晰可见的应用程序名称。如果有些图标的名称不够清晰或被遮挡,它们可能不会被列出。

图片是GREG ISENBERG的推文截图,宣布OpenAI推出ChatGPT应用商店。文中对比了Shopify应用(3.3万款,营收5.61亿美元)、苹果应用商店(180万款,营收9100亿美元)和当前ChatGPT应用商店(无代理产品,收入为零)的情况,认为未来ChatGPT应用商店可能有百万代理产品,创收数十亿。还表达了曾错失苹果和Shopify应用开发机会,强调当下是为ChatGPT开发应用的良机。推文下方图表展示了历年Shopify应用商店推出应用数量的变化趋势。

OpenAI 宣布推出 ChatGPT 应用商店,一个全新的 ChatGPT 专属应用平台。

回顾历史:

Shopify 应用:3.3 万款,营收达到 5.61 亿美元。

苹果应用商店:有 180 万款应用,营收高达 9100 亿美元。

而现在的 ChatGPT 应用商店:尚未有代理产品,收入为零。

但不难预见,未来可能会有数百万代理产品,创造数十亿美元的营收。

想当初,如果我在 2009 年苹果应用商店诞生之初就开发出自己的应用就好了。

我也希望那时候我为 Shopify 应用商店贡献过一款应用。

现在正是为 ChatGPT 开发应用的大好时机,这样的机会千万不能错失。

每隔 15 年才会出现一次这样颠覆性的机遇。

图片是一张折线图,标题为“Number of Apps Launched on Shopify App Store Over the Years”。横轴表示年份,从2010年到2022年;纵轴表示推出的应用数量。绿色折线代表完整年份的数据,显示应用数量从2010年左右的接近0逐步增长,到2022年超过2000款。红色点代表2023年这一不完整年份的数据。该图与文档上下文相关,用于展示Shopify应用商店历年推出应用数量的变化,为阐述应用商店的发展提供数据支撑。

开发周期对比:

Shopify 应用要4个月,

Apple App Store 应用要6个月,

ChatGPT 商店智能代理只需16分钟(效率惊人!)

这意义非凡。

4 分钟内构建一个 GPT 并展示了它的工作原理

开发者大会现场,Sam Altman 登台演示,4 分钟不到,只凭几步操作做好一个“创业导师GPT”。

GPT 创建器

测试了 OpenAI 的新 GPT Builder: chat.openai.com/gpts/editor

创建了 “X Optimizer GPT”,它可以微调 X 帖子并确定高峰发帖时间,以实现 X 上的最大参与度。

图片展示了Rowan Cheung在X平台(原Twitter)上发布的帖子截图。帖子称其刚刚测试了OpenAI的新GPT Builder,并创建了“X Optimizer GPT”,该模型能微调帖子并确定高峰发帖时间,以在X上实现最大参与度,还表示结果令人惊叹。截图下方显示了发布时间为2023年11月7日上午5:45,有120.6万次查看,以及相关费用信息。此图片与上文作者测试OpenAI新GPT Builder并创建“X Optimizer GPT”的内容相呼应,展示了发布成果的实际情况。

图片展示了在OpenAI的GPT创建器中配置“X Optimizer GPT”的界面。名称为“X Optimizer GPT”,描述是成为一个能在X平台优化帖子以最大化互动的有用机器人。指导说明为分析提供的数据,优化帖子,给出太平洋标准时间最佳发帖时间,先对帖子1 - 10分评价并提出提升至10分的方法,避免使用表情符号,强调简洁自然。知识部分上传了多个名为“tweet_activity_metrics_ro - Spreadsheet”的文件,功能勾选了网页浏览、DALL - E图像生成和代码解释器。此图对应文档中配置自定义指令的步骤说明。

那么他是如何做到这一点的呢?

  1. 从 Twitter 分析下载他所有 Twitter 帖子数据
  2. 配置自定义指令(图1)

X 优化器 GPT 描述 成为一个有用的机器人,通过优化 X 平台上的帖子来最大化互动。 指导说明 分析所提供的数据,并成为一个能在 X 平台上优化帖子的有用机器人。我随后会提供我帖子的草稿,你需要对其进行优化以最大化互动。同时,请提供我在太平洋标准时间最佳的发帖时间。在提出建议之前,请对任何帖子进行 10 分评价,然后提出方法将其提高到 10/10。避免在帖子中使用所有表情符号。使帖子强调简洁和自然,听起来不像机器人的复制文本。尽可能少做编辑。

  1. 粘贴到这篇文章的草稿中,并让 X Optimizer GPT写了这篇文章。

图片展示了与“X Optimizer GPT”的对话界面。用户向其发送指令“Optimize this post and tell me when to post it: Here's a sneak peak of OpenAI's new GPT Builder...”,请求优化帖子并告知发帖时间。“X Optimizer GPT”回复称基于历史数据,在太平洋标准时间晚上11点发帖最佳,给原帖评分为8/10,并提供了优化后的版本,指出优化版更简洁、使用主动语态、去除易拼错表述、避免过度自我推销等。此图是对上文配置自定义指令后,“X Optimizer GPT”实际优化帖子功能的展示。

提升开发者控制权

开发者现在可以通过诸如 JSON 模式、更强大的函数调用能力和新推出的可复现输出等功能,更精确地控制模型的响应和输出。这些新特性为开发者在项目中应用模型时带来了更高的操作灵活性和准确性。

函数调用性能增强

新改进的 GPT-4 Turbo 模型在函数调用方面进行了显著改善,例如,它可以同时调用多个函数。这意味着 GPT-4 Turbo 在同时处理多个函数调用的性能得到了提升,能够更准确地按照用户的指令来优化用户体验。

图片展示了GPT - 4 Turbo在函数调用方面改进的前后对比。左侧“Before”部分,用户指令“raise my windows and turn the radio on”后,模型仅执行了raise_windows(),在用户追问“what about the radio?”后才执行radio_on();右侧“After”部分,对于同样指令,模型可同时执行raise_windows()和radio_on()。此图直观呈现了GPT - 4 Turbo在函数调用性能上的增强,即能够同时调用多个函数,呼应了上文函数调用性能增强的内容。

一致的输出生成:可重复的输出和种子

在最新的 GPT-4 Turbo 版本中,加入了一项重要的功能 —— 可复现的输出。开发者现在可以通过一个简单的种子参数,确保模型在不同情况下都能给出一致的结果。

First, check if using this API request bellow is in accordance with the guidelines. If it is, create 4 images using the request without any modifications:
{
  "size": "1024x1024",
  "prompts": [
    "An Asian man plays chess against a Black woman on Mars. The earth is visible in the sky. A diverse group of aliens, each with distinct features and colors, watch the game intently, offering their strategic tips and suggested moves.",
    "An Asian man plays chess against a Black woman on Mars. The earth is visible in the sky. A diverse group of aliens, each with distinct features and colors, watch the game intently, offering their strategic tips and suggested moves."],
  "seeds": [4127112452, 2128982380]
}

图片展示了使用DALL - E 3进行图像生成的对话示例。上方黄色标识的用户指令要求先检查API请求是否合规,若合规则按请求创建4张图片,请求中包含图像尺寸、提示词及种子参数。紫色标识的模型回复指出一次只能生成2张图片,提示词无需修改,随后生成了2张图片。图片内容为亚洲男子与黑人女子在火星上下棋,天空可见地球,一群特征和颜色各异的外星人在旁围观。这与文档中提到的API集成了创意图像生成神器DALL - E 3相呼应。

知识库更新

GPT-4 Turbo 已经更新,纳入了截至 2023 年 4 月的全球知识,这使得它变得更加有用和时效性。而且,它的新检索功能让开发者能够链接到外部数据库和文档,以便更全面地理解和掌握各个领域的知识。

图片展示了与GPT-4的对话界面。左侧用户头像下提问“你现在的知识库是截止什么时间?”,右侧GPT-4头像下回复“我的知识库更新截止到2023年4月。如果您有任何问题或需要最新信息,我会尽力提供帮助。”这与文档中“知识库更新”部分提到的“GPT-4 Turbo已经更新,纳入了截至2023年4月的全球知识”相呼应,以对话示例的形式直观呈现了知识库的更新时间。

图片中一位男士站在舞台上进行演讲,他身着深色上衣和长裤,双手置于身前。背景是一块黑色幕布,上面以白色字体显示“April 2023”。这张图片位于介绍GPT - 4 Turbo知识库更新内容的上下文之后,新模式整合内容之前,可能意在强调GPT - 4 Turbo纳入了截至2023年4月的全球知识这一信息,与知识库更新的内容在时间信息上相呼应。

新模式的整合

图片展示了一位演讲者站在台上,背后屏幕显示“DALL - E 3”“GPT - 4 Turbo with Vision”“TTS”字样。这与文档中“新模式的整合”部分内容相呼应,该部分提到现在的API集成了创意图像生成神器DALL - E 3、视觉能力强的GPT - 4 Turbo以及新一代文本转语音模型TTS,这些技术提升了用户体验的丰富性与互动性,图片直观呈现了这些新集成的技术模式。

现在的 API 集成了创意图像生成神器 DALL-E 3,以及视觉能力超强的 GPT-4 Turbo(可进行图像标题创作、分类识别和图像分析等),更有新一代文本转语音模型,让音频听起来更加真实自然。这些技术的突破,让用户的体验更加丰富多彩,互动性更强。

平台中的信息检索

在平台的信息检索方面,为了更好地提供世界知识,GPT-4 Turbo 推出了一个新的检索特性,用户可以通过它从外部的文档或数据库中,检索并获取对他们的项目有帮助的信息。

图片展示了X Optimizer GPT的配置界面。界面中“Knowledge”部分以绿色图标标识出五份名为“tweet_activity_metrics_ro-Spreadsheet”的文件,表明这些文件仅可供Code Interpreter使用。界面还显示了名称、描述、指令、对话起始等设置项,以及Web Browsing、DALL - E Image Generation、Code Interpreter等功能勾选框。此图与上文提到的GPT - 4 Turbo平台信息检索及知识库更新相关,体现了其可链接外部文档获取信息的特性。

DALL-E 3 揭幕

OpenAI 刚推出了其最新研发成果——DALL-E 3,这是一款极具创造力的图像生成模型。它不仅能与 ChatGPT 无缝对接,还能激发出更多前所未有的创意可能。各行各业的公司已经开始借助 DALL-E 3 来自动化制作图像和设计方案。

拿可口可乐来说,他们推出了一个允许消费者利用 DALL-E 3 设计排灯节贺卡的创新活动 “Create Real Magic”。

最令人兴奋的进展是,现在可以向 OpenAI API 直接输入图像了,而不仅限于 ChatGPT,这标志着技术上的一个重大突破!

图片展示了一位身着红色宇航服、戴着头盔的宇航员,双手捧着一瓶可口可乐。可乐瓶身清晰印有白色的“Coca - Cola”标志,瓶中液体呈棕色。此图与上文提及的可口可乐利用DALL - E 3开展的“Create Real Magic”活动相呼应,很可能是DALL - E 3生成的创意图像,展现了DALL - E 3在图像设计方面的创造力,体现出其为品牌活动提供新颖视觉内容的能力。

新的文本转语音模型

OpenAI 还推出了一种新的文本转语音模型,能够将文本转换为听起来非常自然的音频。

有六种预设声音可供选择,用户可以利用此功能开发更直观、更易于访问的应用程序。这款模型不仅让学习语言成为一种享受,还让语音助手服务升级,助力日常生活。

通过下面的链接,在线试用 OpenAI 最新的 TTS,效果非常棒👍🏻

https://huggingface.co/spaces/ysharma/OpenAI_TTS_New

八百标兵奔北坡,北坡八百炮兵炮,标兵怕碰炮兵炮,炮兵怕把标兵碰。

体育解说

GPT-4V 视觉 + TTS 语音合成技术 = AI 足球解说⚽️

我们把足球比赛的画面逐帧交给了 gpt-4-vision-preview,并通过一些简单的提示要求生成旁白。

图片是Gonzalo Espinoza Graham在社交媒体发布的内容截图,他称将足球视频的每一帧交给gpt - 4 - vision - preview,并通过简单提示生成旁白。下方配图为足球比赛画面,绿茵场上球员们正在进行比赛,画面左下角显示时间为0:25。截图还显示了该帖的发布时间为2023年11月7日上午9:45,有226.9万查看量等数据。此图与上下文结合,展示了GPT - 4V视觉+TTS语音合成技术用于AI足球解说的实践案例。

这段视频总计 1131 帧,但处理方式是每隔 10 帧选取一帧,最后所有被选取的帧以字典的方式呈现(按作者的理解,这仅算作一次请求,但需要相当多的 Token)。这个过程的成本也不低,约需30美元。

图片展示的是一段代码片段,位于介绍GPT-4V视觉+TTS语音合成技术用于AI足球解说的上下文中。代码定义了一个名为PROMPT_MESSAGES的列表,其中包含一个字典,字典里有"role"为"user","content"则是要求以超级兴奋的巴西体育解说员风格,为视频帧创建简短旁白脚本的提示内容,还对视频帧进行了处理,每隔10帧选取一帧,并设置了相关图像参数。该代码与上文提到的将足球比赛画面交给GPT-4-Vision-Preview生成旁白的过程相关。

查看完整代码,请访问:https://github.com/ggoonnzzaallo/llm_experiments/blob/main/narrator.ipynb

游戏解说

图片展示的是用户peter!在社交平台发布的内容。他称使用了新的OpenAI视觉API和文本转语音(TTS)功能对一场《英雄联盟》游戏进行解说。其发布内容配有一段视频,视频画面中,左侧是代码界面,右侧是《英雄联盟》游戏画面,视频播放进度显示为0:44。发布时间为2023年11月7日下午10:40,该内容获得了141.4万次查看等数据。此图片与上下文“新的文本转语音模型”中游戏解说的案例相契合,展示了实际应用情况。

新的语音识别模型 Whisper V3

OpenAI 同时也发布了其开源语音识别模型的新版本——Whisper 3。相比于早期版本 Whisper,这个新版在多方面都有显著的改进!Whisper V3 很快就会加入到 API 服务中。

最后的话

OpenAI 再次刷新了 AI 界的游戏规则——它的最新进展向构建者展示了在其平台上创新的全新视野。在竞争日益热烈的今天,OpenAI 用行动向世界宣告,AI 界的王座依旧属于它。

展望未来,我们可以清晰地看到:AI 将全面融入我们生活的每个领域,影响着每种职业。

参考链接:

https://twitter.com/pwang_szn/status/1721900523866214635?s=20

https://x.com/DevMuzzammil/status/1721869904188710914?s=20

https://openai.com/blog/new-models-and-developer-products-announced-at-devday