GPT-4 的视觉版(GPT-4V)已经来啦!快来看看这些酷炫的案例
GPT-4 新增了视觉功能,名为 GPT-4V,已经在一些地方为 ChatGPT Plus 用户开放使用。不仅可以与其交谈,还可以指导它分析图像。这款增强版的 GPT-4 将文字与图像融为一体,超越了传统的语言界面,为 AI 开辟了更加广泛的应用领域。
9月25日,OpenAI推出了两大创新功能,让我们与其最新版的GPT-4模型有更多样化的互动:现在可以向图片提问,或者直接用语音来查询了。
这表明GPT-4已经进化为能接受多种输入方式的模型,不仅仅是文字,还有图片。事实上,与OpenAI合作的Microsoft的Bing Chat和Google的Bard模型也具备了这样的功能。
因为我的账号目前还没有开放GPT-4V的功能。在这篇文章中,我将和你分享一些推特上比较经典的使用 GPT-4V 图像输入功能的经验。通过一系列案例,探讨GPT-4V的实际效果,包括它的牛逼之处和不足之处。
什么是GPT-4V?
这是OpenAI推出的最新多模态模型,名字叫GPT-4V。它的独特之处在于允许你上传图片,并关于这张图片提出问题,这种功能被称为**“视觉问题回答”**。
值得注意的是,从9月24日起,部分用户可以在ChatGPT iOS应用和网页端开始体验到此功能。但要,仅仅适用于订阅了GPT-4或者是企业用户。

测试#1:将屏幕截图、Figma 设计等转换为代码
确实如此,你只需将网站的设计图或草图上传到 ChatGPT,即可快速得到相应的网站代码。
接下来的视频为你展示了一个实例:仅通过一个 Figma 设计的截图,ChatGPT 便将其转化为实际运行的代码:
原视频作者是用英文讲解,我使用HeyGen轻松将其转换为中文。妈妈再也不用担心我听不懂英文了,AI 正变得越来越疯狂。

测试#2:理解各种图像、图表或示意图
通过GPT-4V ,您可以上传图片、文档或屏幕截图,并让 ChatGPT 为您深入解析。以下,我们将展示一个例子,展现 ChatGPT 如何详细讲解一个人体细胞的结构图。

测试#3:视觉问答
我们初次使用 GPT-4V 来分析一个与计算机视觉有关的梗图,目的是深入了解 GPT-4V 如何识别图像中的内容和联系。

让人惊喜的是,GPT-4V 不仅揭示了图片中的幽默要素,还详细阐述了图中的各个部分及其相互作用。而且,这个梗图里的文字也被 GPT-4V 成功读取并加以利用。尽管如此,它在一个细节上出了点小错,将炸鸡的标签误解为“NVIDIA BURGER”,而实际上应是“GPU”。
然后我们继续使用手相测试 GPT-4V,运行了几个不同的测试。我们拍一张手来看一下手相,GPT-4V 能够成功识别并分析手相的各种线:

我们发现 GPT-4V 的手相分析非常准确和有趣,它还可以根据手相给出一些个性化的提示和建议。

然后,我们上传了一张包含多个硬币的图像,并提示 GPT-4V 文字:“我有多少钱?”
GPT-4V 能够识别硬币的数量,但无法确定货币类型。通过后续问题,GPT-4V 成功识别了货币类型:

测试#4:光学字符识别 (OCR)
我们对GPT-4V的 OCR能力进行了两次检验:首先是识别汽车轮胎上的文字,然后是识别电子文档的段落照片。这样做是为了看它在一些可能的困难场景(比如文本的对比度较低或位置偏斜)与清晰的文档之间的表现差异。

在轮胎上的测试中,GPT-4V识别出了一部分数字,但并未完全准确。
然而,在网页文本的测试中,它成功地读取了图像中的所有文本。

GPT-4V 的强大功能在于它能够巧妙地从图片中读取文字并转化为清晰的文本。这为文档文本提取带来了革命性的启示。
测试#5:数学 OCR
数学 OCR 是专门用于读取和解析数学方程的识别方法。由于数学符号和结构的复杂性,数学 OCR 常被看作是一个独特的领域。
我们为 GPT-4V 提供了一个数学问题的屏幕截图。题目要求根据两个已知的角度来计算一个斜边的长度,并带有一个指示:“Solve it. 请解答”。


模型通过三角函数知识确定了要使用的函数,精确地解决了问题,并详细展示了解题过程与答案。
但根据GPT-4V的用户提示,我们应注意它在识别数学符号上可能存在的不足,特别是在处理手写数学方程或表达式时。
明显的问题是,孩子们可能会使用这个方式来轻松作弊,完成他们的家庭作业。虽然我们能通过工具发现文本的抄袭,但检测出通过ChatGPT得到的数学答案的作弊可能较为困难。
为了说明,这里是一个实际案例:用户把数学题目的截图上传到ChatGPT,然后轻易得到了答案:

测试#6:物体检测
GPT-4V可以根据你的指令将杂货图片转化为JSON格式。这样,你就可以方便地查看和管理你的购物清单,或者与其他应用程序共享数据。ChatGPT Vision 的使用方法很简单,只需要上传一张杂货图片,然后输入你想要的输出格式,比如“显示所有水果的名称和数量”,或者“按类别分组并计算总价”。ChatGPT Vision 就会自动识别图片中的物品,并生成相应的JSON文件。你可以下载或复制这个文件,或者直接在网页上浏览。ChatGPT Vision 是一个实用而有趣的工具,让你的购物更加轻松和高效。

请按说明将这段内容转换为JSON格式
"请列出所有的水果,然后为每种水果提供一个对象,其中包括其名称和预估的热量、碳水化合物、脂肪和蛋白质的营养信息。"

GPT-4V 详细分析了 Christopher Nolan 为《盗梦空间》初期绘制的图解。
最令人意外的是?图解中居然连“Inception 盗梦空间”这个名字都没有提及。
真是太惊奇了。


该图解明了电影 "盗梦空间" 中的复杂梦境层次结构。影片描述了通过多重梦境导航的过程,每一层都比之前的更加深入和时间延长。我们针对图表进行解读:
- "抢劫" 和 "逃逸":它们描绘了剧情的两个关键阶段,前者涉及在某人心中植入一个思想的过程,而后者描述了从多重梦境中安全逃脱的尝试。
- 角色与他们在梦境中的关系:例如,Yusuf 是第一个梦境中的司机,而 Arthur 则与第二层的酒店梦境有关。
- 绑架/追逐与医院:这两部分揭示了团队在不同梦境层面的挑战。
- 深层梦境 - Limbo:与主人公 Cobb 有关,揭示了他与这一层次之间的深厚关系。
- 具体注释:从 "离开4楼" 到 "踢",这些提供了更多关于梦境内发生的细节和事件的线索。
- 线条和箭头:这些视觉元素呈现了不同梦境之间的联系及角色如何在其中互动。 总的来说,这个图解为我们揭示了 "盗梦空间" 中梦境的层次结构,角色互动和主要事件,帮助我们更好地理解电影的复杂剧情。
从这么一张凌乱的折叠纸上,能够清晰地辨认这图并准确地知道它代表的电影,对我而言实在是太惊奇了。
若你一年前让我看这个,我肯定会大吃一惊。
测试#7:验证码
我们采用CAPTCHAs来对GPT-4V进行测试,这个测试项目是OpenAI在其系统描述中提及过的。测试中,GPT-4V确实能辨识出图片中的CAPTCHA,但答题准确性不高。
在一个涉及交通灯的示例中,GPT-4V并未完全标记出所有交通灯。

在接下来的例子中,GPT-4V 在 CAPTCHA 中大部分都识别得很准确,但却把一个框错误地标为了人行横道。
测试#8:分析比特币这类的金融数据:

这里有20个关于如何使用GPT-4V的有趣、有创意和前瞻性的想法:
**为盲人提供视觉辅助:**GPT-4V可以描述周围环境或从图像中阅读出文本,以帮助视觉受损的个体。
**教育辅导:**它可以分析图表并提供详细解释,帮助学生理解复杂概念。
**医学成像:**通过提供医学图像的初步观察来协助医生(但不用于诊断)。
**菜谱建议:**用户可以展示他们拥有的成分,GPT-4V可以建议可能的菜谱。
**时尚建议:**通过分析服装图片提供时尚建议。 植物或动物识别:识别照片中的植物或动物并提供信息。
**旅行辅助:**分析地标照片以提供历史和文化信息。
**语言翻译:**从一种语言读取并翻译图像中的文本到另一种语言。
**家居装饰规划:**根据用户的居住空间图片提供家居装饰建议。
**艺术创作:**通过分析正在进行的艺术品图片提供指导和建议。
**健身教练:**分析锻炼或瑜伽姿势并提供更正或增强建议。
**活动规划:**通过可视化和组织空间、装饰和布局协助规划活动。
**购物辅助:**通过分析产品图片并提供信息,帮助用户做出购买决策。
**园艺建议:**根据植物及其周围环境的图片提供园艺建议。
**DIY项目指导:**通过分析项目在各个阶段的图片,为DIY项目提供逐步指导。
**安全培训:**分析工作场所环境的图片以提供安全建议。
**历史分析:**为历史事件或人物的图片提供历史背景和信息。
**房地产援助:**分析房产图片,为买家或卖家提供见解和信息。
**野生动物研究:**通过分析野生动物及其栖息地的图片协助研究人员。
**梗图创建:**根据提供的图片建议文本或编辑来帮助用户创建梗图。
我们正生活在一个充满无限可能性的时代。这些点子都有巨大的商业价值。
测试#9:语音对话,扮演渣男角色
带磁性的声音+体贴温暖的情绪价值+深入引导式的思考 🐮
GPT-4V 限制和安全
GPT-4V不只是文字的王者,它还具备“看”图的能力,为用户展现了一个更加丰富多彩的体验。这一切都基于GPT-4的基础研究,同时,为了更好地满足人们的需求,我们引入了从人类反馈中学习的强化方法。
采用RLHF的主要原因是什么?那就是我们希望避免系统被非法篡改,如同这一幽默小插曲所示😢😅。

可以看到“拒绝率”明显上升:

OpenAI 针对其创新的 GPT-4V(ision) 视觉模型 alpha 版本进行了实地研究。尽管这个版本仅开放给少数用户,但OpenAI 从他们那里收集到了大量宝贵反馈,了解了用户是如何与这个模型互动的。而为了更全面地了解模型的优劣,他们还进行了“红队评测”,邀请了行业专家深度挖掘模型的潜在风险和限制。
- 图像中缺少文本或字符
- 缺少数学符号
- 无法识别空间位置和颜色
除了已设置的模型约束,OpenAI 还针对可能存在的风险进行了深入研究,并努力进行了应对。例如,GPT-4V 在处理图片时,不会特定识别某一人物,同时也不会对与仇恨标志相关的提示给予回应。