元峰AI笔记 · AI绘画与视频

DALL-E 3 开放部分内测,多了一个开 GPT Plus 的理由

OpenAI 前几天发布了 DALLE 的升级版本,可以与 ChatGPT 集成,从而改进提示词的使用。

DALL-E 3 开放部分内测,多了一个开 GPT Plus 的理由

图片展示了一位身着白大褂的卡通人物,背景是科技感十足的屏幕,屏幕上显示着数学公式、图表等信息。人物手指指向一个发光的脑形结构,脑形结构由线条构成,周围环绕着数字和符号。该图片与文档中介绍DALL-E 3升级版本的内容相关,可能意在体现DALL-E 3在图像生成方面的智能与科技感,与文档中提到的DALL-E 3能够生成更高质量图像、更准确反映提示词等功能相呼应。

OpenAI 前几天发布了 DALL-E 的升级版本,可以与 ChatGPT 集成,从而改进提示词的使用。

这是一项重要的进展,因为现在大多数先进的 AI 图像生成工具都可以根据提示词(图像描述)创建各种艺术风格的图像,从写实照片到奇幻图像。然而,编写准确的提示词可能是一项挑战,因此"prompt engineering 提示工程师"这个职业正在变得越来越受欢迎。

与此同时,DALL-E 3 带来了许多其他重要的新功能。OpenAI 表示,DALL-E 3 能够生成更高质量的图像,更准确地反映提示词,尤其是在处理较长的提示词时表现更出色。

目前,DALL-E 3 正处于研究预览阶段,计划在 10 月份通过 API 发布,供 ChatGPT Plus 用户和企业客户使用。此后,OpenAI 计划在今年秋季尽可能让大家都能用到此功能。一个显著的功能是 DALL-E 3 能够合成和处理文本,在 OpenAI 的博客示例图中已经展示了:

图片展示了一幅卡通插画,画面中一个表情忧郁的鳄梨坐在蓝色躺椅上,双腿交叉,双手放在腿上,旁边放着一盆绿植。鳄梨上方有对话框,写着“I JUST FEEL SO EMPTY INSIDE.”。旁边坐着一位穿着西装、打着领带的医生,手里拿着笔和纸,面前放着一个勺子。这幅图与上下文提到的DALL-E 3能够合成和处理文本的功能相关,可能是在以幽默的方式表达对DALL-E 3生成内容的期待或反思。

DALL·E 3 限量测试,已由微软 Bing 抢先开启了!

https://www.bing.com/new

图片展示的是Bing Chat界面,用户在“New topic”输入框中提出“Make some with brown hair putting on a helmet”的请求,下方展示了四个相关图片示例,均为人物戴头盔的场景。右侧“Recent activity”栏显示了如“Wedding speech”“Book club discussion questions”等聊天记录。该图片与文档中介绍DALL-E 3能够合成和处理文本的内容相关,直观呈现了Bing Chat在收到文本指令后生成图片示例的功能。

图片展示了Bing Chat中DALL-E 3与之前模型在生成新游戏角色方面的对比。左侧“Previous Model”部分呈现了四个不同风格的女性角色头像,右侧“DALL-E 3”部分则展示了两个风格各异的男性角色头像。该图与上下文紧密相关,上下文提到DALL-E 3能够合成和处理文本,此图通过直观对比,体现了DALL-E 3在生成角色方面的表现,展示了其在图像生成方面的进步。

没收到资格也没关系,再加上第三方研究预览、OpenAI 员工的内部试玩,各种测试案例纷纷涌现,包看过瘾。

最夸张的一个,要数 Reddit 上有人建议让 DALL-E 3**“指定画面中出现50个不同物体”**,结果足足画出了几百个。

图片展示了Reddit上关于DALL-E 3的讨论。Goldenier提出一个“context size”测试想法,即列出要在单个图像中绘制的内容并查看有多少内容被包含,如要求GPT列出50个不同对象集,然后使用DALL-E 3绘制。AtreveteTeTe则分享了自己尝试的结果,先写下50个随机对象,再创建其图像,还附上工作截图。该图片与上下文紧密相关,直观呈现了Reddit用户对DALL-E 3测试的讨论及实际操作情况。

图片展示的是DALL-E 3合成的包含50个不同物体的拼贴画,如茶壶、雨伞、钟表、地球仪等。画面中物体排列有序,色彩丰富,构图具有视觉趣味和多样性。右侧有提示信息,说明了拼贴画中包含的物体种类,如茶壶、雨伞、钟表、地球仪等。该图片与文档中提到的DALL-E 3能够合成和处理文本,以及Reddit上有人让其画出几百个物体的挑战相呼应,直观呈现了其合成能力。

收到研究预览版的第三方设计师 Nathan Shipley 接下了这个挑战。

首先他先让 ChatGPT 随机列出 50 个日常物体,然后直接要求把这些物体都画在一幅画里就可以了。完整的提示词是 ChatGPT 自己补全,再由 DALL·E 3 画出来。

图片展示了ChatGPT与DALL-E 3的交互界面。ChatGPT先列出50个日常物体,如放大镜、秋千等,随后要求DALL-E 3画出包含所有这些物体的单幅图像。DALL-E 3回复称将创建一幅包含50种不同物体的图像,如树、自行车、雨伞等。该图片与上下文紧密相关,直观呈现了上下文中Nathan Shipley让ChatGPT列出50个日常物体,再由DALL-E 3画出包含所有物体的图像这一挑战的交互过程。

一张照片中,一位皮肤被阳光亲吻过的中年波利尼西亚男性冲浪者,奋力冲浪,手里拿着一大堆压倒性的 50 件物品,包括茶杯、自行车、雨伞、烛台、口琴、地球仪、笔记本、羽毛、秒表、棋盘、弹珠、围巾、灯笼、画笔、凉鞋、指南针、双筒望远镜、扳手、花瓶、溜溜球、鹅毛笔、水壶、书包、贝壳、挂坠盒、铅笔、日晷、卷尺、算盘、袖扣、保龄球球、口哨、镘刀、抹刀、沙漏、大礼帽、长笛、显微镜、拼图游戏、放大镜、飞盘、陀螺、手电筒、跳绳、开罐器、风铃、盆景树、擀面杖、热水瓶和打字机。海浪在他周围拍打,他的表情充满决心和轻微的恐慌,试图平衡物体和他的冲浪板。

图片展示的是DALL-E 3根据提示词生成的一张图片。画面中,一位皮肤被阳光亲吻过的中年波利尼西亚男性冲浪者,奋力冲浪,手里拿着50件物品,包括茶杯、自行车、雨伞等。海浪在他周围拍打,他的表情充满决心和轻微的恐慌,试图平衡物体和他的冲浪板。该图片是对上下文中Nathan提出要求后,ChatGPT生成的冲浪者手持50件物品冲浪的视觉呈现,直观展示了冲浪者在海浪中平衡物品的场景。

图片展示了一位皮肤被阳光晒黑的中年波利尼西亚男性冲浪者,他站在冲浪板上,表情充满决心和轻微的恐慌,试图平衡着一大堆压倒性的物品。这些物品包括茶杯、自行车、雨伞、烛台、口琴、地球仪、笔记本、羽毛、秒表、棋盘、弹珠、围巾、灯笼、画笔、凉鞋、指南针、双筒望远镜、扳手、花瓶、溜溜球、鹅毛笔、水壶、书包、贝壳、挂坠盒、铅笔、日晷、卷尺、算盘、袖扣、保龄球球、口哨、镘刀、抹刀、沙漏、大礼帽、长笛、显微镜、拼图游戏、放大镜、飞盘、陀螺、手电筒、跳绳、开罐器、风铃、盆景树、擀面杖、热水瓶和打字机。海浪在他周围拍打,背景是蓝天白云。

后来 Nathan 又提出换一个更低的视角的要求,这回 ChatGPT 把提示词中的人物描述换成了“一张从靠近水面的低视角拍摄的照片,一名西班牙老年妇女冲浪经过。冲浪者与一大堆 50 个物体奋力搏斗......”。

图片展示了一位坐在冲浪板上的老人,周围环绕着各种物品,如自行车、钟表、杯子、球等。背景是海浪,天空晴朗。这幅图与文档中关于DALL-E 3开放内测的内容相关,可能是Logan.GPT通过该模型生成的图像,以展示其生成能力,与上下文提到的将提示词发送给Logan.GPT来画的场景相呼应。

虽然我们没法自己体验 DALL-E 3,但是 Logan.GPT 发了帖子,可以把提示词发送给他,帮我们来画。

图片是Twitter上Logan.GPT发布的帖子。上方文字提示发送DALL-E 3提示词,将分享结果。下方文字表示人们想象着使用DALL-E的可能性。图片中,一位穿着白大褂、戴眼镜的卡通人物,手指向上,背景是科技感十足的界面,有大脑、代码、图表等元素。该图片与上下文紧密相关,展示了对DALL-E 3的期待与想象,呼应了上下文对DALL-E 3开放内测的介绍。

https://x.com/OfficialLoganK/status/1704850313889595399?s=20

Wormhole singularity with code flowing into the event horizon, futuristic and awe inspiring.
虫洞奇点,代码流入事件视界,充满未来感,令人惊叹。

图片展示的是名为“Wormhole singularity with code flowing into the event horizon, futuristic and awe inspiring.”的科幻场景。画面中,一个充满未来感的虫洞奇点,其周围环绕着色彩斑斓的光带,光带交织成复杂的图案,仿佛有代码在流动。背景是深邃的宇宙空间,点缀着星星和星云,整体画面充满神秘与震撼感,与文档中描述的科幻主题相契合。

Photorealistic, hyper-detailed image of a hippopotamus sitting confidently on a Vespa scooter, wearing black leather hand shoes. The iconic Eiffel Tower serves as a majestic backdrop, with tourists visibly taken aback by the unique spectacle.
河马穿着黑色皮鞋,自信地坐在 Vespa 踏板车上,逼真、超详细的图像。标志性的埃菲尔铁塔作为雄伟的背景,游客们显然会被这种独特的奇观所震惊。

图片展示了一只拟人化河马骑着白色摩托车的场景。河马体型庞大,穿着黑色鞋子,双手放在车把上,表情略显惊讶。背景是巴黎街景,埃菲尔铁塔隐约可见,周围有行人和喷泉,还有穿着正式服装的男女。图片与上下文可能在探讨城市生活、动物拟人化等主题,通过河马这一不寻常的元素,引发对城市与动物关系的想象。

A hackathon set in a forest with teams of humans, animals, plants and IoT sensor tech visible and working in collaboration
一场以森林为背景的黑客马拉松,由人类、动物、植物和物联网传感器技术组成的团队可见并协同工作

图片描绘了一幅森林场景,多人围坐在木桩上使用笔记本电脑,周围有松鼠、兔子、鹿等动物。树木上布满蓝色的电子屏幕,连接着电线,营造出一种科技与自然融合的氛围。画面中还有一只鸟在空中飞翔。此图与上下文紧密相关,上下文提到一场以森林为背景的黑客马拉松,由人类、动物、植物和物联网传感器技术组成的团队可见并协同工作,此图正是对这一场景的生动呈现。

A group of free-spirited hippies sit atop the VW 1960 beetle van, marveling at the breathtaking view of the Northern Lights above, captured with a 16-35mm f/2.8 lens to capture the expansive sky and foreground elements with a wide-angle view, set at an aspect ratio of 3:2 to highlight the natural beauty, while using a high ISO of 3200 to capture the magical display of lights, and a shutter speed of 20 seconds to capture the movement of the Northern Lights in the sky, creating a dreamy and otherworldly atmosphere, one of the hippies wears a blue hoodie with “no more” text on it
一群自由奔放的嬉皮士坐在大众 1960 甲壳虫面包车上,惊叹于上方北极光的壮丽景色,使用 16-35mm f/2.8 镜头以广角视角捕捉广阔的天空和前景元素,设置3:2的长宽比来突出自然美景,同时使用3200的高ISO来捕捉灯光的神奇展示,以及20秒的快门速度来捕捉北极光在天空中的移动,其中一位嬉皮士穿着一件蓝色连帽衫,上面写着“不再”字样,营造出一种梦幻般的超凡脱俗的氛围

图片展示了一群嬉皮士坐在大众1960甲壳虫面包车上,车顶上坐着一位穿着写有“NO MORE”字样的蓝色连帽衫的嬉皮士。他们惊叹于上方北极光的壮丽景色,画面使用16-35mm f/2.8镜头以广角视角捕捉广阔的天空和前景元素,设置3:2的长宽比来突出自然美景,同时使用3200的高ISO来捕捉灯光的神奇展示,以及20秒的快门速度来捕捉北极光在天空中的移动,营造出梦幻般的超凡脱俗氛围。

Here's a tough one, by ChatGPT (3.5): A group of squirrels engaged in a heated debate over the best strategy to outsmart a cleverly placed nut dispenser, resembling a miniature United Nations assembly. One squirrel passionately argues for diplomacy, another for acorn taxes, and a third for forming alliances with rival chipmunks – all while wearing comically tiny suits and gesticulating wildly.
这是 ChatGPT (3.5) 提出的一个难题: 一群松鼠就如何智胜一个巧妙放置的坚果分配器(类似于微型联合国大会)的最佳策略展开了激烈的辩论。一只松鼠热情地主张外交,另一只松鼠主张橡子税,第三只松鼠则主张与竞争对手的花栗鼠结成联盟——所有这一切都穿着滑稽的小西装,疯狂地打着手势。

图片展示了一场松鼠会议场景。会议室内,松鼠们围绕着桌子,有的站在讲台上,有的坐在桌旁,似乎在激烈讨论。讲台上悬挂着联合国标志,显示“TEALICE”字样。松鼠们表情各异,有的张大嘴巴,有的举起拳头,有的拿着标语牌,标语牌上写着“PEACES DIRATES TAXCES”“CHIPMUNK ALLIANCE”等字样。会议室内还有许多松鼠观众,营造出热闹的氛围。此图与上下文的松鼠会议主题相契合。

图片展示了一群松鼠在会议室开会的场景。会议桌周围坐满了松鼠,他们身着西装,神情各异,有的在讲话,有的在记录。会议桌上摆放着地球仪、文件等物品。背景中,窗外是绿树和蓝天,室内有窗帘、吊灯等装饰,墙上挂着松鼠的画像。这张图片与文档中“一只松鼠热情地主张外交,另一只松鼠主张橡子税,第三只松鼠则主张与竞争对手的花栗鼠结成联盟——所有这一切都穿着滑稽的小西装,疯狂地打着手势”的描述相契合,是对松鼠会议场景的生动呈现。

A medieval fantasy landscape, rolling green fields with a bright blue sky filled with puffy white clouds. On top of one of the clouds is a castle rising from it. A knight races across the field.
中世纪的奇幻风景,连绵起伏的绿色田野,明亮的蓝天上飘着蓬松的白云。在其中一朵云的顶部,一座城堡从云中拔地而起。一位骑士在球场上奔跑。

图片描绘了一位骑士骑着白马在绿意盎然的田野上奔跑的场景。背景中,一座悬浮在空中的城堡,城堡建筑风格奇幻,绿顶红墙,周围环绕着云雾。城堡下方是连绵的山丘和农田,远处是蓝色的天空和白云。图片与上下文的关系是,上下文提到一位骑士在球场上奔跑,此图以具体画面呈现了骑士奔跑的场景,与上下文内容相呼应。

Two onions talking to eachother, with speech bubbles above them. The first onion asks a question, which the second onion responds with a pun.
两个洋葱互相交谈,上面有对话气泡。第一个洋葱问一个问题,第二个洋葱用双关语回答。

图片展示了两个拟人化的洋葱,它们面带笑容,背景为白色。左边的洋葱说“我们在厨房的目的是什么?”,右边的洋葱回答“为了增加美味的层次!”。图片与上下文紧密相关,是对“两个洋葱互相交谈,上面有对话气泡。第一个洋葱问一个问题,第二个洋葱用双关语回答”这一情境的具体呈现,直观地展示了对话内容。

I friend gave me one, and most of AIs struggle with it, “A horse drinking water from water bottle”
我的朋友给了我一个,大多数人工智能都在挣扎,“一匹马从水瓶里喝水”

图片展示了一匹马在农场场景中喝水的场景。马的背上背着一个巨大的塑料水瓶,水瓶口正对着一个木桶,水从瓶口流出,注入木桶。背景是蓝天白云、绿树和围栏,地面是泥土和草地。图片与上下文中的“一匹马从水瓶里喝水”这个双关语相关,直观呈现了该双关语的场景,使读者能更清晰地理解其含义。

“a giant ladybug looking disapprovingly at a mini elephant“
“一只巨大的瓢虫不满地看着一头迷你大象”

图片展示了一只巨大的瓢虫不满地看着一头迷你大象。瓢虫身体呈红色,有黑色斑点,表情严肃,眼睛圆大,嘴巴紧闭,似乎在责备大象。大象体型较小,呈灰色,耳朵较大,眼睛圆润,嘴巴微张,似乎在回应瓢虫。背景为浅色,突出主体。该图片与文档中“一只巨大的瓢虫不满地看着一头迷你大象”的描述相契合,是文档中展示的DALL-E 3生成作品之一。

大象做错了什么???

Adventurers preparing to go through orange glowing magical portal in a great desert, dof, realistic, isometric
冒险家准备在大沙漠中穿过橙色发光的魔法门户,自由度,现实,等距

图片展示了一位白发老者和一位黑发少女在沙漠中面对橙色发光的魔法门户的场景。老者身着棕色长袍,腰间挂有武器,正双手合十,似乎在引导少女。少女身穿浅色长袍,跪在地上,双手合十,面向门户。背景是广阔的沙漠,夕阳西下,天空被染成橙红色,地平线处有一轮红日。此图与文档中介绍DALL·E 3开放部分内测,以及展示其生成的高质量图像内容相关。

还有很多,就不一一列举了,更多作品可以去作者原推下面看。

OpenAI 负责 ChatGPT 企业版的 Adam Goldberg 也晒出不少高质量结果,不过没有分享提示词。

图片展示的是OpenAI负责ChatGPT企业版的Adam Goldberg在Twitter上发布的推文。推文配有“Once you go chat, you Never go Back”(一旦你开始聊天,就永远无法回头)的图片,画面中男子手持粉笔,背景为黑板。该推文与DALL·E 3相关,与上下文提到的DALL·E 3开放部分内测及GPT Plus收费等信息相呼应,体现了DALL·E 3在ChatGPT Plus收费后,仍可期待其免费玩的期待感。

图片展示的是OpenAI负责ChatGPT企业版的Adam Goldberg在Twitter上发布的DALL·E 3生成的图像。图中是一只眼睛,瞳孔部分由电路板和电子元件构成,周围有类似电路的线条,眼白部分有黑色线条。该图片与上下文紧密相关,上下文提到Adam Goldberg晒出不少高质量结果,但未分享提示词,此图正是其发布的高质量生成图像之一,体现了DALL·E 3的创作能力。

图片展示的是OpenAI负责ChatGPT企业版的Adam Goldberg在Twitter上晒出的高质量DALL·E 3生成结果。图中是一个由西红柿构成的拟人化角色,背景是户外花园场景,有西红柿、花等元素。该图片与上下文紧密相关,上下文提到Adam Goldberg晒出不少高质量结果,但未分享提示词,此图正是其晒出的高质量生成作品之一,体现了DALL·E 3在生成创意图像方面的实力。

虽然 10 月份 DALL·E 3 在 ChatGPT Plus 要收费每月 20 美元。

但既然 GPT-4 在 Bing 上是免费提供的,将来DALL·E 3免费玩也可以期待一波了~

参考链接:
[1]https://x.com/OfficialLoganK/status/1704850313889595399?s=20

[2]https://x.com/CitizenPlain/status/1705248617131291032?s=20
[3]https://x.com/CitizenPlain/status/1705248617131291032
[4]https://www.reddit.com/r/StableDiffusion/comments/16owoss/dalle_3_screen_capture_more_info_in_comments/k1p7aav/?context=3

一本《写给设计师看的专用单词表》送给坚持看完的你!

这里有一个非常实用的 AI 出图风格单词表,PDF全文共 134 页。

这个单词表能够帮助你更好地理解和应用不同的出图风格,从而让你的 AI 作品更加漂亮和独特。

因为 AI 出图效果与所选的风格词汇密切相关,只要你掌握了这些关键词汇,你就能够轻松地创作出令人印象深刻的图像。

图片为一张宣传图,背景为黑色网格,上方大字标题为“写给设计师看的专用单词表”,下方有“@Simon_阿文”及“2022.12”字样,右下角有“元峰AGI”标识。该图片位于介绍DALL - E 3开放部分内测及AI出图关键词汇的文档中,可能是作者Simon_阿文发布的内容,用于吸引对设计师群体感兴趣的读者关注其相关专业内容。

图片展示了DALL-E 3开放部分内测中,与设计相关的关键词示例。画面分为多个区域,每个区域呈现不同风格的图像,如Cyberpunk Futuristic、Futuristic、Sci-Fi等风格,还展示了HUD(Head-Up Display)等设计元素。图片与上下文紧密相关,上下文提到AI出图效果与风格词汇相关,此图直观呈现了多种设计风格的图像示例,帮助设计师了解不同关键词对应的效果。

图片展示了写给设计师看的专用单词表,包含Halftone、Pop Art、Memphis、Duotone、80s等风格词汇,每种风格词汇下方配有相关设计作品示例。这些单词表是写给设计师看的专用单词表的一部分,用于帮助设计师掌握与AI出图效果相关的关键词汇,以便创作出令人印象深刻的图像。