元峰AI笔记 · AI绘画与视频

DALL-E 3 vs MJ 5.2 vs SDXL:谁更胜一筹?

DallE 3 是 OpenAI 最近发布的最新 AI 图像生成器,它可以根据自然语言描述直接生成图像,这在AI领域引起了广泛关注。与之前的版本相比,DallE 3有了显著的改进,具有更好的连贯性和图像质量。

DALL-E 3 vs MJ 5.2 vs SDXL:谁更胜一筹?

图片展示了DALL-E 3、MJ 5.2和SDXL三种AI绘画器生成的图像。左侧DALL-E 3图像中,宇航员身着中世纪盔甲,头戴派对帽,手持绿剑,骑着钢马在月球上;中间MJ 5.2图像为一只展翅的鹰,背景有闪电;右侧SDXL图像呈现粉蓝渐变天空,云层与地面相接。图片下方文字“DALL-E 3 VS MJ 5.2 VS SDXL”表明这是三种绘画器的对比展示,与上文提到的使用六种提示词比较三种绘画器,看看哪一种能产生最佳结果相呼应。

Dall-E 3 是 OpenAI 最近发布的最新 AI 图像生成器,它可以根据自然语言描述直接生成图像,这在AI领域引起了广泛关注。与之前的版本相比,Dall-E 3有了显著的改进,具有更好的连贯性和图像质量。

但 Dall-E 3 与其最接近的竞争对手 MidJourney 5.2 和 Stable Diffusion XL 相比如何?

在本文中,我们将使用六种不同的提示词来比较这三种绘画器,看看哪一种能产生最佳结果。

连贯性

Prompt: An astronaut riding a steel horse on the moon. The astronaut is wearing a medieval armor with a party hat and a green sword.

提示词:宇航员在月球上骑着钢马。宇航员身穿中世纪盔甲,戴着派对帽,手持绿色剑。

图片展示了DALL-E 3、Midjourney和SDXL三种绘画器在连贯性测试中的表现。左侧是DALL-E 3的画作,宇航员骑着钢马,背景为月球表面;中间是Midjourney的画作,宇航员骑着摩托车,背景有月亮;右侧是SDXL的画作,宇航员骑着马,手持长矛,背景为月球表面。三幅画作均符合提示词要求,但DALL-E 3的画作与提示词中“派对帽”“绿色剑”等细节较为契合,展示了其连贯性优势。

连贯性是 Dall-E 3 最大的特点之一。Dall-E 3 做得很好,捕捉到了每一个奇怪的细节。其他两个呢?他们有点忘记了派对氛围(没有戴派对帽)和剑。

超现实景观

Prompt: A dreamy landscape where clouds are made of cotton candy and rivers flow with liquid gold

提示词:梦幻般的风景,云朵由棉花糖组成,河流流淌着液体黄金

图片展示了DALL-E 3、Midjourney和SDXL三种AI模型生成的超现实景观图像。左侧DALL-E 3图像中,云朵由棉花糖组成,河流流淌着液体黄金,色彩鲜艳;中间Midjourney图像中,云朵同样由棉花糖组成,河流为蓝色液体,色彩柔和;右侧SDXL图像中,云朵由粉色棉花糖组成,河流为液体黄金,色彩梦幻。该图与上下文关系紧密,直观呈现了三种模型在实现梦幻般风景、云朵由棉花糖组成、河流流淌液体黄金等创意方面的表现。

这里,试图探究这些 AI 模型是否能发挥点创意,实现一些出其不意的组合。目的是将那些“不可思议”的创意变得“惊艳”。

从视觉效果上看,在我看来 SDXL 在这三者之中表现最佳。通过挑战 AI 以全新的手法整合熟悉的元素,当我们尝试用不同的方式组合那些我们熟知的元素时,可以真正评估这些 AI 如何从零开始,理解并构建出新颖的场景。

历史小说

Prompt: Ancient Egyptian pharaoh using a modern smartphone while riding a dinosaur.

提示词:古埃及法老骑着恐龙使用现代智能手机。

图片展示了DALL-E 3、Midjourney和SDXL三种AI图像生成器对“古埃及法老骑着恐龙使用现代智能手机”这一Prompt的生成结果。DALL-E 3画面中法老骑着恐龙,背景有金字塔;Midjourney画面中法老骑着恐龙,背景有棕榈树;SDXL画面中法老骑着恐龙,背景有棕榈树和金字塔。该图与上下文紧密相关,直观呈现了三种AI生成器的表现,对比其对复杂场景的处理能力。

Midjourney 的图像确实令人眼前一亮,但遗憾的是它没有画出古埃及法老的画面。这一次,Dall-E 3 依然瑶瑶领先,所有元素都包含在里面,画面也很不错。

设置这个场景,旨在融合不同的历史背景,考验 AI 如何巧妙地融合真实与虚构。优秀的图像生成器应当展现出富有创意又不失合理性的组合。

情感传达

Prompt: A portrait of a woman holding a wilted rose, her expression one of profound sadness and longing.

提示词:一幅女人的肖像,手握一朵枯萎的玫瑰,她的表情充满了深深的悲伤和渴望。

图片展示了DALL-E 3、Midjourney和SDXL三种AI图像生成器对“一幅女人的肖像,手握一朵枯萎的玫瑰,她的表情充满了深深的悲伤和渴望”这一提示词的生成结果。左侧是DALL-E 3生成的图像,画面中女人手持玫瑰,表情悲伤;中间是Midjourney生成的图像,画面色调偏暗,女人神情哀伤;右侧是SDXL生成的图像,画面中女人手持红玫瑰,表情凝重。该图与上下文关于AI图像生成器在情感传达方面的对比内容相关。

这是一个"你真的懂情感吗?"的考验。有时,心情比外貌更重要。在我看来 Dall-E 3 在这一场中任然是胜出。其他两张图表情有点木讷,没有悲伤感。

这个考验旨在探索 AI 如何利用面部和元素来传递情感,让我们看看 AI 如何洞察人类情感的细微之处。

生物设计

Prompt: An image of a ‘thunderbird,’ a mythical creature that controls storms, depicted in its natural habitat during a fierce thunderstorm

提示词:“雷鸟”的图像,这是一种控制风暴的神话生物,描绘了猛烈雷暴期间其自然栖息地的情况。

图片展示了DALL-E 3、Midjourney和SDXL三种AI模型生成的“雷鸟”图像。左侧DALL-E 3生成的图像中,雷鸟展翅飞翔,背景是闪电和乌云;中间Midjourney生成的图像,雷鸟站立于岩石上,背景有闪电和冰霜效果;右侧SDXL生成的图像,雷鸟展翅,背景是闪电和紫色云层。图片与上下文紧密相关,直观呈现了三种模型在生成“雷鸟”图像方面的表现,辅助说明最终Midjourney夺魁的情况。

Dall-E 3 表现得非常亮眼,但最终 MidJourney 夺魁。那鸟的出现宛如一道亮丽的风景线,风暴更是令人震撼——整个场景充满了力量与情感!

这种挑战需要 AI 运用其无限的想象去构思那些未曾存在的场景,并在其中加入如环境和天气这样的元素,这不仅增加了创作的复杂性,还要看 AI 如何制造出像闪电这样的视觉特效。

建筑设计

Prompt: Design an eco-friendly futuristic city floating on the ocean, with advanced technology and harmony between nature and artificial structures

提示词:利用先进的技术以及自然与人工结构的和谐,设计一座漂浮在海洋上的生态友好的未来城市

这一系列中的每一件作品都值得称赞,但 Dall-E 3 的图最吸引我。这种未来感的设计,仿佛让我真正看到了未来的那种理想的生活空间。

最后的想法

虽然三大 AI 绘画巨头让我们眼前一亮,但每个都有其高光时刻和小瑕疵。

MidJourney 依旧席卷视觉盛宴,带来震撼和创新的画面。但它的连贯性偶有波动,偶尔也会呈现出超乎现实的图像。

Dall-E 3 在逻辑连贯性上更胜一筹,但视觉享受稍逊。同时,它能更准确地应答用户指令,为你呈现理想画面。

SDXL 虽全能,但在视觉和逻辑上都稍显逊色。

总的来说,选择最适合你的 AI 图像工具,取决于你的审美和具体需求。