元峰AI笔记 · AI绘画与视频

120 亿参数背后,Flux.1 如何击败 AI 绘画界的三巨头?附免费使用方法

大家好,我是元峰。这几天,大伙都被 Flux 给刷爆了吧?这个 Flux.1 一出来,把 AI 画画的水平又提高了一大截!看看上面 3 张图,你敢信这是 AI 画的?

120 亿参数背后,Flux.1 如何击败 AI 绘画界的三巨头?附免费使用方法

图片中是一位金发女性,身着深蓝色带有亮片装饰的服装,手持黑色麦克风,左手做出手势,脖子上挂着绿色挂绳,上面有白色文字,胸前佩戴着名牌,名牌上有文字“ARTRODO”。背景中可以看到一些带有字母的标识。文档主要围绕Flux.1在AI绘画领域超越Midjourney V6等巨头展开,此图片与文档上下文内容并无直接关联。

图中是一位长发女士,身着带有金色花纹装饰的深蓝色西装,手持黑色麦克风,面带微笑,左手抬起似在辅助表达。脖子上挂着绿色挂绳,挂绳上有标识牌,牌上有“V-Ray”字样。此图片位于介绍Flux.1在AI绘画界表现相关内容中,似乎与整体介绍AI绘画的主题并无直接关联,可能是文档配图错误。

图片展示了一位在舞台上表演的女性。她有着粉色长发,身穿银色亮片短上衣、黑色皮短裤,搭配黑色长筒靴。她右手持镶钻话筒,左手高高举起,面带笑容,姿态投入。舞台背景有光影效果和烟雾营造氛围。然而,图片内容与文档中关于Flux.1击败AI绘画界巨头及免费使用方法的上下文并无关联。

大家好,我是元峰。这几天,大伙都被 Flux 给刷爆了吧?这个 Flux.1 一出来,把 AI 画画的水平又提高了一大截!看看上面 3 张图,你敢信这是 AI 画的?

Flux.1 它可真是在开源AI画图界立了个新标准。你们想,它那 120 亿个参数,画出来的图质量和效果,把 Midjourney V6、OpenAI 的 Dall-E 3 还有 Stability AI 的 SD3 Ultra 这些巨头都超越了。

什么是 Flux.1?

LUX.1 是一个全新的 AI 图像生成模型,在图像细节、指令遵从性、风格多样性和场景复杂性等方面,为文本到图像合成定义了新的最先进水平(state-of-the-art, SOTA),由 Stable Diffusion 的原班人马创立的黑森林工作室推出。这个模型在开源文生图模型领域引起了广泛关注,被认为有可能取代 Stable Diffusion 成为新的领头羊。

图片是一个二维图表,横轴代表成本(COST),纵轴代表创造力(CREATIVE CAPABILITIES)。图中有三个点分别对应Flux.1的三个版本,从左到右、由下至上依次是FLUX.1[schnell]、FLUX.1[dev]、FLUX.1[pro] 。随着成本的增加,创造力也逐步提升。FLUX.1[schnell]成本最低,创造力也最低;FLUX.1[pro]成本最高,创造力最强;FLUX.1[dev]居于两者之间。图表直观呈现了Flux.1不同版本在成本与创造力方面的差异,与文本中对Flux.1三个版本的介绍相呼应。

Flux 有3个版本

FLUX.1 [pro],全新的 SOTA 文生图模型,具有极其丰富的图像细节、极强的 prompt 遵循能力和多样化风格。目前可以通过 API 使用,只开放商用权限。

FLUX.1 [dev],FLUX.1 [pro] 的开放权重、非商用变体,基于后者蒸馏而成。该模型的表现优于 Midjourney 和 Stable Diffusion 3 等其他图像模型。推理代码和权重已经放在了 GitHub 上。

开源的 FLUX.1 [schnell],它是超高效的 4-step 模型,遵循了 Apache 2.0 协议。该模型在性能上与 [dev]、[pro] 非常接近,可以在 Hugging Face 上使用。

Flux.1 背后团队的故事挺有意思的。这帮人就是 Stable Diffusion 的开发者,也是潜在扩散(latent diffusion)的发明者。在 Stability AI 内部出现一些问题后,关键团队成员离职,成立了一家名为 Black Forest Labs 的新创公司。

所以这次的模型发布也覆盖了商用、开源权重到完全开源,能力最强的提供商用和企业合作的机会,基础版权完全开源。

跟 Stable Diffusion 不同的是,这次 Black Forest Labs 和 xAI 进行了合作,为 Grok 2 提供了图像生成功能,怎么说,算是一个双赢的合作,不管是吸引更多用户,还是积累更多数据进行数据飞轮。

图片展示了Grok聊天界面中图像生成功能的使用示例。上方是用户“Dreaming Tulpa”的指令,要求生成一张在卧室中拍摄的性感Instagram模特近照,2015年用iPhone拍摄,自然光透过窗帘,展示全身,模特为红发。下方是Grok生成的图片,一位红发女性趴在床上。这与文档中提到的Black Forest Labs和xAI合作,为Grok 2提供图像生成功能相呼应,直观呈现了Grok的图像生成效果。

图片展示了由Grok生成的图像,推文内容为“Donald Trump和Kamala Harris牵手的图像”。图中特朗普身着蓝色西装,哈里斯穿着黑色套装,两人面对面牵手,背景有美国国旗。这张图片与上文提到的Black Forest Labs和xAI合作,为Grok 2提供图像生成功能相呼应,是Grok图像生成能力的一个展示实例。

图片展示了Grok利用AI生成的图像成果。上方是用户Gigi B @Gianluigi Ballarani的指令“generate elon musk as a ninja turtle”(生成埃隆·马斯克为忍者神龟形象),下方是Grok生成的图像,画面中是身着忍者神龟服饰、背着武器的埃隆·马斯克形象,背景为城市夜景。这与文档中提到的Black Forest Labs和xAI合作,为Grok 2提供图像生成功能相呼应,直观呈现了Flux.1模型应用于Grok的图像生成效果。

FLUX TED 演讲

但仅过去一周,装载了真实版 LoRA 后,TED 用 Flux 掀起了一场“真人演讲”比赛。

图片展示了一位长发女性手持麦克风站在演讲台前演讲的场景,她身着带有白色图案的深色上衣,背景是色彩渐变的屏幕,台下有观众。图片与上下文相关,上下文提到TED用Flux掀起“真人演讲”比赛,且强调这并非真人,而是由Runway Gen 3和Flux生成的视频和图像,该图片便是展示这样的“真人演讲”画面。

图片展示了一位手持麦克风的女性,她穿着花色吊带,脖子挂着蓝色挂绳,嘉宾卡上有“Google”字样。背景中能看到“TEDx”相关标识。根据上下文可知,这并非真人,而是由Runway Gen 3和Flux生成的图像。上下文提及仅过去一周,TED用Flux掀起“真人演讲”比赛,此图片作为示例,证明了Flux在生成逼真图像方面的能力,如嘉宾卡上的Google字样与真实logo毫无区别。

是的,这不是真人,而是由 Runway Gen 3 和 Flux 生成的视频和图像。仔细看,嘉宾卡上的 Google 字样与真实的 logo 毫无区别。

图片展示了一位在TED演讲台上的男士,他穿着深色西装和浅色衬衫,胸前佩戴着嘉宾卡,双手呈张开姿态,似乎正在进行演讲。背景是红色的“TED”字样。结合上下文可知,该人物并非真人,而是由Runway Gen 3和Flux生成的图像,体现了Flux在图像生成方面的能力,用以说明Flux在AI领域所引发的相关应用和变化。

图片中是一只棕白相间的狗,戴着项圈和吊牌,坐在红色圆形地毯上,前方有一个麦克风。背景中可以看到红色的“TEDx”字样以及部分屏幕内容。结合上下文可知,这是TED用Flux掀起的“真人演讲”比赛相关场景,表明这看似真实的画面实际是由Runway Gen 3和Flux生成的视频和图像,展示了Flux在图像生成方面的能力。

图片展示了一位女性正在进行演讲的场景。她穿着黑色西装外套和条纹衬衫,搭配牛仔裤,头发扎成发髻,双手呈张开状做手势。她胸前佩戴着嘉宾卡。上下文提到这是由Runway Gen 3和Flux生成的视频和图像,并非真人,还特别提及嘉宾卡上的Google字样与真实logo毫无区别。此图片与上下文内容相呼应,直观呈现了Flux参与生成的“真人演讲”画面。

图片展示了一位身着酒红色西装外套和白色内搭的女性正在进行演讲,她双手摊开,姿态自然。背景屏幕上有红色的“TEDx”和蓝色的“AI Search”字样。结合上下文,此图片与TED用Flux掀起“真人演讲”比赛相关,说明图中内容是由Runway Gen 3和Flux生成的视频和图像场景之一,体现了Flux在生成逼真演讲场景方面的应用。

图片展示了一位男士正在进行演讲的场景。他身着西装,站在舞台上,双手张开做出手势。背景是红色的“TEDX”字样以及白色的“AI Search”字样。结合上下文可知,这并非真人演讲,而是由Runway Gen 3和Flux生成的视频和图像,体现了Flux在生成逼真内容方面的能力,是对上文提到的TED用Flux掀起“真人演讲”比赛的直观呈现。

比 Midjourney 更强?

据研究人员称,Flux.1 Pro和Flux.1 Dev在以下每个方面都超过了Midjourney v6.0、Dall-E3和Stable Diffusion 3 Ultra等热门模型:

  • 视觉质量
  • 指令一致性
  • 尺寸和长宽比的多样性
  • 排版
  • 输出多样性

图片展示了以“单个虎眼的极端特写”为提示词的AI绘画成果。左侧是Flux.1生成的图像,呈现了虎眼的直接正面视图,虹膜、瞳孔细节丰富,眼睛的纹理和颜色清晰,“FLUX”一词以大而白色、具可见纹理的笔触绘制其上。右侧是四张Midjourney v6.1生成的虎眼图像,同样有“FLUX”字样。图片直观呈现了Flux.1和Midjourney v6.1在处理同一提示词时的绘画效果,与上文提及的Flux.1在视觉质量等方面超过热门模型相呼应。

***提示词:***单个虎眼的极端特写,直接正面视图。详细的虹膜和瞳孔。重点关注眼睛的纹理和颜色。自然光捕捉真实的眼睛光泽和深度。 “FLUX”一词以大而白色的笔触绘制在其上,具有可见的纹理。

图片展示了Flux.1与Midjourney v6.1生成的图像对比,主题为“乐高厨师小人仔为无家可归者做饭的特写”。左侧是Flux.1生成的图像,一个戴着厨师帽、身穿围裙的乐高厨师手持锅铲,面前的盘子里有食物。右侧四张是Midjourney v6.1生成的图像,呈现乐高厨师在厨房烹饪的不同场景。图片与上文提到的Flux.1在视觉质量等方面超过Midjourney等热门模型的内容相关,通过实际生成图像对比展示其优势。

***提示词:***乐高厨师小人仔为无家可归者做饭的特写。专注于乐高手使用餐具,展示烹饪技巧。温暖的厨房灯光,清晨的气氛。佳能 EOS R5,50mm f/1.4 镜头。捕捉复杂的烹饪技巧。背景暗示慈善背景。灵感来自 Paul Bocuse 和 Massimo Bottura 的风格。定格食物准备的瞬间。通过场景细节传达同情心和利他主义。

图片展示了以“一个戴着墨镜、身穿夏威夷衬衫的大土豆躺在沙滩巾上,周围环绕着色彩缤纷的沙滩球和人字拖,拟人化水果在打沙滩排球等”为提示词的AI绘画成果。左侧大幅画面为Flux.1生成的图像,右侧四张小图为Midjourney v6.1生成的图像。画面中,大土豆形象生动,沙滩场景色彩鲜艳、氛围欢快。图片是对前文提及的Flux.1在视觉质量等方面超过热门模型说法的示例呈现,通过与Midjourney v6.1成果对比,展示Flux.1的绘画能力。

***提示词:***一个戴着墨镜、身穿夏威夷衬衫的大土豆躺在沙滩巾上,周围环绕着色彩缤纷的沙滩球和人字拖。附近,拟人化的水果在打沙滩排球。在背景中,一座灯塔沙雕矗立在一辆带有巨大圆锥体的冰淇淋车旁边,为快乐的海滩游客提供美食。这个场景捕捉到了有趣、俏皮的夏日氛围,附近有海浪拍打的声音。

图片展示了对比效果,左侧是Flux.1生成的图像,画面中是一位戴着红色墨镜、穿着灰色外套的男子,背景是粉紫色天空与山峦,画面左上角有“FLUX”标识;右侧是Midjourney v6.1生成的四张男子图像。图片与上文提及的“Flux.1 Pro和Flux.1 Dev在多个方面超过Midjourney v6.0等热门模型”的内容相关,通过实际生成图像对比,直观呈现两者效果差异。

***提示词:***一个留着胡须、黑发、戴着红色太阳镜、穿着浅灰色巴塔哥尼亚羊毛夹克的男人的肖像。他表情严肃,直视镜头。背景显示了模糊的户外场景,岩石地形和充满活力的粉红色和紫色的日落天空。灯光使图像呈现出温暖的黄金时刻光芒。整体氛围粗犷而又时尚,带有一丝冒险的气息。

图片展示了Flux.1与Midjourney v6.1生成图像的对比。左侧是Flux.1生成的一只在黑色森林场景中的拉布拉多犬,毛色为黄白相间,狗张着嘴,显得较为活泼,背景是黑色的树和叶子。右侧四张图是Midjourney v6.1生成的图像,同样是黑色森林背景下的拉布拉多犬,但整体色调偏暗,狗多为黑色轮廓状。图片与上文“黑色森林中的拉布拉多,有黑色的树和黑色的叶子”的提示词相呼应,用于展示Flux.1的图像生成效果。

***提示词:***黑色森林中的拉布拉多,有黑色的树和黑色的叶子。

你觉得哪个效果最好?

据研究人员称,Flux.1 Pro 和 Flux.1 Dev 在以下每个方面都超过了 Midjourney v6.0、Dall-E3 和 Stable Diffusion 3 Ultra 等热门模型:视觉质量、指令一致性、尺寸和长宽比的多样性、排版、输出多样性。

图片展示了Flux.1不同模型版本与Midjourney v6.0、Dall - E3、Stable Diffusion 3 Ultra等热门模型在视觉质量、指令一致性(Prompt Following)、尺寸和长宽比的多样性(Size/Aspect Variability)、排版(Typography)、输出多样性(Output Diversity)方面的对比雷达图。左侧雷达图呈现多个模型对比情况,右侧则主要突出Flux.1不同版本对比。雷达图直观地显示出各模型在不同维度上的表现情况,与上下文提到的Flux.1在多个方面超过热门模型相呼应。

如下图所示,这是 Flux.1 dev 不同模型版本之间的对比。

图片展示了Flux.1 dev不同模型版本生成的图像对比。包含身着宇航服身处丛林的宇航员、火星上的“FLUX”巨型雕塑、泛舟的金发女子、头戴棕色电视的赛博朋克男子、白色房间中的书籍,以及街头的女性群体等图像。这些图像色彩风格各异,有的色调冷峻,有的鲜艳逼真,展现出Flux.1 dev在图像生成上的多样性,与上文提到的Flux.1 dev不同模型版本对比的内容相契合。

来欣赏一些用Flux.1 Pro生成的令人惊叹的示例图像吧。让我们从人物图像开始,重点关注发丝、皱纹、手指和四肢等细节。

图片展示了三位年轻女性在城市街道上的合影。她们穿着白色、浅棕色背心及蓝色牛仔裤,面带微笑,同时伸出手掌朝向镜头。背景中可看到两旁的建筑、街道上的行人和绿树,整体氛围轻松愉悦。此图是用Flux.1 Pro生成的人物图像示例,位于文档中介绍Flux.1 Pro生成人物图像,强调发丝、手指等细节精度的上下文部分,用以直观呈现该模型在人物图像生成方面的效果。

图片展示的是一张由Flux.1 Pro生成的人物图像。画面中是一位面带微笑的长发女性,她伸出手掌朝向镜头,手掌上写着“I AM NOT REAL”。这张图像作为用Flux.1 Pro生成的示例图像之一,出现在介绍其生成人物图像能力的段落中,用以体现其生成图像的逼真程度,展示了发丝、手掌细节等,配合文本说明其生成图像效果令人惊叹,不说明的话很难看出是AI生成的图像。

图片展示了一位坐在车内的金发女子,她手持一张白纸,纸上写着“I am not real.”。女子面带微笑看向镜头,背景中还能看到另一位表情平静的女性和车外景象。这张图片是用Flux.1 Pro生成的人物图像示例,位于介绍用Flux.1 Pro生成的令人惊叹的示例图像部分,用以展示其生成人物图像的逼真效果,体现了该模型在人物细节呈现上的高水平,让人难以分辨是AI生成还是真实照片。

人物特征如发丝、皱纹和手指的细节精度都非常丝滑。这效果有点哇塞?

下面这几张写实照片更炸裂,图像是如此逼真,logo 都非常完美。是在 X 上分享的一些最逼真的自拍肖像。如果我不讲,你能看出来它是 AI 吗?

图片是一张由Flux.1 Pro生成的人物写实照片,展示了一位穿着红色背心的男性。他有着金色的头发,面部细节清晰,皮肤质感真实,眼神专注。背景是蓝天和远处模糊的山丘,整体图像逼真。这张图片处于文档中介绍Flux.1 Pro生成人物图像效果的位置,用于直观展示其在发丝、皮肤等人物特征细节上的高精度表现,以证明其生成图像的逼真程度。

图片展示了一位在海滩上的年轻女性,她扎着马尾,发丝随风飘动,戴着白色太阳镜,身穿粉色背心,背心上有阿迪达斯和其他标志。她戴着项链,背景是蓝色的大海和沙滩,远处还有一些模糊的人影。这张图片是用Flux.1 Pro生成的人物图像示例,位于介绍用Flux.1 Pro生成的令人惊叹示例图像的段落中,用于展示其在人物细节呈现上的出色效果。

图片展示的是一张由Flux.1 Pro生成的写实人物照片。画面中是一位面带笑容的女性,她戴着酒红色的帽子,穿着带有奥运标志的黑色外套,头发随风飘动,帽子和外套上有一些雪。背景是一片雪景,远处山峦模糊。这张图片与上下文的关系是,作为用Flux.1 Pro生成的令人惊叹的示例图像之一,展示其生成的人物图像的逼真效果,以体现其在视觉质量等方面的优势。

使用 Flux 画一些有年代感的照片。

图片为X平台上用户Pietro Schirano分享的用Flux.1 pro制作的AI照片。配文称这些是“2015年左右无聊的Snapchat照片”。图片展示了三张照片,分别是一位穿着白色字母上衣和牛仔短裤站在草地上的女孩、室内背景下的人物场景、一位穿着灰色上衣的女孩自拍。这些照片呈现出有年代感的风格,与文档中提到使用Flux画有年代感照片的上下文相呼应,展示了Flux.1 pro在生成特定风格图像方面的能力。

图片为使用Flux.1生成的一张有年代感的照片。画面呈现一位坐在车内的年轻女性,她留着黑色的个性发型,穿着黑色带灰色领口的上衣,佩戴着黑色项圈等饰品。图片上方是两条推文,Kiri的推文内容为“请生成一张2006年MySpace的情绪风格头像”,Grok进行了回应。此图对应文档中“使用Flux画一些有年代感的照片”的上下文内容,展示了Flux.1在生成特定风格图像方面的能力。

图片是一张自拍肖像,展现了一位面带微笑的女性。她穿着一件灰色上衣,衣服上有白色和红色图案。背景是室内环境,能看到门和墙壁。此图片位于介绍用Flux.1 Pro生成图像示例的段落中,是用来展示其生成的写实自拍肖像效果,以体现Flux.1 Pro生成图像的逼真度,呼应前文提到的其生成图像逼真,如不讲可能难以看出是AI生成内容的描述。

这是一张由Flux.1 Pro生成的写实自拍肖像图片。画面中是一名男性,他留着胡须,头发短而整齐,穿着灰色的上衣。背景中可以看到室内的一些陈设,包括家具和电器等。图片处于介绍用Flux.1 Pro生成的写实照片部分,用于展示其生成图像的逼真效果,以体现该模型在人物细节呈现上的能力,如人物面部特征等细节都较为清晰,突出其生成图像能达到以假乱真的水平。

图片展示的是一张自拍肖像,由Flux.1 Pro生成。画面中是一位手持黑色手机的女性,她有着棕色的头发,穿着粉色背心,正在对着镜子自拍。这张图片位于介绍用Flux.1 Pro生成的写实照片段落中,用于展示其生成的自拍肖像的逼真效果,以体现该模型生成图像时在人物细节呈现上的出色能力,突出其生成图像的高逼真度和细节精度。

也可以尝试训练不同年龄的Flux模型:

图片展示的是一张用Flux.1 Pro生成的人物图像示例。画面中是一个小男孩,有着蓬松的金色头发,身穿白色无袖上衣和蓝色牛仔裤,正面带笑容伸出一只手。背景是户外地面,有白色圆圈图案。此图位于介绍用Flux.1 Pro生成的人物图像示例处,上下文提到关注发丝、皱纹、手指和四肢等细节,这张图片正是用来展示其在人物图像生成方面的效果,体现了该模型在细节呈现上的能力。

图片展示了一位穿着白色T恤的年轻男子,他有着卷曲的棕色头发,面带微笑,背景为浅色墙面。此图位于介绍使用Flux画有年代感照片及尝试训练不同年龄Flux模型的上下文之间,可能是用Flux.1 Pro生成的人物图像示例,用于展示其在人物细节表现上的能力,如发丝等细节呈现较好,以例证Flux.1 Pro在生成图像方面的出色效果。

图片展示的是一张由Flux.1 Pro生成的写实人物肖像。画面中是一位穿着白色T恤的男子,他有着金色卷发和灰胡须,面带微笑看向镜头。图片位于介绍用Flux.1 Pro生成的人物图像内容处,用以展现其在人物细节处理上的能力,如发丝、皱纹等细节精度丝滑,突出了Flux.1 Pro在生成逼真人物图像方面的强大效果。

图片展示的是一张由Flux.1 Pro生成的人物肖像。画面中是一位穿着白色T恤的男子,他有着浅色头发和胡须,正面带微笑看向镜头。此图位于“也可以尝试训练不同年龄的Flux模型”这一上下文之后,作为Flux.1 Pro生成图像的示例,展现了该模型在人物图像生成上的效果,通过男子的发丝、胡须等细节,体现出模型在人物特征细节处理方面的能力。

作为一个尝试过各种AI绘画工具的人来讲,我可以自信地说,这些是我见过的最逼真的AI生成肖像。

只有图片哪够?我们还可以通过可灵或者 Gen-3 将图片转为动态视频,并开口讲话。看看下面这些视频案例:

用+ Flux + 可灵 + synclabs 做一个 100% AI YouTuber

UnionControlnet 模型

InstantX 发布了 FLUX 的 UnionControlnet 模型。

图片展示了两条推文及相关信息。上方推文由Frank (Haofan) Wang于8月8日发布,称制作了FLUX的Canny ControlNet(预览版),并给出了Hugging Face上的模型链接。下方推文同样来自Frank,提到扩散器的支持也将很快就绪,还展示了huggingface/diffusers库中关于“[FLUX] Support ControlNet”的#9126相关内容。图片与上文提到的InstantX发布FLUX的UnionControlnet模型相呼应,进一步说明了其中Canny Controlnet模型的情况。

这一个模型集合了 Canny、Depth、Pose、Tile 等多个 Controlnet 模型。

而且他们已经新建了 FLUX IPadapter 模型的文件页面,可能已经在训练了。

模型下载:https://huggingface.co/InstantX/FLUX.1-dev-Controlnet-Union-alpha

图片展示了InstantX发布的FLUX的UnionControlnet模型效果示例。左侧从左至右、从上到下依次展示了Canny、Depth、Pose、Low Quality的输入图像及对应控制图,右侧则是Tile、Blur、Gray等效果的输入和输出图像对比。图像中的女性人物穿着橙色外套,不同模型产生了线条、深度、姿态等各异的控制效果及风格变化。此图直观呈现了该模型集合Canny、Depth、Pose等多个Controlnet模型的特点,与上文对该模型的介绍相呼应。

图片展示了两张图像,左侧是一只橘猫在厨房中跃起抓鱼的场景,姿态灵动。右侧是一个人物跃起抓球的黑色剪影,动作舒展。图片位于介绍InstantX发布的FLUX的UnionControlnet模型的内容之后,可能是用于展示该模型在处理姿态等方面图像时的效果示例,以直观呈现其功能特性,帮助读者更好地理解UnionControlnet模型集合了Canny、Depth、Pose、Tile等多个Controlnet模型这一特点。

如何使用 Flux.1

对于那些渴望尝试 Flux.1 的人来说,有几个工具可以选择:

Replicate

Replicate是一个基于云的平台,允许用户运行和微调机器学习 (ML) 模型,包括开源和自定义模型。

要使用 Flux.1,请访问 Blackforest Lab 的 Replicate 页面,将在其中看到列出的三个 Flux 模型。选择你想要测试的一项。请注意,只有 Schnell 模型可以免费访问。

图片展示的是Replicate平台的界面。界面上方有“Welcome to Replicate!”的欢迎语,下方有“Set up billing”“Run AI models on API”等操作提示。右侧区域显示了多个模型相关内容,如“Flux.1 - The new...”等。下方还有“Recent predictions”板块,列出了一些预测记录。此图与上下文相关,上下文介绍了使用Flux.1可选择的工具,其中提到Replicate平台,此图即该平台界面,辅助说明在Replicate平台使用Flux.1的场景。

图片展示了一块黑森林蛋糕,蛋糕上用巧克力块拼出“FLUX SCHNELL”字样,表面撒有糖粉。蛋糕放置在白色托盘上,周围散落着几颗草莓和黑加仑等浆果。图片与上文提到的Flux.1模型相关,是使用Flux.1模型,依据“黑森林蛋糕拼出‘FLUX SCHNELL’字样,美味,美食摄影,动态拍摄”的提示词所生成的美食摄影作品,展示了该模型的图像生成能力。

提示词:黑森林蛋糕拼出“FLUX SCHNELL”字样,美味,美食摄影,动态拍摄

Fal AI

Fal.ai 是一个面向开发者的生成媒体平台,为应用程序提供人工智能推理 API。它也是测试 Flux.1 等多模式模型的绝佳平台。最开始有一定的免费使用额度。

图片展示的是Fal AI平台界面。界面左侧是“Model Category”,有Image to Image等多种模式选项,还有“Model Features”相关设置。界面右侧展示了多个模型生成的图像示例,包括AnimeFlow、FLUX 1 (fake)、FLUX 1 (real)等模型的作品,图像风格多样,色彩绚丽。该图片与上文介绍Fal AI是测试Flux.1等多模式模型的平台相呼应,直观呈现了平台上的模型及生成图像情况。

图片展示的是在Fal AI平台测试Flux.1的界面截图。左侧为输入区域,有一段人物描述的提示词,如 “A charismatic speaker is captured mid - speech...” ,并设有图像尺寸、推理步数等附加设置选项。右侧为结果展示区域,显示一位男性手持麦克风演讲的图像,其背景有“V - Ray”字样。Fal.ai是面向开发者的生成媒体平台,提供人工智能推理API,是测试Flux.1等多模式模型的平台,开始有一定免费使用额度。

HuggingFace

HuggingFace 是一个开源平台,允许用户创建、训练和部署机器学习 (ML) 和自然语言处理 (NLP) 模型。这是一个面向 AI 专家和爱好者的社区,类似于 GitHub for AI。

要在 Hugging Face 上尝试 Flux.1,请创建一个帐户并打开 Flux.1 Schnell 的空间。

图片展示了在Hugging Face平台的[Flux.1 Schnell](https://huggingface.co/black-forest-labs/FLUX.1-schnell)空间中,使用Flux.1生成图像的界面及结果。界面上方显示空间名称,下方输入框内提示词为“一幅宇航员在太空中骑马的图像”,下方展示了生成的图像,画面中一位宇航员身着宇航服骑在马上,背景是太空中的星球,展示了Flux.1的图像生成能力,与上文介绍在Hugging Face上尝试Flux.1的内容相呼应。

提示词:一幅宇航员在太空中骑马的图像

Liblib

这是在 Liblib 中使用 Flux 的截图示例:

图片展示了在Liblib网站中使用Flux的截图示例。左侧界面是参数设置区域,有各种选项和输入框,如生成数量、随机种子等。右侧是生成的图像,是一位穿着婚纱的20岁欧洲女孩,画面呈现电影照片风格,35mm胶片效果,有散景,显示为专业的4k高度详细图像。这与文档中“电影照片一个20岁的欧洲女孩,精致美丽……婚纱”的提示词相呼应,直观呈现了Flux在Liblib平台上依据提示词的生成效果。

提示词:电影照片一个20岁的欧洲女孩,精致美丽,looking_at_viewer,cowboy_shot,<lora:婚纱: 1>,婚纱,.35mm照片,胶片,散景,专业,4k,高度详细,

ComfyUI | 仙宫云

这是在 仙宫云 中使用 ComfyUI 使用 Flux 的截图示例:

图片展示的是仙宫云平台中“行者AI绘画视频ComfyUI镜像”的相关信息。镜像名称为ComfyUI(280G 镜像),于 0813 日更新,内含 FLUX.1 +7 风格 Lora 及多个常用工作流。镜像大小为 286.28 GB,每小时镜像费用为 0.20 元,可点击“立即部署”操作。镜像作者是行者,最后更新于 2024 - 08 - 15,为仙宫云认证创作者。该镜像整合了 Flux、LivePortrait 等热门插件,还内置如一个女孩的一生等常用工作流。此图为在仙宫云中使用 ComfyUI 使用 Flux 的相关示例内容之一。

这是在仙宫云中使用ComfyUI调用Flux的截图示例。画面左侧是节点连接操作区域,有多个节点通过线条相连,部分节点带有文字信息。右侧是图像显示区域,主图为一位女性坐在麦克风前,背景有城市夜景。下方还排列着多张人物图像,展示了不同的人物姿态。此图直观呈现了在仙宫云平台借助ComfyUI使用Flux进行图像生成相关操作及生成结果的情况。

API

你也可以通过 API 访问 Flux.1 Pro。目前它处于预览模式,有一些限制:

只有特定合作伙伴的账户才能激活。

API 目前还不稳定,可能会有变动。

下面是一个Python代码示例:

import os
import requests

request = requests.post(
    'https://api.bfl.ml/v1/image',
    headers={
        'accept': 'application/json',
        'x-key': os.environ.get("BFL_API_KEY"),
        'Content-Type': 'application/json',
    },
    json={
        'prompt': 'A cat on its back legs running like a human is holding a big silver fish with its arms. The cat is running away from the shop owner and has a panicked look on his face. The scene is situated in a crowded market.',
        'width': 1024,
        'height': 1024,
    },
).json()
print(request)
request_id = request["id"]

请注意,向 /v1/image 发送请求的并发数限制为 12 个。如果超出限制,API 会返回 429 状态码,你必须等到之前的任务完成才能继续。

商业用途和许可

现在,有些人可能会问,我可以出售或发布这些图像用于商业目的吗?答案是可以,也可能不行,取决于你使用的模型版本。

Flux.1 Pro支持 Flux.1 Pro 的商业使用,但目前只能通过 Replicate 和 Fal.ai 等平台,由特定合作伙伴访问该模型。

Flux.1 Dev:图像的使用仅限于非商业目的,这意味着你不能销售或发布该模型生成的图像来获取商业利益。

Flux.1 Schnell:在Apache 2.0许可下公开发布,使用上更加灵活。你可以将 Flux.1 Schnell 用于个人和商业用途,只要遵守Apache 2.0许可的条款即可。

总而言之,如果你想将 Flux.1 模型用于商业目的,Flux.1 Pro 和 Flux.1 Schnell 是最佳选择。Flux.1 Pro 通过特定合作关系提供最高质量,而 Flux.1 Schnell 在开源许可下提供了更方便的使用方案。


祝各位玩的开心,如果本文对你有帮助,欢迎点赞。

参考链接:

https://x.com/BenjaminDEKR/status/1822076680858378481

https://x.com/levelsio/status/1823471315635888210

https://x.com/skirano/status/1819444885943914688