元峰AI笔记 · Agent与自动化

我给龙虾装了个 GPT-Image 2.0 Skill,现在设计像呼吸一样简单

最近一周时间,OpenAI 发布了 GPTImage 2.0,相信大家都被它刷屏了。

image.png

最近一周时间,OpenAI 发布了 GPT-Image 2.0,相信大家都被它刷屏了。

我第一时间试了一下。

然后我做了一个决定:必须把它安装到我的 OpenClaw 里

为什么?因为这不是一个"图更漂亮"的升级,只因为它太强了。


验证排名有多强

看到 GPT image 2 在 LMArena 的排名得分——1512 ,领先第二名Nano Banana 242 分——我有点怀疑。

15cc6a5347c7fc9545a1de2cf93763bd.jpg

数字好看,但实际能用吗?

我打开 ChatGPT,先试了一个最直接的场景。

画一个 Sam 在抖音直播间带货 GPT 的图片,比例为 9:16

c7a8639e86e6b1f8dced5e97937da6.webp

很快,一张完整的直播间场景就出来了。直播场景逼真,奥特曼人物自然,整个画面看起来像是真实的直播截图。

这一刻我就知道,这个模型不一样。

再试试文本渲染

既然场景生成这么强,我想看看它在文本渲染上的表现。

生成一张高级餐厅菜单海报
- 餐厅名称:"Ember & Oak"
- 12 道菜品,包含名称和价格
- 风格:优雅、极简、金色点缀
- 文字必须清晰可读
- 宽高比:3:4

XSmVlD8DDUzZBhMBKBSpk_1536x1024_20260425_031625_raw.png

很快,我看到了一张完整的、文字清晰的、可以直接印刷的菜单海报。

没有错别字。没有模糊的标签。没有"重复生成"的痛苦抽卡。

这是我用过的所有图像生成模型里,第一次看到这样的结果。

人物形象生成

既然文本渲染这么强,我想看看它在人物形象生成上的表现。

再帮我画一个 18 岁中国美女吃香蕉的图,配文是,香蕉已经不香了,还是 GPT image 2 香🤔,9:16 的比例

img_v3_02111_811fa5d1-5f05-4dd8-92f9-5fb85db50a3g.png

人物形象逼真,表情自然,文字排版完美。这不仅仅是生成了一张图,而是生成了一个完整的、可以直接用于营销的内容。

多人物融合和一致性

如果我一次生成多张图,它能保持人物的一致性吗?我上传了两张参考图片。一张我自己的图,一张AI美女的图。

6968799ecece28c61236c2c1449c27b8.png

然后我给它一个提示词:

帮我基于刚刚上传的两张图片,重新生成一张合影,他俩在演唱会现场,一起演奏。比例为9:16

img_v3_02112_9e488e78-e8c5-4765-83be-028b1c96f4dg.png

两个人物的特征都被保留了,在同一个场景中自然地出现,演奏的姿态逼真,整个画面看起来像是真实的演唱会现场。

GPT-Image 2.0 能够理解参考图片中的人物特征,并在新的场景中保持一致性。这对做内容创作、品牌宣传、社交媒体素材的人来说,是一个革命性的改变。


太强了,我决定让龙虾也用上它

但这还不够。

我开始想,如果每次都要手动打开 ChatGPT,写提示词,等待生成,这个流程还是太重了。特别是当我发现这个工具这么强的时候,我就在想——能不能让龙虾自动帮我干这件事?

一个简单的办法,可以把 GPT-Image 2.0 安装到 OpenClaw 龙虾里

它变成 OpenClaw 的一个 Skill。这样我就不用每次都只要口述要画的图,OpenClaw 可以在我需要的时候自动调用它,生成我想要的图。


龙虾里的 Skill,每天帮我快速出图

现在我的龙虾里已经跑起来了这个 Skill,每天都在帮我生成图片。

每天早上的新闻日报

情报虾每天早上会自动抓取热点新闻,然后调用这个 Skill 生成一张汇总图。

b9ea42e4bf810b131ed9f6e413b283bb.jpg

我让它按这个风格出一版 AI 新闻日报的图。

eda7a806c9d13d0962c07ff9dcc3b1e0.jpg

第一次出来的时候,图片顶部还是有龙虾的图。 eda7a806c9d13d0962c07ff9dcc3b1e0.jpg

但这一版是 AI 相关的,不需要龙虾了,我让它换个元素。 1434ff08fbe22fca158f7577b1f36dbf.jpg

结果很有意思——除了顶部的元素有变化,其他的几乎没什么变化。这就是 GPT-Image 2.0 和其他画图模型不一样的地方。它有上下文记忆,能理解我的修改意图,而不是每次都重新生成。

成本几毛钱一张,很快就完成了。以前这种图我要么找设计师,要么自己用工具花半小时。现在就是看一眼的事。

训练营海报

我们团队 5 月份有一期 AI+GEO 的线下训练营。以前每次都要和设计师反复沟通,改配色、改文案、改排版。

现在我把基本信息给到gpt出图,很快就出来了。

125344a2444a3d03d9f8d6a2d10f364a.png

2f53a235fbac6d501eaadc1faae282ca.png

线下课易拉宝带二维码.png

那一刻我真的有点感动——这就是我想要的工作方式。

(对 AI+GEO 感兴趣的朋友,可以扫上面的码报名。)

公司前台设计

最近我们公司想要把进门的前台重新设计一下。以前是乱糟糟的一团,现在给龙虾一个需求,几分钟之后,设计就出来了。

720b26537947c57fa62f0c095b7d8910.png

来访客户一进门就能看到最新的内容。这种细节,往往能决定第一印象。

看完这几个案例,我是深深体会到了——为什么最近那么多公众号文章标题都是”设计”为关键词。太强了。

如果你也想用上这个 Skill

很多朋友看到这里,肯定想知道——怎样才能让自己的龙虾也能像我这样出图?

其实很简单。我已经把这个 Skill 开源到 GitHub 上了,你可以直接安装。

请安装 放心API 画图技能,帮我使用 gpt-image-2 模型画图。
技能地址:https://github.com/metafeng/fangxin-image-gen

第二步:然后去 放心API网站拿一个AZ分组的 key

  1. 打开 https://fangxinapi.com 注册 / 登录。
  2. 在控制台创建 API Key(一串以 sk- 开头的字符)。
  3. 建议优先使用 AZ 分组下面的 key,出图稳定性明显更好;其他分组容易超时或者中途断连。

image.png image.png

点击复制到密钥

例如:sk-xxxxxxxxx(替换为自己的) image.png

第三步:key 写进 .env

然后把你的key给到龙虾(替换成你自己的 key):

FANGXIN_API_KEY=sk-xxxxxxxx

image.png

写完保存,下次调用脚本就会自动加载。 装好之后直接用大白话描述你想要什么,AI 会自己挑接口、配参数。下面是一些示例。

帮我画一个 18 岁中国美女吃香蕉的图,配文是,香蕉已经不香了,还是 GPT image 2 香🤔,9:16 的比例

image.png

如果遇到生成到了但是不返回图片的情况,你就直接和龙虾对话,让他给你图片。可能多反复聊几次,就发图片到聊天窗口里面了。

image.png

最后想说的

我一直觉得,真正成熟的 AI 使用者,不是那种最会喊口号的人。而是那种愿意花时间把系统打磨好的人。

因为工具的价值,不在于第一次用的时候多惊艳,而在于你三个月后、半年后、甚至一年后,还能不能继续放心地把事情交给它。

GPT-Image 2.0 也是一样。

它本身很强,但真正的价值,是当你把它吃进龙虾里,让它和其他 Agent 联动,形成一条完整的内容生产流水线的时候。

那时候,你才能真正感受到什么叫"生产力的质变"。

这就是为什么我说"这么好的口粮,必须让龙虾先吃"。

好的工具,不应该只是用。应该吃透它,变成自己的能力


写于 2026-04-25 | 元峰