
最近一周时间,OpenAI 发布了 GPT-Image 2.0,相信大家都被它刷屏了。
我第一时间试了一下。
然后我做了一个决定:必须把它安装到我的 OpenClaw 里。
为什么?因为这不是一个"图更漂亮"的升级,只因为它太强了。
验证排名有多强
看到 GPT image 2 在 LMArena 的排名得分——1512 ,领先第二名Nano Banana 242 分——我有点怀疑。

数字好看,但实际能用吗?
我打开 ChatGPT,先试了一个最直接的场景。
画一个 Sam 在抖音直播间带货 GPT 的图片,比例为 9:16

很快,一张完整的直播间场景就出来了。直播场景逼真,奥特曼人物自然,整个画面看起来像是真实的直播截图。
这一刻我就知道,这个模型不一样。
再试试文本渲染
既然场景生成这么强,我想看看它在文本渲染上的表现。
生成一张高级餐厅菜单海报
- 餐厅名称:"Ember & Oak"
- 12 道菜品,包含名称和价格
- 风格:优雅、极简、金色点缀
- 文字必须清晰可读
- 宽高比:3:4

很快,我看到了一张完整的、文字清晰的、可以直接印刷的菜单海报。
没有错别字。没有模糊的标签。没有"重复生成"的痛苦抽卡。
这是我用过的所有图像生成模型里,第一次看到这样的结果。
人物形象生成
既然文本渲染这么强,我想看看它在人物形象生成上的表现。
再帮我画一个 18 岁中国美女吃香蕉的图,配文是,香蕉已经不香了,还是 GPT image 2 香🤔,9:16 的比例

人物形象逼真,表情自然,文字排版完美。这不仅仅是生成了一张图,而是生成了一个完整的、可以直接用于营销的内容。
多人物融合和一致性
如果我一次生成多张图,它能保持人物的一致性吗?我上传了两张参考图片。一张我自己的图,一张AI美女的图。

然后我给它一个提示词:
帮我基于刚刚上传的两张图片,重新生成一张合影,他俩在演唱会现场,一起演奏。比例为9:16

两个人物的特征都被保留了,在同一个场景中自然地出现,演奏的姿态逼真,整个画面看起来像是真实的演唱会现场。
GPT-Image 2.0 能够理解参考图片中的人物特征,并在新的场景中保持一致性。这对做内容创作、品牌宣传、社交媒体素材的人来说,是一个革命性的改变。
太强了,我决定让龙虾也用上它
但这还不够。
我开始想,如果每次都要手动打开 ChatGPT,写提示词,等待生成,这个流程还是太重了。特别是当我发现这个工具这么强的时候,我就在想——能不能让龙虾自动帮我干这件事?
一个简单的办法,可以把 GPT-Image 2.0 安装到 OpenClaw 龙虾里。
它变成 OpenClaw 的一个 Skill。这样我就不用每次都只要口述要画的图,OpenClaw 可以在我需要的时候自动调用它,生成我想要的图。
龙虾里的 Skill,每天帮我快速出图
现在我的龙虾里已经跑起来了这个 Skill,每天都在帮我生成图片。
每天早上的新闻日报
情报虾每天早上会自动抓取热点新闻,然后调用这个 Skill 生成一张汇总图。

我让它按这个风格出一版 AI 新闻日报的图。

第一次出来的时候,图片顶部还是有龙虾的图。

但这一版是 AI 相关的,不需要龙虾了,我让它换个元素。

结果很有意思——除了顶部的元素有变化,其他的几乎没什么变化。这就是 GPT-Image 2.0 和其他画图模型不一样的地方。它有上下文记忆,能理解我的修改意图,而不是每次都重新生成。
成本几毛钱一张,很快就完成了。以前这种图我要么找设计师,要么自己用工具花半小时。现在就是看一眼的事。
训练营海报
我们团队 5 月份有一期 AI+GEO 的线下训练营。以前每次都要和设计师反复沟通,改配色、改文案、改排版。
现在我把基本信息给到gpt出图,很快就出来了。



那一刻我真的有点感动——这就是我想要的工作方式。
(对 AI+GEO 感兴趣的朋友,可以扫上面的码报名。)
公司前台设计
最近我们公司想要把进门的前台重新设计一下。以前是乱糟糟的一团,现在给龙虾一个需求,几分钟之后,设计就出来了。

来访客户一进门就能看到最新的内容。这种细节,往往能决定第一印象。
看完这几个案例,我是深深体会到了——为什么最近那么多公众号文章标题都是”设计”为关键词。太强了。
如果你也想用上这个 Skill
很多朋友看到这里,肯定想知道——怎样才能让自己的龙虾也能像我这样出图?
其实很简单。我已经把这个 Skill 开源到 GitHub 上了,你可以直接安装。
请安装 放心API 画图技能,帮我使用 gpt-image-2 模型画图。
技能地址:https://github.com/metafeng/fangxin-image-gen
第二步:然后去 放心API网站拿一个AZ分组的 key
- 打开 https://fangxinapi.com 注册 / 登录。
- 在控制台创建 API Key(一串以
sk-开头的字符)。 - 建议优先使用
AZ分组下面的 key,出图稳定性明显更好;其他分组容易超时或者中途断连。

点击复制到密钥
例如:sk-xxxxxxxxx(替换为自己的)
第三步:key 写进 .env
然后把你的key给到龙虾(替换成你自己的 key):
FANGXIN_API_KEY=sk-xxxxxxxx

写完保存,下次调用脚本就会自动加载。 装好之后直接用大白话描述你想要什么,AI 会自己挑接口、配参数。下面是一些示例。
帮我画一个 18 岁中国美女吃香蕉的图,配文是,香蕉已经不香了,还是 GPT image 2 香🤔,9:16 的比例

如果遇到生成到了但是不返回图片的情况,你就直接和龙虾对话,让他给你图片。可能多反复聊几次,就发图片到聊天窗口里面了。

最后想说的
我一直觉得,真正成熟的 AI 使用者,不是那种最会喊口号的人。而是那种愿意花时间把系统打磨好的人。
因为工具的价值,不在于第一次用的时候多惊艳,而在于你三个月后、半年后、甚至一年后,还能不能继续放心地把事情交给它。
GPT-Image 2.0 也是一样。
它本身很强,但真正的价值,是当你把它吃进龙虾里,让它和其他 Agent 联动,形成一条完整的内容生产流水线的时候。
那时候,你才能真正感受到什么叫"生产力的质变"。
这就是为什么我说"这么好的口粮,必须让龙虾先吃"。
好的工具,不应该只是用。应该吃透它,变成自己的能力。
写于 2026-04-25 | 元峰
