元峰AI笔记 · AI绘画与视频

实测案例

<titleNano Banana Pro 上线了</title

Nano Banana Pro 上线了

全网首发,备受期待的 Nano banana Pro 终于上线了!

图片为谷歌DeepMind官方推文,宣布发布Nano Banana Pro,基于Gemini 3构建。推文提到凭借先进文本渲染、丰富世界知识及创意控制,Gemini 3 Pro Image可创建复杂视觉效果、信息图表等。下方展示了Nano Banana Pro的视频演示,包含多个场景画面,如紫色背景的图像、人物肖像、建筑模型等,还配有“Hope”字样。该图片与文档中介绍Nano Banana Pro上线的内容相呼应,直观呈现了其功能。

图片展示的是Google Cloud平台中Gemini 3 Pro Image Preview的页面。页面上方有“Start your Free Trial with $300 in credit”等信息。中间部分介绍Gemini 3 Pro Image,称其为标准模型升级版,适用于快速创意工作流,具备图像生成和对话式、多轮编辑能力。下方有“Open in Vertex AI Studio”和“View Code”按钮,右侧列出Model ID、Version name等信息。底部有“Latest”“Overview”“Documentation”等标签,还提供了“Generation”“Extraction”“Recognition”等功能选项。

官方博客:https://console.cloud.google.com/vertex-ai/publishers/google/model-garden/gemini-3-pro-image-preview?pli=1

图片展示了Gemini 3 Pro Image的模型分析报告。核心概览中提到推理能力强、多模态专家、4K分辨率等。模型参数方面,Token固定为1024 Token,支持上下文模式。功能特性包括Grounding、交互生成、指令理解等。限制与状态方面,功能暂未开放,测试版本资源ID为“gemini-3-pro-image-preview”,有效期至2025 - 11 - 20。开发接入有Vertex AI Studio、Python SDK、cURL/REST等。模型家族为Gemini 2.5 Flash Image、Gemini 3 Pro Image。

分享几个可以快速使用的平台。

ZenMux

这个平台已经接入了, https://zenmux.ai?invite_code=ICJUtabv14633765 目前免费用,快薅。

图片展示的是ZenMux平台界面,左侧有Studio、Analysis、Cost、Usage、Insurance等导航栏。右侧显示“Google: Gemini 3 Pro Image (Nano Banana Pro) Free”模型信息,包括模型类型、输出类型、上下文长度、最大输出长度等参数,还显示了可用提供商数量及可用时间。该图片与文档中介绍ZenMux平台接入Nano Banana Pro模型的内容相关,直观呈现了平台上的模型展示情况。

图片展示了ZenMux平台的界面,中央大幅显示一张女孩怀抱玩偶的图片,女孩穿紫色上衣和白色裙子,玩偶黑色,背景为淡紫色,上方有字母“A”和“ANNISA”。界面上方有“Thank you for choosing our service. Add credits today to receive an additional 20% bonus. Add Credits”的提示。该图片与上文提到的Nano Banana Pro已接入ZenMux平台相呼应,直观呈现了ZenMux平台的操作界面及其中展示的内容。

flowithOS

flowithOS 里面也已经上线了,可以免费薅。

https://try.flowith.io/flowithos

图片展示了Nano Banana Pro平台的界面。界面顶部有“Flow mode”字样,下方有多个板块,每个板块包含文字说明和图片。其中“香蕉计划”板块以紫色背景突出显示,其下方有“香蕉计划”字样。界面底部有一个输入框,显示“正在等待处理...”。该图片与文档中介绍Nano Banana Pro上线的内容相关,直观呈现了平台的界面布局及部分板块样式。

ListenHub

ListenHub第一时间接入,并做了一个产品 Banana Lab。

链接:https://banana.listenhub.ai

公开:加入 Case 库(20 张/日);私密(默认):仅自己可见(10 张/日)。

图片展示的是ListenHub产品Banana Lab的界面。界面上方显示“Banana Lab”及“Powered by Listenium,the world's best AI podcast generator”,并有“打开 Listenium”按钮。中间部分有“生成”按钮,下方有“图像编辑”和“文本生成”选项卡,当前选中“文本生成”。下方有“描述”输入框,提示可输入400字,超字数可使用ChatGPT。还有“风格”“语言”“可编辑”等下拉选择框,以及“生成”按钮。该图片与文档中介绍ListenHub第一时间接入Banana Lab的内容相关,展示了其功能界面。

图片展示的是ListenHub接入Banana Pro后,其产品Banana Lab的界面。左侧有“我的作品”“搜索”“案例库”等选项,当前选中“我的作品”。右侧是作品展示区域,有“搜索记录”和“任意系列”选项,下方展示了多张作品图片,如“姬”“夜”“幻”等,每张图片下方有作品名称、作者及点赞数等信息。该图片与文档中ListenHub接入Banana Pro并做产品Banana Lab的内容相关,直观呈现了其作品展示情况。

实测案例

第1组:出师表分镜图

先帝创业未半而中道崩殂,今天下三分,益州疲弊,此诚危急存亡之秋也。然侍卫之臣不懈于内,忠志之士忘身于外者,盖追先帝之殊遇,欲报之于陛下也。诚宜开张圣听,以光先帝遗德,恢弘志士之气,不宜妄自菲薄,引喻失义,以塞忠谏之路也。   宫中府中,俱为一体;陟罚臧否,不宜异同。若有作奸犯科及为忠善者,宜付有司论其刑赏,以昭陛下平明之理,不宜偏私,使内外异法也。   侍中、侍郎郭攸之、费祎、董允等,此皆良实,志虑忠纯,是以先帝简拔以遗陛下。愚以为宫中之事,事无大小,悉以咨之,然后施行,必能裨补阙漏,有所广益。   将军向宠,性行淑均,晓畅军事,试用于昔日,先帝称之曰能,是以众议举宠为督。愚以为营中之事,悉以咨之,必能使行阵和睦,优劣得所。   亲贤臣,远小人,此先汉所以兴隆也;亲小人,远贤臣,此后汉所以倾颓也。先帝在时,每与臣论此事,未尝不叹息痛恨于桓、灵也。侍中、尚书、长史、参军,此悉贞良死节之臣,愿陛下亲之信之,则汉室之隆,可计日而待也。   臣本布衣,躬耕于南阳,苟全性命于乱世,不求闻达于诸侯。先帝不以臣卑鄙,猥自枉屈,三顾臣于草庐之中,咨臣以当世之事,由是感激,遂许先帝以驱驰。后值倾覆,受任于败军之际,奉命于危难之间,尔来二十有一年矣。   先帝知臣谨慎,故临崩寄臣以大事也。受命以来,夙夜忧叹,恐托付不效,以伤先帝之明;故五月渡泸,深入不毛。今南方已定,兵甲已足,当奖率三军,北定中原,庶竭驽钝,攘除奸凶,兴复汉室,还于旧都。此臣所以报先帝而忠陛下之职分也。至于斟酌损益,进尽忠言,则攸之、祎、允之任也。   愿陛下托臣以讨贼兴复之效,不效,则治臣之罪,以告先帝之灵。若无兴德之言,则责攸之、祎、允等之慢,以彰其咎;陛下亦宜自谋,以咨诹善道,察纳雅言,深追先帝遗诏。臣不胜受恩感激。今当远离,临表涕零,不知所言。

根据上面的文章,生成分镜图。

图片为《出师表》分镜图,以古代中国地图为背景,呈现诸葛亮向刘禅上表的场景。画面中诸葛亮身着深色长袍,坐在床榻上,刘禅则跪于床前。周围有文臣武将、士兵等人物,或在讨论,或在行礼。图中还配有相关文字,如“先帝创业未半而中道崩殂,今天下三分,益州疲弊,此诚危急存亡之秋也...”等,与《出师表》内容相契合,直观呈现了表文中的关键情节。

图片为《前出师表》分镜图,共九格画面。首格是诸葛亮写《出师表》;第二格是诸葛亮在宫中与人讨论;第三格是诸葛亮在亲贤臣、远小人;第四格是诸葛亮在草庐中与刘备商议;第五格是诸葛亮北定中原;第六格是诸葛亮向后主刘禅辞行;第七格是诸葛亮与后主刘禅交谈;第八格是诸葛亮骑马出征;第九格是诸葛亮远去,不知所言。此图与文档中介绍的《前出师表》内容相契合,以分镜形式呈现故事场景。

第2组:长文古画

Prompt: 生成一幅 4K 古画,画上写着:明月几时有?把酒问青天。不知天上宫阙,今夕是何年。我欲乘风归去,又恐琼楼玉宇,高处不胜寒。起舞弄清影,何似在人间。转朱阁,低绮户,照无眠。不应有恨,何事长向别时圆?人有悲欢离合,月有阴晴圆缺,此事古难全。但愿人长久,千里共婵娟。

图片展示了一幅古画,画面右侧有两人在月下起舞,左侧是古风建筑。画面上方有苏轼的《水调歌头·明月几时有》全文,诗中表达了对月的赞美与对人间美好生活的向往。该图片位于“第3组:封神归来:其他AI模型全都给我跪下!”内容之后,可能是作为该组内容的背景或插图,与AI绘画大模型的展示相呼应,体现古风文化元素。

第3组:封神归来:其他 AI模型全都给我跪下!

封神归来:其他 AI模型全都给我跪下! 下图提示词:这张图王座上备注上Nano Banana Pro,下跪人的头上分别是ChatGPT,即梦4.0,Claude,Mindjourney,SD,Adobe Firefly,文心一格,千问等AI绘画大模型。

图片展示的是Nano Banana Pro上线后的实测案例中,第2组“长文古画”生成的古画画面。画面中,一位身穿黄色长袍、戴着王冠的人物坐在宝座上,宝座周围有“NANO BANANA PRO”“封神归来”等文字。宝座下方,ChatGPT、Claude、Adobe Firefly等AI模型人物跪拜,画面底部写着“其他AI模型全都给我跪下!”。该图片直观呈现了Nano Banana Pro在古画生成方面的效果。

第4组:聊天界面生成

Prompt: 生成两张竖版的微信群聊天界面截图,群成员正在讨论 Nano Banana Pro 的发布。

图片展示了Nano Banana Pro上线后,群成员围绕其发布进行讨论的聊天界面截图。左侧显示群成员对Nano Banana Pro发布表示期待,如“终于来了!”“哇!”,并有链接分享。右侧呈现了用Nano Banana Pro制作的聊天界面截图,群成员对其细节表示赞赏,如“疯狂的好!”“细节简直疯狂”。图片直观呈现了文档中关于聊天界面生成测试的实测案例,体现了群成员对Nano Banana Pro发布及功能的积极反馈。

图片展示了两张微信群聊界面截图,主题为“AI Art & Tech Talk”。左侧截图中,AI News Bot发布链接,称谷歌宣布Nano Banana Pro发布,是下一代超逼真、超写实的AI图像生成。下方用户纷纷点赞、评论。右侧截图中,Artistic Soul发布一张画作,称用Nano Banana Pro制作,细节令人惊叹,群成员如Developer Dan、Meme Master等对其表示赞赏。该图片与文档中“第4组:聊天界面生成”内容相关,展示了基于Prompt生成的微信群聊界面截图。

第5组:太阳系图表(测试物理逻辑)

Prompt: "给我展示一个太阳系图表,并用中文给每个行星标注一个有趣的事实

图片展示了一个太阳系图表,背景为黑色,太阳位于中心,周围环绕着八大行星。行星按距离太阳由近及远依次为水星、金星、地球、火星、木星、土星、天王星、海王星,每个行星旁配有其英文名称及简要介绍。如水星是太阳系中最小的行星,表面温度可达到430℃;金星是太阳系中最热的行星,表面温度比水星还高;地球是目前已有记载的唯一有生物生存的行星等。该图与文档中“第5组:太阳系图表(测试物理逻辑)”的Prompt相契合。

第6组:古诗词意境 (测试中文理解与抽象审美)

Prompt: "基于唐诗'大漠孤烟直,长河落日圆'生成一幅画面。广阔无垠的金色沙漠,地平线处有一轮巨大的红色夕阳。远处有一缕笔直的白色烟雾升腾。画面要有油画般的厚重质感,光影层次丰富,展现出苍凉而壮阔的史诗感。"

图片展示了一幅油画风格的沙漠景象。画面中,一轮巨大的红色夕阳悬于天际,地平线处有笔直的白色烟雾升腾。沙漠广阔无垠,沙丘起伏,一条蜿蜒的河流穿行其间。近处,几只骆驼和一个帐篷点缀在画面中,帐篷旁有火光。画面整体色调以暖色为主,光影层次丰富,展现出苍凉而壮阔的史诗感,与文档中基于唐诗“大漠孤烟直,长河落日圆”生成的画面描述相契合。

第7组:超写实微距美食 (测试纹理与食欲感)

Prompt: "一碗极具食欲的四川红油火锅特写。镜头聚焦在翻滚的红油汤底上,可以看到花椒颗粒和鲜红的干辣椒浮动。夹起的一片极薄的雪花肥牛沾满了汤汁,并在灯光下闪着油润的光泽。蒸汽腾腾,4k微距摄影,浅景深。"

图片展示了一锅正在煮的火锅,锅中红油翻滚,漂浮着红辣椒、花椒等调料。画面前景中,一双筷子夹起一片肉,肉片上清晰可见纹理,表面有芝麻点缀。火锅上方有热气腾腾的蒸汽,锅边还放着一个透明玻璃杯。图片与文档中“第7组:超写实微距美食(测试纹理与食欲感)”的测试内容相关,直观呈现了超写实微距美食的效果,强调了纹理与食欲感的呈现。

第8组:逻辑与空间嵌套测试(套娃挑战)

Prompt: "一个晶莹剔透的玻璃水晶球,放在粗糙的旧木桌上。水晶球内部漂浮着一个微缩的宇宙,可以看到旋转的星系和星云。而在那个微缩宇宙的中心,有一个更小的红色苹果。光线穿过水晶球,在木桌上投射出彩虹般的焦散光斑,同时准确地倒映出水晶球内的星系。"

图片展示了一幅超现实主义画作,画面中一个透明的水晶球悬浮在木质桌面上,内部漂浮着一个红色苹果,周围环绕着旋转的星系和星云。水晶球在木桌上投射出彩虹般的焦散光斑,同时准确地倒映出内部的星系。这幅画作与上下文提到的“超写实微距美食(测试纹理与食欲感)”相呼应,体现了超现实主义风格与微缩宇宙概念的结合。

第9组:抽象概念与悖论测试(埃舍尔风格)

Prompt: "一幅超现实主义的画作。一条由流动的液态水构成的莫比乌斯环(Mobius Strip),悬浮在空中。水流在没有重力的情况下无限循环流动。由于是莫比乌斯环,水流既在内侧也在外侧。几条金鱼正在这反重力的水流中游动。背景是白色的虚无空间。"

图片展示了一幅艺术画作,画面主体是一个由蓝色、白色和黄色交织的水波纹构成的环形结构,环内有五条橙色的金鱼游动。这幅画作位于文档中“第10组:中文文字生成测试(OCR杀手)”部分的Prompt示例之前,可能是作为示例图片,用于展示艺术作品或与文字生成测试相关联,为后续文字生成测试提供视觉参考。

第10组:中文文字生成测试(OCR 杀手)

Prompt: "一张赛博朋克风格的街道照片,夜景。画面正中央有一个巨大的、破旧的霓虹灯招牌,招牌上用标准的中文楷体清晰地写着四个大字:'香蕉计划'。招牌滋滋作响,闪烁着粉紫色的光芒,照亮了下方的积水路面。"

图片展示了一张赛博朋克风格的街道夜景照片。画面正中央有一个巨大的、破旧的霓虹灯招牌,招牌上用标准的中文楷体清晰地写着四个大字“香蕉计划”,招牌滋滋作响,闪烁着粉紫色的光芒,照亮了下方的积水路面。招牌周围有电线纵横交错,街道上有行人和车辆,远处建筑的窗户透出灯光。这张图片与文档中“中文文字生成测试(OCR杀手)”的上下文对应,展示了AI生成的赛博朋克风格图片效果。

图片展示了一张赛博朋克风格的街道夜景照片,画面正中央有一个巨大的、破旧的霓虹灯招牌,招牌上用标准的中文楷体清晰地写着四个大字“香蕉计划”。招牌呈现出粉紫色的光芒,照亮了下方的积水路面,周围环境昏暗,街道两旁建筑林立,霓虹灯闪烁,营造出一种未来科技感。该图片与文档中“中文文字生成测试(OCR杀手)”的上下文对应,是对测试Prompt中“香蕉计划”文字生成效果的呈现。

第11组:温馨且充满细节的“旅行手账”

Prompt: A top-down flat lay photography of an open creative travel journal spread on a wooden table. The theme is "My Guangxi Trip". The pages feature a colorful hand-drawn map of Guangxi province with city names. There are printed photographs taped with washi tape showing Guilin Karst mountains, an ancient wind and rain bridge, and a beach. Mixed media style: combining real photos with watercolor illustrations of a bowl of Guilin rice noodles, a girl riding a bike, and Longji terraced fields. Physical details: A small bouquet of dried baby's breath flowers tied with twine is placed in the center of the book. A yellow pressed ginkgo leaf and a scenic spot ticket stub are glued to the page. Handwritten Chinese travel notes and calligraphy titles. Warm natural lighting, cozy atmosphere, high resolution, detailed scrapbooking aesthetic.

图片展示的是“我的广西之旅”主题的开放创意旅行手账。左侧是手绘的广西地图,标注城市名称。右侧有桂林米粉、桂林道路、龙脊梯田等插画,还贴有桂林山水、风雨桥等照片。页面中央有手写中文旅行笔记和书法标题,底部有压花的银杏叶和景点门票。整体呈现温馨且充满细节的旅行手账风格,与文档中介绍的实测案例相契合。

图片展示了一本“My Guangxi Trip”主题的创意旅行手账。左侧页面有手绘地图,标注城市名称,附有桂林山水等照片。右侧页面有北海海滩照片,以及手绘的桂林米粉、骑车女孩、长吉梯田等插画。页面上还粘贴有黄叶、门票等小物件,配有手写中文旅行笔记和书法标题。整体呈现温馨且充满细节的旅行记录风格,与文档中介绍的实测案例相契合。

第12组:新中式赛博朋克 (测试复杂光影与文化融合)

Prompt: "赛博朋克风格的重庆洪崖洞夜景,雨夜。画面中央是一座巨大的全息投影佛像,佛像呈现出半透明的霓虹蓝色。周围是密集的摩天大楼和悬浮列车,街道两旁挂满了红色的发光灯笼,路面湿润反射着五光十色的霓虹灯光。电影级构图,8k分辨率,虚幻引擎5渲染风格。"

图片展示的是赛博朋克风格的重庆洪崖洞夜景。画面中央是一座巨大的全息投影佛像,呈现出半透明的霓虹蓝色。周围是密集的摩天大楼和悬浮列车,街道两旁挂满了红色的发光灯笼,路面湿润反射着五光十色的霓虹灯光。画面右上角有“悬浮列车”字样。该图与文档中对赛博朋克风格重庆洪崖洞夜景的描述相契合,直观呈现了文档所要求的场景。

Google DeepMind 的产品经理 Bea Alessio 给出了一份详细的使用指南,其中透露出不少关键信息。最基本的使用方式当然是随便说一句话,让模型自己猜你想要什么。但如果你想达到专业水准,就需要像导演一样思考。

一个完整的提示词应该包含六个要素:主体(谁或什么)、构图(如何取景)、动作(正在发生什么)、场景(在哪里)、风格(什么审美)、编辑指令(如何修改)。

而如果你想要更精细的控制,还需要进一步明确:

画幅比例(9:16 竖版海报还是 21:9 电影宽屏)、镜头参数(低角度、浅景深 f/1.8)、光线细节(逆光的黄金时刻,拉长阴影)、调色方向(电影级调色,偏青绿色调)、以及具体的文字内容和样式。