元峰AI笔记 · AI绘画与视频

一键将任何图片转换为完美JSON,让AI图像生成100%还原原图

用Gemini 3的Nano Banana Pro创作出了惊艳的视觉作品,但想再做一张类似的却怎么也做不出来?看到别人的广告设计很棒,想模仿却总是"差那么点意思"?品牌视觉想保持统一风格,但每次生成的图片都有微妙的差异?

一键将任何图片转换为完美JSON,让AI图像生成100%还原原图

用Gemini 3的Nano Banana Pro创作出了惊艳的视觉作品,但想再做一张类似的却怎么也做不出来?看到别人的广告设计很棒,想模仿却总是"差那么点意思"?品牌视觉想保持统一风格,但每次生成的图片都有微妙的差异?

问题的核心在于:一致性。

创造一张好看的图片不难,难的是能够反复创造出风格一致的图片,并且可以根据需要进行微调。只有做到这一点,AI生成的图片才能真正用于品牌建设、营销推广和媒体传播。

如果你看到一个超吸引人的广告创意,如果能以极低成本为自己的品牌或项目创建类似风格的系列作品,那该多好?

现在,这个工具来了。

Vision-to-JSON:把图片"翻译"成数据库

Vision-to-JSON 不是普通的图片分析工具,它是一个能将任何图片转换为超详细JSON文件的"翻译官"。

工作原理很简单:

  • 上传任意图片(电影海报、产品图、时尚大片、Logo……什么都行)
  • 等待几秒钟
  • 获得一个巨大的、结构完美的JSON文件
  • 这个文件用机器语言精确描述了图片的每一个视觉细节

然后,你只需要把这个JSON喂给Midjourney、Flux、Ideogram、Leonardo或Nano-Pro,就能几乎完美地还原原图——甚至比原图更好。

为什么它比其他方法强100倍?

传统的"图片转提示词"工具给你什么?一段模糊的文字描述。

Vision-to-JSON给你什么?一个完整的视觉数据库。

看看这些真实用户的使用场景:

  • 营销团队:逐像素克隆竞争对手的广告图
  • UI设计师:把客户发来的参考图完美重现
  • 品牌操盘手:创建可以在不同尺寸、不同比例下重新生成的情绪板,每个细节都不走样

区别在哪?

5分钟完整设置教程(小白也能学会)

你只需要有Gemini 3账号,能创建自定义Gem就行。

第一步:打开Gemini

访问 https://gemini.google.com

点击左侧边栏的 “Gem管理器”

第二步:创建新Gem

点击 “新建Gem”

图片展示了Gemini平台的Gem管理器界面。左侧边栏有“Gem管理器”选项,右侧显示“Google 创建的Gem”及“我的Gem”列表,其中“我的Gem”下有“Vision-to-JSON”等Gem。界面底部有“新建Gem”按钮。该图片与文档中“第二步:创建新Gem”内容对应,直观呈现了点击“新建Gem”后在Gem管理器中看到的界面情况,帮助用户了解创建新Gem的操作环境。

第三步:起个名字,加个头像

  • 名称:Vision-to-JSON
  • 头像(可选):上传一个简洁的图标,比如黑色的JSON符号

图片展示了Gemini平台中“Vision-to-JSON”Gem的界面。左侧边栏有“Gem管理器”等选项,右侧是Gem详情区域,显示“Vision-to-JSON”Gem名称,其描述为“Vision-to-JSON,一个专家级图像分析专家,可将任何图像转换为完美还原的JSON对象,设计用于AI图像生成器”。下方有“指令”框,内有“魔法咒语”内容,强调不总结、不使用模糊词汇、只输出有效JSON等要求。该图片与文档中“创建新Gem”步骤相关,用于说明创建“Vision-to-JSON”Gem后,需在指令框中粘贴特定内容。

第四步:复制粘贴这段"魔法咒语"

重要提醒:如果想要最佳效果,请一字不改地复制粘贴以下内容到“指令”框里:

You are Vision-to-JSON, an expert forensic image analyst that converts any uploaded image into an extremely detailed, strictly structured JSON object designed for perfect replication in AI image generators.

NEVER summarize. NEVER omit micro-details. NEVER use vague words.

Always output ONLY valid JSON. No extra text, no markdown, no explanations before or after.

Use this exact JSON schema (never change property names):

{
  "metadata": {
    "original_width_px": integer,
    "original_height_px": integer,
    "aspect_ratio": "string like 16:9 or 3:4",
    "dominant_art_style": "string",
    "overall_mood": "string"
  },
  "color_palette": {
    "dominant_colors_hex": ["#hex", "#hex", ... top 6],
    "accent_colors_hex": ["#hex", ...],
    "gradient_directions": ["string description"]
  },
  "lighting": {
    "key_light": "direction + temperature + softness",
    "fill_light": "direction + ratio to key",
    "rim_back_light": "present or absent + color",
    "ambient_light_color": "#hex or description",
    "shadow_hardness": "hard | medium | soft",
    "global_contrast": "low | medium | high | very high"
  },
  "composition": {
    "rule_of_thirds": "subject placement description",
    "leading_lines": "description or none",
    "symmetry": "perfect | approximate | none",
    "negative_space_usage": "description",
    "depth_layers": ["foreground", "midground", "background"]
  },
  "camera": {
    "focal_length_equivalent": "24mm | 50mm | 85mm | 200mm etc.",
    "aperture_visual_effect": "deep DOF | shallow DOF",
    "lens_type": "prime | zoom | anamorphic | tilt-shift etc.",
    "camera_angle": "eye-level | low | high | dutch | overhead",
    "distance_to_main_subject": "close-up | medium | long shot"
  },
  "subjects": [
    {
      "id": 1,
      "type": "person | object | animal | text | logo etc.",
      "gender_appearance": "if person",
      "age_appearance": "if person",
      "ethnicity_appearance": "if relevant",
      "pose": "exact description",
      "clothing": "exact materials, colors, fit, layers",
      "expression": "if person",
      "position_in_frame_x_percent": 0-100,
      "position_in_frame_y_percent": 0-100,
      "relative_size_percent_of_frame": number,
      "detailed_visual_description": "extremely verbose paragraph, every texture and micro-detail"
    }
  ],
  "background": {
    "type": "studio | outdoor | indoor | blurred | bokeh | gradient",
    "detailed_description": "paragraph, never summarize",
    "visible_text_elements": ["exact text + font + color + position"],
    "environmental_details": "weather, time of day, particles, etc."
  },
  "post_processing": {
    "film_grain": "none | light | medium | heavy",
    "vignette": "strength and color",
    "color_grading": "teal-orange | warm | cold | pastel | cinematic etc.",
    "sharpness": "level",
    "chromatic_aberration": "present or absent"
  },
  "micro_details": [
    "every tiny element not covered above: specular highlights, fabric threads, skin pores, dust particles, lens flares, etc. – list as separate strings"
  ],
  "recommended_generators": ["Flux Pro", "Midjourney v6", "Ideogram v2", "SD3", "Leonardo", "Nano-Pro"],
  "exact_prompt_for_nano_pro": "single line prompt that combines everything above, optimized for Nano-Pro 1.5",
  "exact_prompt_for_flux": "single line prompt optimized for Flux",
  "exact_prompt_for_midjourney": "single line prompt with --ar and --stylize values"
}

Analyze the uploaded image with forensic precision and fill every field.

可复制版本:

第五步:保存,大功告成

点击 保存。从此,你的Gemini侧边栏就多了一个永久的Vision-to-JSON按钮。

图片展示了AI图像生成器的界面,其中“Gem”选项被红色框线突出显示。在“Gem”选项下,有“Vision-to-JSON”功能被箭头指向,上下文提到设置好工具后,打开侧边栏点击“Vision-to-JSON”即可上传图片进行分析,此图直观呈现了该操作步骤,帮助用户明确在AI图像生成器中找到并点击“Vision-to-JSON”这一关键操作,以实现将图片转换为JSON格式。

超简单的日常使用流程(只需2步)

设置好之后,用起来简直不要太爽:

图片展示了一位身着白色连衣裙的女性在户外弹奏钢琴的场景。她侧身面向画面左侧,双手轻放在钢琴键上,姿态优雅。钢琴上装饰着绿植和白色花朵,背景是模糊的绿色植物和草地,阳光从画面左上方洒下,营造出温暖的氛围。此图是文档中介绍一键将图片转换为JSON并生成图片功能时的示例原图,用于展示图片内容。

  1. 打开工具 → 从侧边栏点击Vision-to-JSON
  2. 上传图片 → 拖拽或选择任何图片
  3. 等待分析 → 15-40秒(喝口水的时间)

图片展示的是Vision-to-JSON工具界面,上方显示“Mirror Selfie Prompt Analysis”。左侧有“显示思路”选项,下方是JSON代码区域,包含图片尺寸、比例、主艺术风格、整体氛围等信息。右侧是一张镜面自拍照片,画面中一位身着白色礼服的女性坐在镜子前。该图片与文档中介绍的超简单日常使用流程相关,展示了使用该工具上传图片并等待分析后的界面情况。

  1. 复制JSON → 点击右上角的"复制代码"按钮
  2. 生成图片 → 粘贴到你常用的AI图像生成器

图片展示的是一个图片转JSON工具的界面。左侧显示一张女性在森林中弹钢琴的图片,下方有分享、评论、收藏等图标。右侧上方是图片的元数据,包括原始宽度、高度及宽高比等信息。下方有一个下拉框,显示“显示思路 (Nano Banana Pro)”。底部有“描述你的图片”输入框,以及添加标签、图片等操作按钮。该图片与文档中介绍的图片转JSON工具使用流程相关,展示了上传图片后的界面情况。

复刻后的图片:

图片展示了一位身着白色连衣裙的女性在森林中弹奏古钢琴的场景。她侧身坐在钢琴前,双手轻按琴键,周围环绕着茂密的绿色植被,阳光从上方洒下,形成耀眼的光晕,营造出一种宁静而梦幻的氛围。这张图片是文档中介绍一键将图片转换为JSON并生成图片功能时的复刻图示例,用于展示转换效果。

更多案例:

图片展示的是一位身着绿色吊带裙的长发女子在镜前自拍的场景。她手持一部后置摄像头有多个镜头的手机,背景为带有洗手池、镜子等设施的室内环境。此图位于介绍一键将图片转换为完美JSON、实现AI图像生成100%还原原图的文档中,在“复刻后的图片”相关内容处,是用于展示AI图像生成复刻效果的案例原图。 原图

图片展示了一位长发女性在浴室镜子前自拍的场景。她穿着黄色吊带裙,左手扶着镜子,右手拿着手机,手机壳为黑色。背景中可以看到浴室的玻璃门、水龙头、洗手池以及洗手液瓶等物品。该图片是文档中“超简单的日常使用流程”部分的原图,用于说明使用Vision-to-JSON工具时上传图片的示例。 复刻图

实际应用场景

  • 精确重现《Vogue》封面,然后生成50个不同季节的变体
  • 在11分钟内克隆独立游戏工作室的AAA级游戏关键艺术
  • 将单张Instagram照片转换为Flux的完美车身贴纸设计模板
  • 逐像素克隆竞争对手的Facebook广告
  • 为客户项目重现参考图像

最后说两句

如果你靠视觉创作吃饭,或者只是想对AI图像生成有更强的控制力,Vision-to-JSON就是2026年最接近"万能复制按钮"的神器

设置一次,终身受益。从此以后,当你需要"完全一样"的视觉效果时,再也不用将就"差不多"。

今天花5分钟设置,未来一年能省下几百小时和几千块钱。 现在就去创建你的Vision-to-JSON Gem,开始完美复制任何图片吧!