元峰AI笔记 · AI大模型

谷歌 Gemini 3.0 封神归来!数据碾压 GPT-5,奥特曼罕见祝贺

Gemini 3.0 终于来了,但最大的惊喜并非模型本身。而是谷歌全新的 Antigravity IDE。

谷歌 Gemini 3.0 封神归来!数据碾压 GPT-5,奥特曼罕见祝贺

图片展示的是谷歌Gemini 3.0的标志。背景为黑色,中间以白色字体呈现“Gemini 3”,左侧有一个由蓝色、紫色、黄色、绿色四色组成的星形图案。该图片位于介绍谷歌Gemini 3.0的文档中,与上下文紧密相关,上下文提到Gemini 3.0是谷歌迄今为止最重要的AI版本,发布首日将全新模型应用到搜索中,而此图片正是其标志,直观呈现了该版本的名称。

Gemini 3.0 终于来了,但最大的惊喜并非模型本身。而是谷歌全新的 Antigravity IDE

当所有人都在猜测发布日期,围观 OpenAI 在 GPT-5 更新上的失误,以及 Anthropic 庆祝 Claude 的最新胜利时,谷歌刚刚发布了这可能是其迄今为止最重要的 AI 版本。

图片展示的是谷歌新发布的智能体编码平台Google Antigravity的网页界面。页面上方有导航栏,包括Google Antigravity、Product、Use Cases、Pricing、Blog、Resources等选项。中间大标题为“Experience liftoff with the next-generation IDE”,下方有“Download for MacOS”和“Explore use cases”按钮。背景为白色,右侧有蓝色点状图案。该图片与文档中介绍谷歌发布新AI版本的内容相关,直观呈现了新平台的界面。

老实说,这款新的谷歌 IDE 让我们大多数人都措手不及。

自 2023 年末 Gemini 发布以来,我一直关注着谷歌的 AI 发布动态。Gemini 3 结合了最先进的推理能力,并做了一件谷歌从未做过的事:在发布首日就将全新模型应用到搜索(Search)中

此外,他们还构建了一个名为 Google Antigravity 的新型智能体编码平台,与 Cursor 2.0 等工具展开正面对抗。

核心数据: Gemini 3 Pro 在 LMArena 上的得分为 1501,碾压了其前代产品的 1451 分以及目前所有可用的前沿模型。

图片展示了Gemini 3.0发布后在Text和WebDev两个领域的排名情况。Text领域中,Gemini 3.0 Pro以1501分排名首位,获得3089票;WebDev领域同样,Gemini 3.0 Pro以1487分排名首位,获得1062票。该图片与文档中介绍Gemini 3.0在发布首日将全新模型应用到搜索中,以及构建智能体编码平台等内容相关,直观呈现了其在特定领域的表现。

它在学术基准测试和流程中展示了博士级的推理能力,并能在单次对话中处理高达 100 万 token 的上下文。

但真正的看点不仅仅是性能的提升。而是谷歌如何重新构想 AI 模型的能力——从即时生成交互式视觉界面,到自主构建整个应用程序并测试自己的代码。

在这篇详细分析中,我将涵盖:

  • Gemini 3 是什么以及它与过去发布的版本有何不同
  • Google Antigravity 和新的智能体编码方法
  • 生成式 UI(Generative UI)及其对开发者的重要性
  • 真实的基准测试数据及其对比情况
  • 这对当前的 AI 格局意味着什么

Gemini 3 Pro 有什么不一样?

Gemini 3 是谷歌最新的基础模型,今天在 Gemini 应用、AI Studio、Vertex AI 中公开发布,并首次进入 Google 搜索。

谷歌称其为“最智能的模型”,能帮助你“将任何想法变为现实”。

此次发布包括两个版本:

  • Gemini 3 Pro:现已向所有人开放。具备最先进的推理能力、多模态理解和高级编码能力。
  • Gemini 3 Deep Think:增强推理模式,经过额外的安全测试后,将在未来几周内向 Google AI Ultra 订阅者推出。

这次,比较意外的是,奥特曼也都发推表示祝贺。

祝贺谷歌推出 Gemini 3!看起来是个很棒的模型。

技术基础

Gemini 3 Pro 采用了超过 1 万亿参数的稀疏混合专家(MoE)架构

  • 上下文窗口:100 万 token(约 70 万单词或 10 本小说)。
  • 多模态处理:同时处理文本、图像、音频、视频和代码。
  • 输出生成:每次响应最多可生成 64,000 token。
  • 知识截止日期:2025 年 1 月。

核心能力升级

官方定义:AI 领域的重磅力量 Gemini 3 树立了 AI 模型性能的新标杆,赋能用户一气呵成地进行创作、编码和构建。这是谷歌迄今为止最出色的智能体(Agentic)和 Vibe Coding 模型。

  • 全新外观:视觉布局(Visual Layout)和动态视图(Dynamic View)以更具沉浸感的方式呈现结果。
  • Gemini 智能体:可处理多步骤任务(如预订行程、比价),并在关键操作前获取用户确认。

图片展示的是OpenAI CEO Sam Altman在Twitter上发布的祝贺谷歌Gemini 3.0的帖子。内容为“祝贺谷歌推出Gemini 3!看起来是个很棒的模型。”并附有翻译。该帖子发布于2025年11月19日上午1:05,获477.6万查看,2301条评论,2919次转发,2081次收藏。图片与上下文紧密相关,直观呈现了OpenAI CEO对谷歌新模型发布表示祝贺的场景,体现了谷歌Gemini 3.0发布在业界引起关注。

这次发布的量级之重,甚至让 OpenAI CEO Sam Altman 也罕见地打破沉默,发推向谷歌致意: “祝贺 Google 发布 Gemini 3!看起来是个很棒的模型。” (Congrats to Google on Gemini 3! Looks like a great model.)

这一来自最大竞争对手的肯定,或许侧面印证了 Gemini 3 此次的压迫感。

Deep Think 深度思考模式

这种增强的推理模式将 Gemini 3 的能力推向了解决最具挑战性问题的更高水平。

图片展示了Gemini 3 Deep Think在三个学术基准测试中的性能。左侧为“人类最后考试”,Gemini 3 Deep Think标准版和Pro版分别得41%和37.5%;中间是“GPQA Diamond”,标准版和Pro版分别得93.8%和91.9%;右侧是“ARC-AGI-2”,标准版和Pro版分别得45.1%和31.5%。该图与上文提到的Gemini 3 Pro学术基准测试性能提升内容相呼应,直观呈现其在不同测试中的表现。

学术基准测试性能提升:

  • Humanity’s Last Exam: 41.0% (标准版 37.5%)
  • GPQA Diamond: 93.8% (标准版 91.9%)
  • ARC-AGI-2: 45.1% (含代码执行) —— 展示了新颖的问题解决能力

分阶段的方法让谷歌有时间收集反馈,确保增强的推理能力在大规模应用中表现良好。

性能基准与竞争:一份野心勃勃的成绩单

Gemini 3 Pro 凭借其最先进的推理和多模态能力,可以将任何创意变为现实。它在每一项主要的 AI 基准测试中都显著超越了 2.5 Pro。

图片展示了LMArena平台上的Text和WebDev两个榜单。Text榜单中,Gemini - 3.0 - pro以1501分排名首位,获得3089票;WebDev榜单中,Gemini - 3.0 - pro同样以1487分位列第一,获得1062票。Gemini - 3.0 - pro在两个榜单中均处于领先位置,其优异表现与文档中提到的其在多项性能基准测试中取得的突破性成绩相呼应,体现了其在模型性能方面的优势。

它以 1501 Elo 分的突破性成绩登顶 LMArena 排行榜。它在“人类终极考试”(Humanity’s Last Exam,在不使用任何工具的情况下得分为 37.5%)和 GPQA Diamond(91.9%)中获得最高分,展现了博士级的推理能力。它还为前沿模型在数学领域设立了新标准,在 MathArena Apex 上取得了 23.4% 的最新业界最佳成绩。

图片为Gemini 3 Pro、Gemini 2.5 Pro、Claude Sonnet 4.5、GPT - 5.1在多个AI基准测试中的表现对比。表格包含Benchmark名称、描述、各模型得分等信息。如“Humanity’s Last Exam”无工具,Gemini 3 Pro得分为37.5%;“ARC - AGI - 2”为视觉推理谜题,Gemini 3 Pro得分为31.1%;“GPQA Diamond”无工具,Gemini 3 Pro得分为91.9%等。该图与上下文紧密相关,直观呈现了Gemini 3 Pro在各基准测试中的成绩,体现其在AI领域的领先地位。

Gemini 3 在一系列关键 AI 基准测试中均处于领先地位。

这张图片展示了一份关于 Gemini 3 Pro 的性能基准测试(Benchmark)对比图。这是 Google DeepMind 发布的一份技术报告摘要,旨在展示其最新模型 Gemini 3 Pro 相比于前代产品(Gemini 2.5 Pro)以及主要竞争对手(Claude Sonnet 4.5 和 GPT-5.1)的性能优势。 以下是对这张图中关键信息的深度分析和解读:

核心结论:全面的代际领先

从整体数据来看,Gemini 3 Pro(第一列,淡蓝色背景)在几乎所有列出的基准测试中都取得了最高分(粗体显示)。 这不仅仅是微小的提升,在某些特定领域(尤其是数学、视觉推理和长窗口理解),它展现出了相对于 GPT-5.1 和 Claude Sonnet 4.5 的“代际级”碾压优势。

关键领域的详细解读

A. 极高难度的数学与逻辑推理 (Reasoning & Math)

这是最引人注目的部分,显示了模型在处理非标准化、高难度问题上的突破。

  • MathArena Apex: 这是一个极具挑战性的数学竞赛题库。

    • Gemini 3 Pro: 23.4%
    • GPT-5.1: 1.0%
    • Claude Sonnet 4.5: 1.6%
    • 解读: 这是一个数量级的差异。说明在极高难度的数学竞赛领域,Gemini 3 Pro 解决了一部分其他模型完全“无法理解”或“乱猜”的问题。
  • ARC-AGI-2: 视觉逻辑推理测试(通常被认为是衡量通向 AGI 进度的重要指标)。

    • Gemini 3 Pro 得分 31.1%,几乎是 GPT-5.1 (17.6%) 的两倍。这表明其在未见过的视觉模式归纳能力上有了质的飞跃。

B. 智能体与屏幕理解能力 (Agentic & Screen Understanding)

这部分对于 AI 自动化工作流(Agent)至关重要。

  • ScreenSpot-Pro: 屏幕理解能力(识别 UI 元素、理解屏幕内容)。

    • Gemini 3 Pro: 72.7%
    • GPT-5.1: 3.5%
    • 解读: 这是一个惊人的差距。这意味着 Gemini 3 Pro 可以像人类一样精准地“看懂”电脑或手机屏幕,这对于开发能够自动操作软件的 AI Agent 是决定性的能力。
  • Vending-Bench 2: 长程智能体任务(Long-horizon agentic tasks),用“净资产均值”来衡量。

    • Gemini 3 Pro: $5,478.16
    • GPT-5.1: $1,473.43
    • 解读: 在复杂的、需要多步规划和决策的模拟经济环境中,Gemini 3 Pro 的表现远超对手,证明其规划和执行能力更强。

C. 长上下文与多模态 (Long Context & Multimodal)

  • MRCR v2 (1M pointwise): 百万级 token 的长文本检索。

    • Gemini 3 Pro: 26.3%
    • Claude/GPT: Not supported (不支持)
    • 解读: 这一栏强调了 Google 在超长上下文窗口(Context Window)技术上的护城河。竞争对手在处理 1M(100万)长度的信息点查询时甚至无法支持,而 Gemini 依然保持了功能性。
  • Video-MMMU: 视频信息获取。

    • Gemini 3 Pro (87.6%) 依然领先,显示了其原生多模态(Native Multimodal)处理视频的能力依然是业界顶尖。

竞争格局分析

根据图表中的模型命名(GPT-5.1, Claude Sonnet 4.5),我们可以推断出以下市场态势(基于图表设定的时间点):

  • Claude Sonnet 4.5: 在代码(SWE-Bench)方面表现尚可(77.2%),甚至略微超过 Gemini 3 Pro(76.2%),这是它唯一保持竞争力的领域。但在数学和屏幕理解上落后较多。
  • GPT-5.1: 虽然是强大的竞争对手,但在这份 Google 提供的榜单中,它在多项高难度推理和视觉任务上被 Gemini 3 Pro 拉开了显著差距,特别是在 ScreenSpot(屏幕理解)和 MathArena(高难数学)上。

总结

这张图传递的主要信号是:Gemini 3 Pro 正在试图从“聊天机器人”向“全能智能体(Generalist Agent)”转型。 它不再仅仅满足于回答文本问题,而是重点强化了:

  1. 视觉/屏幕理解(为操作电脑做准备)。
  2. 复杂逻辑规划(为解决长链路任务做准备)。
  3. 超难学科推理(突破现有 AI 的智力天花板)。 这是一份极具野心的成绩单,特别是针对AI Agent(智能体) 开发者而言,ScreenSpot-Pro 和 Vending-Bench 的分数提升是最具吸引力的卖点。

图片为Gemini 3 Pro技术基准测试与性能深度解析图。分为六个板块,左侧为“核心结论:代际领先”“智能体与屏幕理解”“竞争格局分析”,右侧为“高难推理与数学”“长上下文与多模态”“战略转型总结”。其中,“高难推理与数学”板块显示Gemini 3 Pro在MathArena Apex测试中得分为23.4%,在ARC-ADP-2测试中得分为31.1%,在多项测试中表现优异。该图与上下文紧密相关,直观呈现了Gemini 3 Pro在各方面的技术性能表现。

谷歌的规模优势

  • AI 概览:每月 20 亿用户
  • Gemini 应用:每月活跃用户 6.5 亿(对比 ChatGPT 每周 7 千万用户)
  • Google Cloud AI:超过 70%的云客户使用
  • 开发者生态系统:1300 万开发者使用 Gemini 模型进行开发

***Google 可以将 Gemini 3 部署到搜索、Gmail、文档、YouTube、安卓以及其他数十个数十亿人日常使用的产品上。***目前,没有其他 AI 公司拥有这种分发优势。

Gemini 3 如何使用?

从今天开始,您可以通过以下方式访问 Gemini 3:

Gemini App:所有用户免费访问

图片展示了谷歌Gemini 3.0的界面。上方显示“Hello, Metafeng”。中间有“Ask Gemini”输入框,可添加工具。右侧有“Thinking”下拉菜单,当前选中“Thinking”模式,其下有“Choose your model”选项,可选择“Fast”或“Thinking”模式。下方有“Create Image”“Write”“Build”“Deep Research”“Create Video”等功能按钮。该图与文档中介绍Gemini 3.0使用方式的内容相关,直观呈现了其界面操作选项。

https://gemini.google.com/app

Google AI Studio:开发者免费访问(宽裕速率限制)

图片展示了Google AI Studio的界面。左侧为导航栏,有Home、Get API key、Settings等选项。中间是“Playground”区域,上方有“Featured”“Gemini”“Live”等多个标签,当前选中“Gemini”。下方展示了“Gemini 3 Pro Preview”“Nano Banana”“Gemini Face Lab”等模型。右侧是“Run settings”设置区域,有“Gemini 3 Pro Preview”“System instructions”“Temperature”“Media resolution”“Thinking level”等设置项,还显示了“Grounding with Google Search”开关处于开启状态。该图与文档中介绍Gemini 3在Google AI Studio免费访问的内容相关。

https://aistudio.google.com/prompts/new_chat

Vertex AI:企业级部署

图片展示的是Google AI Studio中Gemini 3.0的界面。左侧有“New chat”“Generate media”等选项,中间是聊天区域,显示了Gemini 3.0的介绍,包括其设计目标、功能等。右侧有“Prompt”“Code”“Mindmap”等标签,当前选中“Prompt”,下方有“Model settings”“System instructions”“Mindmap”等设置项。该图片与文档中介绍Gemini 3.0使用方式的内容相关,直观呈现了在Google AI Studio中访问Gemini 3.0的界面情况。

https://console.cloud.google.com/vertex-ai/studio/multimodal;mode=prompt

Gemini CLI:开发者命令行界面

图片展示了Gemini 3.0在Gemini CLI界面的使用情况。界面顶部有“GEMINI”字样及提示信息,包括开始的建议、使用提示器或运行命令、结果最精确需具体、更多详情可使用/help等。下方显示测试成功,可协助进行软件工程任务。界面底部有“Type your message or @path/to/file”输入框,显示当前工作空间路径为“~ /workspace/gemini - 3.0 - example (main)” ,并有“no sandbox (see /docs)”及“gemini - 3 - pro - preview”等信息。

Google Antigravity:新智能体开发平台

图片展示了Google Antigravity平台界面。左侧为平台主界面,有“Open Folder”等操作按钮,下方是工作空间列表。右侧是“Agent”区域,突出显示了“Antigravity”部分,其中“Ask anything (Ctrl+L) to mention / for workflows”为提示语,下方有“Planning”选项,其下拉菜单中列出“Gemini 3 Pro (High)”“Gemini 3 Pro (Low)”“Claude Summit 4.5”“Claude Summit 4.5 (Thinking)”“GPT-4X 1208 (Medium)”等模型选项。该图与文档中介绍Google Antigravity作为新智能体开发平台的内容相关,展示了其模型选择功能。

https://antigravity.google/

搜索中的 AI 模式:Google AI Pro/Ultra 订阅者

第三方平台已集成 Gemini 3:

  • Cursor (编程 IDE)
  • GitHub Copilot
  • JetBrains IDEs
  • Replit
  • Manus
  • Cline

图片展示的是JetBrains IDEs中集成的Gemini 3.0界面。左侧弹出窗口显示“Plan, @ for context, / for commands”,下方有“Agent”和“Composer 1”选项,其中“Composer 1”被选中。右侧有“New Agent”“Show Terminal”“Show Files”“Search Files”“Open Browser”等功能快捷键提示。该图片与文档中介绍第三方平台已集成Gemini 3.0的内容相关,直观呈现了IDEs中Gemini 3.0的使用界面。

Gemini 3 实战案例库

在 Gemini 3 正式发布前,我就分享过一些案例:

如果说之前的案例展示了其在创意娱乐领域的爆发力,那么正式发布后的今天,我们将看到更多它在垂直领域与生产力工具方面的惊人表现。

随着更多用户获得访问权限,实战案例库将持续更新。以下是基于中国社交媒体生态的复杂应用构建演示:

案例1:全渠道短视频分发矩阵后台

挑战目标:构建一个集成了多平台 API 接口、具备内容分发与管理功能的应用界面。

提示词(Prompt):

帮我创建一个视频分发平台,核心功能要求如下:

  1. 渠道同步:支持绑定国内主流自媒体平台(视频号、抖音、小红书、快手等)。
  2. 一键分发:绑定完成后,用户只需上传一次视频、填写描述与标签,即可同步发送至所有已绑定平台。
  3. 灵活发布:支持“全选”发布或自定义勾选特定平台发布。
  4. UI 设计规范:主色调采用 #bc1f1a。整体风格要求简约、现代、有质感,特别注重排版布局与留白处理。

图片展示了谷歌Gemini 3.0平台界面。左侧为Gemini编辑器,显示用户关于创建视频分发平台的提示词及生成的平台功能描述。右侧是平台管理界面,有“有赞”“快手”“抖音”“小红书”等自媒体平台图标,其中“小红书”被红色框突出显示。该图片与文档中Gemini 3实战案例库的内容相关,直观呈现了Gemini平台的编辑与管理功能,辅助说明其在视频分发平台创建中的应用。

案例2:视频深度理解与二创神器 —— “记忆”让它更懂你

图片展示的是Gemini 3.0在视频深度理解与二创方面的表现。画面中显示视频内容的逐字稿及其中文翻译,如“Gemini从一开始就是多模态的”被翻译为“我们的Gemini 1模型能看、听、理解海量信息,并将很快地自主生成内容”。画面右上角有“1:56”及“请提取出视频中的逐字稿,并翻译为中文”的提示。下方有“Show thinking”选项,以及“Ask Gemini”输入框,还展示了“Tools”选项。该图片与上下文紧密相关,直观呈现了Gemini 3.0对视频内容的理解与翻译能力。

如果说识别视频只是基本功,那么 Gemini 3 真正的杀手锏在于它的长时记忆(Memory)与语境理解

我的需求: 上传一段视频,提取其中的解说词,并要求它帮我重新规划分镜,用于制作我自己的短视频(二创)。

图片展示的是Gemini 3.0在视频深度理解与二创方面的对话界面。界面中Gemini 3根据文档内容,为“必火AI”定制短视频分镜脚本,考虑到品牌打趣及AI Avatar形式,将脚本设计为AI Avatar口播+硬核演示画面。还给出了视频时长、视频比例、配乐建议等具体信息。图片与上下文紧密相关,直观呈现了Gemini 3在视频创作方面的智能表现。

图片展示了视频脚本内容,分为时间、画面内容、口播文案、制作/剪辑备注四部分。画面内容包括“AI Avatar大特写”等,口播文案有“谷歌刚发布了Gemini 3!”等,制作/剪辑备注有“重点:这里的节奏要极快,直接抓住眼球”等。图片中用红色箭头分别指向“谷歌Gemini 3正式发布!”“大家熟悉的Gemini 1已经能看能听”“2.00:17 ‘reasoning’(推理)连线动画”等关键信息,与上下文介绍的Gemini 3视频脚本内容相呼应。

Gemini 3 的惊艳表现: 这虽然是一个新开的对话窗口,但 Gemini 3 仿佛一位老搭档,直接调取了我们过往的交互记忆:

  1. 品牌与形式自动匹配:它精准识别出我的品牌是“必火 AI”,并主动提出结合我惯用的 “AI Avatar(数字人)” 形式来撰写脚本。
  2. 精确到秒的分镜规划:在提取逐字稿后,它生成了一份包含“画面内容”、“口播文案”和“剪辑备注”的详细表格。注意看截图,它甚至规划了在 00:03 出现“multimodal”文字,在 00:17 配合“reasoning”做连线动画,卡点极其精准。
  3. 策略性建议:更离谱的是,它记得我之前研究过 n8n 工作流,竟然主动建议我将 n8n 自动化作为视频的引流“钩子(Hook)”。

它不再是一个冷冰冰的问答机器,而是一个真正懂你业务逻辑、能帮你从素材提取到脚本落地的一站式 AI 助理。

图片是针对“必火AI”品牌提出的额外建议。1. IP植入方面,建议在提到“Google Antigravity”概念时,让AI Avatar以惊讶或思考表情出现,增加视频生动性。2. 私域引流上,可置顶评论“正在研究如何用n8n接入Gemini 3 API自动生成视频,想看的扣1”,筛选精准粉丝。3. 封面图设计上,使用原视频中00:25的彩色星光Logo为背景,前面放AI Avatar,加标题《Gemini 3炸场!》。最后询问是否需提取关键帧或生成视频提示词。

案例3:用 Gemini 3.0 编写复古相机应用

图片展示了博主@Ann Nguyen在X(推特)上分享的内容。她用Gemini 3.0在一次对话中为一个复古相机应用进行了vibe编码,还配有“亲自试试”字样及“翻译帖子”链接。图片下方是一张复古相机应用的截图,相机上有手绘贴纸,旁边有几张照片,右下角有“DOWNLOAD”按钮。该图片与文档中博主分享用Gemini 3.0编写复古相机应用的内容相关,直观呈现了应用效果。

我在 X(推特)上刷到了博主 @Ann Nguyen 的分享,瞬间感到“破防”了。

大神的操作: 她仅用 Gemini 3.0,通过 “Just ONE convo(仅仅一次对话)”,就通过 Vibe Coding 的方式“搓”出了这个精致可爱的网页版复古相机应用。

  • 极简交互:打开即用,UI 拟物化设计非常讨喜。
  • 功能完整:调用摄像头、实时滤镜、生成拍立得边框,一气呵成。
  • 零代码感:整个过程仿佛不是在写代码,而是在通过“Vibe(氛围/感觉)”进行创作。

虽然我没能做出这么惊艳的作品,但这让我看到了 Gemini 3 真正的天花板。

👉 强烈建议大家亲自体验一下:https://www.bubbbly.com/app/retro-camera.html

想亲自实现可以使用下面的提示词跑一下。

提示词:请帮我制作一个复古拍立得照相机应用,网页左下角显示一个相机,可以连接摄像头,实时显示摄像头内容,点击拍摄按钮,从相机顶部缓慢弹出一张相纸,从模糊到清晰显示照片,可以将照片从相机上方拖动到页面上相机之外的区域,像照片墙的效果

图片展示了谷歌Gemini 3.0开发平台界面,左侧为指令输入区域,提示制作复古拍立得照相机应用。右侧是开发成果展示区,呈现了“RetroCam”应用界面,有相机图标、多张照片及“Upload Pic”按钮,还设有“Clear All”按钮。该图片与文档中“用Gemini 3.0编写复古相机应用”的实战案例相关,直观呈现了应用开发成果,帮助用户了解开发效果。


我会陆续更新更多案例进来。

⚠️ 实践出真知: 所有的评测都带有主观视角,Gemini 3 的上限在哪里,取决于使用者的想象力与需求复杂度。不要只做旁观者,建议亲自上手 run 一遍代码或任务。只有当你把它接入自己的真实工作流时,才能真正探测到它的能力边界是否满足你的预期。


惊喜 -- Google Antigravity 智能体开发平台

Google DeepMind 在吸纳了 Windsurf 的人才后,推出了名为 “Google Antigravity” 的全新代理开发平台。正如其名“反重力”,它的愿景是让开发者的创意真正“升空”。

什么是 Antigravity?

Antigravity 是一个智能体优先(Agent-first) 的 IDE。

它通过两种方式介入开发过程:

  • 一是直接嵌入在集成开发环境(IDE)中的“同步代理”,为开发者提供即时协助;
  • 二是能够控制浏览器并在后台运行的“异步代理”。这种双轨并行的设计,让 AI 不仅能处理眼前的代码问题,更能自主执行跨平台的复杂操作,从而显著增强了开发工作的自动化程度与效率。

核心差异:传统 IDE 以“文件”为核心,Antigravity 以**“智能体”** 为核心。界面围绕智能体的工作构建,你扮演架构师,智能体负责实施(编写代码、运行终端、浏览器测试)。

(今天已作为 macOS、Windows 和 Linux 的免费公开预览版推出, 我刚刚下载了它,目前正在进行测试。)

本质上,Antigravity 是一种熟悉的 AI IDE 体验。

但智能体(Agents)已被提升到一个专用的层面,可以直接访问三个关键组件:

  1. 编辑器(Editor):代码编写和修改
  2. 终端(Terminal):命令执行和系统操作
  3. 浏览器(Browser):测试、验证和计算机使用

图片展示了Google Antigravity智能体开发平台的界面。左侧为Explorer区域,显示“无文件夹打开”,有“Open Folder”和“Clone Repository”选项。中间是Antigravity区域,有“Open Folder”“Open Agent Manager”“Clone Repository”按钮,下方是Workspaces列表,包含claude code +4.6等项目。右侧是Agent区域,显示“Antigravity”字样,下方有“Ask anything”输入框及“Planning”“Gemini 3 Pro (High)”选项。该图直观呈现了平台的编辑器、终端、浏览器等功能区域,与上下文介绍的智能体可直接访问编辑器、终端、浏览器等功能相契合。

智能体现在可以自主规划和执行复杂的端到端软件任务,同时验证自己的代码。 你扮演架构师的角色。智能体负责实施。

多模型支持

Antigravity 并不局限于谷歌的模型。开发者可以选择:

  • Gemini 3 Pro
  • Claude Sonnet 4.5
  • GPT-OSS (OpenAI 开放权重模型)

图片展示了谷歌Antigravity智能体开发平台界面。左侧为平台主界面,有“Open Folder”“Open Agent Manager”“Clone Repository”等操作按钮,下方是工作空间列表。右侧是Agent界面,上方显示“Ask anything (Ctrl+L) to mention / for workflows”,下方有“Planning”“Gemini 3 Pro (High)”“Gemini 3 Pro (Low)”“Claude Sonnet 4.5”“Claude Sonnet 4.5 (Thinking)”“GPT-OSS 1208 (Medium)”等模型选项,其中“Gemini 3 Pro (High)”被高亮显示。该图片与文档中介绍多模型支持的内容相关,直观呈现了平台的模型选择界面。

谷歌为 Gemini 3 Pro 的使用提供了宽裕的速率限制,每五小时刷新一次以防止滥用。 其他模型的访问取决于容量和速率限制。

智能体优先(Agent-First)方法

Antigravity 颠覆了传统 IDE 模式。

其他编程工具将文件和文件夹放在首位。你需要不断浏览目录、打开文件、编辑代码和切换上下文。 Antigravity 颠覆了这一模式。 界面围绕智能体及其工作构建,而不是围绕浏览文件。如果您愿意,仍然可以切换到传统的编辑器视图,但默认为智能体优先。

智能体通过详细的工件(artifacts)交流其工作。你可以看到它们在计划什么、构建什么以及如何测试。

图片展示的是Google Antigravityaity智能体开发平台的Agent Manager界面。左侧有Inbox、Start conversation、Open Workspace等选项,下方有Knowledge、Browser、Settings、Provide Feedback等。右侧是欢迎界面,介绍在Agent Manager中可启动智能体处理任务,如深入研究、长期项目或后台任务,可监控多个智能体进度并查看工作。下方示例了Agent Manager、Editor Window及Agent A的交互,强调可在一个智能体优先界面处理不同任务,使用编辑器编写代码或专注于任务。

智能体通过详细的工作成果进行沟通。你可以看到它们的计划、正在构建的内容以及如何进行测试。

这提升了开发的各个方面:

  • 从零开始构建功能
  • UI 迭代和设计
  • Bug 修复与调试
  • 研究与报告生成
  • 端到端应用程序开发

自主任务执行

智能体不只是生成代码,它们执行完整的工作流:

分析需求 -> 创建计划 -> 编写代码 -> 浏览器测试 -> 识别问题迭代 -> 验证结果

  1. 你描述想要构建的内容
  2. 智能体分析需求并创建计划
  3. 智能体跨多个文件编写代码
  4. 智能体在浏览器中测试应用程序
  5. 智能体识别问题并进行迭代
  6. 智能体验证最终结果
  7. 你进行审查和批准

整个过程由智能体管理,它同时在编辑器、终端和浏览器之间保持上下文。

专为信任与自主而构建

谷歌围绕三个核心原则设计了 Antigravity:

  • 信任 —— 智能体提供任务级上下文和可验证的工件,以便你确切知道正在构建什么以及原因。
  • 自主 —— 智能体独立工作,但始终处于你的控制和指导之下。
  • 反馈 —— 详细的进度报告和工件生成让你在整个开发过程中随时知情。 这代表了我们要构建软件方式的彻底转变。 不再是自己编写每一行代码,你是在更高的战略层面进行操作,而智能体则处理战术性的实施。

Vibe Coding 性能

谷歌声称 Gemini 3 是他们“有史以来最好的 Vibe Coding 模型”。数据支持了这一点:

  • WebDev Arena: 1487 Elo (榜首)
  • Terminal-Bench 2.0: 54.2%(通过终端测试工具使用能力)
  • SWE-bench Verified: 76.2%(衡量编码智能体性能)

这些基准测试检验了模型理解开发者意图、编写功能代码以及解决现实世界软件工程问题的能力。 Antigravity 通过一个干净的界面使这些能力变得触手可及,无需深厚的 AI 专业知识即可有效使用。

⚠️ 现实残酷:Antigravity 上手避坑指南

“理想很丰满,现实很骨感。” Antigravity 的概念确实迷人,但在今天的实际体验中,我发现它的上手门槛远比想象中要高。如果你也卡在了第一步,以下是我用血泪换来的避坑经验

1. 登录卡死?网络环境是关键 很多朋友下载后一直卡在登录页面转圈,这大概率是网络环境问题。Antigravity 对网络要求极高,亲测有效的解决方案如下:

图片展示了Google Antigravity智能体开发平台登录界面。界面上方有三个彩色圆点,中间为“Sign into Google”提示,下方有“Sign in with Google”按钮。界面底部有“Back”和“Next”按钮,以及五个蓝色圆点指示器。该图片与文档中“登录卡死?网络环境是关键”部分内容相关,用于直观呈现登录时的界面情况,帮助用户了解登录时可能出现的界面样式,辅助解决登录卡死问题。

  • 节点选择:首选美国(US) 节点,其他地区节点失败率较高。
  • 代理模式:这是最重要的一步!必须开启增强模式(Enhanced Mode / Tun 模式),并设置为全局代理(Global)
  • 浏览器设置:建议将 Chrome 设为默认浏览器,以确保验证流程顺畅。

图片展示了Mac系统代理设置界面。其中“增强模式”选项被红色箭头突出指向,表明其为当前选中状态。该界面还列出了其他代理设置选项,如“设置为系统代理”“开机启动”“显示实时速率”“允许局域网连接”等,每个选项右侧均有对应的快捷键标识。此图与文档中“运行报错与卡顿”部分内容相关,可能是在介绍在Mac系统中进行相关设置的操作步骤。

2. 运行报错与卡顿 即便进去了,开发过程也不算顺滑。可能是因为网络波动或软件处于预览阶段,生成过程中频繁出现“死机”或卡顿,经常需要手动点击“继续生成”才能把任务跑完。

图片显示了Google Antigravity智能体开发平台出现错误的提示信息。内容为“Agent terminated due to error”,并告知用户如果错误持续,可以提示模型重试或开始新对话,还可查看故障排除指南获取更多帮助,右下角有“Dismiss”按钮。该图片与上文提到的因网络波动或软件处于预览阶段,生成过程中频繁“死机”、卡顿,需手动点击“继续生成”相呼应,直观呈现了平台运行时出现的错误状况。

图片展示了谷歌Gemini 3.0在开发平台上的生成页面效果。页面上方显示“VibeCoding / Video Distribution Platform”,下方列出任务步骤,如“Implementing Dashboard page with mock data”等。中间部分有“继续”按钮,箭头指向两个“继续”按钮,分别对应“Thought for 32s”和“Thought for 18s”内容。底部提示“Agent terminated due to error”,并有“Dismiss”按钮。该图片与文档中对Gemini 3.0生成页面效果的描述相关,直观呈现了其生成过程中的部分界面情况。

3. 产出效果:Web 端 vs 客户端 费了九牛二虎之力,最终生成的页面效果却让我略感失望。它与直接在 Web 端(网页版)生成的代码几乎一模一样,甚至在某些细节处理上还不如 Web 端精致。

图片展示的是VideoDist

目前的客户端体验还有很大优化空间。如果你不想折腾网络,直接用 Google AI Studio 可能是更高效的选择。


生成式界面 (Generative UI)

Gemini 3 本次还引入了谷歌称之为“生成式界面”(generative interfaces)的功能——AI 能够响应任何提示,同时生成内容和完整的用户体验。 即时构建的交互式工具、可视化效果和应用程序。

  • 动态视图(Dynamic View)—— Gemini 3 为每个提示设计并编码完全定制的交互式响应。 系统明白,向 5 岁孩子解释微生物组与向成年人解释需要不同的内容和功能。 为企业创建社交媒体帖子库与规划即将到来的旅行需要截然不同的界面。
  • 视觉布局(Visual Layout)—— 创建具有照片和交互模块的身临其境、杂志风格的视图。

关键区别:视觉布局生成滑块、复选框和其他过滤器,让你可以进一步自定义结果。 如果你问如何规划为期三天的罗马之旅,你不只会得到一份纯文本行程。

例子:规划旅行时,你得到的不是纯文本,而是一个带有地图、图片和可调整选项的交互式页面。


结语

谷歌这次发布的执行方式与过去截然不同。Gemini 3 Pro 在几乎所有基准测试中名列前茅,并引入了生成式 UI 和 Antigravity 平台。

当 OpenAI 应对 GPT-5 反响平平的问题,Anthropic 庆祝 Claude 获得开发者的喜爱时,谷歌正利用其庞大的分发主导权(Search, Android, Workspace)发起反击。

我们进入 Gemini 时代已经两年了,谷歌现在似乎正在占据领先地位。


资源