元峰AI笔记 · AI大模型

一个由 Gemini 3 开启的智能新时代

Google 与 Alphabet 首席执行官 Sundar Pichai(桑达尔·皮查伊) 的公开信:

一个由 Gemini 3 开启的智能新时代

图片展示的是Gemini 3的标志。背景为黑色,中间有一个由蓝色点状元素构成的“3”字,其内部有蓝色点状图案环绕。左侧有一个由蓝色、红色、黄色、绿色四色组成的菱形图案。该图片位于介绍Gemini 3开启智能新时代的文档中,与上文提到的“两年多前,我们开启了Gemini时代”相呼应,直观呈现了Gemini 3这一AI技术的标识。

Google 与 Alphabet 首席执行官 Sundar Pichai(桑达尔·皮查伊) 的公开信

近两年前,我们开启了 Gemini 时代,这是我们要公司有史以来规模最大的科学与产品创举之一。从那时起,看到人们如此喜爱它简直令人难以置信。AI 概览(AI Overviews)现在的月活跃用户已达 20 亿。Gemini App 月活跃用户超过 6.5 亿,我们超过 70% 的云客户都在使用我们的 AI,1300 万开发者正在使用我们的生成式模型构建应用,但这仅仅是我们所见影响力的冰山一角。

得益于我们在 AI 创新方面差异化的全栈式策略——从领先的基础设施到世界级的研究、模型和工具,再到触达全球数十亿人的产品,我们能够比以往更快地将先进能力推向世界。

每一代 Gemini 都建立在上一代的基础之上,让您能做更多事情。Gemini 1 在原生多模态和长上下文窗口方面的突破,扩展了信息处理的种类和数量。Gemini 2 为代理能力奠定了基础,并拓展了推理和思考的前沿,协助处理更复杂的任务和创意,这也使得 Gemini 2.5 Pro 在 LMArena 榜首位置占据了半年之久。

现在,我们要推出 Gemini 3,这是我们要最智能的模型,它融合了 Gemini 的所有能力,助您将任何创意变为现实。

它在推理方面达到了最先进水平,旨在掌握深度和细微差别——无论是感知创意中微妙的线索,还是剥离难题中交织的层级。Gemini 3 也更擅长弄清您请求背后的语境和意图,因此您只需较少的提示词即可获得所需内容。想到在短短两年内,AI 已经从单纯阅读文本和图像进化到能够“察言观色”,真是令人惊叹。

从今天起,我们将以 Google 的规模全面推送 Gemini。这包括搜索中 AI 模式下的 Gemini 3,它具备更复杂的推理能力和全新的动态体验。这是我们首次在发布首日就将 Gemini 部署到搜索中。Gemini 3 今天也将登陆 Gemini App,并在 AI Studio 和 Vertex AI 中面向开发者开放,同时也将出现在我们全新的代理开发平台 Google Antigravity 中——详见下文。

像前几代一样,Gemini 3 再次推动了技术水平的进步。在这个新篇章中,我们将继续拓展智能、代理和个性化的边界,让 AI 真正对每个人都有所帮助。

希望您喜欢 Gemini 3,我们会不断改进它,并期待看到您用它构建的成果。未来还有更多精彩!


隆重介绍 Gemini 3:我们要最智能的模型,助您将任何创意变为现实

Google DeepMind 首席执行官 Demis Hassabis 与 Google DeepMind 首席技术官兼 Google 首席 AI 架构师 Koray Kavukcuoglu,代表 Gemini 团队致辞

今天,我们在通往通用人工智能(AGI)的道路上又迈出了一大步,正式发布 Gemini 3。

它是世界上多模态理解能力最强的模型,也是我们要迄今为止最强大的代理和 Vibe Coding(直觉编程)模型,能够提供更丰富的可视化效果和更深层次的交互性——所有这一切都建立在最先进的推理基础之上。

我们通过发布预览版 Gemini 3 Pro 来开启 Gemini 3 时代,并于今日在 Google 系列产品中上线,以便您在日常生活中使用它来学习、构建和规划任何事情。我们还推出了 Gemini 3 Deep Think——我们的增强推理模式,它将 Gemini 3 的性能推向新高——并在向 Google AI Ultra 订阅用户开放前,先提供给安全测试人员使用。

最先进的推理能力,具备前所未有的深度与细腻度

Gemini 3 Pro 凭借其最先进的推理和多模态能力,可以将任何创意变为现实。它在每一项主要的 AI 基准测试中都显著超越了 2.5 Pro。

它以 1501 Elo 分的突破性成绩登顶 LMArena 排行榜。它在“人类终极考试”(Humanity’s Last Exam,在不使用任何工具的情况下得分为 37.5%)和 GPQA Diamond(91.9%)中获得最高分,展现了博士级的推理能力。它还为前沿模型在数学领域设立了新标准,在 MathArena Apex 上取得了 23.4% 的最新业界最佳成绩。

除文本外,Gemini 3 Pro 还重新定义了多模态推理,在 MMMU-Pro 上得分 81%,在 Video-MMMU 上得分 87.6%。它还在 SimpleQA Verified 上取得了 72.1% 的业界最佳成绩,显示出在事实准确性方面的巨大进步。这意味着 Gemini 3 Pro 在解决科学和数学等广泛主题的复杂问题时,具备极高的能力和可靠性。

图片为Gemini 3 Pro在多个AI基准测试中的表现对比表。表格包含Benchmark名称、描述、Gemini 3 Pro得分、Gemini 2.5 Pro得分、Claude Sonnet 4.5得分、GPT - 5.1得分等列。如Humanity's Last Exam在学术推理方面,Gemini 3 Pro得分为37.5%等。该表直观呈现了Gemini 3 Pro在各测试中的得分情况,与上下文提到的其在多项关键AI基准测试中处于领先地位相呼应。

Gemini 3 在一系列关键 AI 基准测试中均处于领先地位。

这张图片展示了一份关于 Gemini 3 Pro 的性能基准测试(Benchmark)对比图。这是 Google DeepMind 发布的一份技术报告摘要,旨在展示其最新模型 Gemini 3 Pro 相比于前代产品(Gemini 2.5 Pro)以及主要竞争对手(Claude Sonnet 4.5 和 GPT-5.1)的性能优势。 以下是对这张图中关键信息的深度分析和解读:

核心结论:全面的代际领先

从整体数据来看,Gemini 3 Pro(第一列,淡蓝色背景)在几乎所有列出的基准测试中都取得了最高分(粗体显示)。 这不仅仅是微小的提升,在某些特定领域(尤其是数学、视觉推理和长窗口理解),它展现出了相对于 GPT-5.1 和 Claude Sonnet 4.5 的“代际级”碾压优势。

关键领域的详细解读

A. 极高难度的数学与逻辑推理 (Reasoning & Math)

这是最引人注目的部分,显示了模型在处理非标准化、高难度问题上的突破。

  • MathArena Apex: 这是一个极具挑战性的数学竞赛题库。

    • Gemini 3 Pro: 23.4%
    • GPT-5.1: 1.0%
    • Claude Sonnet 4.5: 1.6%
    • 解读: 这是一个数量级的差异。说明在极高难度的数学竞赛领域,Gemini 3 Pro 解决了一部分其他模型完全“无法理解”或“乱猜”的问题。
  • ARC-AGI-2: 视觉逻辑推理测试(通常被认为是衡量通向 AGI 进度的重要指标)。

    • Gemini 3 Pro 得分 31.1%,几乎是 GPT-5.1 (17.6%) 的两倍。这表明其在未见过的视觉模式归纳能力上有了质的飞跃。

B. 智能体与屏幕理解能力 (Agentic & Screen Understanding)

这部分对于 AI 自动化工作流(Agent)至关重要。

  • ScreenSpot-Pro: 屏幕理解能力(识别 UI 元素、理解屏幕内容)。

    • Gemini 3 Pro: 72.7%
    • GPT-5.1: 3.5%
    • 解读: 这是一个惊人的差距。这意味着 Gemini 3 Pro 可以像人类一样精准地“看懂”电脑或手机屏幕,这对于开发能够自动操作软件的 AI Agent 是决定性的能力。
  • Vending-Bench 2: 长程智能体任务(Long-horizon agentic tasks),用“净资产均值”来衡量。

    • Gemini 3 Pro: $5,478.16
    • GPT-5.1: $1,473.43
    • 解读: 在复杂的、需要多步规划和决策的模拟经济环境中,Gemini 3 Pro 的表现远超对手,证明其规划和执行能力更强。

C. 长上下文与多模态 (Long Context & Multimodal)

  • MRCR v2 (1M pointwise): 百万级 token 的长文本检索。

    • Gemini 3 Pro: 26.3%
    • Claude/GPT: Not supported (不支持)
    • 解读: 这一栏强调了 Google 在超长上下文窗口(Context Window)技术上的护城河。竞争对手在处理 1M(100万)长度的信息点查询时甚至无法支持,而 Gemini 依然保持了功能性。
  • Video-MMMU: 视频信息获取。

    • Gemini 3 Pro (87.6%) 依然领先,显示了其原生多模态(Native Multimodal)处理视频的能力依然是业界顶尖。

竞争格局分析

根据图表中的模型命名(GPT-5.1, Claude Sonnet 4.5),我们可以推断出以下市场态势(基于图表设定的时间点):

  • Claude Sonnet 4.5: 在代码(SWE-Bench)方面表现尚可(77.2%),甚至略微超过 Gemini 3 Pro(76.2%),这是它唯一保持竞争力的领域。但在数学和屏幕理解上落后较多。
  • GPT-5.1: 虽然是强大的竞争对手,但在这份 Google 提供的榜单中,它在多项高难度推理和视觉任务上被 Gemini 3 Pro 拉开了显著差距,特别是在 ScreenSpot(屏幕理解)和 MathArena(高难数学)上。

总结

这张图传递的主要信号是:Gemini 3 Pro 正在试图从“聊天机器人”向“全能智能体(Generalist Agent)”转型。 它不再仅仅满足于回答文本问题,而是重点强化了:

  1. 视觉/屏幕理解(为操作电脑做准备)。
  2. 复杂逻辑规划(为解决长链路任务做准备)。
  3. 超难学科推理(突破现有 AI 的智力天花板)。 这是一份极具野心的成绩单,特别是针对AI Agent(智能体) 开发者而言,ScreenSpot-Pro 和 Vending-Bench 的分数提升是最具吸引力的卖点。

Gemini 3 Pro 还为每一次交互带来了全新的深度和细腻度。它的回答聪明、简洁且直接,摒弃了陈词滥调和阿谀奉承,取而代之的是真知灼见——告诉你需要听到的,而不仅仅是你想要听到的。它就像一位真正的思维伙伴,为你提供理解信息和表达自我的新方式,从通过生成高保真可视化代码来转化深奥的科学概念,到进行创意头脑风暴,无所不能。

Gemini 3 可以编写代码将托卡马克中的等离子体流可视化,并写一首诗来捕捉核聚变的物理原理。

图片展示了Gemini 3 Pro在技术基准测试与性能深度解析方面的关键信息。分为六个板块,包括核心结论、高难推理与数学、智能体与屏幕理解、长上下文与多模态、竞争格局分析、战略转型总结。如核心结论指出全面领先;高难推理与数学板块提及MathArena Apex等;智能体与屏幕理解板块有ScreenSpot - Pro等;长上下文与多模态板块有MIRCR v2等。这些板块内容与上下文紧密相关,是对Gemini 3 Pro技术性能的详细说明。

Gemini 3 深度思考 (Deep Think)

Gemini 3 Deep Think 模式进一步拓展了智能的边界,使 Gemini 3 的推理和多模态理解能力实现了质的飞跃,助您解决更复杂的问题。

在测试中,Gemini 3 Deep Think 的表现超越了 Gemini 3 Pro 在“人类终极考试”(不使用工具得分为 41.0%)和 GPQA Diamond(93.8%)上已然令人印象深刻的成绩。它还在 ARC-AGI-2(包含代码执行,经 ARC Prize 验证)上取得了前所未有的 45.1% 的成绩,展示了其解决新颖挑战的能力。

图片展示了Gemini 3 Deep Think在“人类终极考试”“GPQA Diamond”“ARC-AGI-2”三个AI基准测试中的表现。其中,“人类终极考试”得分为41%和37.5%;“GPQA Diamond”得分为93.8%、91.9%、86.4%、83.4%、88.4%、88.1%;“ARC-AGI-2”得分为45.1%、31.5%、13.6%、4.9%、15.8%、17.6%。该图与上文提到的Gemini 3 Deep Think模式在这些测试中表现优异相呼应,直观呈现其成绩。

Gemini 3 Deep Think 模式在一些最具挑战性的 AI 基准测试中表现优异。

Gemini 3 助您学习、构建和规划任何事情

学习任何事情

Gemini 从一开始就是为了无缝综合跨多种模态(包括文本、图像、视频、音频和代码)的任何主题信息而构建的。Gemini 3 结合了其最先进的推理、视觉和空间理解能力、领先的多语言性能以及 100 万 token 的上下文窗口,拓展了多模态推理的前沿,以最适合您的方式帮助您学习。

例如,如果您想学习家族传统的烹饪方法,Gemini 3 可以解读不同语言的手写食谱并将其翻译成可分享的家庭烹饪书。或者,如果您想学习一个新主题,您可以提供学术论文、长视频讲座或教程,它可以生成交互式抽认卡、可视化图表或其他格式的代码,帮助您掌握材料。它甚至可以分析您的匹克球比赛视频,找出您可以改进的地方,并生成全面的体态改进训练计划。

  • Gemini 3 可以帮助您学习和保存家庭烹饪传统。在 Gemini Canvas 中试用。
  • Gemini 3 可以帮助您分析研究论文等复杂信息,并生成交互式指南的代码。
  • 获取关于您匹克球比赛的专家级体育分析,助您提升球技。

为了帮助您更好地理解网络上的信息,搜索中的 AI 模式现在使用 Gemini 3 来启用新的生成式 UI 体验,如沉浸式视觉布局、交互式工具和模拟,所有这些都是根据您的查询完全即时生成的。

在搜索的 AI 模式中,利用生成式 UI 学习 RNA 聚合酶工作原理等复杂主题。

构建任何东西

建立在 2.5 Pro 成功的基础之上,Gemini 3 兑现了为开发者将任何想法变为现实的承诺。它在零样本生成方面表现卓越,能够处理复杂的提示词和指令,渲染出更丰富、更具交互性的 Web UI。

Gemini 3 是我们要构建过的最好的 Vibe Coding 和代理编程模型——使我们的产品更具自主性,并提升开发者的生产力。它以 1487 Elo 的惊人高分登顶 WebDev Arena 排行榜。它在测试模型通过终端操作计算机工具使用能力的 Terminal-Bench 2.0 上得分 54.2%,并在衡量编程代理能力的基准测试 SWE-bench Verified (76.2%) 上大幅超越 2.5 Pro。

您现在可以在 Google AI Studio、Vertex AI、Gemini CLI 以及我们全新的代理开发平台 Google Antigravity 中使用 Gemini 3 进行构建。它也已上线 Cursor、GitHub、JetBrains、Manus、Replit 等第三方平台。

  • 编写一款具有更丰富视觉效果和改进交互性的复古 3D 飞船游戏。在 AI Studio 中试用。
  • 通过使用代码构建、解构和重组精细的 3D 体素艺术,将您的想象力变为现实。在 AI Studio 中试用。
  • 使用 Gemini 3 构建一个带有着色器的可玩科幻世界。在 AI Studio 中试用。

您可以使用 Gemini 3 通过 Vibe Coding 构建更丰富、更具交互性的 Web UI 和应用程序。

推出全新的“代理优先”开发体验

随着 Gemini 3 带来的模型智能加速,我们有机会重新构想整个开发者体验。今天,我们发布 Google Antigravity,这是我们全新的代理开发平台,它使开发者能够在更高的、以任务为导向的层面上进行操作。

利用 Gemini 3 先进的推理、工具使用和代理编程能力,Google Antigravity 将 AI 辅助从开发者工具箱中的一个工具转变为积极的合作伙伴。虽然 Google Antigravity 的核心是熟悉的 AI IDE 体验,但其代理已被提升到一个专用的层面,并被赋予了直接访问编辑器、终端和浏览器的权限。现在,代理可以代表您自主规划并同时执行复杂的端到端软件任务,同时验证它们自己的代码。

除了 Gemini 3 Pro,Google Antigravity 还与我们用于浏览器控制的最新 Gemini 2.5 Computer Use 模型,以及我们顶级的图像编辑模型 Nano Banana (Gemini 2.5 Image) 紧密结合。

Google Antigravity 使用 Gemini 3 驱动飞行追踪应用的端到端代理工作流。该代理独立规划、编写应用程序,并通过基于浏览器的计算机使用来验证其执行。

规划任何事情

自 Gemini 2 开启代理时代以来,我们取得了很大进展,不仅提升了 Gemini 的编程代理能力,还改进了其在更长跨度内可靠规划的能力。Gemini 3 通过登顶 Vending-Bench 2 排行榜证明了这一点,该测试通过管理模拟自动售货机业务来测试长期规划能力。Gemini 3 Pro 在整个模拟运营年度中保持了一致的工具使用和决策制定,在不偏离任务的情况下带来了更高的回报。

图片展示了Vending-Bench 2测试中不同模型的平均余额变化情况。横轴为天数,纵轴为平均余额(美元)。蓝色线代表Gemini 3 Pro,绿色线为Claude Sonnet 4.5,橙色线是GPT-5.1,浅蓝色线为Gemini 2.5 Pro。从图中可见,Gemini 3 Pro在365天内平均余额最高,达到约5000美元,远超其他模型。该图与上下文紧密相关,直观呈现了Gemini 3 Pro在长期规划能力测试中的表现,证明其能带来显著更高的回报。

Gemini 3 Pro 与其他前沿模型相比,展示了更好的长期规划能力,能产生显著更高的回报。

这意味着 Gemini 3 可以更好地帮助您处理日常生活中的事务。通过结合更深层次的推理与改进后更一致的工具使用,Gemini 3 可以代表您采取行动,从头到尾处理更复杂的多步骤工作流——例如预订本地服务或整理收件箱——所有这些都在您的控制和指导下进行。

Google AI Ultra 订阅用户今天即可在 Gemini App 中通过 Gemini Agent 体验这些代理能力。在改进 Gemini 的代理能力过程中我们学到了很多,我们很高兴看到随着我们很快将其扩展到更多 Google 产品中,您将如何使用它。

Gemini Agent 可以帮助您整理 Gmail 收件箱。Google AI Ultra 订阅用户现在即可在 Gemini App 中试用。

负责任地构建 Gemini 3

Gemini 3 是我们迄今为止最安全的模型,并经历了 Google 所有 AI 模型中迄今为止最全面的安全评估。该模型表现出更少的迎合讨好倾向,对提示注入(prompt injections)的抵抗力增强,并改进了针对网络攻击滥用的防护。

除了针对我们前沿安全框架(Frontier Safety Framework)关键领域的内部测试外,我们还与世界领先的主题专家合作进行评估,向英国 AISI 等机构提供早期访问权限,并获得了 Apollo、Vaultis、Dreadnode 等行业专家的独立评估。欲了解更多信息,请参阅 Gemini 3 模型卡。

Gemini 的下一个时代

这仅仅是 Gemini 3 时代的开始。即日起,Gemini 3 开始推出:

  • 面向 Gemini App 的所有用户,以及搜索中 AI 模式下的 Google AI Pro 和 Ultra 订阅用户

图片展示的是Gemini 3的界面。上方显示“Hello, Metafeng”,下方有“Ask Gemini”输入框,可添加工具。右侧有“Thinking”下拉菜单,当前选中“Thinking”模式,其下有“Choose your model”选项,列出“Fast”和“Thinking”模式,其中“Thinking”模式右侧有勾选标志。界面底部有“Create Image”“Write”“Build”“Deep Research”“Create Video”五个功能按钮。该图片与文档中介绍面向Gemini App的所有用户及搜索中AI模式下Google AI Pro和Ultra订阅用户推出Gemini 3的内容相关,展示了Gemini 3的使用界面。

https://gemini.google.com/app

  • 面向使用 AI Studio 中 Gemini API 的开发者、我们全新的代理开发平台 Google Antigravity 以及 Gemini CLI

图片展示了Google AI Studio的界面,左侧为导航栏,有Home、Get API key、Dashboard、Documentation等选项。中间是“Playground”区域,上方有“Google AI Studio”标题,下方有“Featured”“Gemini”“Live”等多个标签。右侧是“Gemini 3 Pro Preview”部分,显示其为最新模型,具备100%预训练和多模态理解能力等特性,还设有“System Instructions”“Temperature”“Media resolution”“Thinking level”等设置项,以及“Grounding with Google Search”开关等工具选项。

https://aistudio.google.com/prompts/new_chat?model=gemini-2.5-flash-image

  • 面向 Vertex AI 和 Gemini Enterprise 的企业用户

对于 Gemini 3 Deep Think 模式,我们会花额外的时间进行安全评估并收集安全测试人员的反馈,然后将在未来几周内向 Google AI Ultra 订阅用户开放。

我们计划很快向 Gemini 3 系列发布更多模型,以便您利用 AI 做更多事情。我们期待收到您的反馈,并看到您利用 Gemini 学习、构建和规划的成果。