一个由 Gemini 3 开启的智能新时代

Google 与 Alphabet 首席执行官 Sundar Pichai(桑达尔·皮查伊) 的公开信:
近两年前,我们开启了 Gemini 时代,这是我们要公司有史以来规模最大的科学与产品创举之一。从那时起,看到人们如此喜爱它简直令人难以置信。AI 概览(AI Overviews)现在的月活跃用户已达 20 亿。Gemini App 月活跃用户超过 6.5 亿,我们超过 70% 的云客户都在使用我们的 AI,1300 万开发者正在使用我们的生成式模型构建应用,但这仅仅是我们所见影响力的冰山一角。
得益于我们在 AI 创新方面差异化的全栈式策略——从领先的基础设施到世界级的研究、模型和工具,再到触达全球数十亿人的产品,我们能够比以往更快地将先进能力推向世界。
每一代 Gemini 都建立在上一代的基础之上,让您能做更多事情。Gemini 1 在原生多模态和长上下文窗口方面的突破,扩展了信息处理的种类和数量。Gemini 2 为代理能力奠定了基础,并拓展了推理和思考的前沿,协助处理更复杂的任务和创意,这也使得 Gemini 2.5 Pro 在 LMArena 榜首位置占据了半年之久。
现在,我们要推出 Gemini 3,这是我们要最智能的模型,它融合了 Gemini 的所有能力,助您将任何创意变为现实。
它在推理方面达到了最先进水平,旨在掌握深度和细微差别——无论是感知创意中微妙的线索,还是剥离难题中交织的层级。Gemini 3 也更擅长弄清您请求背后的语境和意图,因此您只需较少的提示词即可获得所需内容。想到在短短两年内,AI 已经从单纯阅读文本和图像进化到能够“察言观色”,真是令人惊叹。
从今天起,我们将以 Google 的规模全面推送 Gemini。这包括搜索中 AI 模式下的 Gemini 3,它具备更复杂的推理能力和全新的动态体验。这是我们首次在发布首日就将 Gemini 部署到搜索中。Gemini 3 今天也将登陆 Gemini App,并在 AI Studio 和 Vertex AI 中面向开发者开放,同时也将出现在我们全新的代理开发平台 Google Antigravity 中——详见下文。
像前几代一样,Gemini 3 再次推动了技术水平的进步。在这个新篇章中,我们将继续拓展智能、代理和个性化的边界,让 AI 真正对每个人都有所帮助。
希望您喜欢 Gemini 3,我们会不断改进它,并期待看到您用它构建的成果。未来还有更多精彩!
隆重介绍 Gemini 3:我们要最智能的模型,助您将任何创意变为现实
Google DeepMind 首席执行官 Demis Hassabis 与 Google DeepMind 首席技术官兼 Google 首席 AI 架构师 Koray Kavukcuoglu,代表 Gemini 团队致辞
今天,我们在通往通用人工智能(AGI)的道路上又迈出了一大步,正式发布 Gemini 3。
它是世界上多模态理解能力最强的模型,也是我们要迄今为止最强大的代理和 Vibe Coding(直觉编程)模型,能够提供更丰富的可视化效果和更深层次的交互性——所有这一切都建立在最先进的推理基础之上。
我们通过发布预览版 Gemini 3 Pro 来开启 Gemini 3 时代,并于今日在 Google 系列产品中上线,以便您在日常生活中使用它来学习、构建和规划任何事情。我们还推出了 Gemini 3 Deep Think——我们的增强推理模式,它将 Gemini 3 的性能推向新高——并在向 Google AI Ultra 订阅用户开放前,先提供给安全测试人员使用。
最先进的推理能力,具备前所未有的深度与细腻度
Gemini 3 Pro 凭借其最先进的推理和多模态能力,可以将任何创意变为现实。它在每一项主要的 AI 基准测试中都显著超越了 2.5 Pro。
它以 1501 Elo 分的突破性成绩登顶 LMArena 排行榜。它在“人类终极考试”(Humanity’s Last Exam,在不使用任何工具的情况下得分为 37.5%)和 GPQA Diamond(91.9%)中获得最高分,展现了博士级的推理能力。它还为前沿模型在数学领域设立了新标准,在 MathArena Apex 上取得了 23.4% 的最新业界最佳成绩。
除文本外,Gemini 3 Pro 还重新定义了多模态推理,在 MMMU-Pro 上得分 81%,在 Video-MMMU 上得分 87.6%。它还在 SimpleQA Verified 上取得了 72.1% 的业界最佳成绩,显示出在事实准确性方面的巨大进步。这意味着 Gemini 3 Pro 在解决科学和数学等广泛主题的复杂问题时,具备极高的能力和可靠性。

Gemini 3 在一系列关键 AI 基准测试中均处于领先地位。
这张图片展示了一份关于 Gemini 3 Pro 的性能基准测试(Benchmark)对比图。这是 Google DeepMind 发布的一份技术报告摘要,旨在展示其最新模型 Gemini 3 Pro 相比于前代产品(Gemini 2.5 Pro)以及主要竞争对手(Claude Sonnet 4.5 和 GPT-5.1)的性能优势。 以下是对这张图中关键信息的深度分析和解读:
核心结论:全面的代际领先
从整体数据来看,Gemini 3 Pro(第一列,淡蓝色背景)在几乎所有列出的基准测试中都取得了最高分(粗体显示)。 这不仅仅是微小的提升,在某些特定领域(尤其是数学、视觉推理和长窗口理解),它展现出了相对于 GPT-5.1 和 Claude Sonnet 4.5 的“代际级”碾压优势。
关键领域的详细解读
A. 极高难度的数学与逻辑推理 (Reasoning & Math)
这是最引人注目的部分,显示了模型在处理非标准化、高难度问题上的突破。
-
MathArena Apex: 这是一个极具挑战性的数学竞赛题库。
- Gemini 3 Pro: 23.4%
- GPT-5.1: 1.0%
- Claude Sonnet 4.5: 1.6%
- 解读: 这是一个数量级的差异。说明在极高难度的数学竞赛领域,Gemini 3 Pro 解决了一部分其他模型完全“无法理解”或“乱猜”的问题。
-
ARC-AGI-2: 视觉逻辑推理测试(通常被认为是衡量通向 AGI 进度的重要指标)。
- Gemini 3 Pro 得分 31.1%,几乎是 GPT-5.1 (17.6%) 的两倍。这表明其在未见过的视觉模式归纳能力上有了质的飞跃。
B. 智能体与屏幕理解能力 (Agentic & Screen Understanding)
这部分对于 AI 自动化工作流(Agent)至关重要。
-
ScreenSpot-Pro: 屏幕理解能力(识别 UI 元素、理解屏幕内容)。
- Gemini 3 Pro: 72.7%
- GPT-5.1: 3.5%
- 解读: 这是一个惊人的差距。这意味着 Gemini 3 Pro 可以像人类一样精准地“看懂”电脑或手机屏幕,这对于开发能够自动操作软件的 AI Agent 是决定性的能力。
-
Vending-Bench 2: 长程智能体任务(Long-horizon agentic tasks),用“净资产均值”来衡量。
- Gemini 3 Pro: $5,478.16
- GPT-5.1: $1,473.43
- 解读: 在复杂的、需要多步规划和决策的模拟经济环境中,Gemini 3 Pro 的表现远超对手,证明其规划和执行能力更强。
C. 长上下文与多模态 (Long Context & Multimodal)
-
MRCR v2 (1M pointwise): 百万级 token 的长文本检索。
- Gemini 3 Pro: 26.3%
- Claude/GPT: Not supported (不支持)
- 解读: 这一栏强调了 Google 在超长上下文窗口(Context Window)技术上的护城河。竞争对手在处理 1M(100万)长度的信息点查询时甚至无法支持,而 Gemini 依然保持了功能性。
-
Video-MMMU: 视频信息获取。
- Gemini 3 Pro (87.6%) 依然领先,显示了其原生多模态(Native Multimodal)处理视频的能力依然是业界顶尖。
竞争格局分析
根据图表中的模型命名(GPT-5.1, Claude Sonnet 4.5),我们可以推断出以下市场态势(基于图表设定的时间点):
- Claude Sonnet 4.5: 在代码(SWE-Bench)方面表现尚可(77.2%),甚至略微超过 Gemini 3 Pro(76.2%),这是它唯一保持竞争力的领域。但在数学和屏幕理解上落后较多。
- GPT-5.1: 虽然是强大的竞争对手,但在这份 Google 提供的榜单中,它在多项高难度推理和视觉任务上被 Gemini 3 Pro 拉开了显著差距,特别是在 ScreenSpot(屏幕理解)和 MathArena(高难数学)上。
总结
这张图传递的主要信号是:Gemini 3 Pro 正在试图从“聊天机器人”向“全能智能体(Generalist Agent)”转型。 它不再仅仅满足于回答文本问题,而是重点强化了:
- 视觉/屏幕理解(为操作电脑做准备)。
- 复杂逻辑规划(为解决长链路任务做准备)。
- 超难学科推理(突破现有 AI 的智力天花板)。 这是一份极具野心的成绩单,特别是针对AI Agent(智能体) 开发者而言,ScreenSpot-Pro 和 Vending-Bench 的分数提升是最具吸引力的卖点。
Gemini 3 Pro 还为每一次交互带来了全新的深度和细腻度。它的回答聪明、简洁且直接,摒弃了陈词滥调和阿谀奉承,取而代之的是真知灼见——告诉你需要听到的,而不仅仅是你想要听到的。它就像一位真正的思维伙伴,为你提供理解信息和表达自我的新方式,从通过生成高保真可视化代码来转化深奥的科学概念,到进行创意头脑风暴,无所不能。
Gemini 3 可以编写代码将托卡马克中的等离子体流可视化,并写一首诗来捕捉核聚变的物理原理。

Gemini 3 深度思考 (Deep Think)
Gemini 3 Deep Think 模式进一步拓展了智能的边界,使 Gemini 3 的推理和多模态理解能力实现了质的飞跃,助您解决更复杂的问题。
在测试中,Gemini 3 Deep Think 的表现超越了 Gemini 3 Pro 在“人类终极考试”(不使用工具得分为 41.0%)和 GPQA Diamond(93.8%)上已然令人印象深刻的成绩。它还在 ARC-AGI-2(包含代码执行,经 ARC Prize 验证)上取得了前所未有的 45.1% 的成绩,展示了其解决新颖挑战的能力。

Gemini 3 Deep Think 模式在一些最具挑战性的 AI 基准测试中表现优异。
Gemini 3 助您学习、构建和规划任何事情
学习任何事情
Gemini 从一开始就是为了无缝综合跨多种模态(包括文本、图像、视频、音频和代码)的任何主题信息而构建的。Gemini 3 结合了其最先进的推理、视觉和空间理解能力、领先的多语言性能以及 100 万 token 的上下文窗口,拓展了多模态推理的前沿,以最适合您的方式帮助您学习。
例如,如果您想学习家族传统的烹饪方法,Gemini 3 可以解读不同语言的手写食谱并将其翻译成可分享的家庭烹饪书。或者,如果您想学习一个新主题,您可以提供学术论文、长视频讲座或教程,它可以生成交互式抽认卡、可视化图表或其他格式的代码,帮助您掌握材料。它甚至可以分析您的匹克球比赛视频,找出您可以改进的地方,并生成全面的体态改进训练计划。
- Gemini 3 可以帮助您学习和保存家庭烹饪传统。在 Gemini Canvas 中试用。
- Gemini 3 可以帮助您分析研究论文等复杂信息,并生成交互式指南的代码。
- 获取关于您匹克球比赛的专家级体育分析,助您提升球技。
为了帮助您更好地理解网络上的信息,搜索中的 AI 模式现在使用 Gemini 3 来启用新的生成式 UI 体验,如沉浸式视觉布局、交互式工具和模拟,所有这些都是根据您的查询完全即时生成的。
在搜索的 AI 模式中,利用生成式 UI 学习 RNA 聚合酶工作原理等复杂主题。
构建任何东西
建立在 2.5 Pro 成功的基础之上,Gemini 3 兑现了为开发者将任何想法变为现实的承诺。它在零样本生成方面表现卓越,能够处理复杂的提示词和指令,渲染出更丰富、更具交互性的 Web UI。
Gemini 3 是我们要构建过的最好的 Vibe Coding 和代理编程模型——使我们的产品更具自主性,并提升开发者的生产力。它以 1487 Elo 的惊人高分登顶 WebDev Arena 排行榜。它在测试模型通过终端操作计算机工具使用能力的 Terminal-Bench 2.0 上得分 54.2%,并在衡量编程代理能力的基准测试 SWE-bench Verified (76.2%) 上大幅超越 2.5 Pro。
您现在可以在 Google AI Studio、Vertex AI、Gemini CLI 以及我们全新的代理开发平台 Google Antigravity 中使用 Gemini 3 进行构建。它也已上线 Cursor、GitHub、JetBrains、Manus、Replit 等第三方平台。
- 编写一款具有更丰富视觉效果和改进交互性的复古 3D 飞船游戏。在 AI Studio 中试用。
- 通过使用代码构建、解构和重组精细的 3D 体素艺术,将您的想象力变为现实。在 AI Studio 中试用。
- 使用 Gemini 3 构建一个带有着色器的可玩科幻世界。在 AI Studio 中试用。
您可以使用 Gemini 3 通过 Vibe Coding 构建更丰富、更具交互性的 Web UI 和应用程序。
推出全新的“代理优先”开发体验
随着 Gemini 3 带来的模型智能加速,我们有机会重新构想整个开发者体验。今天,我们发布 Google Antigravity,这是我们全新的代理开发平台,它使开发者能够在更高的、以任务为导向的层面上进行操作。
利用 Gemini 3 先进的推理、工具使用和代理编程能力,Google Antigravity 将 AI 辅助从开发者工具箱中的一个工具转变为积极的合作伙伴。虽然 Google Antigravity 的核心是熟悉的 AI IDE 体验,但其代理已被提升到一个专用的层面,并被赋予了直接访问编辑器、终端和浏览器的权限。现在,代理可以代表您自主规划并同时执行复杂的端到端软件任务,同时验证它们自己的代码。
除了 Gemini 3 Pro,Google Antigravity 还与我们用于浏览器控制的最新 Gemini 2.5 Computer Use 模型,以及我们顶级的图像编辑模型 Nano Banana (Gemini 2.5 Image) 紧密结合。
Google Antigravity 使用 Gemini 3 驱动飞行追踪应用的端到端代理工作流。该代理独立规划、编写应用程序,并通过基于浏览器的计算机使用来验证其执行。
规划任何事情
自 Gemini 2 开启代理时代以来,我们取得了很大进展,不仅提升了 Gemini 的编程代理能力,还改进了其在更长跨度内可靠规划的能力。Gemini 3 通过登顶 Vending-Bench 2 排行榜证明了这一点,该测试通过管理模拟自动售货机业务来测试长期规划能力。Gemini 3 Pro 在整个模拟运营年度中保持了一致的工具使用和决策制定,在不偏离任务的情况下带来了更高的回报。

Gemini 3 Pro 与其他前沿模型相比,展示了更好的长期规划能力,能产生显著更高的回报。
这意味着 Gemini 3 可以更好地帮助您处理日常生活中的事务。通过结合更深层次的推理与改进后更一致的工具使用,Gemini 3 可以代表您采取行动,从头到尾处理更复杂的多步骤工作流——例如预订本地服务或整理收件箱——所有这些都在您的控制和指导下进行。
Google AI Ultra 订阅用户今天即可在 Gemini App 中通过 Gemini Agent 体验这些代理能力。在改进 Gemini 的代理能力过程中我们学到了很多,我们很高兴看到随着我们很快将其扩展到更多 Google 产品中,您将如何使用它。
Gemini Agent 可以帮助您整理 Gmail 收件箱。Google AI Ultra 订阅用户现在即可在 Gemini App 中试用。
负责任地构建 Gemini 3
Gemini 3 是我们迄今为止最安全的模型,并经历了 Google 所有 AI 模型中迄今为止最全面的安全评估。该模型表现出更少的迎合讨好倾向,对提示注入(prompt injections)的抵抗力增强,并改进了针对网络攻击滥用的防护。
除了针对我们前沿安全框架(Frontier Safety Framework)关键领域的内部测试外,我们还与世界领先的主题专家合作进行评估,向英国 AISI 等机构提供早期访问权限,并获得了 Apollo、Vaultis、Dreadnode 等行业专家的独立评估。欲了解更多信息,请参阅 Gemini 3 模型卡。
Gemini 的下一个时代
这仅仅是 Gemini 3 时代的开始。即日起,Gemini 3 开始推出:
- 面向 Gemini App 的所有用户,以及搜索中 AI 模式下的 Google AI Pro 和 Ultra 订阅用户

- 面向使用 AI Studio 中 Gemini API 的开发者、我们全新的代理开发平台 Google Antigravity 以及 Gemini CLI

https://aistudio.google.com/prompts/new_chat?model=gemini-2.5-flash-image
- 面向 Vertex AI 和 Gemini Enterprise 的企业用户
对于 Gemini 3 Deep Think 模式,我们会花额外的时间进行安全评估并收集安全测试人员的反馈,然后将在未来几周内向 Google AI Ultra 订阅用户开放。
我们计划很快向 Gemini 3 系列发布更多模型,以便您利用 AI 做更多事情。我们期待收到您的反馈,并看到您利用 Gemini 学习、构建和规划的成果。