谷歌Deep Think八语奥赛屠榜,自主攻克4大未解难题,科研壁垒崩塌

marsbit發佈於 2026-04-08更新於 2026-04-08

文章摘要

谷歌DeepMind推出AI系统Deep Think,在八种语言(日语、中文、法语、韩语、印地语、越南语、俄语、葡萄牙语)的数学和信息学奥林匹克区域赛中均取得高分甚至满分成绩,展现跨语言推理能力。其中日语数学奥赛满分,中文数学奥赛获86.3%高分,但信息学竞赛表现略弱,显示其在纯推理与工程实现间的能力差异。 Deep Think此前已在IMO、ICPC等国际顶级竞赛中达到金牌水平,并逐步扩展至物理、化学等多学科。其升级版还能驱动科研智能体Aletheia,自主解决未解数学问题,参与论文撰写,并在计算机科学、物理学、经济学等领域突破长期难题。 尽管成绩单目前仅由Google内部发布,未经第三方独立验证,但其多语言能力有望降低非英语科学家的科研门槛,推动AI作为“人类智力倍增器”的公平应用。

「Deep Think」在所有竞赛中都击败/媲美竞争对手」!

刚刚,Google DeepMind高级研究员Conglong Li在X平台连发12条帖子,甩出了一张前所未见的成绩单。

一个AI,同一个大脑,八张不同语言的试卷,全部高分交卷。

在任何一个模型身上,这样的成绩实属罕见。

从IMO金牌到区域赛全覆盖

这次Deep Think拿下多个榜单高分,并非突然的单点爆发,而是一条已经持续了近一年的能力演进曲线。

首先登顶最硬核的推理赛场。

2025年7月,Gemini Deep Think首次在国际数学奥林匹克(IMO)达到金牌标准,42分拿下35分。同期在ICPC世界决赛也取得类似高水平表现。

这两个成绩,DeepMind官方博客已经正式公布。

Google DeepMind随后把这两项成绩都写进了官方博客,作为Deep Think迈过数学与编程「世界级竞赛门槛」的标志。

接着,Deep Think开始从「世界冠军级单项突破」,走向「跨语言、跨学科、跨场景的系统验证」。

2026年2月,Google连发三篇博客。

一篇介绍Gemini 3.1 Pro模型本体,一篇介绍Deep Think专用推理模式的重大升级,一篇来自DeepMind科学发现团队,直接把Deep Think定位成「人类智力倍增器」。

升级后的Deep Think交出了一串硬指标:

Humanity's Last Exam拿下48.4%(无工具辅助),ARC-AGI-2达到84.6%(ARC Prize基金会官方验证),Codeforces竞赛编程Elo评分3455,2025国际物理奥赛和化学奥赛笔试部分达到金牌水平。

这条路线非常清楚:先用IMO、ICPC这样的世界级竞赛,证明它的强大推理能力,然后再用多语种、区域赛和跨学科奥赛成绩,证明它的跨语言、跨领域稳定迁移的通用深度推理能力。

Gemini Deep Think从IMO金牌到PhD级科研加速的能力演进

8语言成绩单逐项细看

现在,把这张成绩单真正摊开来看。

日语最亮眼。

2025年第35回日本数学奥赛本选(JMO Finals),满分。

ICPC亚洲日本初赛,满分。

其中,JMO本选这项成绩甚至超过了当届最高得分对应的80%水平,达到官方所说的「金奖相当」标准。

法语同样满分,100%。

中文就有意思了。

第41届中国数学奥林匹克(CMO),Deep Think拿到86.3%,相当出色。但中国信息学奥赛(NOI)只有63.3%。

86.3%和63.3%之间的落差,画出了AI推理能力的真实边界。

在数学竞赛里,模型面对的是抽象推导、证明构造和多步演绎,这恰好是Deep Think最擅长的能力带。

但到了信息学竞赛,问题就不只是「想明白」,还包括把逻辑翻译成可执行代码、控制边界条件、兼顾复杂度约束,并且在实现层面避免失误。

前者更接近纯推理,后者则要求「推理+算法设计+工程化实现」同时过关。

其它语种,韩语、印地语、越南语、俄语、葡萄牙语对应的竞赛结果里,Deep Think 也都实现了击败对手或至少持平。

如果把日语、法语、中文再合起来看,这次最不寻常的一点其实不是某一门单科刷到满分,而是同一个模型、同一种Deep Think推理系统,在多种语言的竞赛试卷上,都交出了第一梯队的成绩。

这份成绩单可靠吗?

但这里有一个关键的缺失:

Conglong Li并没有列出竞品的具体对比数据:所有成绩,全部来自Google内部评测。没有第三方独立复现,没有竞赛官方认证,评测方法完全没有公开。

每道题是做一次还是做很多次取最优?推理时用了多少算力?有没有人工提示工程介入?

这些直接影响成绩含金量的细节,也都没提。

还有一点容易被忽略:这些考试全部是各国区域选拔赛,不是国际决赛。

区域赛的题目难度和国际决赛之间,隔着一个量级。

研究员明确说了,这些成绩「将被纳入模型卡」,截至发稿,模型卡尚未正式更新。

所以,目前这仍然好像是一张由考生自己打分、自己公布、尚未交给教务处盖章的成绩单。

多语言科研公平性,被忽视的真正战场

为什么Google要专门花精力做8种语言的区域赛评测?

当前AI推理能力的评测,几乎全部基于英语。

MATH、GSM8K、HumanEval、ARC-AGI......这些都是英语。

全世界的数学家、物理学家、工程师,只要母语不是英语,在使用AI科研工具时都要先过一道语言关。

Google选的这8种语言不是随机的。

日语、韩语、中文覆盖东亚科研重镇,印地语、越南语覆盖新兴市场,法语、俄语、葡萄牙语覆盖欧洲和南美。

加在一起,这是全球科研产出的大半壁江山。

DeepMind在官方博客里把Deep Think定位为「人类智力倍增器」,说它能「处理知识检索和严格验证,让科学家专注于概念深度和创造性方向」。

结合这次的多语言成绩,这句话的潜台词不难理解:这个倍增器,不仅限英语的科学家用。

更值得注意的是Deep Think在科研落地上已经走了多远。

DeepMind公布了一个叫Aletheia的数学研究智能体,基于Deep Think驱动,能自主生成、验证、修订研究级数学问题的解法。

Aletheia由Deep Think驱动,能够对研究级数学问题进行迭代式生成、验证与修正

Aletheia已经参与产出了多篇研究论文,其中一篇完全由AI自主完成,计算了算术几何中的特定结构常数。

另外,在700个开放数学问题的半自主评估中,它还独立解决了4个此前未解的问题。

Gemini Deep Think模式在计算机科学、物理学、经济学等领域也展现出巨大潜力。

在计算机科学领域,Deep Think帮助推翻了一个悬而未决十年的猜想,在物理学领域找到了宇宙弦引力辐射的新型解析解,在经济学领域扩展了一个拍卖理论定理。

AI推理流程的示意图,展示了在网络层进行的大规模解空间探索如何被汇聚为结构化推理,并通过自动化与人工验证加以确认。

通过与专家合作解决18个研究难题,Gemini Deep Think的高级版本帮助突破了算法、机器学习与组合优化、信息论以及经济学领域长期存在的瓶颈。

这已经远远超出了「做竞赛题」的范畴。

当竞品还在卷英文benchmark排行榜的时候,Google已经在「AI科研加速器」领域找到了新战场。

这件事请最重要的东西其实不是分数,它背后真正的信号是:AI科研工具的语言壁垒正在被当作一个工程问题来解决。

如果这条路走通了,全世界用日语、韩语、中文、印地语做研究的科学家,将第一次和英语母语者站在同一条起跑线上。

这一次,Google已经把牌摊在了桌上。

至于竞争对手谁会跟牌,相信我们很快也将看到。

参考资料:

https://blog.google/intl/ja-jp/company-news/technology/gemini-31-pro-gemini-31-pro-deep-think/%20

https://deepmind.google/blog/accelerating-mathematical-and-scientific-discovery-with-gemini-deep-think/%20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/%20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/

本文来自微信公众号“新智元”,作者:新智元

相關問答

Q谷歌Deep Think在哪些国际竞赛中取得了金牌级别的成绩?

A谷歌Deep Think在国际数学奥林匹克(IMO)达到金牌标准(42分拿下35分),在ICPC世界决赛也取得高水平表现,并在2025国际物理奥赛和化学奥赛笔试部分达到金牌水平。

QDeep Think在8种语言的竞赛中表现如何?哪些语言取得了满分?

ADeep Think在8种语言的竞赛中都取得了高分,其中日语和法语竞赛取得了满分,中文数学奥林匹克(CMO)获得86.3%,但信息学奥赛(NOI)为63.3%,其他语言如韩语、印地语、越南语、俄语、葡萄牙语均击败或持平竞争对手。

QDeep Think在科研领域有哪些具体突破?

ADeep Think驱动了Aletheia数学研究智能体,自主解决了4个此前未解的数学问题,并在计算机科学领域推翻了一个悬而未决十年的猜想,在物理学领域找到了宇宙弦引力辐射的新型解析解,在经济学领域扩展了拍卖理论定理。

Q谷歌为什么选择8种特定语言进行区域赛评测?

A谷歌选择的8种语言(日语、韩语、中文、印地语、越南语、法语、俄语、葡萄牙语)覆盖了全球科研产出的大半壁江山,旨在解决AI科研工具的语言壁垒,让非英语母语的科学家也能平等使用高级AI研究工具。

Q目前Deep Think公布的竞赛成绩存在哪些可信度问题?

ADeep Think的成绩全部来自Google内部评测,缺乏第三方独立复现和竞赛官方认证,评测方法未公开,未说明题目尝试次数、算力使用和人工提示等细节,且区域赛难度低于国际决赛,模型卡尚未正式更新,因此成绩单的可靠性有待验证。

你可能也喜歡

富达年中复盘:2026 年数字资产的 6 大关键趋势

富达数字资产研究团队在2026年年中复盘报告中,梳理了年初展望中提出的六大关键趋势进展,认为数字资产领域正在进行结构性“重塑”。 1. **数字资产与传统资本市场加速整合**:趋势持续且快于预期。现货比特币ETP期权未平仓合约激增,代币化领域活跃,监管框架(如SEC/CFTC指南)趋于清晰,推动数字资产进一步融入主流金融体系。 2. **代币持有者权利受关注但仍不明朗**:生态内相关机制(如回购、治理重组)的试验在继续,但市场尚未对此形成明确的“权利溢价”定价,该趋势仍处早期。 3. **人工智能算力需求可能影响比特币挖矿**:比特币算力与挖矿难度出现下降,虽部分受季节性因素影响,但增长放缓的长期趋势与AI算力竞争加剧的预测相符,矿工可能正转向更有利可图的AI数据中心业务。 4. **比特币网络处于新的转折点**:OP_RETURN数据上限放宽未导致网络滥用或臃肿。当前焦点转向网络动态,Bitcoin Knots节点占比约17%,虽引发对潜在分裂风险的讨论,但Bitcoin Core(占比77%)仍主导共识。同时,抗量子计算等长期安全升级研究获得进展。 5. **空头暂时掌控市场局面**:年初至今,受清算去杠杆、高通胀及地缘政治不确定性影响,熊市情景占上风,比特币价格下跌。但近期在地缘冲突后,比特币展现出避险属性,跑赢部分传统资产,且机构参与、监管清晰度提升等结构性利好依然存在。 6. **黄金保持强势,去美元化趋势显现**:黄金在央行购金及去美元化趋势支撑下表现强劲。有证据显示比特币开始在一些国际贸易场景(如伊朗)作为支付手段被使用,但比特币紧随黄金优异表现的情景尚未出现。 **结论**:当前数字资产市场呈现短期压力与长期结构性进展并存的局面。投资者需超越价格波动,关注机构融合、监管、基础设施等领域的实质推进,这些正为下一阶段增长积蓄力量。

marsbit31 分鐘前

富达年中复盘:2026 年数字资产的 6 大关键趋势

marsbit31 分鐘前

富达年中复盘:2026 年数字资产的 6 大关键趋势

富达数字资产在年中复盘中,梳理了其在《2026年展望》中提出的六大关键趋势的当前进展: 1. **数字资产与资本市场加速整合**:传统金融渠道对数字资产的敞口需求坚挺,现货比特币ETP期权等产品发展迅速,反映出机构和主流投资者采用率持续上升。代币化势头增强,监管框架也趋于清晰,推动数字资产进一步融入金融体系。 2. **代币持有者权利逐渐受关注**:生态内正在试验更多机制以绑定持有者利益,如基于储备的回购和治理结构更新。但相关的“权利溢价”尚未完全体现在市场定价中,趋势仍处早期。 3. **人工智能与挖矿的潜在转变**:比特币算力增长呈现放缓趋势,部分原因可能是矿工将能源和基础设施转向利润率可能更高的AI算力需求。这符合此前关于结构性转变的判断。 4. **比特币处于新的转折点**:提高OP_RETURN数据上限并未导致区块链明显膨胀或网络压力。当前焦点转向网络动态,如Bitcoin Knots节点的波动可能带来潜在分裂风险,但Bitcoin Core节点仍主导共识。同时,抗量子计算等长期安全升级的准备工作也在推进。 5. **空头暂时掌控局面**:受去杠杆、高通胀及地缘政治不确定性影响,比特币价格承压,熊市情景占上风。但在压力时期,比特币也展现出作为高流动性中立资产的韧性,且机构参与、监管清晰度提升等结构性利好依然存在。 6. **黄金保持强势**:受央行购金及全球“去美元化”趋势支撑,黄金年初表现强劲。央行需求持续,黄金已成为全球主要储备资产。然而,此前预期的比特币紧随黄金的优异表现尚未出现。 **结论**:当前数字资产市场呈现短期压力与长期结构性进展并存的局面。机构化、监管和基础设施等趋势正按预期推进,为下一阶段增长积蓄力量,投资者需关注这些底层转变而非短期价格波动。

链捕手39 分鐘前

富达年中复盘:2026 年数字资产的 6 大关键趋势

链捕手39 分鐘前

Crypto GP 的中年危机:没有 PMF,就没有 LP 的下一张支票

**Crypto GP的中年危机:没有PMF,就没有LP的下一张支票** 当前加密货币市场,有限合伙人(LP)已不再愿意为虚无的梦想买单,普通合伙人(GP)必须拿出具有产品市场契合度(PMF)的具体产品才能持续获得融资。市场环境已从“购买未来愿景”转向“购买具体产品”阶段,LP要求立即、相对确定的赚钱机会。 文章将当前加密募资产品分为三大类:一级市场(Primary)、流动性市场(Liquid)以及中心化/去中心化金融原生收益(CeFi/DeFi Native Yield)。本文上篇重点分析一级市场。 **一级市场现状与挑战:** 过去,LP投资加密VC的主要理由包括:捕捉行业增长红利、获取项目投资渠道、信赖GP的卓越判断力、看重GP的“攒局”资源整合能力,或是进行声誉投资。然而,这些理由如今已大大削弱: 1. 获取加密资产曝险的途径(如ETF、托管账户等)已非常丰富,不再依赖VC盲池基金。 2. LP自身学习能力增强,或已建立内部团队,对GP渠道的依赖降低。 3. 多数GP在上个周期未能证明其判断力优于市场。 4. 市场下行时,“攒局”与退出变得困难。 **谁能留在牌桌上?** 在当前环境下,能继续在一级市场募资的GP主要包括: 1. 管理规模足以进入捐赠基金等长期耐心资本配置范围的基金。 2. 使用自有资金投资的家族办公室、公司或高净值人士。 3. 在本周期内真正为LP创造了超额回报的少数基金。 4. 具备明确生态资源和利益置换能力的“攒局型”基金。 对于其他大多数GP而言,行业信任已然受损,需要心态归零,在细分领域重新证明自己创造超额回报的能力,或提供具体的服务价值,以此重建信任并寻求发展。

marsbit1 小時前

Crypto GP 的中年危机:没有 PMF,就没有 LP 的下一张支票

marsbit1 小時前

脱钩时代来临,比特币不再是加密的唯一罗盘

文章指出,加密市场正告别以比特币为单一风向标的时代,分化为“内生型”和“外生型”两大资产阵营。 内生型资产(如比特币和多数传统加密货币)的价值仍与加密市场整体行情深度绑定。而外生型资产的崛起成为新趋势,其价值主要依托自身业务的真实需求和基本面,日益独立于比特币价格波动。 例如,Hyperliquid作为混合型案例,其部分合约交易已转向非加密资产。Venice等项目则完全脱离加密市场,其商业模式更接近消费级AI服务,收入来自用户为AI推理付费。Figure公司利用区块链技术提升贷款效率,其核心价值在于金融科技业务本身。 此外,稳定币等赛道的企业收购与高增长(如BVNK、Bridge),也显示了其发展与加密牛熊周期的脱钩。 这一转变意味着行业分析逻辑的根本改变:研究外生型资产需要像分析传统企业一样,专注于用户群体、经济模型和行业护城河等基本面,而非紧盯比特币价格。文章列举了多个具备潜力的外生型赛道,包括链上金融服务、AI与加密融合、新型数字银行、支付、非金融消费产品等。 目前,投资相关企业股权仍是主要途径,代币机制仍需优化。但核心趋势已定:加密市场的驱动力正变得多元,行业研究重心将从解读比特币图表转向深耕企业基本面。未来,加密市场齐涨共跌的局面或将不再。

marsbit2 小時前

脱钩时代来临,比特币不再是加密的唯一罗盘

marsbit2 小時前

交易

現貨
合約
活动图片