AI领走埃尔德什100美元赏金,44页顶刊没解的题,它一页纸答出

marsbit发布于2026-07-20更新于2026-07-20

文章摘要

AI模型GPT-5.6在数学研究领域取得突破,以简洁证明解决了长期悬而未决的埃尔德什问题。1991年,数学家József Beck曾在顶刊《数学年刊》发表44页论文,部分解决了埃尔德什第119号问题中关于单位圆上零点多项式模的猜想,但第三问始终未解,并附有100美元赏金。如今,GPT-5.6与数学家Korsky合作,仅用一页纸就完成了该问题的证明,其方法并未依赖复杂新工具,而是通过巧妙的调和分析技巧,发现了被人类直觉忽略的更直接路径。 曼彻斯特大学研究员、埃尔德什问题网站维护者Thomas Bloom对此评价称,这并非推翻前人工作,而是找到了更优解法,表明某些难题的障碍可能源于人类研究习惯的局限。此前,AI在解决埃尔德什其他猜想(如Cycle Double Cover猜想)时也展现出类似特点:能坚持不懈地尝试多种变体,突破人类因“直觉性止损”而放弃的思路。 去年OpenAI曾因宣称GPT-5解决多个埃尔德什问题而引发争议,被指仅是复现已知文献。如今,随着GPT-5.6在多项数学评测中表现提升,并在ARC-AGI等衡量推理能力的基准测试中取得进展,关于“AI数学能力是否遇到瓶颈”的讨论也在持续。有观点认为,许多历史难题的“难”可能部分源于人类耐心的边界,而非纯粹的智力屏障,AI的持久探索能力正在重新定义难题的解决可能。

一页纸,啃下了一篇要用44页顶刊论文才啃动的硬骨头。

1991年,《数学年刊》(Annals of Mathematics)上登出过一篇44页的论文。

作者叫József Beck,这个名字在组合数学圈无人不知。

他是Beck-Fiala定理的提出者,1985年Fulkerson奖得主,1986年国际数学家大会受邀报告人,差异理论的奠基者之一。

论文标题是《单位圆上零点多项式的模:埃尔德什的一个问题》,攻克的是埃尔德什问题库(Erdős Problems)里编号119的那道题。

在单位圆上随便取一串复数当零点,乘成多项式,这个多项式在单位圆上的最大模Mn,能不能保证在无穷多个n处超过n的c次方。

Beck证明了,能。这道题是那个年代公认最难啃的硬骨头。

AI领走了埃尔德什的赏金。119号问题当年一口气问了三问,第三问悬赏100美元,如今状态已改为SOLVED。

35年后,这篇论文被一页纸超过了。

说这话的,是Thomas Bloom。

他是一位数学家、曼彻斯特大学研究员,也是erdosproblems.com网站的创建者和维护者。

埃尔德什留下的1000多道开放问题都挂在这个网站上,是全球数学家追踪这些问题的第一站。

正因如此,AI公司每次宣称「解决了埃尔德什问题」,都要先过他这一关。

他在X上写道:

目前为止,GPT-5.6 Sol是我见过数学上最有意思的新模型。那些提交到erdosproblems.com的新证明,凡是我细看过的,全部正确,而且都包含一些有趣的想法。

Bloom还特意强调,这不是因为AI动用了什么更复杂的武器,而是我们原本以为,这道题比它实际上难得多。

OpenAI总裁Greg Brockman转发了这条推文,说了一句:

感觉这是推进数学的一个分水岭时刻。能真正改善人类生活的科学与医学突破,现在感觉非常近了。

埃尔德什的100美元悬赏,AI领走了

先把这道题的来龙去脉捋清楚。

1957年,埃尔德什在一篇论文里问出了这道题,一口气问了三问,问的是单位圆上零点多项式的模。

此后的四十年里,他在1961、1964、1982、1990、1997年反复重提。

第一问,Wagner在1980年拿下。

第二问,Beck在1991年拿下,证明存在某个c>0,使得max_{n≤N} M_n > N^c。这就是那篇44页的《数学年刊》论文。

Beck这篇论文发表于《数学年刊》1991年第134卷第3期

第三问,埃尔德什自己掏钱挂了100美元赏金,出处是他1997年的一篇文章。

现在,领走赏金的是GPT-5.6和一位叫Korsky的数学家。他们只用一页纸,就搞定了Beck没碰的那一问。

埃尔德什一生提出上千道问题,并自掏腰包为它们悬赏,金额从25美元到1万美元不等。

Bloom的评价是:GPT在Korsky的提示下,只用了1页简单的调和分析技巧,就证出了比Beck那篇44页Annals论文更强的结果。

关键的一步,Bloom后来在讨论区里点破了:把一个非负函数做卷积,再在时间上平移1,表达式一下子就光滑了,原本硬啃的地方顺了下来。

他说,这种把算子范数放到对偶范数和内积里去估的路数,本来就是分析里最常用的招之一。

不是新工具,是旧工具用在了没人想过的地方。

Bloom说明,Beck那篇Annals论文里有许多重要而有趣的想法,只是这道题用不上。他补了一句:至少对我来说,这挺意外的。

他还提到一个细节:没人算过那个常数,估计非常小。Beck自己当年也没算,而依他的判断,如果那个常数值得一提,Beck不会不算。

所以,这不是AI推翻了顶刊,而是发现了一条人类本来可以不绕的弯路。

对数学家来说,这比「AI又解出一道题」刺激得多。

解出一道题,只是多了个工具。这一次,是工具反过来纠正了用工具的人。

人会耸耸肩走开,AI会接着试下一个

如果只有这一件事,它顶多算个漂亮的孤例。

GPT-5.6 Sol Ultra于7月9日全量放开,7月10日,OpenAI宣布GPT-5.6 Sol Ultra产出了Cycle Double Cover猜想的完整证明。

这道题由Szekeres在1973年、Seymour在1979年各自独立提出,悬了约五十年。

模型被分配了8小时,实际用了不到1小时,跑法是64个子智能体并行开工。提示词和证明PDF全部公开。

Bloom是第一个给出实质评价的人。

他说这是一个很漂亮的证明,然后给了三个形容词:

短。初等。1980年代就本可以被发现。

他也点出了背后的原因:他推测,关键那一步里有一个很小的、反直觉的拐弯。

一个人类数学家会怎么处理这道题?

他会先试那个最自然的做法,检查一遍线性代数,发现不行,然后耸耸肩,心里想一句「本来也没指望能这么容易」,起身走人。

但AI不会气馁。它会接着做小变体,直到某一个成立为止。

AI强在不做情绪性止损。

回头看今年4月,GPT-5.4 Pro在80分钟里解掉了Erdős 1196,用的是von Mangoldt函数。

牛津的Jared Lichtman在那个问题上耗了七年,他后来说,自1935年以来,所有做原始集问题的人都习惯了同一个开局动作,而那个动作,遮蔽了一个在明处摆了整整90年的技术可能。

陶哲轩看完的评价更狠:过去几十年,人类在第一步就集体走偏了。

人类的直觉当然不是缺陷。恰恰相反,它是效率工具:替我们省掉了海量注定失败的尝试,没有它,没人能在有限的一生里走到学科前沿。

代价是,偶尔它也会省掉不该省的那一次。

说GPT-5.6有意思的人,去年说过另一句话

去年10月,Bloom曾公开打脸OpenAI。

当时,OpenAI副总裁Kevin Weil转发了Mark Sellke的帖子并写道:GPT-5刚刚找到了10道此前未解的埃尔德什问题的解,另有11道取得进展,这些题都已经开放了数十年。

Bloom一句话回应为此定性:戏剧性的误导。

他说这些题在网站上标着open,只意味着他本人不知道有哪篇论文解决过它。GPT-5干的事情,是把他不知道的那些文献翻了出来。

而找到文献,不等于造出证明。

接下来的情形,许多人都记得。

LeCun在旁边补刀,暗讽自己埋的雷炸了自己。Hassabis更直接:这太尴尬了。

Weil删帖。

OpenAI研究员Sébastien Bubeck最后承认只是找到了文献里已有的解。

今年5月OpenAI再宣布推翻一个1946年的埃尔德什几何猜想时,在公告里同步附上Noga Alon、Melanie Wood和Thomas Bloom的评价。

AI数学撞墙了吗?

Bloom那条帖子底下的论战,也很精彩。

唱衰派以用户qrdl为代表,「5.6的思维链输出少得可怜,677那道题毫无进展,物理侧的CritPT评测相比5.4几乎没动」。

他的结论是:AI在数学上已经撞墙了。

用户qrdl在论坛发帖,说CritPT自5.4以来几乎没动,除非他们找到了给基准刷分的办法,否则结果也就这样。

qrdl的论证倒不情绪化。

他认为大模型本质上是静态权重的token生成器,做数学的时候,不会像人一样实时长出新的神经连接。而真正的创造性跳跃,需要一个有弹性的大脑。

qrdl的体感是:每次开新会话去攻677,模型就把那些早已失败过的老招式再来一遍。

回怼来得也很快。

Nat Sothanaphan指出,CritPT是物理测试,不是数学基准,拿它一家的曲线证明AI在数学上撞墙,是挑对自己有利的数据。

他给的反证是:5.6在包括FrontierMath在内的一大批评测上都比5.5有提升。

另一派是实战派,代表是名为old-bielefelder的用户。

old-bielefelder报告,GPT-5.6 Sol思考14分钟、复核9分多钟,把Pintz 2018年那个0.72的指数改进到0.7195。

不算惊天动地,但确实动了,用old-bielefelder自己的说法是「第一口奶」。

作为对照,前一天晚上GPT-5.5在同一个问题上磨了一个多小时,0.72纹丝不动。

他随后把结果直接通知了Pintz本人。

第三种声音同样来自Nat Sothanaphan,他借用了Bloom的一个说法:现代数学是一座巨大的教堂。

走到这座教堂的最前沿本身就极耗力气,而大模型已经能以超人的效率做到这件事,最近的突破基本都源于此。再往前推,需要的是流动智力。

有人说大模型没有流动智力,他认为这是错的。

ARC系列评测这几年的持续上涨就是证据,GPT-5.6 Sol在最高推理档位下拿到7.8%。这个基准今年3月上线时,最好成绩是0.37%,而人类稳定在90%以上。

ARC Prize官方验证成绩。GPT-5.6 Sol在ARC-AGI-3上的表现随推理档位陡升,Low档只有0.3%,Max档拿到7.8%。

他的解释是:教堂的地基太庞大了,庞大到把那点正在快速生长的流动智力完全盖住。所以你光看产出的分量,会觉得什么都没发生。

但等到某一天流动智力开始压过地基,它会突然变得肉眼可见。

吵了两周,这场争论真正吵出来的,不是「AI能不能做数学」,是「难」这个字要怎么定义。

数学史上那些标着「悬而未决」的条目,一部分记录的是问题本身的难度,另一部分记录的只是人类耐心的边界。

过去这两者混在一起,没人分得开。现在,开始能区分了。

一道题挂了几十年没人领走,可能不是因为它有多难,而是因为没人肯在那条路上再试第三十次。

还有多少题目,卡住它们的其实只是人类的耐心?

参考资料:

https://annals.math.princeton.edu/1991/134-3/p03

https://www.erdosproblems.com/forum/thread/AI%20Contributions

https://arcprize.org/results/openai-gpt-5-6-sol

本文来自微信公众号“新智元”,作者:ASI启示录;编辑:元宇

热门币种推荐

相关问答

Q这篇文章报道了AI解决了哪个著名的数学问题?

AAI(GPT-5.6 Sol)与数学家Korsky合作,解决了埃尔德什问题库(Erdős Problems)中的第119号问题,特别是该问题的第三问,这个问题曾由数学家József Beck在1991年用一篇44页的顶刊论文(《数学年刊》)解决了第二问。AI用一页纸的证明解决了第三问,并因此领走了埃尔德什悬赏的100美元。

QThomas Bloom对GPT-5.6 Sol解决这个数学问题的评价是什么?

AThomas Bloom评价GPT-5.6 Sol是他见过的数学上最有意思的新模型之一。他认为AI提交的证明不仅正确,而且包含有趣的想法。他指出,AI并没有使用更复杂的工具,而是揭示了这个问题实际上比人类原先认为的要简单,并采用了一种人类先前没有想到的、使用已有调和分析技巧的简洁方法,从而走了一条捷径。

Q根据文章,与人类相比,AI在尝试解决这类数学难题时有什么独特优势?

AAI在尝试解决数学难题时,不会像人类那样容易“情绪性止损”。当一个人类数学家尝试一个自然方法失败后,可能会放弃并认为此路不通。但AI会不知疲倦地继续尝试小的变体,直到找到其中一个成立。这种无限的耐心和系统性的穷举能力,使得AI能够发现那些被人类直觉或习惯性思维所忽略的可能性。

Q文章中提到,去年OpenAI在宣称解决埃尔德什问题时曾遇到什么尴尬情况?

A去年,OpenAI曾宣称GPT-5找到了10个未解的埃尔德什问题的解。但网站维护者Thomas Bloom指出,这造成了“戏剧性的误导”,因为那些问题在网站上标记为“开放”,仅意味着他本人不知道有已发表的解决方案,而GPT-5实际上只是发现了文献中已有的解,并未创造出新的证明。这导致OpenAI相关人士删帖并承认错误,一度成为争议事件。

Q文章中关于“AI在数学上是否撞墙”的争论,反对者qrdl和Nat Sothanaphan的主要观点分别是什么?

A反对者qrdl认为AI在数学上已经“撞墙”,因为模型本质上是静态的token生成器,缺乏人脑实时生长新神经连接的创造性,在解决特定问题时会重复失败的尝试。支持者Nat Sothanaphan则认为,不能仅凭物理测试基准(CritPT)停滞就断定数学能力停滞,他指出GPT-5.6在包括FrontierMath在内的多个数学评测上都有提升,并且AI的“流动智力”(体现于ARC-AGI等基准)正在快速增长,只是目前被庞大的已知知识(“地基”)所掩盖,尚未全面显现。

你可能也喜欢

WEEX TradFi:一个USDT账户交易股票、黄金、石油和全球市场

全球加密货币交易所WEEX宣布推出WEEX TradFi,这是一项新的USDT保证金交易服务,允许加密用户直接接触传统市场,包括黄金、白银、原油、代币化股票和全球指数。 通过WEEX TradFi,用户可以使用单一账户交易加密和传统资产,无需单独的经纪账户或银行入金,消除了摩擦。市场24/7开放,让交易者能灵活地在加密与传统资产间切换。 该服务旨在为加密原生交易者提供多元化投资渠道,让他们在不脱离现有USDT工作流程的情况下,接触宏观经济主题。交易合约追踪价格变动而非赋予底层资产所有权,因此不涉及股票、股息或投票权。 WEEX TradFi移除了传统市场访问通常所需的经纪账户、银行关联资金和固定交易时间限制。用户只需使用USDT(通过链上转账、OTC购买或内部转账)为账户注资,即可从现有WEEX期货余额中直接开仓。 WEEX还推出了“WEEXTradFi交易挑战赛”,为新老用户提供奖励,包括欢迎奖金、新用户奖金和交易竞赛,奖励以试用金形式发放。所有交易涉及风险,且产品并非在所有地区都可用。 WEEX成立于2018年,已发展成为拥有超过620万用户的全球加密货币交易所,提供丰富的交易对和高杠杆期货交易,并注重安全性与用户体验。

TheNewsCrypto32分钟前

WEEX TradFi:一个USDT账户交易股票、黄金、石油和全球市场

TheNewsCrypto32分钟前

交易

现货

热门文章

从H2A到A2A:AI Agent经济体与Crypto新机遇

6月17日,哈佛大学独立研究员、美国AI科学院(NAAI)通讯院士、比特币基金会终身会员韩锋做客火币HTX《大咖讲堂》第三期,以《从H2A到A2A》为主题,分享了其对Agent经济、Crypto基础设施及数字社会未来发展的思考。

344人学过发布于 2026.07.01更新于 2026.07.01

从H2A到A2A:AI Agent经济体与Crypto新机遇

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.1k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片