OpenAI连破10道数学难题,Fable 24小时「复现」5道

marsbit发布于2026-08-05更新于2026-08-05

文章摘要

上周末,OpenAI与Anthropic在数学前沿领域展开了一场引人注目的竞争。 8月1日,OpenAI研究员Sébastien Bubeck宣布,其未发布的新主力模型Astra一口气证明了10项停滞多年的前沿数学难题,并提供了详细的Lean证明证书和思路复盘。其中,关于“非索菲克群”的成果被认为足以刊登顶级期刊《数学年刊》。这一突破引发了AI界关于“数学奇点”的热议。 不到24小时,Anthropic迅速接招。其研究员Levent Alpöge表示,利用已公开的模型Fable,在无网络、防泄漏的条件下,独立复现了Astra成果中的5项。这意味着,OpenAI凭借未发布模型获得的“首发”优势,保质期大幅缩短至一天以内。 OpenAI方面称,找到这10项解法的边际推理成本不足2000美元,但此数字未包含模型训练、人力整理与形式化证明等前期巨大投入。尽管如此,这仍将AI解决前沿难题的单次成本降至新低。 此次竞争不同于传统“刷榜”。两大模型在独立条件下抵达相同结论,更接近于科学界的“同行评审”和“独立验证”,旨在检验结果的可靠性与可复现性。 然而,这些高度专业的数学成果超出了绝大多数人的理解范围,公众只能依赖专家构建的信任链。有数学家指出,AI的成就建立在人类数百年的数学积累之上,将其简单描述为“AI取代数学家”并不准确。关键在于证明是否带来了关于问题本身的新认知。 随着AI可能进入低成本、批量产出数学证明的阶段,最稀缺的能力或许正从“生成证明”转向“验收证明”。当证明的产出速度越来越快,人类验证与理解的能力能否跟上,已成为新的核心考验。

10项数学难题,24小时反转。

这个周末,OpenAI与Anthropic两大AI巨头,在数学的最前沿短兵相接。

先是8月1日,OpenAI研究员Sébastien Bubeck宣布,他们未公开的下一代主力模型Astra,一口气证明了10项前沿数学成果,还甩出了10份Lean证书、10份逐题思路复盘。

别小看这10个问题。

它们的主要结论至少10年没人推动过,不少一搁就是几十年,是货真价实的开放难题。

虽算不上数学里最深的未解之谜,却个个都是难啃的硬骨头。

Epoch AI旗下FrontierMath的负责人Elliot Glazer直言:光是非索菲克群这一篇,就肯定能进数学界公认的顶级期刊Annals of Mathematics。

这10道难题一甩出,AI圈直接炸了,有人当场喊出「数学奇点已经到来」。

Anthropic这边迅速接招。

不到24小时,研究员Levent Alpöge在Bubeck的帖子下回了一句:「我用Fable完成了一半。」

紧接着他又补充,自己做出来的是OpenAI榜单上的第4、5、6、7、8项,一共5项。

实验条件,Levent称很干净:完全自主、通用提示词、全程无网络,为了防止OpenAI的解法泄漏进上下文,还特意加了一层防护。

当然,Levent目前还没放出Fable的完整证明细节,他表示会上传。

但如果得到证实,这件事的分量就变了:

OpenAI用未发布的模型Astra抢到的首发先机,只保住了24小时。而追上来的Fable,是Anthropic早就公开、人人都能调用的模型。

一项「数学首发」,保鲜期只剩24小时

网友Chubby转帖:「公开可用的Fable,复现了Astra一半成果。」

评论区有人调侃:这么看,OpenAI是不是只抢到了一个首发?

过去,一项数学成果的优先权之争,通常以年为单位。

谁先想到、谁先证出、谁先发表,中间隔着漫长的投稿、审稿、修改。

而现在,Astra还没正式发布,它公布的成果,仅仅24小时,就已经被一个公开模型追平了一半。

首发的含金量还在,但保质期却大大缩短。

不少网友已经在喊「数学奇点」,两个AI巨头也紧紧咬上了。

2000美元背后,还有更贵的账

OpenAI还甩出一个数字:找到这10项解法,成本不到2000美元。

按研究员Noam Brown的说法,它对应的是寻找这些解法所需的token,再按Sol API价格折算出来的。

也就是说,这只是成功跑出10个解法那一刻的边际推理成本。

在这之外,还有Astra本身的训练研发、那些试了却没成功的问题、人类把论证整理成249页论文的工时、把每个证明形式化成Lean的成本,以及最后外部数学家审查的成本。

Noam自己也承认,他们还尝试过其他重大问题,但都没成功,千禧年大奖难题一个都没拿下。

即便如此,2000美元仍然把AI解出一道前沿难题的边际成本,打到了地板。

有人甚至调侃,OpenAI是不是明天会再公布10项数学突破,或者等到下周一次发100项。

从「互相刷榜」到「互相验货」

Fable去重做Astra的同一批题,这件事要比普通刷榜有意思得多。

刷榜测的是已知答案:题目和标准答案都摆在那儿,比谁分高。

而两个模型在无网络、防泄漏的条件下,各自独立抵达同一个前沿结论,测的是完全不同的东西:这个结果到底可不可靠,能不能被独立复现。

这更像同行评审。

Levent目前只是在X上「作出了声明」,并没有放出那5项证明的PDF、提示词、完整运行日志、token成本或Lean证书。

网友Haider质疑:就算是真的,为什么要用Fable去复现Astra,而不是直接拿它去解新的开放问题?

事实上,Fable并不是只会蹭Astra热度,它也会解新题。

7月,Levent就用Fable给出过Jacobian猜想的三维反例,事后还有人专门写了一份7页的代数验证材料,确认那个显式映射确实推翻了三维及更高维的猜想。

绝大多数人看不懂的成果,谁来验收

这10项成果,到底有多重要,绝大多数人很难去判断。

Ethan Mollick一语道破:对地球上几乎每一个人来说,这不只是超出能力,而是超出理解范围。我们只能相信专业数学家告诉我们它厉不厉害。

代码、图片、聊天,普通人还能亲手体验AI强在哪。

可非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,这些只有极少数专家看得懂。

AI能力越往科学前沿走,公众能依靠的就越不是亲身体验,而是一条长长的信任链。这种「连惊叹都无从惊叹」的状态,正在越来越多领域同时发生。

数学家Thomas Bloom提醒,这些成果用的是上百年积累的数学理论、数学家亲手搭好的形式化系统,把它简单描述成「AI取代了数学家」,并不诚实。

他给出的标准是:这份证明,有没有教给我们关于这个问题的新东西?

所以真正的问题来了:当AI能低成本、批量地生产前沿数学证明,我们到底该拿什么衡量它的成果?

答案也许不在它的产出端,而在验收端:一份证明能不能被读懂、被核对、被判断出分量,才能最终决定它的真实价值。

最稀缺的能力,正在从「做出证明」转向「看懂并验收证明」。

当AI一夜之间就能证出十道难题,真正的考验才刚开始:证明越造越快,我们的验证,还追得上吗?

参考资料:

https://x.com/haider1/status/2083908869915611554

https://x.com/polynoamial/status/2083470822258467194

https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742

本文来自微信公众号“新智元”,作者:ASI启示录

相关问答

QOpenAI用哪个模型解决了10个前沿数学难题?

AOpenAI使用了其未公开的下一代主力模型Astra解决了10个前沿数学难题。

QAnthropic用哪个模型在24小时内复现了OpenAI部分成果,复现了几项?

AAnthropic使用了其公开的模型Fable,在24小时内复现了OpenAI成果列表中的第4、5、6、7、8项,共计5项。

Q根据文章,OpenAI解决这10项难题的边际推理成本是多少美元?这个成本包含哪些更大的开销?

AOpenAI解决这10项难题的边际推理成本不到2000美元。这个成本只是寻找解法所需的token成本,不包含Astra模型的训练研发、尝试其他问题失败的成本、人类整理论文和形式化证明的工时,以及外部数学家审查的成本。

Q文章中提到,当AI能批量生产数学证明时,最稀缺的能力正在从什么转向什么?

A当AI能批量生产数学证明时,最稀缺的能力正在从“做出证明”转向“看懂并验收证明”。

Q根据数学家Thomas Bloom的观点,衡量AI数学证明成果的关键标准是什么?

A根据数学家Thomas Bloom的观点,衡量AI数学证明成果的关键标准是:这份证明是否教给了我们关于这个数学问题的新东西。

你可能也喜欢

图解Cloudflare钱包:使用X402的稳定币支付新玩家

8月4日,Cloudflare宣布推出Wallets,但当前仅开放用户认领“handle”(名称),而充值、付款等核心功能尚未上线。此次发布更接近于确立付款方身份,而非完整的支付解决方案。 Cloudflare近期支付相关产品包括:处于开放测试的Stripe Projects(代理为用户刷卡开通服务)、仍在等候名单的Monetization Gateway(商户收款入口),以及此次的Wallet。三者侧重不同,Wallet旨在补充付款方的身份、余额与授权规则。 x402协议数据显示其网络过去30天处理超7500万笔交易,总金额约2424万美元,平均每笔0.32美元,符合API调用等微支付特征。但这反映的是开放协议的整体活动,并不能直接等同于Cloudflare钱包的采用率或代理自主消费规模。 Cloudflare文档示例将单次API调用定价为0.01美元,并展示了基于HTTP 402状态的微支付流程。但目前开发者路径仍需自行保管私钥并使用测试网络货币。Wallet计划区分账户持有者的主钱包与代理使用的虚拟钱包,并引入额度、白名单等风控规则,但这些功能尚未开放配置。 当前存在三条不同的代理支付路径:Stripe Projects使用支付令牌且设有消费上限;x402开发者路径需自持私钥;而Wallet仅开放名称注册。三者仅在“代理支付”概念上共享交集,Cloudflare钱包的稳定币支持、链选择、地区合规及费率等关键细节仍有待公布。

marsbit27分钟前

图解Cloudflare钱包:使用X402的稳定币支付新玩家

marsbit27分钟前

TradeXYZ与Hyperliquid:揭秘50%分成下的共生关系

市场情绪趋向谨慎,AI投资需兼顾增长与现金流才会受认可;加密市场则面临ETF资金流出和利率上升的压力。加密货币内部,市场热点轮动至Solana和去中心化交易所(DEX)板块。 宏观层面,美股主要指数表现分化,黄金微涨,而比特币表现较弱。AI巨头财报显示,市场更青睐能证明投资回报且不严重损耗现金流的公司。加密市场持续承压,ETF资金转为净流出,国债收益率高企压制风险偏好。 在加密领域,Solana生态本周表现最佳,主要受个别代币上线主流交易所推动;DEX板块紧随其后,Uniswap因费用机制扩展至新链而上涨。文章指出,围绕Uniswap v4 hooks的链上创新值得关注。 文章重点探讨了交易平台TradeXYZ与底层链Hyperliquid之间的关系。TradeXYZ在Hyperliquid上构建,并将其协议收入的一半分给Hyperliquid。针对外界关于TradeXYZ可能因分成过高而离开、或Hyperliquid如何实现价值的担忧,文章分析认为,双方是高度共生的关系:Hyperliquid提供了关键的基础设施和用户基础,而TradeXYZ的执行力是RWA市场增长的关键。离开对双方都是“声誉自杀”,且不切实际。Hyperliquid除分成外,还通过其他费用和二阶效应(如增加稳定币供应带来收入)获利。 核心问题在于双方如何从追求增长的“低费率”模式,转向更稳定、更高的费用基础以实现长期盈利。

marsbit42分钟前

TradeXYZ与Hyperliquid:揭秘50%分成下的共生关系

marsbit42分钟前

报道:DeepSeek 重启融资,投前估值 5000 亿元

多名交易人士透露,DeepSeek已重启第二轮融资,计划募资500亿元,投前估值约5000亿元,目标8月下旬完成签约。此前,该公司于今年4月启动、6月完成首轮融资,募资500亿元,估值超3500亿元,创下中国AI大模型领域首轮融资规模纪录。 第二轮融资在7月中旬开启后一度暂停,据称与创始人梁文锋对网上流传的“投资者会议实录”不满有关。目前重启后,公司与投资方希望低调推进。部分投资机构表示尚未收到重启通知。 本轮融资名单包括首轮落选机构及既有投资方的增资意向。DeepSeek首轮投资方包括国家人工智能产业投资基金、腾讯、宁德时代、溥泉资本、网易、京东等。首轮融资意向资金超1000亿元,显示市场热度高涨。 若本轮顺利完成,DeepSeek两轮融资总额将超1000亿元,估值较首轮提升约43%。其融资规模远超同行,例如月之暗面近期以约2100亿元估值完成融资,并已启动Pre-IPO轮。 模型能力与效率直接影响公司估值。DeepSeek原定7月中旬发布的V4正式版略有延迟,V4-Flash已于7月31日公测,其Agent能力显著提升,在多项基准测试中表现优异。第三方评测显示,其智能水平国内领先,且延续高性价比路线,API调用成本低于多数竞争对手。 在推理成本上升的背景下,高性价比成为行业趋势。近期OpenAI亦下调模型价格,但DeepSeek-V4-Flash发布后性价比优势再度凸显。据OpenRouter榜单,该模型本周Token消耗量已居全球首位。

marsbit1小时前

报道:DeepSeek 重启融资,投前估值 5000 亿元

marsbit1小时前

交易

现货
活动图片