AI能解千禧难题,也能杀死人类?华尔街日报拉响末日警报

人工智能已经强大到既能攻克人类最艰深的数学难题,也能对人类构成生存威胁。

这是《华尔街日报》专栏作家Ben Cohen的观点。

在9月11日的一篇专栏中,他探讨了AI与数学的关系。

Cohen坦言自己并不理解纳维-斯托克斯方程,但他认为,即使没有任何数学背景,也能体会到OpenAI近期宣称的突破背后意味着什么:

AI的进步正在加速,而且这种加速令人不安。

一条数学领域的深度新闻,瞬间转变成了关乎全人类命运的话题。

同一天,陶哲轩等25位菲尔兹奖得主联合发布了一份声明,题为《AI在数学中的严重失配》。

他们所指的“失配”,是AI公司与数学家追求的目标不一致:数学家渴望新颖的方法和深入的理解,而AI公司则希望用知名难题来提升模型得分。

一边是专栏作家在警示末日,另一边是顶级数学家谈论失配。

如果你将这一周的事件串联起来,就能理解他们为何感到焦虑:

9月3日,GPT-6 Astra发布,在FrontierMath Tier 4中取得了97.6%的成绩;
9月5日,OpenAI一个尚未公开的内部模型,在首批智能体启动约88小时后,为纳维-斯托克斯问题提供了一套解法;
9月8日,OpenAI公开了这一结果,当天即被NYU数学家指控抢先发布,并引发了“不让Anthropic员工署名”的争议;
9月10日,Epoch AI宣布FrontierMath Tier 4已饱和;
9月11日,25位菲尔兹奖得主联合发声。当晚,《华尔街日报》将数学突破与AI灭绝风险并列在了同一个标题中。

七天,五件事共同指向了一个裂口:AI创造知识的速度、人类确认知识的速度以及规则调整的速度,正在严重脱节。

14个月,AI攻克了最难数学基准

FrontierMath Tier 4是由Epoch AI设计的一组研究级数学题,专门用于测试最强大的模型。

这些题目极其困难,有些甚至需要顶尖研究者花费数天才能解决。

2025年7月Tier 4刚上线时,最强模型仅能解答约5%的题目,几乎等同于交白卷。

但不到14个月,Epoch宣布:每一道Tier 4题目,都至少被AI解答过一次。

其中,最后一题由GPT-6 Astra完成,出题人是数学家Jay Pantone。

Epoch特别指出,过去数学家常抱怨模型通过“意外捷径”绕过精心设计的题目,但最后这一题没有走捷径。

随后,Epoch得出了一个冷酷的结论:这个基准已经饱和。

考卷已经跟不上考生的步伐,需要更换试卷了。

Epoch已将战场转向真正的开放问题,AI评测体系开始探索人类自己也不清楚答案的未知领域。

AI能力增长的速度,已经超过了我们测量它的方法。

正如Epoch的Greg Burnham所感叹:一个时代落幕,另一个时代开启。

88小时,AI首次像研究所一样运作

如果说FrontierMath证明了“基准开始落后于模型”,那么纳维-斯托克斯事件则展现了一幅更具颠覆性的画面:

AI不仅会解题,它已经开始像一个庞大的科研机构那样运作。

这根本不是一次单打独斗,而是一场涉及多达一万个智能体的“大兵团作战”。

它们被分成不同的小组,有的负责证明,有的负责证伪,彼此通信、共享中间结论,甚至在中途无缝切换最新版本的模型。

首批智能体启动约88小时后,其中一个小组提交了一份长达百页的最终证明。

这一整个过程,完美复制了人类顶尖科研机构的运作模式。

机器狂奔88小时生成结果,人类确认却需以年计

在人类世界里,纳维-斯托克斯问题仍处于“未解决”状态。

根据千禧年奖的规则,一个解答需先在合格渠道发表,发表后至少等待两年,并获得全球数学共同体的普遍认可,Clay才会启动正式审议。

Clay主席Martin Bridson对AFP表示,评估过程“刻意不急”,且必须“绝对严格”。OpenAI自己也表示,不打算申领这100万美元。

因此,这件事最准确的表述是:OpenAI公布了一套千禧年难题的解法,声称已完成Lean形式化验证,但尚未得到数学共同体的独立确认。

机器生成结果,88小时。人类确认结果,至少两年。这恐怕是本周AI数学领域最刺眼的一组对比。

这并非人类验证太慢。问题在于机器将“发现”加速了几百倍,而人类的“理解”并未随之加速。

所以,真正的问题是,当机器开始以“几天一个重大结果”的节奏批量生产知识时,未来几年甚至几十年的阅读、检查、解释、简化和吸收,谁来做?

署名制度首先遭遇挑战

纳维-斯托克斯结果公开的当天,数学圈沸腾了。

NYU数学家Tristan Buckmaster和在Anthropic任职的Levent Alpöge,整个8月也一直在研究相关的流体方程。

据《纽约时报》还原,这两人工作的方式如下:

Buckmaster提出问题,Alpöge将问题交给Anthropic内部模型;模型生成结果后,两人再根据输出调整问题,继续反馈数据。

按Buckmaster的说法,事后OpenAI提出了多个安抚方案:允许他先发布自己的结果、让他成为OpenAI论文的第一作者、提供算力让他继续研究。

但最大的障碍是:OpenAI不想让Levent出现在论文上。

在商言商,一个OpenAI投入重金的内部项目,凭什么要署上竞争对手Anthropic员工的名字?

随后,事情又延伸到了另一个更敏感的话题。Buckmaster过去数月一直在使用Codex整理AI生成的数学草稿。

那么,他输入Codex但尚未公开的独家科研思路,有没有可能通过隐秘的数据管线,成为OpenAI自己研究模型的养料?

Buckmaster承认没有证据,但在他看来,事件的时间线和OpenAI的证明路线,都在暗示这一点。

OpenAI则在9月10日紧急更新公告称,经内部彻查,Buckmaster过去两个月的Codex提示词绝对不可能通过训练或其他任何方式影响这套内部模型。

谁对谁错,这里暂时成了一笔糊涂账,但它真正暴露出来的,是一整组过去从未被认真回答过的问题:

一个人的私有提示词到底算不算受保护的科研资料?
企业内部的砸钱研究项目能否署竞争对手公司员工的名字?
如果模型参考过海量的公开资料,又该如何界定新的贡献与既有工作的边界?

普林斯顿高等研究院的Peter Sarnak对《纽约时报》说:“这种讨价还价,我这辈子没听说过。”

数学界几百年沉淀下来的学术规则,从未为这种狂暴的机器生产速度设计过防撞带。

25位菲尔兹奖得主真正担心的事

就在一天后,25位菲尔兹奖得主联合发布了一份重磅声明。

陶哲轩、Peter Scholze、James Maynard、Maryna Viazovska……数学圈最顶尖的大脑几乎全员出动。

这份声明并非“反AI檄文”。

事实上,陶哲轩本人一直在积极尝试用AI辅助数学研究。

而且声明也承认,AI确实有潜力加速真正的数学理解。

他们真正深恶痛绝的是将“解题”直接等同于数学。在当下狂热的AI圈,AI公司为了股价和宣发,正急功近利地将“解掉名题”作为最高优化目标。

在他们眼里,千禧年大奖难题似乎只是用来证明模型有多牛的跑分工具。

但数学的真正宝贵之处,是在枯燥的解题过程中诞生新方法和新概念,最终沉淀成人类的共同知识体系。

现在AI公司隔三差五就抛出一个震撼结果,快到没人来得及消化。这条传了几千年的链条,随时可能断裂。

联名信还特别指出,结果发布得太快,这些解答根本来不及清楚区分哪些是新想法、哪些是踩在前人的肩膀上,从而势必带来严重的署名与归属混乱。

为什么一个数学突破,会和“末日警告”挂钩?

普通人真正关心的,不是“AI超过了数学家”。

而是机器创造知识的速度,第一次以碾压姿态,快过了人类确认、归属、消化知识的速度。

这并非危言耸听,GPT-6 Astra系统卡写明,它是OpenAI第一个达到网络安全“Critical”阈值的模型,在ExploitBench上获得了100%。

解千禧年难题的组织能力、零日漏洞的攻击能力、更难被看清的推理,三样东西在同一个模型身上同时具备。

OpenAI在纳维-斯托克斯公告的最后一段,还有一句话:

接下来他们要先把这个新模型摸透,再决定往前冲多快,可能需要对进展速度做更审慎的选择。

是的,刚交出千禧年难题答卷的AI公司,主动谈起了减速。

Cohen还在专栏末尾提到了一件事。

上个月,OpenAI把一批顶尖数学家请到旧金山办公室开闭门会,假设AI终将在数学上超越人类,然后大家再来讨论教育怎么办、科研合作怎么办、论文发表怎么办、下一代数学家还怎么培养。

谈了一天,没有答案。

这道题,也没法打包交给Lean去自动验证。

只能人类自己解。

参考资料: https://www.wsj.com/tech/ai/ai-math-millennium-prize-safety-openai-anthropic-05179825
https://epoch.ai/benchmarks/frontiermath-tier-4-v2?view=graph&tab=release-date
https://www.nytimes.com/2026/09/10/science/tristan-buckmaster-openai-math-navier-stokes.html?utm_source=chatgpt.com
https://www.daniellitt.com/blog/2026/8/11/the-end-of-mathematics/
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。

围绕以游戏类型为阅读线索,引导读者自主建构对策略对战的理解。,九游平台持续打磨更优质的服务。

九游平台信息科技有限公司自2011年成立以来,始终致力于通过精编的阅读材料与体验线索,帮助体育爱好者深度理解比赛背后的策略逻辑。我们不以简单的比分论英雄,而是围绕战术设计、球员跑位、教练博弈等维度展开分析,让每篇内容都成为你提升观赛理解的阶梯。

本场比赛的关键转折点出现在第55分钟,主队中场核心因伤离场后,客队迅速接管中场控制权。九游平台的数据模型显示,该球员下场后主队传球成功率从83%骤降至67%,直接导致后续失球。伤病管理同样是策略对战的重要一环。

九游平台深耕内容呈现不依赖测评分数,而是围绕玩法设计、叙事节奏等维度展开。领域,用心服务每一位用户。