编辑|Panda
理论物理中一项保持了三年的计算纪录,被 AI 刷新了。
几个小时前,Anthropic 宣布:Claude 在科研平台 Claude Science 中基本无人监督地连续运行数天,算出了平面 N=4 超对称杨-米尔斯理论(planar N=4 super-Yang-Mills)中的九圈六粒子散射振幅。

这是理论物理「散射振幅」领域公认的前沿难题,此前在该模型中的最高纪录停留在八圈,由 SLAC 国家加速器实验室的 Lance Dixon 与合作者于 2023 年创下。
这次突破由八圈纪录的创造者亲自把关。Dixon 独立验证了 Claude 的结果,并评价称,一个大语言模型能执行完这套复杂配方中的每一步、并把算力组织起来,在他看来「是一场相当了不起的胜利」。他甚至直言,除了他的合作者之外,Claude 比任何人都更懂他们团队 2019 年和 2023 年的那两篇论文。
更令人意外的是过程和成本。研究者交给 Claude 的只有一句任务描述,此后的「指导」几乎只剩下「继续整个计算折合到普通用户身上约一两千美元,其中真正用于数值计算的部分只有约 100 美元,相当于 96 个 CPU 跑一周。而 Dixon 原本认为,直接计算九圈振幅太难,他的团队为此已经筹备了好几年。

这项突破的起点,是一封公开的「战书」。
8 月 7 日,前理论物理学家、科普博主 Matt von Hippel 在自己的博客 4gravitons 上发了一篇带点挑衅意味的文章,标题叫「只有 AI 进入我的领域才算数」。他在文中点名向 AI 公司下战书:
用一名学者能负担得起的算力,去解决散射振幅领域的一个悬而未决的大问题。
https://4gravitons.com/2026/08/07/it-only-counts-when-ai-gets-to-my-field/
他给出了两个选项:要么把 N=8 超引力算到七圈,要么把 N=4 超对称杨-米尔斯理论的六粒子振幅算到九圈。
一个月后,AI 完成调整。Anthropic 刚刚刊出的,正是 von Hippel 本人撰写的客座文章,标题就是:「是的,Claude 能算九圈」。

https://www.anthropic.com/research/yes-claude-can-do-nine-loops
九圈,难在哪里?
要理解这件事的分量,得先说清楚物理学家在算什么。
粒子物理学家预测粒子行为,靠的是一类叫「散射振幅」的公式:给定参与碰撞的粒子的能量和动量,散射振幅能告诉你它们以某种方式发生反应的概率。
预测算得越精确,就越能和大型强子对撞机(LHC)这类实验的结果做细致比对。一旦出现偏差,就可能是新物理的线索,比如暗物质的本质,或者宇宙中物质与反物质为何不对称。
问题在于,散射振幅极难精确计算,物理学家几乎只能做近似。他们把计算按「圈」(loop)来分层,圈数大致衡量了粒子之间的相互作用被允许复杂到什么程度。每多加一圈,答案就更接近真实值,但计算量也随之急剧膨胀。von Hippel 在挑战原文中写道,这类计算的复杂度通常随圈数呈指数级甚至阶乘级增长。
所以现实中,绝大多数散射振幅只算到两圈,少数能到三圈。粒子物理中最精确的那个预测,电子反常磁矩,用到了五圈。
N=4 超对称杨-米尔斯理论则是这个领域专门的玩具模型。「杨-米尔斯」是描述电磁力、强核力、弱核力这三种基本相互作用的理论框架;「N=4 超对称」则意味着每个粒子都配有四个超对称伙伴。粒子多到不现实,这个理论并不描述真实世界。但恰恰是这种高度对称,让许多变量组合相互抵消,计算反而变得相对可控。研究者在这里打磨新方法,看它们能走多远。
这次用到的方法叫「自举」(bootstrap)。von Hippel 把它比作数独:先写出答案可能的全部形式,用一套专门的「字母表」记在计算机文件里,然后拿所有已知约束去逐一排除,包括其他方法给出的预测、答案必须遵守的规则、以及相关问题中已知的结果。理想情况下,最后只剩一个候选能通过所有检查,而且还有富余的检查条件用来确认没有算错。
八圈的纪录,Dixon 是绕着走拿到的。2023 年,他和 Yu-Ting Liu 借助一种被称为「对跖对偶」(antipodal duality)的奇特对称性,先算出相对更容易的「形状因子」(form factor),再由此换算出八圈振幅。此后几年,他的团队一直盯着九圈,计划沿用同样的间接路线。在他看来,直接去算九圈振幅太难了
值得一提的是,von Hippel 本人正是这一研究路线的老兵。他曾与 Dixon 等人合作,把六粒子振幅推进到六圈和七圈。换句话说,他挑的是自己亲手啃过的骨头。
一句 prompt,然后不断「继续」
8 月底,Anthropic 的两位物理学家 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 联系上了 von Hippel,告诉他挑战已经被攻克。
他们使用的是Fable 5.1模型,运行在 Claude Science 平台上。von Hippel 在文中解释,Claude Science 是一种「harness」,即在大模型外面套上结构化规则和提示,让它在科研任务中表现得更稳健
据文章描述,两人先问 Claude 哪一个挑战它最有把握,然后只给了一句非常简短的任务描述:计算平面 N=4 SYM 中九圈的六粒子(六边形)振幅。
此后的「科研指导」基本就是让它接着干。文中披露的一条典型指令大意是:我要去睡觉了,接下来几个小时不在,继续做,直到我叫停为止,每四到六小时汇报一次进度。
最终,Claude 用两种方式各算了一遍:一是直接的自举法,二是 Dixon 团队那条经由形状因子的间接路线。据文章介绍,任选其一,终端用户的花费大约都在一两千美元,大头是长时间运行模型本身的费用。其中自举计算部分用 Python 和符号计算库 SymPy 完成,只占约 100 美元,相当于 96 个 CPU 跑一周。
von Hippel 感慨,十年前他做这类研究时,96 个 CPU 跑一周算是不小的投入,如今只要理由充分,这点资源相当平价。
验证者的感受:像一个塌掉的舒芙蕾
文章末尾附有 Dixon 亲自撰写的一段附言,题目就叫「被机器抢先是什么感觉」。

他写道,9 月 1 日,Anthropic 的两位研究者告诉他 Claude 算出了九圈振幅,并请他验证结果。对他而言,那一刻是大语言模型改变物理学这件事「真正落到自己身上」的时刻。
让 Dixon 印象深刻的,与其说是计算规模,不如说是整套流程的脆弱性。按他的描述,这套计算配方只要有任何一处出错,整个结果就会像失败的舒芙蕾一样塌掉,研究者只能回头苦苦排查。而且其中大量构造细节繁琐到不会被完整写进论文,这意味着 Claude 必须从零开始把所有代码搭建起来。
由于从九圈振幅倒推九圈形状因子相对容易,Dixon 主要是沿这条路做的验证。这也带来一个略显微妙的局面:他花了两周验证的,正是自己团队已经追了好几年的目标。
他坦言并不感到沮丧,理由有两个。
- 他的团队本来就在用定制的 Transformer 模型预测更高圈数的结果,还提出过一句口号,大意是只要机器给出候选答案,他们就有全套工具去验证
- Claude 解题时用的正是 Dixon 与合作者多年来发展出的方法,连结果的呈现格式都沿用了他们既有的规范。在他看来,他在验证 Claude 的同时,Claude 也在验证他们过去所有的工作。这也是他那句「Claude 比任何人都更懂我们的论文」的由来。
不过在称赞之余,Dixon 也表示,在他看来,真正让人辗转反侧的时刻,会出现在模型抢在人类之前提出新的物理原理和洞见的时候。
中国团队几乎同时抵达
这个故事还有一条平行线索,且与中国有关。
在 Anthropic 联系 von Hippel 之后没几天,中国科学院理论物理研究所的何颂(Song He)也找上门来:他的课题组已经拿到了九圈结果的大部分。9 月 17 日,何颂与 Jirong Jing、Xiang Li 在 Zenodo 上公开了一份数据集,题为《六胶子 MHV 振幅直至九圈的符号》,涵盖二圈至九圈的符号(symbol)数据。

https://zenodo.org/records/22800071
据 von Hippel 和 Dixon 的描述,何颂团队也借助了基于 GPT-6 的 AI 辅助,但只用于计算部分约束条件,整体框架仍由人来搭建,这与 Anthropic 那种「一句 prompt 加反复继续」的近乎全自动路线截然不同。
Dixon 在附言里自嘲,两周之内他先后被「一台机器」以及「人类加机器」抢了先
von Hippel 特别提到,各方之间的氛围相当友好。接下来,Dixon、何颂及其合作者会发表这些结果,并为后来的研究者做详细解释和分析。
挑战者的复盘:低垂的果实比想象的多
回到 von Hippel 本人。他当初立下挑战,是想借自己熟悉的领域回答这个问题:AI 到底能不能绕过那些人人都以为无法逾越的算力瓶颈?
他在挑战原文里的逻辑是这样的:外界都在争论 AI 能否产生真正的新想法,但想法有多难找,只有找到之后才知道;计算的难度则更「实在」。许多关于超级智能的末日设想,从模拟人类心智以操纵人心,到从第一性原理设计纳米机器,批评者的标准反驳都是算力不够。如果 AI 能用学术圈级别的资源解决一个被公认为算力受限的问题,那才真正值得担心。
结果呢?von Hippel 的结论很坦诚:这次并没有出现他期待的那种「以意想不到的方式突破算力壁垒」。
Claude 用的是已知方法,只是比人类此前愿意投入的算力多了一些。它可能受益于用 Python 而不是物理学家惯用的 Maple 或 Mathematica,软件工程实践可能也比人类研究者更规范,但并没有到「超级智能」的程度。何颂团队几乎同步抵达,也从侧面说明这个目标对人类而言并非遥不可及。
他由此得出的最大体会是:哪怕目标简单明确,专家眼中遥不可及的事情,实际上可能并没有那么难,低垂的果实比预想的多。 多年来一直有计算机背景的朋友对他说,振幅研究者只要多雇几个程序员就能大幅推进,von Hippel 承认,这些人现在可以觉得自己说对了。
但他同样强调了另一面。这类计算琐碎而混乱,他自己如果用 96 个 CPU 跑一周,几乎必然会因为第一次出错而拖成两周。Claude Science 却在几乎没有科学监督的情况下一次跑通,没有依赖任何外部合作者的输入。他给仍然认为 AI 错误百出、不堪大用的人的建议是:这类工作,它现在已经能可靠地完成了。
他还做了一个纵向对比。今年 3 月,Anthropic 发布的「vibe physics」实验里,AI 做物理项目还像个学生,任务规模小,需要大量手把手指导,错误频出。半年后,它完成的已是振幅领域顶尖专家才会去碰的前沿计算。他不排除这恰好是一个特别适合 AI 的问题,但他判断,技术本身确实变强了。
至于能否推而广之,von Hippel 保持谨慎。N=4 这类玩具模型通常只属于很小的研究圈子,而面向真实世界的振幅计算竞争激烈得多,那里的低垂果实可能更少。但他也提醒,做这些计算的研究者如果还没试过让 AI 科研平台一次性冲击前沿计算,就该试试了,同时要准备好验证结果的方案。他不会太意外,有人能在合理预算内再多挤出一圈。
把这件事放回 9 月的背景里看,会更有意思。
就在本月 8 日,OpenAI 宣布其未公开模型调动上万个 AI 智能体,给出了纳维-斯托克斯方程存在性与光滑性问题的一个反例,也就是千禧年大奖难题之一,该结果目前仍在接受数学界审视。与那种动用海量算力的「大兵团作战」相比,九圈振幅的故事显得朴素得多:一个商用科研平台,一句任务描述,几千美元,几天时间。
也正因为朴素,它可能更值得学术界关注。von Hippel 最终坦承,他原本希望借这次挑战一窥未来,看到某种前所未见的计算新方法,从而在超级智能的争论中获得有依据的判断。但他得到的答案是,自己此前对极限在哪里的认识过于天真了。
而 Dixon 留下的那个问题仍然悬着:当大模型不再只是执行人类写好的配方,而是开始先于人类提出新的物理原理时,物理学家又该如何自处?