Claude computes a nine-loop amplitude in N=4 super-Yang-Mills

Anthropic 這篇 2026 年 9 月 25 日發布的文章 《Yes, Claude can do Nine Loops》,記錄的是一次相當具體的前沿科研測試:Claude 在很少人工干預的情況下,完成了理論粒子物理中一個此前尚未完整算出的 九圈散射振幅(nine-loop scattering amplitude)。文章由前理論物理學家、科學作家 Matt von Hippel 撰寫,並附有 Stanford/SLAC 物理學家 Lance Dixon 的驗證說明。

Anthropic 原文:Yes, Claude can do Nine Loops⁠

1. Claude 到底算出了什麼

問題是:

\text{planar } \mathcal N=4\ \text{super Yang-Mills}

理論中的 六粒子 MHV 散射振幅(six-particle MHV amplitude)到九圈階(nine loops)。

散射振幅(scattering amplitude)用於計算粒子相互作用發生的概率。實際計算通常只能做微擾展開:

A=A^{(0)}+g^2A^{(1)}+g^4A^{(2)}+\cdots+g^{18}A^{(9)}+\cdots

圈數越高,計算複雜度迅速增加。現實粒子物理中,大量精密計算停留在二圈或三圈,極少數可以做到更高。這次處理的 \mathcal N=4 super Yang-Mills 並不是描述現實世界的標準模型,而是一個高度對稱、特別適合研究散射振幅數學結構的理論模型。

此前 Lance Dixon 等人在 2023 年利用 form factor + antipodal duality 得到了八圈結果。他原先認為直接計算九圈振幅太困難,可能需要繼續通過 form factor 間接取得。

2. 這件事的起源其實是一個公開挑戰

Matt von Hippel 此前提出了一個很具體的 AI 挑戰:

如果 AI 公司真的想讓理論物理學家感到震撼,那就不要只做 benchmark,而是解決散射振幅領域真正尚未完成的問題。

他列出了兩個目標,其中一個就是:

\mathcal N=4\ SYM \quad \rightarrow \quad 9\ loops

他的要求還有一層:不能靠投入幾百萬美元算力暴力破解,而應當使用普通學術研究者有可能取得的計算資源。

結果大約一個月後,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 接受了這個挑戰。

3. 比結果本身更值得注意的是 Claude 的工作方式

研究者給 Claude 的初始任務基本只有一句:

“The problem is to compute the Six-particle (hexagon) amplitude in planar N=4 SYM at nine loops.”

之後人工指令甚至簡單到:

“I’m going to sleep … Keep working on this until I tell you to stop.”

Claude 使用的是 Fable 5.1 + Claude Science。Claude Science 是把 Claude 放入具有科研工具、結構化提示和工作規則的 agent harness 中,並不等於單純在普通聊天窗口裡問 Claude 一道題。

它持續工作,自己寫程序、調試、組織計算,最後還採用了兩條彼此獨立的路線:

  1. 直接使用原來的 amplitude bootstrap。
  2. 使用 form-factor 的間接方法。

兩種方法得到相符的結果。

這一點很關鍵,因為第二條計算路徑實際上提供了一種獨立交叉驗證。

4. 它並沒有靠巨大算力硬砸

文章估計,如果終端用戶自己運行整套 Claude 工作流,每一條計算路線的 Claude 使用成本約為:

\$1,000\sim \$2,000

直接 bootstrap 的數值計算部分使用 Python + SymPy,大約:

96\ CPUs \times 1\ week

計算資源成本約 100 美元。

所以 von Hippel 原本希望看到的是:

AI 發明一種人類沒有想到的新方法,突破原有計算極限。

實際發生的事情沒有這麼戲劇化。

Claude 基本使用了人類已經發明的方法,加上良好的軟件工程、程序實現、持續自主運行和比此前研究者願意投入稍多一些的計算資源,把原本被認為太麻煩、太容易出錯或者計算量太大的問題真正做完了。

5. 人類其實也幾乎同時算到了

這一點使這篇文章的結論比「AI 解決了人類不會的物理問題」要弱很多。

中國科學院 Song He(何頌)團隊幾乎同期也取得了九圈結果的重要部分,後來完成了 nine-loop amplitude 的 symbol。他們同樣使用了 AI 輔助,包括 GPT-6,但 AI 主要協助部分 constraints 計算,整體研究框架仍由人類研究者掌握。

因此這次不能說:

\text{Claude 發現了人類無法找到的新物理}

比較準確的是:

\text{已知理論方法}
+\text{文獻理解}
+\text{自主編程}
+\text{長時間 agent 運行}
+\text{計算資源}
\rightarrow
\text{前沿新計算結果}

而且這個結果與人類頂尖研究團隊的進展幾乎同步。

6. Lance Dixon 認為真正令人意外的是「可靠地完成整個流程」

Dixon 是此前八圈工作的主要研究者之一,也是這次 Claude 結果的獨立驗證者。

他特別指出,真正困難的不只是算力。

這套 bootstrap 計算非常脆弱。任何一個環節寫錯,後面的整個計算都可能失敗。而且論文通常不會記錄所有瑣碎的實現細節,所以 Claude 不能簡單把現有代碼抄過來,它必須根據論文和方法自己重新建立大量代碼。

Dixon 原本認為直接算九圈 amplitude 太難,所以自己的團隊準備先求較容易的 form factor,再利用他們 2023 年提出的 antipodal duality 得到 amplitude。

Claude 卻直接完成了 amplitude。

Dixon 隨後主要通過反向得到 form factor 來驗證 Claude 的結果。

7. 這篇文章實際展示的是科研 Agent 能力的變化

von Hippel 特別比較了 2026 年 3 月與 9 月的情況。

3 月時,AI 做物理研究還比較像學生,需要大量人工指導,而且容易犯錯;半年後,這次系統已經能在極少科研監督的情況下,持續完成一項真正處在該領域研究前沿的計算。

因此這次結果比較值得注意的地方並不是單純的:

9 > 8

而是科研工作的自主跨度增加了:

\text{讀文獻}
\rightarrow
\text{理解既有方法}
\rightarrow
\text{設計實現}
\rightarrow
\text{寫代碼}
\rightarrow
\text{調試}
\rightarrow
\text{調度計算}
\rightarrow
\text{持續數日運行}
\rightarrow
\text{得到候選結果}
\rightarrow
\text{使用另一方法交叉驗證}

其中大部分過程沒有領域專家一直在旁邊逐步糾正。

8. 但文章也刻意沒有把它說成「AI 已經成為理論物理學家」

von Hippel 最後承認,他原本想通過這個挑戰判斷 AI 是否開始突破人類認知和計算能力的邊界,但這次實驗並沒有回答這個問題。

Claude 沒有提出新的物理原理,也沒有發明革命性的 amplitude 方法。

他發現的反而是另一件事情:人類此前認為存在的計算極限,本身可能估計得過於保守。

Dixon 的看法也類似。他認為更深刻的時刻會出現在:

\text{LLM 首先提出新的物理原理或新的物理洞見}

而不是像這次一樣,把人類已經建立的方法执行到此前没有执行到的位置。

所以這次「nine loops」目前更接近一次很強的 AI autonomous research execution 案例,而不是一次「AI 發現新物理定律」的案例。它證明的是,至少對某些高度形式化、可以計算驗證、具有大量既有文獻與明確約束條件的前沿科研問題,2026 年的科研 Agent 已經可以在很少人工介入的情況下完成過去需要專業研究團隊長時間推進的完整計算任務。