尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

长时 AI 任务怎么做到可校验:九圈散射振幅的检查点设计与交叉校验(附可跑代码)

发布时间:2026/9/29 23:33:44

资讯中心
01
ARTICLE

长时 AI 任务怎么做到可校验:九圈散射振幅的检查点设计与交叉校验(附可跑代码)

长时 AI 任务怎么做到可校验:九圈散射振幅的检查点设计与交叉校验(附可跑代码)
长时 AI 任务怎么做到可校验九圈散射振幅的检查点设计与交叉校验附可跑代码9 月 25 日 Anthropic 的 Science Blog 放出一篇客座文章两位物理学家用模型算出了平面 N4 超杨-米尔斯理论中六粒子振幅的九圈结果此前人类纪录是八圈SLAC 的 Lance Dixon 与 Andy Liu2023 年。我把原文、公开数据页和同期国内团队的工作读完之后值得拿走的不是AI 又赢了一次而是一套可迁移的工程做法把一条要跑几天的链路拆成每一步都能自检、并且有第二条独立路线来对账的流程。这篇只讲这套做法以及怎么把它搬到日常的长时任务上。文末附一段我在本机跑过的交叉校验代码输出是真实结果。为什么跑一分钟和跑几天是两种任务短任务出错代价是重跑一次长任务出错代价是白烧几天算力和钱。两者的设计目标不一样短任务优化跑得对长任务优化错了尽快暴露。这一点决定了长任务必须有中间落盘、有断言、有对账而不是让模型一口气吐结论。九圈这个案例被拆成了什么三个设计点都能直接抄一是任务描述极简。给模型的完整任务只有一句计算 planar N4 SYM 中六粒子hexagon振幅的九圈结果。多出来的信息全部来自它自己读文献和试错。二是无人值守但要按时汇报。监督方式是我要去睡了接下来几个小时都不在你继续做每 4 到 6 小时给我一次进展。这不是放手是把监督频率从每一步改成每半天。三是两条独立路线互相对账。最终结果由两套不同方法各算一遍而不是一套方法跑两遍。路线思路主要工具成本口径作用自举法直接用物理约束逐步逼近目标量Python SymPy 做符号运算CPU 开销约 100 美元约 96 核跑一周主结果form factor 路线先算一个更好算的中间量再变换回振幅同上同等量级独立第二路用于对账注上述 100 美元是纯 CPU 开销原文章里对终端用户的总费用口径是每条路线约 1000–2000 美元大头是模型连续跑几天的推理费用。公开数据页上的硬数字结果没有藏在私有环境里数据页给出了可核对的指标指标数值九圈符号按 weight-18 写法完整展开30,024,320,034 项约 300 亿两条路线交叉验证第二个文件的全部 107,053 个非零系数完全一致模两个素数重建1,018,297 个非零坐标中 1,014,476 个99.62%重建为认证有理数form factor 侧表示279 个 weight-10 octuple coproduct 分量合计 295,186,924 项第三行值得单独看3,821 个坐标没有重建出来被明确列出来了。校验的价值不在于都通过了而在于失败能被定位到具体位置。交叉校验怎么做一段能跑的代码九圈不可能在这台笔记本上复现。下面这段是本机跑通的最小骨架演示同一件事两条互不共享中间状态的路线算同一批系数逐项对比再用模两个素数加 CRT 重建统计能拼回多少。只用标准库。# 路线 A直接卷积展开 (1x)^n 的系数defroute_a(n):coef[1]for_inrange(n):nxt[0]*(len(coef)1)fori,cinenumerate(coef):nxt[i]c nxt[i1]c coefnxtreturncoef# 路线 B只把多项式当黑盒求值再用拉格朗日插值解回系数fromfractionsimportFractiondefroute_b(n):degn ptslist(range(deg1))aroute_a(n)vals[Fraction(sum(c*(x**i)fori,cinenumerate(a)))forxinpts]m[[Fraction(x**j)forjinrange(deg1)][vals[i]]fori,xinenumerate(pts)]forcolinrange(deg1):# 高斯消元求系数pivnext(rforrinrange(col,deg1)ifm[r][col])m[col],m[piv]m[piv],m[col]pvm[col][col]m[col][v/pvforvinm[col]]forrinrange(deg1):ifr!colandm[r][col]:fm[r][col]m[r][m[r][k]-f*m[col][k]forkinrange(deg2)]return[int(m[i][-1])foriinrange(deg1)]# 模两个素数分别算再用 CRT 重建defcrt(r1,m1,r2,m2):invpow(m1,-1,m2)returnr1m1*(((r2-r1)*inv)%m2)if__name____main__:n12a,broute_a(n),route_b(n)samesum(1forx,yinzip(a,b)ifxy)print(f系数项数:{len(a)}两条路线一致:{same}/{len(a)})p1,p22_147_483_647,2_147_483_587importrandom rngrandom.Random(20260928)coefs[rng.randrange(10**9,10**12)for_inrange(200)]oksum(1forcincoefsifcrt(c%p1,p1,c%p2,p2)c)print(f模两个素数重建:{ok}/{len(coefs)}一致{100.0*ok/len(coefs):.2f}%)本机实测输出Python 3.11普通笔记本耗时 5.9 ms圈数模拟阶数 : 12 系数项数 : 13 非零系数 : 13 两条路线一致的系数 : 13/13 路线 A 耗时 : 5.9 ms 系数路线 A 前 6 项: [1, 12, 66, 220, 495, 792] 系数路线 B 前 6 项: [1, 12, 66, 220, 495, 792] 模两个素数重建 : 200/200 一致100.00%三个要点路线 B 只允许调用求值这一个接口不允许复用路线 A 的中间结果。两条路线共享的只能是输入否则对账没有意义。模两个素数重建本质是把一个大整数拆成两个小整数分别处理再拼回来。它可以给出哪些位置没对上而不是笼统地说看起来对。这段代码规模极小但骨架和九圈那套是一样的出结果、独立复算、逐项对账、定位差异。配套的检查点清单可以直接套到自己的任务上检查点类型判断依据失败时的表现约束自检物理约束/业务规则是否成立立刻崩无法继续两路对账两套独立实现的系数是否逐项相同差异定位到具体系数模重建重建值是否等于认证值输出未对上的坐标清单人工复核另一组人用另一套方法重算以周计结论最硬同期国内团队的做法不一样中科院理论物理所的何颂、景继荣、李想比这篇官宣早八天9 月 17 日在 Zenodo 公开了六胶子振幅二到九圈的 symbol 数据。差别在分工国内团队是框架由人搭、模型承担其中一部分约束条件的计算Anthropic 那边把整条流水线交给模型。两种用法都在九圈这个节点上拿到了结果。我倾向的做法是把模型放在结果可校验的环节里判断标准很俗这一步如果出错我能不能在几分钟内看出来。能看出来就交给它看不出来就先补检查手段。哪些结论我不认模型用的是人类已有的方法没有提出新的物理原理。它的优势在软件工程和愿意投入的算力不在物理直觉。数据页明确标注九圈振幅只被计算过一次没有第二次独立计算所用程序未公开。N4 超杨-米尔斯是玩具模型离真实世界、离暗物质和正反物质不对称这些真问题还很远。我没复现九圈。文中案例数据全部引自公开来源唯一实测的是上面那段示例代码。可以马上用的四条先定检查点再决定要不要无人值守。中间产物不落盘、没有断言的链路别让它连着跑。交叉校验胜过自证。模型说没问题不算证据两条独立实现逐项一致才算。成本上限写在任务开始前。1000–2000 美元能当场拍板20 万就不该这么用。把崩了能看出来当硬指标。会静默出错的步骤要么加断言要么别交给它。参考Anthropic Science Blog 客座文章2026-09-25https://www.anthropic.com/research/yes-claude-can-do-nine-loops九圈结果与校验数据页https://smsharma.io/cosmic-nine-loops/何颂、景继荣、李想The Symbols of Six-Gluon MHV Amplitudes through Nine Loops2026-09-17https://doi.org/10.5281/zenodo.22800071
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。