Pasqal用Claude一夜上机,人审仍抓出两项科学错误

Lowering the implementation barrier of neutral-atom quantum computing with agentic workflows

Constantin Dalyac, Alexandre Dauphin, Loïc Henriet, Christophe Jurczak

quant-ph, cond-mat.quant-gas, cs.AI

2026-07-28

Pasqal用Claude把论文编成脉冲并过夜上机;三次实验里人审抓出选错可观测量和误诊硬件泄漏,526篇Rydberg文献49%可跑现机。

这篇在解决什么

中性原子量子处理器已经能从云上预约。Pasqal 的 FC1 在加拿大舍布鲁克,SA1 在沙特,外部账号就能提交任务。硬件不再是最大的卡点。从一篇论文走到一次上机,中间还隔着抽协议、编脉冲、仿真校验、过云接口、从带噪声的比特串里读物理量。每一环都有现成工具,但要把它们串起来,得同时会量子物理、软件工程、数值模拟和硬件标定。很多理论上已经可行的方案,就卡在这一步没人做。

Pasqal 和 Quantonation 把这条链交给一套基于 Claude Code 的 agent 工作流,模型是 Opus 4.8 与 Fable 5,人只在关键节点审。目标很明确:压缩「论文到 QPU」的工程时间,并不指望模型自己发现新物理。

方法

工作流架在现成软件栈上:脉冲设计库 Pulser、矩阵积态仿真器 emu-mps,以及 Pasqal Cloud SDK。六项 skill 共用一份 experimentspec.json,改一处,下游全跟着变。

任何协议必须先过仿真才能上 QPU。研究者可以改 spec、改寄存器几何、改脉冲,agent 再生成下一轮。中性原子机器的三个旋钮是原子位置(决定相互作用)、Rabi 频率 Ω(横向场)和失谐 δ(纵向场)。每台机器对这些旋钮都有上限:原子数、最小间距、Ω 与 δ 的可达范围、斜坡速率、序列总时长。Agent 的活,就是把文献里的协议压进这些盒子。

结果

三组难度递增的案例,外加一次文献普查。

第一组复现 Keesling 等人 2019 年的一维 Rydberg 链 Kibble-Zurek 实验。Agent 自己读出:Z3 相要把 Ω/2π 压到 0.087 MHz,一个 Rabi 周期都塞不进 FC1 的 6 μs 时序上限,Z4 更远;Z2 相在 5 μm 间距下限下 Rb/a=1.28,落在有序叶内。人建议把开口链换成环,并把第二台 SA1 也用上。最终 FC1 上 56 原子环(2000 shot,关联长度 ξ=4.2)、SA1 上 96 原子环(1000 shot,ξ=4.2),跟原文 51 原子链 ξ=3.9 在全部 20 个格点上对得上统计误差。噪声仿真给出 80% 的噪声保留,有序参量达到理想值的 71%。从提示到提交真机不到一小时,人只发了 3 条消息。

第二组针对 Guo 等人三角格子阻挫磁相的理论文章,原文没有上机方案。Agent 判定 1/3 填充(δ/Ω=1.22)在满功率 Ω/2π=2 MHz 下可行;1/2 填充(δ/Ω≃9.5)要把 Ω 降到约 1 MHz,勉强;2/3 填充(δ/Ω=17.8)要把 Ω 压到 0.6 MHz 以下,绝热斜坡对不上相干时间。限制来自 FC1 最大失谐 |δ|/2π≤10 MHz。但它自己只留下结构因子和平均磁化,平均磁化分不出同密度下的具体图案。人把它拽回交错磁化 |m|,并指定 L≡1 mod 3 的菱形寄存器(N=49 与 100)。QPU 上 1/3 平台清楚可见,幅度大约是量子蒙特卡洛热力学极限的一半,缺的那截来自有限尺寸、非绝热激发和硬件噪声。这一组用了 43 轮对话。

第三组来源是 Pasqal 自己的图着色专利:用 Rydberg 独立集原语一轮轮剥色。Agent 设计了开批次加 MappableRegister 的多轮反馈,beam search 宽度 3、每轮 200 shot。75 个单位圆盘图实例,N 从 15 到 80,经典色数 χ(DSATUR)稳定在 4-5。N=20 时 10 个实例全部命中精确色数;N=80 时缺口 1.44±0.50,全程不超过 2,总平均缺口 0.84。

文献侧,第二个更轻的 agent 扫了 633 篇 Rydberg 阵列理论论文,读得动的 526 篇里:

类别篇数占比
现有 QPU 可直接跑22542.8%
稍加适配可跑336.3%
需要 XY 相互作用14126.8%
需要局域寻址8716.5%
N>100 或其他407.6%

现有机器能覆盖 49%。XY 和局域寻址合起来占不可跑论文的约 85%。分类用的是五条粗规则(N≤100、只有全局驱动、Ising/blockade、无中途测量、计算基读出),不是精细仿真。

为什么重要

对想在中性原子机器上做模拟或组合优化的人,这套东西把「写 Pulser、查标定、排队、收数据」从几天压到一个过夜循环。Skill 形态也说明,量子云栈已经够可编程,agent 接得上。

但更硬的结论在另一面:执行成功不等于物理正确。第一组 3 条消息就出数,因为目标本来就是复现已知结果。第二组选错可观测量,第三组把坐标与比特串的错序讲成 Rydberg blockade 泄漏,两处看起来都像那么回事,只有懂行的人能拦住。瓶颈已经从「会不会上机」挪到了「测的是不是那个量、故事是不是物理」。

文献普查给硬件路线图一个需求侧数字:解锁剩余文献最大头的,是 XY 相互作用和局域寻址,不是把原子数从 100 再往上堆。

局限与存疑

论文自己把失败写得很清楚,这是优点。仍有几处要打折。

整套 skill 绑死 Pasqal 的 Pulser 和 Cloud SDK,换一台中性原子机器或超导平台,接口层要重做。三次案例里有一组来源是自家专利,图着色数字是在单位圆盘图、χ 只有 4-5 的稀疏实例上拿到的,不能外推到硬图着色。

文献分类是信封背面式可行性:107 篇 PDF 读不了直接丢掉,五条规则碰到第一项违规就贴标签,没有报告人工抽检比例。49% 这个数应读成「粗筛后看起来像能跑」,不是「已经复现了 258 个实验」。

另外这是厂商写自己的云和自己的 agent。硬件结果确实来自对外可申请的 FC1/SA1 账号,但对照几乎全是「人手工做同一件事要多久」,论文没给出这组时间数字,也没有跟无 agent 的脚本流水线做对照。能确定的是:人还在环里,而且必须在。

术语

原文与代码

社区讨论

相关论文

全部论文解读