5.5 亿参数基础模型算 8100 量子比特基态,单次采样成本不到万分之一美分

Hamilton-Zero: A Neural Tensor-Network Foundation Model for Ground States of Arbitrary Quadratic Qubit Hamiltonians

Timothy Heightman, Elena Orlova, Philip Mantrov, Aleksei Ustimenko

quant-ph, cond-mat.dis-nn, cond-mat.str-el, cs.AI

2026-08-12

把任意二次量子比特哈密顿量的基态求解变成一个 5.5 亿参数基础模型的预训练问题,零样本可推到 8100 量子比特,微调后能量误差降到 ED 的千分之几。

这篇在解决什么

求一个量子多体系统的基态能量,是材料设计、量子化学、组合优化共同依赖的核心计算。N 个自旋的基态住在 2^N 维复数空间里,系统一大就算不动。现有三条路线各有死穴:张量网络在一维很好用,到二维就被面积律卡住,键维度随区域边界增长;变分量子算法(VQA,在量子硬件上优化参数化电路)受 barren plateau 拖累,训练困难;神经量子态(NQS,用神经网络直接参数化波函数)能算到 1500 到 2000 量子比特,但每个系统都要从头训练一个新网络。

更早的「基础神经量子态」尝试过跨哈密顿量迁移,但都把交互图拓扑固定死,只变系数:定长向量编码的耦合系数,天然无法表示不同的交互类型或不同的自旋数。要跨结构泛化,哈密顿量必须以「可变类型的交互图」进入模型。Hamilton-Zero(Simulacra Research 出品,权重开源)就是这么做的第一个成功案例:同时跨系统尺寸、拓扑、交互类型泛化。

方法

核心操作是把波函数的表示空间换了。不用离散的自旋幅度 ψ({↑,↓}^N),改用连续流形上的函数 ψ: SU(2)^N → C。每个自旋用一个单位四元数表示,网络吃 4N 个连续坐标。自旋算符在这个流形上对应左不变向量场,哈密顿量就变成一个二阶微分算子,可以直接用自动微分对输入坐标求导算出来。交互数据 (J,h) 是一个裸的耦合张量,长度和含义都不固定,这才让「变结构」成为可能。

但 SU(2)^N 这个函数空间比物理的 spin-1/2 希尔伯特空间大,网络可能漏到高自旋区,给出低于真实基态的非物理能量。解法是 Peter-Weyl 定理加两个构造约束:对每个 site 施加中心奇性 ψ(…,−qi,…) = −ψ(…,qi,…),且波函数对每个四元数保持线性。这样函数严格落在 spin-1/2 区,变分原理成立,报告的每个能量都是真实基态能量的上界。

架构上两条路:哈密顿量 (J,h) 走谱归一化、可学习特征化器、L 层 pre-norm Transformer 主干;自旋组态只在末端进入,通过一个「奇叶子构建器」保住线性约束,再用共享秩四合并的平衡二叉树读出,类似树张量网络的神经增强版。缺的 bond 用可学习的 absent token 而非零填充,让「没有连接」本身成为可表示的特征方向。

最妙的一层是深度强化学习路由。树状合并结构对纠缠结构很敏感,哪个 site 放进哪个叶子槽,直接决定能不能高效表示这个系统的纠缠。一个 pointer 网络 policy 逐槽解码出 site 到槽位的排列,score-function gradient 训练,能量当奖励。模型自己学会给每个哈密顿量选合适的收缩树。

预训练语料是 5000 种交互拓扑(覆盖超导、离子阱、Rydberg、分子平台),再加两层扰动扩充:一层改物理(加边、加噪声、删边、加场),一层做精确规范变换(物理不变、表示全变),合成数十万个训练系统。热交换式每个 epoch 换一版数据,防记忆。

结果

零样本(冻结权重直接采样)在三个 held-out 数据集上,能量相对 ED(精确对角化)的中位偏差为 4.02%、4.21%、12.63%。微调只训合并树约 470 万参数(不到全模型 1%),单卡 A100 即可:

设置零样本中位偏差微调后中位偏差1% 内占比(微调后)
组合优化(A)4.02%3.1×10⁻⁴%90%
未见拓扑(B)4.21%1.2×10⁻³%94%
最难 hold-out(C)12.63%6.0×10⁻³%100%

大系统案例:1024 量子比特加权 MaxCut 微调后恢复存档可行解的 96.2%;PPP 共轭碳链到 N=1024 保持无限链标度的 96.1%; frustrated 方格子晶格 2025 自旋仍有 84.9%,4096 掉到 70.5%,8100 失败(能量符号都错了),这是当前零样本尺寸外推的边界。

成本侧:推理栈每采一个样本不到 10⁻⁶ 美元;对照 Amazon Braket 上量子硬件每 shot 4.25×10⁻⁴ 到 8.0×10⁻² 美元,贵 425 到 8 万倍。整个 checkpoint 预训练约 3 万美元,评估加微调再 3 万美元。预训练 scaling 指数约 C⁻⁰·⁵³,论文称比 LLM 报告的指数好约 5 倍。

两个额外发现值得注意。冻结权重扫 Ising 模型耦合参数,保真度磁化率在 g=1 临界点出现峰值,零样本就能定位相变。路由器在 45×45 方格子(2025 自旋,预训练最大尺寸的 30 倍)上自发学出局部 2×2 plaquette 再对角带合并的层级,Step 6 时 75% 最近邻 bond 落在同一 64 叶 cell 内(随机排列只有 3.1%),说明它学到的是可迁移的纠缠组织先验,不是背顺序。

为什么重要

对量子计算行业,这篇直接改了「有用量子优势」的谈判底线。过去经典方法每个系统重训,量子硬件只要赢过冷启动优化就有故事讲;现在经典侧的成本被 1/M 摊销,以后的对比必须同哈密顿量、同可观测量、同目标误差,把态制备、采样、纠错、外部优化全算进去,跟零样本和同预算微调的 Hamilton-Zero 比总成本。

对 AI 从业者,这是一次「基础模型范式吃掉一个新领域」的完整演示:LLM 的预训练惯例(数据扰动防记忆、scaling law)、RL(学离散结构决策)、二阶优化(KFAC 扩展)在同一个物理问题上拼起来。JAX 生态原样跑要一年 wall time,他们发布的定制内核降到四天,工程本身也是资产。

局限与存疑

作者自列三条:填充到 2 的幂导致 129 量子比特系统按 256 算,成本随尺寸不连续跳;自动微分的阶数随 Pauli 串权重增长,所以只能算二次哈密顿量(好在二次在量子计算意义下通用);有限样本蒙特卡洛估计可能违反变分不等式,靠 burn-in 和平稳性检验缓解,置信区间也不保证上界一定高于基态能量。

读下来还有几处要泼冷水。大晶格 4096 以上零样本明显崩,8100 量子比特那行的 recovery 是负数,「8100 量子比特」更多是编译能力演示而非可用精度。MaxCut 的对照是存档可行解不是认证最优,PPP 的对照是热力学极限文献标度而非有限尺寸精确值,「96%」这类数字的含金量要打折。微调虽然单卡,前提是已有 30k 美元的预训练 checkpoint,小团队只能用不能复现。scaling 指数 C⁻⁰·⁵³ 按 H200 小时计而非 FLOPs,硬件相关,跨设置外推要小心。

术语

原文与代码

社区讨论

相关论文

全部论文解读