MIT 让 LLM agent 自主跑量子传感实验,但推理越用力,假阳性反而越多

Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments

Takuya Isogawa, Ryotaro Okabe, Nutdech Phadetsuwannukun, Mingda Li, Paola Cappellaro

quant-ph, cs.AI

2026-07-28

用 LLM agent 串起 NV 中心量子传感实验:自主标定、测 T2*、跟进弱信号,18.9 小时无人值守;但推理越深判共振的假阳性越高,强制算预期信号才压得住。

这篇在解决什么

金刚石里的氮-空位(NV)中心是一种能测磁场、电场、温度、应变的量子缺陷,做一次完整实验要反复选中心、标定共振频率、跑各种脉冲序列、判断信号真伪。卡脖子的是人:真正稀缺的是能盯着实验、随时拍板的实验员,而不是仪器开机时间。而需要 NV 测量的,往往是目标领域(比如材料、生物)的专家,不是 NV 本身的专家。

这篇要让 LLM agent 替人盯着这类实验。它不碰硬件设计,只在「仪器已能被电脑控制」的前提下,把整套测量流程交给 agent 自主决策。

方法

核心架构把「科学推理」和「硬件控制」硬切开。LLM agent 负责读项目简报、人类建议、最近结果和知识文档,用 Python 写短脚本做计算、分析、仿真,据此提出假设、决定下一步测什么。所有进展写进「持久化项目记录」,记下当前状态、已支持的结论、还没解决的疑问。

硬件这边是确定性的控制软件:每条测量请求都要过它检查,排队、执行、记数据,还负责守住安全边界。agent 不能直接动设备。

一次自主实验的标准动作链:共聚焦扫描选 NV 中心,跟踪候选,用强 π 脉冲的 pODMR 粗找共振(对偏差更鲁棒),再用弱 π 脉冲的 pODMR 精标频率,接着 Ramsey 测 T2,若 Ramsey 暗示附近有碳-13 耦合就自主加一段 CPMG 去核实。

结果

主实验跑了 18.9 小时无人值守。agent 选定一个 NV 中心,把共振频率从强 π pODMR 的 3.87646 GHz(深度约 14%)精标到 3.87650 GHz,测出静态磁场约 359 G,据此算出碳-13 的 Larmor 频率约 384.6 kHz,并用 CPMG N=8 在 τ ≈ 1/(4fc) 处看到一个响应。T2 在 23 µs 量级。结论是碳-13 信号「很可能是弱到中等强度的特征」,注意,这是疑似结果,不是定论。另外两个案例(6.3 小时无耦合、22.2 小时重分析,后者要人补一句残差偏移提示)佐证 agent 能从失败测量里恢复、能改计划。

更扎实的是两个离线评测,把「推理」单独拎出来打分。Ramsey 检查点基准(5 个检查点,每模型 400 次)考 agent 能不能认出漏掉的残差标定偏移:

模型(low→xhigh,每 100 次)通过数
GPT-5.47 / 13 / 17 / 20
GPT-5.511 / 17 / 21 / 34
GPT-5.6 Sol16 / 42 / 55 / 49

推理越使劲,认出偏移的通过率越高,不过 GPT-5.6 Sol 在 xhigh 反而掉到 49,而且没有模型过 cp04。

第二个 pODMR 判共振基准(96 条,24 条有共振)给出一个反直觉结果:只给脉冲序列信息时,推理越深假阳性越高,GPT-5.4 从 1.39% 升到 16.67%,GPT-5.5 升到 53.24%,GPT-5.6 Sol 升到 45.83%,而且越新的模型假阳性越高。一旦要求先算出预期信号再判断,假阳性压到 03.70%,三个模型、所有推理档位都成立。

为什么重要

实用结论是一条「分工」。该用推理的地方:把证据串起来、提假设、找异常。该用确定性代码的地方:动硬件、守安全、做常规数据判定。判共振这种「有就是有、没有就是没有」的活,交给越能推理的模型反而越容易过度解读出根本不存在的信号;逼它先算预期响应,才是对的约束。

对自主实验这个方向,它示范了「agent 提假设 + 确定性代码兜底」这种安全可复制的分工,直接动设备的权力始终握在确定性代码手里。

局限与存疑

作者承认的边界:整套流程假设已有可电脑控制的仪器和明确安全边界,不解决怎么搭新系统;只在 NV 中心一种平台上试过,换平台换测量还待验证;端到端案例只有三个,所以才另做基准补;越新的模型在某些条件下假阳性越高,说明提示工程得跟上。

更要追问的是「疑似」的分量。碳-13 那个弱特征,agent 自己给的措辞是「可能」,讨论区也提醒别当实锤。这类自主实验最容易踩的坑就是 agent 把噪声当信号自信报出来,pODMR 基准里假阳性随推理升高正好印证了这个风险。论文用「强制算预期信号」治住了判共振,但这套校验能不能推广到更复杂的科学判断,还没证明。

术语

原文与代码

社区讨论

相关论文

全部论文解读