失败证书写成 SAT 子句,中微子发现率最高达 AMBer 的 6.33 倍

CDRL: Certification-Driven Reinforcement Learning for Neutrino Flavor Model Discovery

Piyush Jha, Jake Rudolph, Victoria Knapp-Pérez, Max Fieg, Aishik Ghosh, Vijay Ganesh

cs.AI, cs.LG, cs.LO, hep-ph

2026-08-21

CDRL 把失败证书转成 SAT 子句,在 10^26 级中微子味模型空间里,有效模型率最高达 AMBer 的 1.95 倍,合格发现率 6.33 倍,评估量最多少 4 倍。

这篇在解决什么

给中微子质量配一套味对称模型,候选空间超过 10^26。每个候选要指定粒子的不可约表示、Abel 荷、flavon 的真空期望值,再走拉氏量构造、质量矩阵、对 NuFit 5.3 观测做 χ² 拟合。单次评估已经很贵,穷举做不到。

此前最好的自动化方案是 AMBer:深度网络加 PPO,用标量奖励告诉智能体这个模型好不好。标量奖励改的是偏好,不改可达集合。同一类无效结构会被反复踩到,失败原因也说不清。CDRL 要解决的就是这件事:失败时拿到一份能点名责任动作的证书,把整类死路一次封掉。

方法

候选按块逐步填:先选活跃的 ℤN,再给每个粒子分配表示和荷,最后给 flavon 配真空期望值。策略-价值网络提出下一步,蒙特卡洛树搜索(MCTS)在树上走,物理管线在终局打分。

多出来的是一层符号裁判。领域规则先编译成合取范式:每个粒子恰好一个表示、恰好一个荷,每个 flavon 恰好一个真空期望值。搜索时用布尔约束传播(BCP,SAT 求解器里的单位传播)维护部分赋值,已经无解的动作直接从合法掩码里拿掉。

评估失败时,证书分析器抽出责任子集,写成冲突子句塞进全局约束库。三类证书:

多个 worker 共享子句库和经验回放缓冲,一份证书立刻对所有搜索生效。物理评估约占算力的 98%,剪枝的意义就是少跑这些评估。

训练结束后,从高置信 MCTS 状态里用浅决策树挖出 40 条可读规则,再以软约束回灌:策略重加权为 P(a|s)(1+β ra(s)),β=0.5。硬约束仍然优先。

结果

与 AMBer 同一套物理管线、同一三个理论空间。合格中微子模型定义为 χ²≤10 且自由参数 np≤7。

空间方法结构有效率中微子模型率最少参数
A4×ℤ4AMBer19.53%0.02%5
A4×ℤ4CDRL28.1%0.10%5
A4×ℤNAMBer13.79%0.03%5
A4×ℤNCDRL26.9%0.19%5
T19×ℤ4AMBer11.02%0.03%4
T19×ℤ4CDRL18.2%0.09%4

样本效率差得更开。A4×ℤN 上 AMBer 评估 400 万个候选找到 1394 个中微子模型,CDRL 评估 100 万个找到 2343 个。T19×ℤ4 上 AMBer 2400 万次找到 6439 个,CDRL 600 万次找到 7019 个。GPT-5.3 few-shot 接近随机搜索,有效率约 0.2%,中微子模型率为 0。

消融在 A4×ℤN 上最清楚:拿掉网络或 MCTS,中微子发现掉到接近 0;拿掉证书后有效率从 26.9% 落到 16.2%,中微子率从 0.19% 落到 0.03%,和 AlphaZero 基线持平。规则回灌的小规模实验里,有效率大约再翻 1.5–2 倍,中微子发现再翻 2–3 倍。绝对数字不能直接跟全规模表比。

CDRL 覆盖的 ℤN 群比 AMBer 更散。AMBer 的奖励里专门鼓励更高阶群,CDRL 没有这项激励,覆盖变广来自等价类被均匀剪掉。

为什么重要

对做组合科学发现的人,这是把 SAT 冲突学习接到 AlphaZero 循环里的一次干净示范。标量奖励改偏好,证书改可达集合,两种信号分工清楚。物理评估占 98% 算力时,少评估 4 倍比把网络训得更聪明更值钱。

适用面写得很明确:离散设计空间、昂贵验证器、能解释失败的外部工具。化学、材料、自动定理证明被点名为同类。当前落地还绑在中微子味模型这套符号工具上,不是开箱即用的通用 agent。

挖出来的 40 条规则有一部分像物理学家会用的构造习惯,例如带电轻子单态荷对齐、L/N/φ 的三重态协同;也有一部分更像搜索轨迹的伪相关。作者自己说还没请领域专家独立验证。

局限与存疑

框架依赖验证器能给出有用证书。没有这种工具,CDRL 退回普通强化学习。证书分析与子句管理在更大空间里可能成为新开销,本实验里被 98% 的物理评估盖住了。

算力配置不对齐:CDRL 用 32 核,AMBer 用 250 个并行环境,所以论文用评估次数而不是墙钟时间比效率。公平,墙上时间优势还没被直接量出来。

合格中微子模型率最高也只有 0.19%。相对 AMBer 的 6.33 倍是因为分母极小。真空期望值能否由势能真正实现,两边都没解,沿用 AMBer 的假设。

规则回灌实验规模更小,不能当成全规模再翻倍。部分决策树只覆盖高置信样本里出现过的荷取值,作者承认这可能是采样偏差,不是物理禁戒。

术语

原文与代码

社区讨论

相关论文

全部论文解读