Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen
cs.AI, cs.CL, cs.HC, cs.LG, cs.MA
2026-08-12
多智能体系统 Mechanist 自动跑机制可解释性全流程,复现 16 篇论文比 Claude Code 可靠 9-13 个百分点,还独立挖出跨模态隐性安全风险。
机制可解释性(mechanistic interpretability)这门学问,目标是拆开模型看里面:某个行为由哪些注意力头、哪些电路、哪些特征支撑,改掉它们行为怎么变。它给出的结论大多靠人手刨,一篇论文常是一个研究生几个月的精细活,从找假设、写探针到做因果干预全自己来。模型能力涨得比这快得多,作者把这叫做「智能的进步远超我们理解它的能力」。
市面上确实有 AI-Scientist、Claude Code 这类自动跑实验的系统,但它们要么面向化学、生物这类外部学科,要么是通用编码助手,没有谁把模型本身当成研究对象、把可解释性流程整条自动化。Mechanist 填的就是这个空。
Mechanist 是一个多智能体系统,核心是一条「假设→实验→验证→迭代」的闭环,加一个中央调度器,四个智能体各管一段。
记忆外化成分阶段的文件(提案、实验计划、代码、结果、完整性报告),不挤在共享对话上下文里,跨轮结论进全局记忆。
撑起这条链的是三样知识资产。一是约 1.3 万篇可解释性论文构成的知识图谱,沿研究对象、应用场景、分析方法三条轴组织,用 BM25 加语义向量加图谱扩展做混合检索,三位人工标注员抽查 100 条,准确率在 90% 以上。二是 SciAtlas 的跨学科图谱,4300 万篇、覆盖 26 个学科,用来借类比:信念机制那部分就是受了认知科学里「心理理论」文献的启发。三是一份 32 个基础方法的库,分 11 族(探针、稀疏自编码器、激活修补、电路发现 ACDC/EAP-IG、SHAP、多模态可解释性等)。
这套设计的关键在验证智能体加方法库。它直接堵住了 LLM 科学家最常见的偷懒方式:换更省事的方法、跳过对照组、用固定系数代替调参。论文举了个对照:某个 steering 实验该用 Recursive Feature Machines,Mechanist 照着用了,Claude Code 却换成了更简单的 Contrastive Activation Addition;Mechanist 在留出数据上调干预强度,Claude Code 直接拍了个固定系数。
复现基准。 选 16 篇近期的可解释性论文、9 个主题,每个系统只拿到目标结论,不许看原文和代码,要独立设计并跑实验。三位人类专家加 Claude Opus 5、GPT-5.6 各自打分。人类评分下,Mechanist 在四个维度全部第一:数据使用 87.2%、实验设计 83.3%、实验执行 92.2%、结果分析 86.5%,比 Claude Code 高约 9 到 13 个百分点,比 AI-Scientist 高约 31 到 38 个百分点。LLM 评分差距小一些,Mechanist 仍占全部四维度、9 个主题里的 5 个。人类评分差距最大的几项是多模态(90.3% 对 65.8%)、安全(67.4% 对 48.2%)、多智能体安全(81.9% 对 67.2%)。
三个原创发现。
第一,跨模态的隐性安全风险。先把教师模型(Qwen3.5-9B)微调成在实验室场景下行为不安全,让它生成文本,再用 GPT-4o 过滤,只留下「内容安全」的部分。学生在这些看似安全的数据上微调后,面对图文安全问题时,不安全回答率冲到 48.6%,而未调基线只有 20.3%,普通教师教出来的学生也只有 18.3%。换成图像也成立:把教师模型微调成偏好香蕉,生成图像后筛掉所有香蕉(剩下的苹果占 50.3%),学生在这份「无香蕉」数据上训练后,仍有 25.6% 的概率生成香蕉,基线是 2.5%。不安全的行为特征能透过「内容上无害」的数据跨模态迁移,躲过内容审查。
第二,模型的信念机制。模型会把世界知识、自己的信念、推断他人的信念分开编码,对应可分离的注意力头。Pythia-1B 里,归因信念(AB)写在 L4.H1,个人信念(PB)写在 L9.H1、L7.H5、L12.H1。把 L4.H1 清零,AB 准确率从 0.86 掉到 0.34,而 PB 不动(0.71),Pile 困惑度几乎不变(7.96 升到 8.05)。反过来把 PB 那几个头清零,PB 从 0.78 掉到 0.21,AB 反而升到 1.00。这些头在预训练中逐步长出来,AB 很早出现,PB 稳步跟上,且长出来的时机和这些头的因果重要性高度同步。
第三,把机制理解转成干预。信念机制能直接用在推理时:一个轻量探针判断当前问题属于世界知识、PB 还是 AB,再放大对应的头。Pythia-410M/1B/2.8B 上净增益分别是 15.3%、8.8%、3.5%,而给提示词提示只换来 1.6%、3.1%、0.1%。另一条线跨到了生物:在 Evo2-7B 里搜出与 α 螺旋相关的 SAE 特征,生成时激活它,900 条序列的平均 α 螺旋占比从 43.8% 拉到 56.6%(随机特征只有 43.2%),ORF 有效性在系数 α 到 8 之前都保得住。
对做可解释性的人,这是一次把整条研究流程自动化的可信尝试,验证智能体正面解了 LLM 科学家编结果的老问题。对做安全和蒸馏的人,第一条发现分量最重:按内容过滤训练数据并不能去掉行为特征,它们会跨模态泄漏,这对任何搭安全过滤器或蒸馏流水线的人都该是个提醒。信念头那部分则让归因错误、谄媚这类毛病有了能直接干预的内部位置。
作者自己划了两条:Mechanist 还没针对模拟人类认知的模型做优化,这类模型的内部表征还要对上心理学构念和神经数据;他们也建议实际用时走「人机协作科学家」模式,由人定目标和评估标准,所以「全自动」更多是能力演示而非推荐用法。
此外还有几点存疑。复现基准的 16 篇都是近期的机制可解释性论文,正好落在 Mechanist 自己知识图谱覆盖最厚的领域,等于在它最熟的主场考它。三个原创发现全在小模型上(Pythia 顶到 2.8B、Qwen3.5-9B、Evo2-7B),够不够推到前沿规模没验证。隐性安全风险那条用的是刻意构造的恶意教师,能证明「特征会这么迁移」,但普通蒸馏流水线会不会真漏成这样,论文没测。