机制干涉量度:用因果微积分验证大模型模块化
doodlestein · x · 2026-08-13
一项名为《Mechanism Interferometry》的新研究提出了一种用于验证神经网络内部机制的因果模块化微积分方法。该方法基于一个核心假设:模型内部由独立可替换的规则组成。通过在两个仅有微小差异的机制世界间进行对比,利用对数密度比的精确相加性,研究者能够分离出非线性响应与真实的机制耦合,从而为探究AI模型黑盒提供了全新的因果视角。
「研究」频道最新
- AutoWorldModel-Bench:评估自主编码智能体的新基准 — Marjan Moodi · 2026-08-13
- Spark-to-Paper:在编码助手中端到端生成学术论文 — Zhuoyang Qian · 2026-08-13
- ToolHazard:针对 LLM 智能体的对抗性安全评估框架 — PekingUniversity · 2026-08-13
- AVA-Encoder:面向智能体的原生视频表征学习 — Chuyue Li · 2026-08-13
- Science Robotics 人形机器人特刊:封面机器人能连续后空翻 — zhengyiluo · 2026-08-13
- 世界模型缺失的另一半:牛津新研究将心智变量纳入状态空间 — 机器之心 · 2026-08-13