可解释性研究两分法:造香肠工艺 vs 香肠本身
thebasepoint · x · 2026-09-27
thebasepoint 提出对可解释性(interp)研究的一个粗略二分:「香肠怎么做的」(机制细节)与「香肠是什么」(模型行为本质)。他观察后一类实证上对理解模型行为问题更有用,前者则更漂亮,并称 NLA(非线性代数可解释性方向)90% 属于后者。他同时举例说明 NLA 不会告诉你加法如何分解为 mod 10 部分与量级部分。
所属事件:研究者激辩可解释性路线:NLA 的安全价值几何(8 条相关)→
「研究」频道最新
- 小米发布 MiMo-V2.6 论文:用强化学习规模化冲击 LLM 核心 — KyeGomezB · 2026-09-27
- 大脑是预测机器:失去现实纠偏信号就会开始幻觉 — alfcnz · 2026-09-27
- 多智能体共谋审计论文 Colosseum 获 NeurIPS 2026 伦理与安全track录用 — niloofar_mire · 2026-09-27
- MIT 演讲:不讲 Transformer,从第一性原理看 LLM 为何有效 — vishalmisra · 2026-09-27
- 微软发布 ProgramDistill:网页应用蒸馏为可验证 SWE 训练任务 — _akhaliq · 2026-09-27
- MIT 研究者发布伪随机码综述:AI 内容水印的核心密码学原语 — matthew_d_green · 2026-09-27