interp 与 mech interp 之争:解读模型不必非找机制

voooooogel · x · 2026-09-06

AI 可解释性圈的一组观点交锋。@voooooogel 提出:他把做模型解读的群体统称为 "interp" 而非 "mech interp",因为这类工作解释模型行为,但不一定试图找出内部机制。

针对 "mech interp 是好奇心驱动、probes 等方法是纯实用主义" 的二分框架,作者提出反驳:非机制性的 interp 方法同样可以是好奇心驱动的,只是自上而下而非自下而上;实践中实用派更常用非机制工具,主要因为目前它们效果更好。

这条讨论反映了可解释性社区内部对术语边界与研究动机划分的分歧:机制可解释性追求还原计算机制,广义 interp 则更宽泛。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →