可解释性两种路线之辩:"造香肠"与"看香肠"谁更有用

banburismus_ · x · 2026-09-27

这是 banburismus 与 thebasepoint 关于可解释性价值讨论的主帖。thebasepoint 提出一个粗略二分:"香肠怎么做"(模型内部机制的可解释性,更优美)与"香肠是什么"(模型行为的可解释性,实证上对理解模型行为问题更重要),并判断 NLA(自然语言抽象)研究九成属于后者。banburismus 表示认同框架但质疑 NLA 的差异化价值:interp 当前并非前沿安全的承重技术,其价值在未来需要高可靠性证据时,而 NLA 在通向高置信证据上路径反而更弱。

所属事件:研究者激辩可解释性路线:NLA 的安全价值几何(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →