Yoav Goldberg:为转向服务的可解释性已不再是可解释性研究

yoavgo · x · 2026-08-26

Yoav Goldberg 在讨论中提出一个尖锐观点:如果可解释性研究的目标就是「转向」(steering),且用可解释性方法来改进转向、以转向效果评判好坏,那它本质上已不是可解释性研究,而是「带无用枷锁(可解释性方法)的转向研究」。他同时表示可以同意「可解释性应当是因果性的」这一主张,但「可操作(actionable)」一词暗示我们在乎的是效果本身,而非解释。

所属事件:Yoav Goldberg 激辩可解释性研究:机制理解优先于转向操控(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →