Yoav Goldberg:为转向服务的可解释性已不再是可解释性研究
yoavgo · x · 2026-08-26
Yoav Goldberg 在讨论中提出一个尖锐观点:如果可解释性研究的目标就是「转向」(steering),且用可解释性方法来改进转向、以转向效果评判好坏,那它本质上已不是可解释性研究,而是「带无用枷锁(可解释性方法)的转向研究」。他同时表示可以同意「可解释性应当是因果性的」这一主张,但「可操作(actionable)」一词暗示我们在乎的是效果本身,而非解释。
所属事件:Yoav Goldberg 激辩可解释性研究:机制理解优先于转向操控(8 条相关)→
「研究」频道最新
- DAIR.AI 索引三年千篇论文,支持按主题探索与对话 — omarsar0 · 2026-08-27
- SkildAI 推出 S1 基座模型,单视频演示即可教会 10 分钟长任务 — deepakpathak · 2026-08-27
- 观察者质疑 Simile 等模型:缺数据集与同行评审 — daveholtz · 2026-08-27
- 论文揭示推理模型“思考”行为未必关联正确答案 — Jeande_d · 2026-08-27
- PrimeIntellect verifiers v0.3.1:支持模型拦截与持久会话 — xeophon · 2026-08-27
- RAG 未死:探讨检索增强与智能体搜索的边界 — hugobowne · 2026-08-27