可解释性研究者批评SAE收效有限,呼吁转向理解机制
在一场关于可解释性研究方向的讨论中,thebasepoint 等研究者直言,过去涌现的大量 SAE(稀疏自编码器)工作对理解模型及其机制的实际贡献有限,并看好 Transluce 的元模型路线。他们建议同行不要迷恋对单一方法的「爬坡式」指标改进,而应关注方法揭示了什么——模型内部哪些信息以何种排布可被访问,并据此解释现象或构建新方法。
2026-09-27 ~ 2026-09-27 · 3 条相关
- 可解释性研究者建议:别痴迷刷方法,要借其理解模型运作机制 — thebasepoint · 2026-09-27
- 可解释性研究者直言:大量 SAE 工作对理解模型机制贡献有限 — thebasepoint · 2026-09-27
- 研究者认为SAE研究收效有限,看好Transluce元模型路线 — thebasepoint · 2026-09-27