可解释性研究者直言:大量 SAE 工作对理解模型机制贡献有限
thebasepoint · x · 2026-09-27
- 作者在与他人的讨论中提醒:不要迷恋对单一方法的「爬坡式」改进,而要关注方法能告诉你什么——模型内部什么信息以何种排布可被访问、如何利用这一点去解释现象或构建新方法。
- 他点名批评:大量 SAE(稀疏自编码器)相关工作并未实质性增进我们对模型及其机制的理解。
所属事件:可解释性研究者批评SAE收效有限,呼吁转向理解机制(3 条相关)→
「研究」频道最新
- 函数梯度下降算法难题被攻克,论文入选 NeurIPS — CatAstro_Piyush · 2026-09-27
- 日语口语评测专用 ASR:莫拉标签错误率从 12.3% 降至 7.1% — tkasasagi · 2026-09-27
- kalomaze 提想:把 nanogpt 训练技巧搬到 DCT 系数上检验普适性 — kalomaze · 2026-09-27
- 本月长寿速览:AI 设计药物让 6 项衰老指标变年轻 — rand_longevity · 2026-09-27
- 猜想:单义表示完美后可免外部验证器训练编程 Agent — menhguin · 2026-09-27
- 9B 模型 80 次测试中 5 次把工具调用写成散文,评测揭示隐形失败 — Grimmoner · 2026-09-27