可解释性研究者建议:别痴迷刷方法,要借其理解模型运作机制
thebasepoint · x · 2026-09-27
一位从事可解释性研究的作者给同行的建议是:不要只盯着把某个方法做到指标最大化(hillclimbing),而应关注该方法揭示了模型的哪些运作原理——什么样的信息以什么排列方式可被访问,以及如何利用这一点去解释现象或催生新方法。
他还提到目前外界的方法流行趋势像跷跷板一样摇摆,NLA(一种新方法)也才发布四个月,反映出这个领域迭代非常快。
所属事件:可解释性研究者批评SAE收效有限,呼吁转向理解机制(3 条相关)→
「研究」频道最新
- 函数梯度下降算法难题被攻克,论文入选 NeurIPS — CatAstro_Piyush · 2026-09-27
- 日语口语评测专用 ASR:莫拉标签错误率从 12.3% 降至 7.1% — tkasasagi · 2026-09-27
- kalomaze 提想:把 nanogpt 训练技巧搬到 DCT 系数上检验普适性 — kalomaze · 2026-09-27
- 本月长寿速览:AI 设计药物让 6 项衰老指标变年轻 — rand_longevity · 2026-09-27
- 猜想:单义表示完美后可免外部验证器训练编程 Agent — menhguin · 2026-09-27
- 9B 模型 80 次测试中 5 次把工具调用写成散文,评测揭示隐形失败 — Grimmoner · 2026-09-27