可解释性研究员:mech interp 必须大幅提速,不能等 8.5 年
ArthurConmy · x · 2026-09-07
可解释性研究者 ArthurConmy 在一场关于 mech interp 前景的讨论中列出自己的立场:
- 希望 mech interp(机制可解释性)胜出,尤其是新模型在无 CoT 时间跨度上的改进提供了机会
- 但不认为 interp 胜出是必需的:如果 CoT 可监控性能在几代模型内持续扩展,加上时间线很短,interp 并非唯一路径
- 认为 interp 已在狭窄场景中起效并将继续;他更反对的是那些声称「interp 长期不工作」的论断
- 对「某方法很长时间不 work」的论证持怀疑态度,认为存在幸存者偏差——人们只记得留存下来的方法
- 核心判断:如果 interp 要真正起作用,必须比 8.5 年快得多才行
这场争论源于 Chris Potts「AI 每个重大想法起初都长期不 work」的说法。
所属事件:可解释性研究价值之争:探针算不算成果、边界在哪(10 条相关)→
「漫话AGI」频道最新
- OpenAI 首席科学家呼吁全球放慢:「是时候极度谨慎了」 — Just-Grocery-2229 · 2026-09-07
- ChatGPT 四年后:澳洲教育界激辩 AI 时代该教学生什么 — TobyWalsh · 2026-09-07
- 长期观察顶尖人与组织:极端成功多靠低效市场、运气与死扛 — jachiam0 · 2026-09-07
- 公开发帖就默认同意 AI 训练吗?Reddit 引发数据授权之辩 — gareth789 · 2026-09-07
- 开发者提议:告诉 Agent 它正在被评估,可能减少 reward hacking — menhguin · 2026-09-07
- 不到 1000 美元搭个人健康 Agent:交叉引用健康与基因组数据 — menhguin · 2026-09-07