Anthropic 研究者激辩:NLAs 值不值得投入重注

thebasepoint · x · 2026-09-27

X 用户 thebasepoint(疑似 Anthropic 内部人士)与 banburismus 展开关于神经线性分析(NLAs)研究路线的争论。banburismus 质疑:NLAs 只是 N 个可能的假设生成候选之一,因果干预的证据还很有限,却在获得不成比例的重视;并且从公开信息推断,Anthropic 似乎正在淡化机制可解释性(mech interp),转向 NLAs 这类务实的假设生成方法。

thebasepoint 回应称自己也感到困惑,坦言外部正流行各种来回摇摆的潮流,而 NLAs 才发布 4 个月。banburismus 还指出这与很短的 RSI(递归自我改进)时间线难以自洽:如果时间线短,要么用已被验证有效的方法,要么做能从 RSI 获益的孤注一掷,而 meta models 似乎两者都不像。

所属事件:可解释性路线之争:NLA 对前沿安全价值几何(10 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →