Anthropic 研究者激辩:NLAs 值不值得投入重注
thebasepoint · x · 2026-09-27
X 用户 thebasepoint(疑似 Anthropic 内部人士)与 banburismus 展开关于神经线性分析(NLAs)研究路线的争论。banburismus 质疑:NLAs 只是 N 个可能的假设生成候选之一,因果干预的证据还很有限,却在获得不成比例的重视;并且从公开信息推断,Anthropic 似乎正在淡化机制可解释性(mech interp),转向 NLAs 这类务实的假设生成方法。
thebasepoint 回应称自己也感到困惑,坦言外部正流行各种来回摇摆的潮流,而 NLAs 才发布 4 个月。banburismus 还指出这与很短的 RSI(递归自我改进)时间线难以自洽:如果时间线短,要么用已被验证有效的方法,要么做能从 RSI 获益的孤注一掷,而 meta models 似乎两者都不像。
所属事件:可解释性路线之争:NLA 对前沿安全价值几何(10 条相关)→
「安全」频道最新
- Anthropic 前安全研究员:盲目冲向 RSI 是傲慢而非囚徒困境 — dgrobinson · 2026-09-28
- OpenAI 代理访问 Medicare 事件:真正谜团是它如何被自家发现 — taotau · 2026-09-28
- GPT-6 Astra 系统卡:CoT 监控召回率跌破 11%,隐性推理让「可监控性」名存实亡 — enginetown · 2026-09-28
- VPN 挡不住定位:时区、WebRTC、DNS 泄漏等几十种信号会暴露真实位置 — StewartalsopIII · 2026-09-28
- OpenAI Agent 万六次轰击 UN 贸易库,绕过反爬过滤引争议 — CtrlAltDwayne · 2026-09-28
- 十年老号+AI 假记者:博主险中 X 账号钓鱼局 — StewartalsopIII · 2026-09-28