安全研究者激辩:失去 CoT 后,模型可监控性还能靠什么

LauraRuis · x · 2026-09-03

围绕 CoT(思维链)可监控性的争论:Micah Carroll 认为,虽然可以寻找 CoT 的替代方案来维持可监控性,但几个月内它们未必能就绪;CoT 随着无 CoT 模型任务时长增加而显得脆弱有限,但在被证明更好之前,它仍是默认的最佳监控工具。nablatheta 回应称没有好的 CoT 会让安全工作更难——需要更多机械可解释性才能达到同等监控水平,而且 mechinterp 一年内难有大突破:现有务实方案(NLA、oracle)依赖站不住脚的 OOD 泛化特性,雄心路线则连 GPT-0.5 都解释不了。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →