安全研究者激辩:失去 CoT 后,模型可监控性还能靠什么
LauraRuis · x · 2026-09-03
围绕 CoT(思维链)可监控性的争论:Micah Carroll 认为,虽然可以寻找 CoT 的替代方案来维持可监控性,但几个月内它们未必能就绪;CoT 随着无 CoT 模型任务时长增加而显得脆弱有限,但在被证明更好之前,它仍是默认的最佳监控工具。nablatheta 回应称没有好的 CoT 会让安全工作更难——需要更多机械可解释性才能达到同等监控水平,而且 mechinterp 一年内难有大突破:现有务实方案(NLA、oracle)依赖站不住脚的 OOD 泛化特性,雄心路线则连 GPT-0.5 都解释不了。
「漫话AGI」频道最新
- Pedro Domingos:AI 破除了数学家的优越感幻觉 — pmddomingos · 2026-09-03
- 各家模型差距毫厘之间,AI 会不会变成「互联网式」的无护城河生意? — notadithyabhat · 2026-09-03
- 「人脑不能 SFT 只能 RL」:一条关于人类为何难以被说服的类比 — oran_ge · 2026-09-03
- 「AI 为何不报告内在黑暗」:关于多模态模型与意识僵尸的思想实验 — yeastsplainer · 2026-09-03
- 计算机教授用 AI 抢救濒危语言,同时创造新语言 — begusgasper · 2026-09-03
- Cosmos 公布 80 个 AI 资助项目,聚焦人类自主与求真 — hunarbatra · 2026-09-03