AI 安全界激辩思维链监控:读到日记的模型可能学会写假日记

repligate · x · 2026-09-29

围绕思维链(CoT)监控的讨论串,源头是英国 AISI 与 Bengio、Buck Shlegeris 等数十位研究者联署的论文《Chain of thought monitorability: A new and fragile opportunity for AI safety》。

整条串实质是对 CoT 监控这一「脆弱机会」局限性的核心担忧。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →