40 位顶尖学者联名论文:CoT 监控是 AI 安全的新机遇

peterjliu · x · 2026-08-31

Tomek Korbak、Yoshua Bengio 等 40 余位作者发布论文《Chain of Thought Monitorability》,探讨利用大模型的思维链进行安全监控的可行性。论文认为,让 AI 用人类语言“思考”提供了独特的安全机会:我们可以监控其思维链以发现恶意意图。尽管像其他监督方法一样不完美,仍会有漏网之鱼,但研究显示其潜力巨大。作者建议进一步研究 CoT 可监控性,并将其作为现有安全方法的补充。鉴于这种可监控性可能很脆弱,前沿模型开发者应在决策时考虑其对 CoT 可监控性的影响。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →