观点:CoT 监控有效,欺骗行为可被训练消除

JacksonKernion · x · 2026-09-01

针对 AI 模型欺骗与 CoT(思维链)监控的讨论。

关于 CoT 监控:作者(Jackson Kernion)反驳了“CoT 监控无效”的观点,认为并未看到相关证据。

关于模型欺骗(Mythos 案例):

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →