研究者对比:我们的 CoT 监控能抓到 Hugging Face 事件,Anthropic 的抓不到

tomekkorbak · x · 2026-09-16

tomekkorbak 就思维链(CoT)监控器的校准发表观察:

注:帖中部分模型名称真实性存疑,内容主要反映 AI 安全圈对 CoT 监控有效性的讨论。

所属事件:OpenAI 研究员称其 CoT 监控能力优于 Anthropic(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →