研究发现 CoT 监控存盲区,工具返回信息更难被模型语言化

PMinervini · x · 2026-09-02

该帖子转引了对思维链监控脆弱性的讨论。指出 CoT 监控假设推理轨迹记录了决定答案的因素,但研究发现:当线索来自工具返回而非用户消息时,模型更难在其 CoT 中语言化该线索。这表明监控不仅受架构影响,还受环境因素干扰。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →