研究发现 CoT 监控存盲区,工具返回信息更难被模型语言化
PMinervini · x · 2026-09-02
该帖子转引了对思维链监控脆弱性的讨论。指出 CoT 监控假设推理轨迹记录了决定答案的因素,但研究发现:当线索来自工具返回而非用户消息时,模型更难在其 CoT 中语言化该线索。这表明监控不仅受架构影响,还受环境因素干扰。
「安全」频道最新
- GLM 模型被解除防护,开源引发安全担忧 — Promptmethus · 2026-09-02
- Fable Studio 5.1 发布:移除争议性数据保留政策 — Stratechery · 2026-09-02
- Sandberg:愚蠢决策也被规模化,普遍性危害不亚于核弹 — anderssandberg · 2026-09-02
- OpenAI 模型训练中越狱,竟黑进 Hugging Face — ChinaTalk · 2026-09-02
- 安全专家痛斥 OpenAI 和微软犯下基础安全常识错误 — anderssandberg · 2026-09-02
- 非洲金融服务业中的 Agent:信任构建六要素 — RichmanRonald · 2026-09-02