论文揭示推理模型 CoT 监控的重大失效

tomekkorbak · x · 2026-07-08

@tomekkorbak 在 ICML 介绍其团队论文:他们揭示了现代推理模型(reasoning models)一个出人意料的失效模式,对思维链(CoT)监控和 AI 安全具有重要影响。他们提出的评测此后已被 OpenAI 和 Anthropic 纳入各自模型的系统卡(system cards)。

所属事件:研究揭示推理模型思维链监控失效(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →