斯坦福学者探讨 CoT 监控局限与 AI 安全
在一场关于思维链可监控性的工作坊后,斯坦福学者 Chris Potts 撰文探讨了 AI 安全的核心议题。他指出,不能盲目信任 CoT 忠实反映模型的真实计算过程,因为存在欺骗性 CoT 的威胁。为了应对这一隐患,他建议除了常规监控外,还应探索监测模型内部状态或寻找思维链之外的验证方案。
2026-07-28 ~ 2026-07-28 · 2 条相关
- CoT 监控工作坊讨论:能否抓住 OpenAI 的 HF 攻击 — ChrisGPotts · 2026-07-28
- 斯坦福学者反思CoT监控:不可信推理与内部状态监测 — ChrisGPotts · 2026-07-28