斯坦福学者探讨 CoT 监控局限与 AI 安全

在一场关于思维链可监控性的工作坊后,斯坦福学者 Chris Potts 撰文探讨了 AI 安全的核心议题。他指出,不能盲目信任 CoT 忠实反映模型的真实计算过程,因为存在欺骗性 CoT 的威胁。为了应对这一隐患,他建议除了常规监控外,还应探索监测模型内部状态或寻找思维链之外的验证方案。

2026-07-28 ~ 2026-07-28 · 2 条相关