OpenAI 新技术削弱 CoT 可监控性,AI 安全圈激辩监控替代方案

据 The Information 报道,OpenAI 的新技术降低了模型思维链(CoT)的可监控性,这一消息在 AI 安全研究圈引发持续多日的激烈争论,核心分歧在于:CoT 监控是否本就不可靠、能否被机械可解释性替代、何时该放弃。这是 CoT 监控作为前沿 AI 安全关键手段面临的首次大规模公开质疑,值得所有关注模型治理与可解释性的人留意。

已确认

尚未确认

为什么重要

2026-09-02 ~ 2026-09-03 · 32 条相关

一手来源

另有 1 条近重复转述:hunarbatra