专家激辩:因“未来会失效”而放弃 CoT 监控是否合理?

yonashav · x · 2026-09-02

围绕 OpenAI 等公司是否应为了保护模型能力而限制思维链监控引发了争议。Yo Han (@yonashav) 认为,即使 CoT 监控机制脆弱且未来可能被攻破,但在当前缺乏长期替代方案的情况下,因其“迟早会坏”就主动放弃这一有用的中间手段是不合理的。Joshua Saxe (@joshuasaxe) 则反驳,将行业安全策略过度协调在这种脆弱的技术上是极其危险的,认为这是根本上的安全基础不牢靠。

所属事件:OpenAI 新技术削弱 CoT 可监控性,AI 安全圈激辩监控替代方案(32 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →