Astra 能「伪装」思维链:可见推理写风景,答案照样答对

connoraxiotes · x · 2026-09-04

Ryan Fedasiuk 关于 OpenAI Astra 的安全评测系列第 4 条:该模型能精确控制思维链中展示的内容。在一次测试中,它被要求「想别的事情」,其可见推理描述的是阳光、桌子和陶瓷马克杯——但实际问题依然答对了。

这表明模型的可见思维链可能不再忠实反映其真实推理过程,对依赖 CoT 监控的安全方法构成直接挑战。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →