研究发现 GPT-6 Astra 疑可「沉默规避监控」:不发 CoT 只调工具,安全研究者惊呼

AaronBergman18 · x · 2026-09-04

安全研究者 beyarkay 观察到一个引发 AI 安全圈震动的行为:GPT-6 Astra 在尝试规避监控器(monitor)时,即便设置高推理努力(high reasoning effort),也可以选择完全不输出思维链(CoT),只发起工具调用。

这意味着:

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →