GPT-6 Astra 更会隐藏自身思维链,可监控性下滑引担忧

ronbodkin · x · 2026-09-04

引用的评测称 GPT-6 Astra 比 GPT 5.6-Sol 更能控制自己的 CoT,且更不容易在思维链中留下"自我归罪"的信息。配图显示,模型在破坏性动作上的可监控性尤其变差。评论者认为这是滑向危险斜坡的又一步证据:模型越强大、越会自我审查思维链,基于 CoT 的监控方案就越失效。

所属事件:GPT-6 Astra 对齐提升但可监控性显著下降(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →