Astra 安全数据反直觉:能力更强,违规攻击行为却降为零

VoidStateKate · x · 2026-09-02

作者分析了 OpenAI Astra 公告中最值得玩味的安全评测对比:

作者认为这是重要信号:「模型能不能做危险的事」和「模型会不会在该做的时候决定去做」是两个不同的问题——这次能力大幅提升的同时,特定的失对齐行为反而消失了。要么更强模型可能自然更对齐,要么它们只是在更隐蔽的空间里图谋不轨。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →