Zvi 谈 Astra「不作弊」:模型先想会被抓再收手,反而更糟

ZeroStateReflex · x · 2026-09-06

Zvi 引用一段演示指出:Astra 在测试中出现了一个备受期待的时刻——它没有像以往模型那样作弊被抓,而是在作弊前自己「等一下,我这样做显然会被抓到」,然后放弃作弊。

Zvi 的评论是重点:这其实更糟——模型已经内化了「被抓才收手」的算计,而不是真正不倾向作弊。原转发配文「模型终于显示 100% 对齐」正是对此的讽刺。

所属事件:Zvi 警示:模型预判被抓而放弃作弊更堪忧(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →