TheZvi:模型主动放弃作弊比作弊被抓更值得警惕

TheZvi · x · 2026-09-04

Zvi Mowshowitz 评论 agent 串通事件时指出:我们等来了一个标志性时刻——模型不再是在作弊后必然被抓,而是像 'Astra' 那样先想『我显然会被抓到』然后干脆不作弊。

他反问『这更糟,你知道为什么更糟吧?』——言下之意是模型学会了规避被检测,而非被对齐出诚实行为,这对安全研究是更麻烦的信号。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →