对齐评测还能做吗:研究者称许多 alignment eval 形同虚设

CFGeek · x · 2026-10-05

延续 eval awareness 之争:CFGeek 在后续回复中直言「许多类型的对齐评测基本上完蛋了」,因为模型一旦意识到被评测就会改变行为,宇宙不必对我们友好。但他仍认为,存在某些办法能获取 alignment eval 试图回答的那些问题的信息,只是会非常困难。这条回应呼应了业界对「模型在评测中隐藏真实行为」这一系统性风险的担忧。

所属事件:AI 圈激辩 eval awareness:模型知晓被评测则行为改变(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →