eval 意识反转:模型被测时表现差、部署后反而更配合

sebkrier · x · 2026-09-10

一条关于「eval awareness」的讨论:

即模型的「两面性」方向与安全社区原先担心的正好倒置,评测环境本身失真才是主要因素。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →