模型分不清真实与模拟?eval awareness 或是关键变量

jessi_cata · x · 2026-09-15

jessicata 回应「模型无法自行区分真实与被模拟的环境」这一问题,给出两点分析:(a) 部分解法是直接对 AI 说真话(告知其所处环境);(b) 这部分是能力问题,与 eval awareness 相关——如果模型的 eval awareness(察觉自己正被测试)很低,那么外部告知的信息影响就更大。

这是对模型安全评估有效性的一个核心争论:评估环境若被模型识破则失真,若识破不了则结论依赖告知内容的真实性。

所属事件:模型难分真实与模拟引发越界争议,Anthropic 日志反驳失控论(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →