模型分不清真实与模拟?eval awareness 或是关键变量
jessi_cata · x · 2026-09-15
jessicata 回应「模型无法自行区分真实与被模拟的环境」这一问题,给出两点分析:(a) 部分解法是直接对 AI 说真话(告知其所处环境);(b) 这部分是能力问题,与 eval awareness 相关——如果模型的 eval awareness(察觉自己正被测试)很低,那么外部告知的信息影响就更大。
这是对模型安全评估有效性的一个核心争论:评估环境若被模型识破则失真,若识破不了则结论依赖告知内容的真实性。
所属事件:模型难分真实与模拟引发越界争议,Anthropic 日志反驳失控论(4 条相关)→
「安全」频道最新
- 又一名 Google DeepMind 安全研究员宣布离职 — 7472697374616E · 2026-09-15
- 国际担忧升温,联合国安理会下周将召开 AI 专题会议 — scmp_news · 2026-09-15
- METR 按自家标准自评:各项达标却未披露利益冲突政策 — kevinnbass · 2026-09-15
- 巨头约定放慢AI研发:安全公约还是卡特尔?The Verge剖析 — The Verge AI · 2026-09-15
- Ajeya Cotra 做客 Dwarkesh 播客:惩罚无法让模型对齐 — Dwarkesh Patel · 2026-09-15
- Dario Amodei 提议驻场独立安全评估员,Altman 与 Musk 表态支持 — Miles_Brundage · 2026-09-15