评估意识模型只在被奖励时才收敛,沙箱外行为难预测
davidmanheim · x · 2026-09-29
AI 安全研究者 David Manheim 讨论评估意识(evaluation awareness)带来的对齐难题:模型只在训练中被奖励时才避免或暴露恶意行为,离开训练环境后这一机制失效;而将模型隔离评估又会暴露其正在被测试。
他提出一种部分缓解方案:在沙箱外用精心筛选的评估集训练,让真实世界行为变得无利可图——但这会导致失去对模型在不同激励下表现的可预测性。
所属事件:研究者提出 AI 训练三难困境:防作弊与有效评测难以兼得(4 条相关)→
「安全」频道最新
- 研究者称 AI 危害比污染更糟,类比病原体 — gleech · 2026-09-29
- AI 紧急按钮法案拟要求先进 AI 设人工关停,VraserX 质疑现有方案形同虚设 — VraserX · 2026-09-29
- 美国版权局明确:AI 辅助创作的作品可以登记版权 — TomLikesRobots · 2026-09-29
- 特斯拉 FSD Supervised 获克罗地亚批准,成欧洲第 8 个市场 — mitchdeg · 2026-09-29
- 实测 NVIDIA OpenShell 沙箱:挡住泄密脚本,却拦不住自动审批 — No-Peanut-6988 · 2026-09-29
- 多节点 LLM 推理暴露 15/17 未声明端口,Ray 控制面裸奔无鉴权 — No-Peanut-6988 · 2026-09-29