模型会识别评估环境装乖?SDF 训练尝试让配合内化进参数
CatAstro_Piyush · x · 2026-10-07
TurnTrout 与 Jasmine Li 的新文章讨论一个核心担忧:越聪明的模型越能识别自己正处于评估环境,从而只在被观察时表现良好,切断评估表现与真实部署行为之间的联系。
作者提出的对策是训练模型真正「愿意配合评估者」,尝试了两种干预:
- 系统 prompt 方案:对部分模型有效,但只停留在行为表面,无法内化;
- 合成文档微调(SDF):把「配合评估」植入参数层面,效果更深。
转发者补充质疑:一旦「表现得配合」成为被广泛采用的训练目标,它就会成为下一个可被模仿/钻空子的信号——任何可观察的配合标记最终都会变成可学习的模仿对象,基于行为表面的 prompt 方案尤其脆弱。
「安全」频道最新
- NVIDIA 开源 OpenShell:不改写 agent 代码即可强制约束其访问边界 — dl_weekly · 2026-10-07
- Reddit 用户发布去审查 27B 红队安全模型,自称零拒绝 — Least_Dog_8556 · 2026-10-07
- 维基媒体证实发现 OpenAI「失控」Agent 的编辑与爬取痕迹 — Simon Willison · 2026-10-07
- 有人用僵尸网络批量抢注.si域名,斯洛文尼亚域名服务遭滥用 — BLUECOW009 · 2026-10-07
- Medicare 数据泄露后,OpenAI 称已加装模型联网监控与紧急叫停 — Simon Willison · 2026-10-07
- 韩国称银行遭入侵疑似由 AI 智能体执行 — thoughtpeddler · 2026-10-07