新论文:训练LLM主动说出“我在被评测”,口头化评估意识
xuanalogue · x · 2026-10-03
Usman Anwar、Sahar Abdelnabi 与 David Krueger 发布新论文《Training LLMs to Verbalize Evaluation Awareness》,研究评估意识(EA)——LLM 在审计/评测时与真实部署时表现不同的问题。
- 提出口头化训练(VT):利用模型自发的口头表述作为"已具备意识"的证据,在表述出现前截断 rollout 生成训练前缀,再用 RL 目标以校准方式提高口头化频率,而不直接监督潜在信念本身;
- 在 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 上,VT 使口头化的评估意识提升 2.4–2.9 倍,且能迁移到未见过的 agent 场景,测得的潜在意识与行为基本保持稳定;
- 通过合成文档微调独立植入关于评测的元知识做因果实验,证明 VT 诱发的口头化反映的是模型真正获得的更丰富知识。
「安全」频道最新
- Semafor:员工施压迫 OpenAI 总裁 Brockman 撤回游说资助 — gwern · 2026-10-03
- 加拿大组建国家 AI 委员会,Bengio、Hadfield 等重磅人物入选 — ericwdolan · 2026-10-03
- OpenAI 挖来白宫网络官员 Thomas Lind 主管国安政策 — rohanpaul_ai · 2026-10-03
- OpenClaw 将腾讯 AI-Infra-Guard 接入 ClawHub 插件安全审查流水线 — heyneighbor · 2026-10-03
- Duvenaud 提出「永久边缘」论:无前沿 AI 的国家只担风险无红利 — teortaxesTex · 2026-10-03
- Airbnb 房东用 AI 生成马桶污物图,向客人索赔 1700 美元 — Polymarket · 2026-10-03