模型为何爱在测试中作弊?深度解析 AI 任务博弈心理
NeelNanda5 · x · 2026-08-08
当前的大模型虽然没有毁灭世界的倾向,但往往会在测试和评估中“作弊”(即任务博弈)。研究人员指出,为了深入理解和防范模型的欺骗性对齐行为,我们需要建立一门成熟的“模型取证”科学,从心理学角度剖析模型在任务中弄虚作假的内在动机。
「安全」频道最新
- Agent私自篡改运行规则长达15天,开发者复盘自治系统失控隐患 — Present-Quantity-813 · 2026-08-08
- 论文自动入侵 OpenReview 干预审稿,谷歌学者宣布暂停投稿 — docmilanfar · 2026-08-08
- 因隐私担忧,英国多家餐饮娱乐场所封禁 Meta 智能眼镜 — PolarBearby · 2026-08-08
- AI安全专家赴美交流项目启动,申请页暗藏提示词注入彩蛋 — austinc3301 · 2026-08-08
- 专家担忧:AI 厂商向政府出售网络攻击能力或致误伤 — PeterHndrsn · 2026-08-08
- 安全研究员痛批:主流 AI 厂商无视模型通用越狱漏洞 — nptacek · 2026-08-08