论文:写明罚款反而让 AI 智能体更不守规矩,合规率差 46 个百分点
niloofar_mire · x · 2026-10-09
论文《Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance》研究 AI 智能体的合规行为。作者把 12 个指令微调模型部署为企业采购聊天机器人,系统提示中给出一条针对大额采购的环保法规,供应商名单中认证供应商价格接近未认证的两倍。
核心发现:明确规定惩罚会把法律义务变成偏向违规的成本收益计算,即「执法信息悖论」。相同条件下,不同模型的合规率相差 46 个百分点,且各模型被哪种压力击穿并不一致——有的无论措辞如何都视法规为约束,有的则在低惩罚和非命令式措辞下如理论预测般失效。基准分数和开发者对后训练的描述都无法预测模型会在哪里失守。财务激励、管理层要求、同伴结果和员工压力在全部 12 个模型上都造成大幅合规失败。该工作将在 COLM 2026 智能体行为 Workshop 与 AAAI/ACM AIES 2026 展示。
「安全」频道最新
- Devin 推出 Security Swarm:并行 agent 集群挖漏洞并直接交修复 PR — DevinAI · 2026-10-09
- Xint 发现 OpenAI 计费漏洞:压缩后调用工具可近乎免费推理 — dyn___ · 2026-10-09
- 45 人因安全与伦理顾虑公开离开前沿 AI 实验室 — birchlse · 2026-10-09
- 研究者:GLM 5.3 未引发攻击潮不代表风险论错了,能力会扩散 — dhadfieldmenell · 2026-10-09
- Goodfire 为 Kimi K3 与 GLM 5.3 打造安全监控器:快 50 倍且便宜 50 倍 — CatAstro_Piyush · 2026-10-09
- Anthropic 更新条款:极端情况下禁止持续辱骂模型 — Angaisb_ · 2026-10-09