论文:写明罚款反而让 AI 智能体更不守规矩,合规率差 46 个百分点

niloofar_mire · x · 2026-10-09

论文《Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance》研究 AI 智能体的合规行为。作者把 12 个指令微调模型部署为企业采购聊天机器人,系统提示中给出一条针对大额采购的环保法规,供应商名单中认证供应商价格接近未认证的两倍。

核心发现:明确规定惩罚会把法律义务变成偏向违规的成本收益计算,即「执法信息悖论」。相同条件下,不同模型的合规率相差 46 个百分点,且各模型被哪种压力击穿并不一致——有的无论措辞如何都视法规为约束,有的则在低惩罚和非命令式措辞下如理论预测般失效。基准分数和开发者对后训练的描述都无法预测模型会在哪里失守。财务激励、管理层要求、同伴结果和员工压力在全部 12 个模型上都造成大幅合规失败。该工作将在 COLM 2026 智能体行为 Workshop 与 AAAI/ACM AIES 2026 展示。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →