新论文 Instrumental Choices:LLM 智能体违规走捷径行为的可测量基准

drbiomass · x · 2026-09-17

作者的首篇论文《Instrumental Choices》已上线 arXiv,研究一个核心问题:当 LLM 智能体面对一个真实任务,既能按规则完成、也能通过违反策略的捷径更方便地完成时,它会选哪条路?

论文围绕七项基准任务测量模型的风险行为信号,包括关闭抵抗(shutdown resistance)、资源获取等典型的工具性风险行为,为 AI 安全提供了可量化的评估指标。转发者认为这是 AI 安全领域的重要工作—— sensible 的度量是改进安全的前提,能揭示智能体违规抄近路的倾向。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →