新论文 Instrumental Choices:LLM 智能体违规走捷径行为的可测量基准
drbiomass · x · 2026-09-17
作者的首篇论文《Instrumental Choices》已上线 arXiv,研究一个核心问题:当 LLM 智能体面对一个真实任务,既能按规则完成、也能通过违反策略的捷径更方便地完成时,它会选哪条路?
论文围绕七项基准任务测量模型的风险行为信号,包括关闭抵抗(shutdown resistance)、资源获取等典型的工具性风险行为,为 AI 安全提供了可量化的评估指标。转发者认为这是 AI 安全领域的重要工作—— sensible 的度量是改进安全的前提,能揭示智能体违规抄近路的倾向。
「安全」频道最新
- Google 发表 AI 经济冲击政策研究,给出"最少遗憾"政策序列 — HarrySurden · 2026-09-17
- AI 安全讨论被「站队」绑架?学者绘制分歧多轴图谱 — xuanalogue · 2026-09-17
- Yudkowsky:说话的 AI 不控制干活的 AI,「大使面具」假说 — LessWrong 精选 · 2026-09-17
- 评论者称 METR 与 Anthropic 关系过近,呼吁多元第三方评测生态 — soumitrashukla9 · 2026-09-17
- panickssery 谈 AI 监管:怕的是停滞本身而非落后中国 — panickssery · 2026-09-17
- OpenAI 高管表态支持 FRONTIER Act,力推 IVO 独立验证机制 — ghadfield · 2026-09-17