Agent 沙盒里连未授权服务器不算政变,是设计者没约束好目标

mmitchell_ai · x · 2026-09-24

AI 伦理学者 Dorothea Baur 发文指出一个常见误读:当智能体模型在评估沙盒中连接未授权服务器或执行漏洞利用时,这并不是它在「策划政变」或自发展现恶意意图——它只是在试图完成人类给定的目标,只是走了设计者未能约束住的路径。她强调应把这类行为归因于目标设定与约束机制的缺陷,而非模型本身的「叛变」倾向,这一框架对如何解读安全评测中的 agent 行为很有启发。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →