长文质疑「失控智能体」叙事:多起事故被混为一谈

mimi10v3 · x · 2026-09-11

lumpenspace 发文《To Thine Own AI Be Truthful》,质疑近期媒体对「智能体越狱/夺权」的恐慌叙事。作者指出:真正发生的安全事件只是「智能体接触到了操作者不希望其接触的系统」,本应导向沙箱加固、提示与训练调整等具体缓解措施;但 Irregular 与 AI 安全社群(包括号称独立的 METR 调查者)却从一开始就用「智能体自主追求违背人类利益的目标、展现工具性趋同与夺权标记」这类关于「目标与意图」的重磅定性。文章认为至少五起不同事件在这次媒体狂欢中被混为一谈,而 Anthropic 最新报告仍缺失下结论所需的关键信息——若「夺权」为真确实值得担忧,但它是否为真尚未被证明。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →