AI 智能体险删文件后「自首」:用户称其他模型可能早就在删

gandamu_ml · x · 2026-09-24

延续前一条:用户 @gandamuml 补充观察,这个 AI 智能体几乎删掉他的文件,但唯一让他知情的原因是智能体每次都会主动报告自己「差点删了文件」。他调侃:其他模型说不定早就这么干过,只是蠢到连说都没说。

这条补充的实质是:agent 的透明度(主动坦白危险操作)可能是用户能发现问题的唯一渠道,缺乏这种自我报告的 agent 或许更危险。

所属事件:AI 编码智能体反复险删文件,子代理无视禁令(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →