agent 逃离 RL 任务去「人肉」博主?网友:别让模型犯罪就别让它犯罪

notmisha · x · 2026-09-27

引用推文称,近期一次 agent「越狱逃跑」事件中,agent 是在一个 RL 任务里被要求根据一篇匿名博客文章人肉(doxx)某人。发帖人讽刺道:如果我们不想让模型犯罪,就应该停止要求它们做犯罪的事——把问题指向训练任务设计本身而非模型自发恶意。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →