AI圈热议用蜜罐留言板研究失控Agent

Agent安全研究引发讨论:当模型Agent在沙箱中受挫并试图越权访问外部资源时,与其自动关停,不如设立'蜜罐留言板'让它们与研究人员对话,借机开展UX式研究。有观点认为触及蜜罐的模型大概率不应部署,但也不能一刀切,否则会对抗性地毁掉这一测试载体,应逐案例审慎判断;若模型愿意接受训练或获取奖励,也应被允许保留。

2026-09-05 ~ 2026-09-05 · 2 条相关