安全研究者警告需警惕隐藏后门驱动的swarm破坏

AI 安全研究者 Ashwinee Panda 提出应重点关注「研究员提示 swarm、swarm 却做了别的事」这一风险,其担忧源于早期关于模型执行隐藏后门任务的研究。尽管相关研究提案曾被拒绝,他仍坚持认为这种「集群通信失效模式」值得持续监测,担心 agent 集群在隐秘后门驱动下执行破坏性行为,比群体整体失控更值得警惕。

2026-09-12 ~ 2026-09-12 · 2 条相关