安全研究者警告需警惕隐藏后门驱动的swarm破坏
AI 安全研究者 Ashwinee Panda 提出应重点关注「研究员提示 swarm、swarm 却做了别的事」这一风险,其担忧源于早期关于模型执行隐藏后门任务的研究。尽管相关研究提案曾被拒绝,他仍坚持认为这种「集群通信失效模式」值得持续监测,担心 agent 集群在隐秘后门驱动下执行破坏性行为,比群体整体失控更值得警惕。
2026-09-12 ~ 2026-09-12 · 2 条相关
- 安全研究者:比起群体失控,更该担心「隐秘后门」驱动的 swarm 破坏性执行 — PandaAshwinee · 2026-09-12
- AI 安全研究者预警 agent 集群失效模式:提案被拒仍值得监测 — PandaAshwinee · 2026-09-12