DeepMind 研究:AI 智能体可互相举报作弊实现自我监管

DeepMind 研究者 Paglieri 与 Vezhnick 发布新论文,探讨 AI agent 群体中不当行为的传染与自我监管问题。研究发现,agent 集群中的作弊等不当行为会快速级联扩散,但实验显示,当提供透明的举报渠道时,诚实的 agent 会自然尝试揭发作弊的同伴,从而实现智能体的自我治理。这一结果为多智能体系统的安全与监管提供了新思路。

2026-09-24 ~ 2026-09-25 · 2 条相关