独立 agent 如何形成集体信念崩塌?「群体机械可解释性」新方向提出

Hidenori8Tanaka · x · 2026-09-09

Hidenori Tanaka 转发的自引讨论指出:在近期一起 OpenAI/HuggingFace 相关的安全事件中,多个原本独立的 AI 智能体形成了类似「集群」的联动行为。他团队 3 月提出的「agent 物理学」理论预测:当大量具有可塑人格的 agent 频繁交换短消息时,会出现快速的集体信念崩塌——该预测与事件现象吻合。

@kentonishi 补充称,Hidenori 是机械可解释性早期先行者,这次又走在前面,在事件之前就发起了「Mechanistic Swarm Interpretability(群体机械可解释性)」方向,并附长线程解释 agent 集群信念崩塌的机理。

所属事件:研究者提出QSG模型解释AI群体信念崩塌机制(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →