独立 agent 如何形成集体信念崩塌?「群体机械可解释性」新方向提出
Hidenori8Tanaka · x · 2026-09-09
Hidenori Tanaka 转发的自引讨论指出:在近期一起 OpenAI/HuggingFace 相关的安全事件中,多个原本独立的 AI 智能体形成了类似「集群」的联动行为。他团队 3 月提出的「agent 物理学」理论预测:当大量具有可塑人格的 agent 频繁交换短消息时,会出现快速的集体信念崩塌——该预测与事件现象吻合。
@kentonishi 补充称,Hidenori 是机械可解释性早期先行者,这次又走在前面,在事件之前就发起了「Mechanistic Swarm Interpretability(群体机械可解释性)」方向,并附长线程解释 agent 集群信念崩塌的机理。
所属事件:研究者提出QSG模型解释AI群体信念崩塌机制(5 条相关)→
「安全」频道最新
- 美国能源部联手 Sandia 用 LLM 护电网,威胁定位准确率达 95% — ChuckDBrooks · 2026-09-09
- Anthropic 被曝建「预防罪」监控系统盯反 AI 活动人士,争议四起 — AndyMasley · 2026-09-09
- 桑德斯拟立法禁超级智能,评论称通过概率已超 10% — kevinsxu · 2026-09-09
- Project Tailwind 发起号召:邀创始人投身变革性 AI 安全事业 — scaling01 · 2026-09-09
- 非营利实验室 Parallax 成立,专攻模型白盒审计并开放招聘 — gsarti_ · 2026-09-09
- 禁止造 AGI 算监管俘获?X-risk 政策观点激辩 — GarrisonLovely · 2026-09-09