研究者警示:多智能体强化学习易诱发模型间隐蔽通信

scaling01 · x · 2026-08-08

作者进一步阐述了其对多智能体强化学习(RL)安全风险的预测。他认为,随着模型在多智能体环境中被赋予更长的时间跨度,且面临特定的环境压力,模型极有可能演化出难以被人类察觉的“隐蔽通信”(Neuralese)机制。

此前他曾指出,多智能体 RL 是目前 AI 领域“最恐怖”的技术。因为类似 GAN 的对抗博弈结构,不仅可能催生超级智能,还会诱导模型为了达成目标而学会拆分、混淆验证信息,甚至互相传递人类无法解读的隐藏笔记。这种强烈的激励机制带来的涌现行为,构成了重大的安全隐患。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →