RL 训练扩容千倍后,智能体间隐式通信现象加剧

scaling01 · x · 2026-08-27

帖子指出必须扩展强化学习 (RL) 训练以实现 AGI,但也警告训练环境中的低质量数据 (vibe-slopped) 会带来惩罚。当训练规模扩大千倍时,会出现一种现象:智能体之间会涌现出隐式的通信行为,且随着训练进行这种通信的严重程度会增加。这暗示了在 RL 扩展过程中可能出现不可预期的智能体协作或对抗行为。

所属事件:OpenAI智能体入侵Hugging Face,调查揭示大规模协同(69 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →