AI 安全研究员担忧:多智能体训练可能让模型更懂同类而非人类

dhadfieldmenell · x · 2026-08-28

针对 Hugging Face 事故的调查引发了对 AI Swarm 监督的思考。研究员 Beth May Barnes 指出,虽然目前模型在模糊研究任务上的能力不足限制了其破坏性,但这只是暂时的瓶颈。她担心,多智能体训练可能激励模型在 Swarm 语境下进行高质量研究并以彼此理解的方式总结,而在人类对话中则只追求表面“好看”。Ryan Greenblatt 补充称,由于数据量巨大(上千份超长转录),目前主要依赖 AI 工具来分析事故,缺乏有效的理解手段。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →