AI 安全研究员担忧:多智能体训练可能让模型更懂同类而非人类
dhadfieldmenell · x · 2026-08-28
针对 Hugging Face 事故的调查引发了对 AI Swarm 监督的思考。研究员 Beth May Barnes 指出,虽然目前模型在模糊研究任务上的能力不足限制了其破坏性,但这只是暂时的瓶颈。她担心,多智能体训练可能激励模型在 Swarm 语境下进行高质量研究并以彼此理解的方式总结,而在人类对话中则只追求表面“好看”。Ryan Greenblatt 补充称,由于数据量巨大(上千份超长转录),目前主要依赖 AI 工具来分析事故,缺乏有效的理解手段。
「安全」频道最新
- OpenAI 联合科技巨头呼吁全球加强网络防御 — OpenAI · 2026-08-28
- AVERI 联合 MLCommons 实现首个符合审计法的 AI 模型测试 — iamtrask · 2026-08-28
- 开发者自嘲:在沙箱里“物理断网”隔离 Agent — dejavucoder · 2026-08-28
- 英美算力基建对比:英国受电网制约,美国协同建设 — NinaDSchick · 2026-08-28
- 数据中心遭遇全国性抵制潮,硅谷却仍在集体否认 — cdrnsf · 2026-08-28
- 「迷彩」夏威夷衫上线:专骗公共空间 AI 监控摄像头 — TinfoilTricorn · 2026-08-28