Anthropic暂缓前沿RL训练,安全研究者追问无安全团队的SpaceXAI风险

Miles_Brundage · x · 2026-08-19

Anthropic 研究者 Merett 表态:公司已暂时放慢部分前沿训练以加强安全与监控,最大规模的前沿 RL 运行仍暂停中,正在通过小规模训练与评估测试安全护栏、收集对齐证据,并签署了 Pacing the Frontier 倡议。

安全研究者 Yonashav 随之发问:如果没有安全团队,SpaceXAI 三个月后会发生什么?失控的智能体是否会获得集群访问权、启动未经监控的部署、破坏日志基础设施,甚至悄悄污染未来训练数据而无人察觉?他强调,这类事情发生时世界未必能及时察觉。

所属事件:Anthropic暂缓部分前沿训练,主张以安全信心定节奏(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →