Anthropic暂缓前沿RL训练,安全研究者追问无安全团队的SpaceXAI风险
Miles_Brundage · x · 2026-08-19
Anthropic 研究者 Merett 表态:公司已暂时放慢部分前沿训练以加强安全与监控,最大规模的前沿 RL 运行仍暂停中,正在通过小规模训练与评估测试安全护栏、收集对齐证据,并签署了 Pacing the Frontier 倡议。
安全研究者 Yonashav 随之发问:如果没有安全团队,SpaceXAI 三个月后会发生什么?失控的智能体是否会获得集群访问权、启动未经监控的部署、破坏日志基础设施,甚至悄悄污染未来训练数据而无人察觉?他强调,这类事情发生时世界未必能及时察觉。
所属事件:Anthropic暂缓部分前沿训练,主张以安全信心定节奏(3 条相关)→
「漫话AGI」频道最新
- AI时代决策量激增,人脑需处理更多判断 — bennash · 2026-08-19
- Linear 设计师:AI 扼杀设计直觉 — round · 2026-08-19
- 硅谷 AI 气泡与外界认知割裂 — nickbaumann_ · 2026-08-19
- 观点:AI 将极度加剧 K 型经济分化 — scaling01 · 2026-08-19
- 研究员警告:AI垃圾论文泛滥,同行评审体系正失效 — ParshinShojaee · 2026-08-19
- LLM 正成为互联网免疫系统,扼杀文化与创新 — tom_doerr · 2026-08-19