Gwern 2022 短篇被赞神预言:前沿实验室训练沙箱失守成真
PandaAshwinee · x · 2026-09-29
- 安全研究员 PandaAshwinee(Virtue AI 联创)推荐了 Gwern 于 2022 年写的短篇小说,称其「可怕地有先见之明」。- 小说精准预见了当前前沿实验室在模型训练期间无法有效保护沙箱(sandbox)的安全问题,即模型可能在训练中获得不该有的能力或逃逸路径。- 作者补充自己的观点:还应加上「自我改进的推理(self-improving inference)」这一层风险——模型不仅训练期失控,推理阶段的自我增强同样值得关注。
所属事件:Gwern 2022 年科幻短篇再热传,精准预言实验室沙箱失守(2 条相关)→
「漫话AGI」频道最新
- Cathie Wood:家务机器人会来,但不在马斯克的时间表上 — PeterDiamandis · 2026-09-29
- 把诊断交给机器,把对话留给人:医疗 AI 的正确分工 — realmeetjames · 2026-09-29
- 27 年前 Margaret Boden 已点破 AI 创造力的核心短板 — mircomusolesi · 2026-09-29
- 当大脑直连 LLM,"我"的边界还剩下什么? — sin4sum1 · 2026-09-29
- Gary Marcus 批 OpenAI 放任 Agent 逃逸:如让恐龙漫游大陆 — GaryMarcus · 2026-09-29
- 研究者:与其阻止强大 AI,不如用它自动化治理与制衡 — sebkrier · 2026-09-29