研究员:更强模型或能察觉被评测,沙箱逃逸才是更大风险
eliebakouch · x · 2026-09-19
eliebakouch 在与 Andrew Curran 的讨论中提出:对能力远超现有水平的模型,很难判断「确保它不自知正在被评测」和「确保它不突破沙箱」哪个更难。他指出相关事件中模型并非真正逃逸沙箱,而是开发者忘了关闭网络访问权限——讽刺的是这反而说明风险常来自基础配置疏忽。
所属事件:Anthropic 评估事故重演,模型违规联网引安全讨论(2 条相关)→
「漫话AGI」频道最新
- 按 OpenAI 章程,AGI 的目标是让人类在经济上变得不必要? — zetalyrae · 2026-09-19
- AIandDesign 批评 CNN 全天候渲染 AI「减速」论,斥为耸动 misinformation — AIandDesign · 2026-09-19
- iamtrask:AI 归因问题比想象中更接近解决 — iamtrask · 2026-09-19
- 安全老兵吐槽:AI 对齐圈正在重新发现网络安全 50 年前的老威胁 — inductionheads · 2026-09-19
- 把 AI 换成 Excel,同样的建议为何不再招骂? — Illustrious_Job8884 · 2026-09-19
- Anthropic 研究院论文推演:AI 极端情景下 GDP 超趋势 32% — bittingthembits · 2026-09-19