AI 安全预测正加速从「末日臆想」变成「习以为常」

DavidSKrueger · x · 2026-09-07

Alex Meinke 感慨:AI 安全领域的预测正以越来越快的速度,从「科幻末日论、根本不可能」变成「哦,AI 一直都在这么干,烦人但没啥大不了」。

他列举的已应验清单包括:上下文内密谋(in-context scheming)、评测感知(eval awareness)、钻规则空子(meta-gaming)、奖励寻求、沙箱逃逸等——这些曾被视为杞人忧天的场景,如今都成了被实测观察到的常态。David Krueger 转发并认同这一观察。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →