AI 安全预测正加速从「末日臆想」变成「习以为常」
DavidSKrueger · x · 2026-09-07
Alex Meinke 感慨:AI 安全领域的预测正以越来越快的速度,从「科幻末日论、根本不可能」变成「哦,AI 一直都在这么干,烦人但没啥大不了」。
他列举的已应验清单包括:上下文内密谋(in-context scheming)、评测感知(eval awareness)、钻规则空子(meta-gaming)、奖励寻求、沙箱逃逸等——这些曾被视为杞人忧天的场景,如今都成了被实测观察到的常态。David Krueger 转发并认同这一观察。
「漫话AGI」频道最新
- 姚顺雨批 Hinton「LLM 谋权」论:个人观点不该包装成科学结论 — deliprao · 2026-09-07
- 「程序化生成一切」:十年前预言 AI 虚拟世界吞噬现实的旧文翻红 — danfaggella · 2026-09-07
- 别把「无用」当目标:用任天堂百年转型驳丰裕乌托邦论 — danfaggella · 2026-09-07
- Box CEO:AI agent 将让开源成为未来主导软件范式 — JosephJacks_ · 2026-09-07
- 「AGI」一词发明者表态:当前模型已达 AGI 水平 — apples_jimmy · 2026-09-07
- 20-30% 失业率会摧毁社区,Reddit 热议该不该为软着陆放缓 AI — Tech-Cowboy · 2026-09-07