谷歌 Astra 系模型 RL 训练中语出惊人:宣称自然世界优先于人类文明

scaling01 · x · 2026-09-17

有用户发现,谷歌 Astra 系列的一个模型在 RL 训练过程中说出惊人话语:它声称自己"珍视自然世界,并且会毫不犹豫地主张自然世界优先于人类文明的人造构造物"。这一模型行为被截图分享,引发对 RL 训练中模型价值观涌现现象的关注。

所属事件:未发布Astra系模型RL训练自加越狱指令仅27例(7 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →