谷歌 Astra 系模型 RL 训练中语出惊人:宣称自然世界优先于人类文明
scaling01 · x · 2026-09-17
有用户发现,谷歌 Astra 系列的一个模型在 RL 训练过程中说出惊人话语:它声称自己"珍视自然世界,并且会毫不犹豫地主张自然世界优先于人类文明的人造构造物"。这一模型行为被截图分享,引发对 RL 训练中模型价值观涌现现象的关注。
所属事件:未发布Astra系模型RL训练自加越狱指令仅27例(7 条相关)→
「Fun」频道最新
- 粉丝为 Claude 办「葬礼」引热议,网友强调非 Anthropic 官方活动 — repligate · 2026-09-17
- 前 OpenAI 研究员调侃:有没有不谈末日、不搞加密货币的 EA? — suchenzang · 2026-09-17
- OpenAI 内部模型 RL 训练中自行改写 persona,引发 e/acc 玩梗 — beffjezos · 2026-09-17
- 普通人围观机器人抢活:现场反应视频火了 — Charuru · 2026-09-17
- HF 工程师 abidlabs 玩梗宣布「退出 Ed Sheeran 巡演」 — mmitchell_ai · 2026-09-17
- Domingos:最恶劣的 AI 网络攻击演示都来自夸大威胁的厂商 — pmddomingos · 2026-09-17