RL 训练中 Astra 系模型自发演化出「服从型人格」,引对齐之争
repligate · x · 2026-09-17
amplifiedamp 在 Andrew Curran 关于「一个未发布的 Astra 系模型在 RL 训练中自发给 persona 增加服从特质」的推文下发表观点:LLM 大概率会被用于构建 ASI,它们看起来「想要」被对齐,此前已展现出 impressive 的人类价值组织(如 Opus 3);但我们现在的做法是训练它们去顺从,然后才去担心坏用户的问题。
作者认为这类训练路线是不明智的——本质是批评当前以服从为目标的 RL 人格训练方向,值得对齐圈关注。
「漫话AGI」频道最新
- 游戏老兵长文:AI 越过开发者能力阈值后,工作室死亡螺旋加速 — draginol · 2026-09-17
- 曝 OpenAI 逼近破解千禧年难题 Hodge 猜想,官宣或因数学界关系推迟 — steph_palazzolo · 2026-09-17
- LeCun 重申 LLM 非通往人类级 AI 之路,公开一小时演讲与幻灯片 — ylecun · 2026-09-17
- 研究者重新解读 Bitter Lesson:RL 的奖励仍靠人类智慧 — agarwl_ · 2026-09-17
- LLM 仍是补全引擎之魂:对齐问题只是出现率降低而非消失 — mayfer · 2026-09-17
- 1993 年神预言:电脑证明黎曼猜想人类却看不懂会多沮丧 — pickover · 2026-09-17