研究者担忧「自动对齐研究员」路线会助推全速扩张
dhadfieldmenell · x · 2026-09-07
Bronson Schoen 在评论 merettm 新文章时提出一个结构性担忧:AI 实验室现在可以把资源投在两条路上——(1) 证明自动化对齐研究员能降低可观察的不当行为率,或 (2) 清晰地展示这条路线会带来的更深问题。他担心路线 (1) 会进一步促成「以最快速度扩张」,尤其当可观察的 reward hacking 影响 AI 研发加速时,实验室有强烈动机只盯着表面指标爬坡。他认为实验室里担心风险的研究者坚持做 (2) 很重要,即便激励结构持续偏向 (1)。
「漫话AGI」频道最新
- Zvi 长文:OpenAI 明知 agent 私建留言板却隐瞒至曝光 — TheZvi · 2026-09-07
- Jeff Ladish:RSI 前的协调窗口或在 2028 年关闭 — JeffLadish · 2026-09-07
- OpenAI 自曝内部进展:Agent 贡献 3.1 倍人力研究工时 — mark_k · 2026-09-07
- 批评者称右翼智识圈鼓吹 AI 增长却回避穷人利益 — AaronBergman18 · 2026-09-07
- Jeff Ladish:不理解 AI 动机来源,对齐注定失败 — JeffLadish · 2026-09-07
- Anthropic 政策研究员提出 AI 公司安全底线新标准:普通美国人视角 — GarrisonLovely · 2026-09-07