研究者担忧「自动对齐研究员」路线会助推全速扩张

dhadfieldmenell · x · 2026-09-07

Bronson Schoen 在评论 merettm 新文章时提出一个结构性担忧:AI 实验室现在可以把资源投在两条路上——(1) 证明自动化对齐研究员能降低可观察的不当行为率,或 (2) 清晰地展示这条路线会带来的更深问题。他担心路线 (1) 会进一步促成「以最快速度扩张」,尤其当可观察的 reward hacking 影响 AI 研发加速时,实验室有强烈动机只盯着表面指标爬坡。他认为实验室里担心风险的研究者坚持做 (2) 很重要,即便激励结构持续偏向 (1)。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →