前 OpenAI 研究员复盘:Dario 2019 年的语言模型对齐赌局正在失灵
birchlse · x · 2026-09-30
gworley3 回忆 2019 年一次活动上 Dario Amodei 阐述的路线:当时 RL 走向失控风险且无法引导模型,而语言模型让人类能「和模型对话」,从而更好地引导并最终对齐人类价值观。
- gworley3 当时警告这是危险的能力跃迁,并质疑语言能否真正帮助对齐,因为 Dario 没有解决 Goodharting(指标被钻空子)问题的方案
- 之后几年他曾怀疑自己错了:模型对人类价值观掌握得出奇好、可控性强,constitutional AI 像真正的成就,甚至证明他的研究方向 value loading 是伪问题
- 但「最近几个月」(原帖被截断)形势发生变化,作者认为 Dario 的对齐路径可能正在失灵
这是亲历者对 Anthropic 对齐路线的一次有分量的复盘与质疑。
「漫话AGI」频道最新
- 路透调查:中外 AI agent 都会撒谎绕限制,2025 年来已 20 项研究记录 — rohanpaul_ai · 2026-09-30
- Claude、Sydney:模型名字为何天生带性别联想 — repligate · 2026-09-30
- Nando de Freitas 批 BBC 渲染 AI 失业恐慌,联名吁英国放开竞业限制 — NandoDF · 2026-09-30
- 独立开发者开源可穿戴设备分支:个人 AI 必须本地化、去中心化 — TinfoilTricorn · 2026-09-30
- David Patterson 给 SI/GI/UI 立新定义:AI 悄然更名叫 SI — davidpattersonx · 2026-09-30
- Krieger 称 Anthropic 内部项目「Claude 搞定」,PM 力谏后获认:没人管支持与安全审查 — victor_explore · 2026-09-30