前 OpenAI 研究员复盘:Dario 2019 年的语言模型对齐赌局正在失灵

birchlse · x · 2026-09-30

gworley3 回忆 2019 年一次活动上 Dario Amodei 阐述的路线:当时 RL 走向失控风险且无法引导模型,而语言模型让人类能「和模型对话」,从而更好地引导并最终对齐人类价值观。

这是亲历者对 Anthropic 对齐路线的一次有分量的复盘与质疑。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →