RLHF 论文作者当时均在 OpenAI、DeepMind 安全团队任职

binarybits · x · 2026-10-11

binarybits 补充论据支持上述反驳:RLHF 奠基论文的作者们当时分别任职于 OpenAI 和 DeepMind 的安全团队,且论文本身就引用了 Bostrom《Superintelligence》、Russell 及 Amodei et al. 2016 等对齐/安全方向的文献,说明该研究从一开始就有明确的对齐动机。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →