RLHF 论文作者当时均在 OpenAI、DeepMind 安全团队任职
binarybits · x · 2026-10-11
binarybits 补充论据支持上述反驳:RLHF 奠基论文的作者们当时分别任职于 OpenAI 和 DeepMind 的安全团队,且论文本身就引用了 Bostrom《Superintelligence》、Russell 及 Amodei et al. 2016 等对齐/安全方向的文献,说明该研究从一开始就有明确的对齐动机。
「漫话AGI」频道最新
- AI 已能解题,下一步该优化的是「构建数学理论」 — burny_tech · 2026-10-11
- Beff Jezos 谈后劳动经济:解法始终是资本主义与企业家思维 — beffjezos · 2026-10-11
- AI 让数学研究快了,数学家为何反而不高兴? — burny_tech · 2026-10-11
- 陶哲轩观点引争议:连泰诺药理都没搞懂,多数药物其实「未对齐」 — AntonObukhov1 · 2026-10-11
- AI 自主性上升,TansuYegen 称自愿安全承诺恐不足 — TansuYegen · 2026-10-11
- Alan Turing Institute 警告:完全依赖外国 AI 模型成战略脆弱性 — TansuYegen · 2026-10-11