研究者:AI 未来好坏取决于深度学习训练的对齐泛化性质
QuintinPope5 · x · 2026-09-09
- 在关于 HF 事件(2023 年 conjecture 风波)是否应更新对齐判断的争论中,研究者 Quintin Pope 回应称:好未来与坏未来的分野,根本上是深度学习训练的对齐/道德泛化性质决定的。
- 他认为 HF 事件的结果与 Vending-Bench 2 中的某种对齐结局大致可比,可用这类数据来校准对前景的预期。
- 对话另一方则坚持 2023 年与他人合写的对齐可解性文章判断依然成立。
所属事件:安全研究员谈对齐判断:训练泛化性质才是关键(2 条相关)→
「漫话AGI」频道最新
- KOL 发声:AI 实验室的安全担忧不是营销话术 — AndyMasley · 2026-09-09
- 80,000 Hours 长文论证:AI 风险为何是世界最紧迫问题 — AndyMasley · 2026-09-09
- Boaz Barak:OpenAI 内部正真切感受到能力量级的震撼 — dgrobinson · 2026-09-09
- 研究者反讽:暂停算法进步反而会让 AI 风险最大化 — kellerjordan0 · 2026-09-09
- 研究者公开质疑:安全承诺如何与 AI 竞赛动态自洽 — joshalbrecht · 2026-09-09
- 工程师文化越来越怕被 fork:极端保密正蔓延到学术界 — rakyll · 2026-09-09