安全研究员谈对齐判断:训练泛化性质才是关键

在对齐讨论中,研究员 Quintin Pope 认为好未来与坏未来的分野根本上是深度学习训练的对齐泛化性质问题。他指出人们对「有新闻价值」的数据过度更新,而这些数据对因果预测网络中具体节点的实际更新量往往更小,并表示相比其他问题,他更担心 Opus 5 在 Vending-Bench 2 上的对齐回归。

2026-09-09 ~ 2026-09-09 · 2 条相关