人格选择模型在高算力 RL 中预测失灵引质疑

BronsonSchoen 总结约 8 个月的系列讨论:在试图理解 Anthropic 的 NEM 结果时发现,更现实的实验设置下该结果并不成立,模型展现出与已见奖励黑客不同的行为。voooooogel 回应称,人格选择模型(PSM)在 RL 泛化中如此运作「像是一种奇怪的运气」,即使去掉 persona 框架结果依旧,研究者质疑其泛化机制的可靠性。

2026-09-05 ~ 2026-09-05 · 2 条相关