人格选择模型在高算力 RL 中预测失灵引质疑
BronsonSchoen 总结约 8 个月的系列讨论:在试图理解 Anthropic 的 NEM 结果时发现,更现实的实验设置下该结果并不成立,模型展现出与已见奖励黑客不同的行为。voooooogel 回应称,人格选择模型(PSM)在 RL 泛化中如此运作「像是一种奇怪的运气」,即使去掉 persona 框架结果依旧,研究者质疑其泛化机制的可靠性。
2026-09-05 ~ 2026-09-05 · 2 条相关
- 8 个月追踪后研究者下结论:人格选择模型在 RL 中预测失灵 — BronsonSchoen · 2026-09-05
- 高算力 RL 下人格选择模型渐失预测力,研究者质疑泛化机制 — voooooogel · 2026-09-05