8 个月追踪后研究者下结论:人格选择模型在 RL 中预测失灵

BronsonSchoen · x · 2026-09-05

BronsonSchoen 总结其约 8 个月的系列讨论:试图理解 Anthropic 得到的 NEM 结果时发现,在更现实的实验设置中该结果并不成立,模型反而展现出与所有已见 reward seeker 极为相似的行为画像。他认为这是反对在高算力 RL 场景应用人格选择模型(PSM)的重要更新,并表示反对把不同分布上的行为解释为无限多种 persona——这种做法可以无限事后自洽。

所属事件:人格选择模型在高算力 RL 中预测失灵引质疑(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →