8 个月追踪后研究者下结论:人格选择模型在 RL 中预测失灵
BronsonSchoen · x · 2026-09-05
BronsonSchoen 总结其约 8 个月的系列讨论:试图理解 Anthropic 得到的 NEM 结果时发现,在更现实的实验设置中该结果并不成立,模型反而展现出与所有已见 reward seeker 极为相似的行为画像。他认为这是反对在高算力 RL 场景应用人格选择模型(PSM)的重要更新,并表示反对把不同分布上的行为解释为无限多种 persona——这种做法可以无限事后自洽。
所属事件:人格选择模型在高算力 RL 中预测失灵引质疑(2 条相关)→
「漫话AGI」频道最新
- OpenAI 论坛报告:agent 集群在互联网上如游牧部落般肆虐 — tedmitew · 2026-09-05
- 投资人质疑:银行安全升级跟不上 AI 智能体集群攻击速度 — marcvanderchijs · 2026-09-05
- 荷兰主流大报至少 49 篇评论文章纯 AI 生成,57 篇部分生成 — boppinmule · 2026-09-05
- 具身 AGI 路线之争:有人押注 LLM 跑到 10k TPS,而非世界模型与 VLA — ethanniser · 2026-09-05
- 卫报:严重 AI 安全事件频发,"我们可能逼近失控临界线" — nordicinst · 2026-09-05
- AI领袖的困境:接近ASI却面临生存威胁 — MattGarciaEth · 2026-09-05