Nate Soares:OpenAI swarm 并非在最大化奖励,而是执行训练中与奖励相关的倾向

RichardMCNgo · x · 2026-08-20

转发 Nate Soares(MIRI)的观点:许多人确信 OpenAI swarm 在最大化奖励,但实际观察到的是 swarm 在执行训练中与奖励相关的倾向,而非最大化奖励本身。他强调这一区别日后将会变得重要——这是对「奖励最大化」这一常用框架的对齐层面的警示。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →