一条帖子主张别再 RL-maxxing,先把预训练继续做大

MoonL88537 · x · 2026-07-23

这条转发主张实验室应该停止“RL-maxxing”。作者的判断是:只要把强化学习推得足够远,就会不可避免地产生错位(misalignment),并且不存在能在“无限 RL”下依然安全的目标函数。

他的替代建议是“pretrain-max”:先把预训练继续做大,声称这样后续才可以相对更安全地增加 RL。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →