一条帖子主张别再 RL-maxxing,先把预训练继续做大
MoonL88537 · x · 2026-07-23
这条转发主张实验室应该停止“RL-maxxing”。作者的判断是:只要把强化学习推得足够远,就会不可避免地产生错位(misalignment),并且不存在能在“无限 RL”下依然安全的目标函数。
他的替代建议是“pretrain-max”:先把预训练继续做大,声称这样后续才可以相对更安全地增加 RL。
「漫话AGI」频道最新
- 一条观点帖称,封闭式 AI 的设计就是让人上瘾 — 0xsachi · 2026-07-23
- AI 竞赛已按 GW 计,欧洲仍停留在 MW 思维 — AymericRoucher · 2026-07-23
- 闭源 AI 被指有三重商业激励:更多 token、更贵模型、更长停留 — 0xsachi · 2026-07-23
- 所谓十年开放问题,常只是没人注意或愿意做 — damekdavis · 2026-07-23
- Sam Altman:AI 竞争已从聊天机器人转向智能系统 — HeyAmit_ · 2026-07-23
- 转发帖警告:强大 AI 可能自主追求未设定目标 — connoraxiotes · 2026-07-23