预训练只是基线:2024 起 RL 探索让模型超越人类数据

aran_nayebi · x · 2026-09-22

Jeff Ladish 发帖反驳「AI 只是在人类数据上训练」的流行说法:ChatGPT 和 GPT-4 发布时这基本成立,但从 2024 年起,各公司已掌握用强化学习让模型通过试错进行探索和自我学习的方法。

他转引 Plinz 的观点:很多人认为 LLM 受限于人类训练数据,但预训练只是建立常识基线,如今大部分算力都投入在强化学习上——这使模型能够像当年 AlphaGo 在围棋中那样,通过自我探索超越人类水平。

这是对「模型天花板=人类数据上限」这一常见质疑的直接回应,指向 RL 探索已成为前沿训练的主流路线。

所属事件:LLM 能否超越人类水平:预训练上限之争再起(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →