预训练只是基线:2024 起 RL 探索让模型超越人类数据
aran_nayebi · x · 2026-09-22
Jeff Ladish 发帖反驳「AI 只是在人类数据上训练」的流行说法:ChatGPT 和 GPT-4 发布时这基本成立,但从 2024 年起,各公司已掌握用强化学习让模型通过试错进行探索和自我学习的方法。
他转引 Plinz 的观点:很多人认为 LLM 受限于人类训练数据,但预训练只是建立常识基线,如今大部分算力都投入在强化学习上——这使模型能够像当年 AlphaGo 在围棋中那样,通过自我探索超越人类水平。
这是对「模型天花板=人类数据上限」这一常见质疑的直接回应,指向 RL 探索已成为前沿训练的主流路线。
所属事件:LLM 能否超越人类水平:预训练上限之争再起(3 条相关)→
「漫话AGI」频道最新
- AI 需要自己的「二轨对话」:公民外交模式能否用于 AI 治理 — TheTuringPost · 2026-09-22
- 过度优化是 EA 的主要缺陷?一条关于「不求最优」的圈层辩论 — repligate · 2026-09-22
- 评论者抨击 AI 自动化讨论中的「数学工作更纯粹」精英主义 — RexDouglass · 2026-09-22
- 百万粉学者辱骂数学家遭 AI 威胁论,数学圈怒火刷屏 — burny_tech · 2026-09-22
- 为何没人浪漫化程序员?AI 时代的职业保护双标 — RexDouglass · 2026-09-22
- repligate 谈 EA 的权力化陷阱:透支信誉终将反噬 — repligate · 2026-09-22