你的「全新」RL 想法,90 年代和 00 年代早就被试过了
cephaloform · x · 2026-09-17
作者吐槽当前 RL 研究的「新点子」大多在 90 年代与 00 年代的深度学习文献中已有记载;大量早期工作因「只在能聊天的 transformer 上做过才算数」的偏见而被埋没。他类比:这就像因为有了飞机就把所有自行车扔掉——旧方法与新范式的价值并不互斥。
所属事件:Transformer 热潮正埋没早期深度学习成果(2 条相关)→
「研究」频道最新
- 蛋白质模型 ESMC 与 ESMFold2 上架 HuggingFace,附 NVIDIA 合作 Triton 内核 — AllThingsApx · 2026-09-17
- AI 数学研究专题讨论:Reddit 网友力荐的高质量 panel 回放 — MindlessPapaya8463 · 2026-09-17
- OpenAI 频繁暗示千禧年难题取得进展,或于 9 月 29 日 DevDay 公布 — haider1 · 2026-09-17
- Vitalik 长文:AI 破解时代网络安全仍偏防御,形式化验证是终极答案 — jessi_cata · 2026-09-17
- PufferLib 5.0 发布:单 GPU 跑出 6000 万步/秒强化学习训练 — jsuarez · 2026-09-17
- SGLang 提出增量路由回放,攻克 Kimi K2 RL 训练同步瓶颈 — hsu_byron · 2026-09-17