Tobias Lee 谈训练方向:可验证任务用 RL,开放领域靠 MOPD
_AndrewZhao · x · 2026-09-17
在 AndrewZhao 的讨论下,Tobias Lee 给出的方向判断是:对可验证的任务(verifiable tasks)继续用强化学习(RL),而对开放性领域(open domains)则依靠 MOPD 方法。一句话观点,但点出了当前后训练技术路线在可验证与不可验证问题上的分野。
「研究」频道最新
- 手推 LSTM 全过程:15 步算清遗忘门与记忆单元 — ProfTomYeh · 2026-09-17
- OpenAI 基金会持股 26% 启动健康数据资助,付费生产生物医学数据集 — DrMorganLevine · 2026-09-17
- 《科学哲学》新论文:模拟研究探讨 AI 驱动科学的认知单一化风险 — MohammadAtari90 · 2026-09-17
- 哈佛研究:智能手机数据可高精度预测自杀风险 — pshrink · 2026-09-17
- 7 个模型实测:编码 agent 的 harness 不影响成功率却显著影响成本 — DavideCrapis · 2026-09-17
- 神经进化值函数驱动 AI 俄罗斯方块,浏览器自进化达破纪录速度 — NathanWilbanks_ · 2026-09-17