Tobias Lee 谈训练方向:可验证任务用 RL,开放领域靠 MOPD

_AndrewZhao · x · 2026-09-17

在 AndrewZhao 的讨论下,Tobias Lee 给出的方向判断是:对可验证的任务(verifiable tasks)继续用强化学习(RL),而对开放性领域(open domains)则依靠 MOPD 方法。一句话观点,但点出了当前后训练技术路线在可验证与不可验证问题上的分野。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →