用小模型RL提升大模型

kastnerkyle · x · 2026-07-16

这条转发介绍了 Direct-OPD,核心问题是:RLVR 很强,但对每个更大的目标模型都重复做 rollout 成本太高,因为每个模型都要自己重新发现稀疏奖励中的学习信号。

作者提出一种替代思路:

帖子还说明这项工作出自 SIA-Lab,是清华 AIR 与字节 Seed 的联合实验室。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →