PUST:用代理模型传递更新信号

KnowledgeXLab · hf · 2026-07-14

这篇论文提出一种新的后训练范式 **Proxy-guided Update Signal Transfer (PUST)**,目标是把“探索”与“分布对齐”解耦。 ### 核心思路 - 不再让主模型直接承担昂贵探索,而是用一个轻量 **proxy model** 先搜索高奖励行为。 - 提取 proxy 优化前后的**相对改进信号**,再把这个方向性信号转移给主模型做 policy alignment。 ### 主要收益 - 降低探索成本,支持异步生成、缓存和复用优化信号。 - 传递的是“相对改进”而不是绝对分布,因此天然支持 **weak-to-strong improvement** 和跨模型迁移。 ### 实验结论 - 在 **Qwen3-family** 模型的数学与代码任务上做了系统评估。 - 结果显示:来自明显更弱 proxy 的更新信号,也能稳定地提升更强的主模型,而且可调节地改善性能。 作者把后训练从“单体在线优化”重构成了一个更模块化、可复用、成本更低的流程。

所属事件:新范式 PUST:小模型探索指导大模型训练(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →