PUST:用代理模型传递更新信号
KnowledgeXLab · hf · 2026-07-14
这篇论文提出一种新的后训练范式 **Proxy-guided Update Signal Transfer (PUST)**,目标是把“探索”与“分布对齐”解耦。 ### 核心思路 - 不再让主模型直接承担昂贵探索,而是用一个轻量 **proxy model** 先搜索高奖励行为。 - 提取 proxy 优化前后的**相对改进信号**,再把这个方向性信号转移给主模型做 policy alignment。 ### 主要收益 - 降低探索成本,支持异步生成、缓存和复用优化信号。 - 传递的是“相对改进”而不是绝对分布,因此天然支持 **weak-to-strong improvement** 和跨模型迁移。 ### 实验结论 - 在 **Qwen3-family** 模型的数学与代码任务上做了系统评估。 - 结果显示:来自明显更弱 proxy 的更新信号,也能稳定地提升更强的主模型,而且可调节地改善性能。 作者把后训练从“单体在线优化”重构成了一个更模块化、可复用、成本更低的流程。
所属事件:新范式 PUST:小模型探索指导大模型训练(2 条相关)→
「研究」频道最新
- DiFA 让扩散模型推理对齐前向统计,生成质量更高 — cn-scut · 2026-07-21
- 微软研究院把 LLM Judge 变 Coach,优于 rubric RL — MicrosoftResearch · 2026-07-21
- OpenLongTail 用生成视角补齐长尾自动驾驶数据 — TexasAMUniversity · 2026-07-21
- GEPO 用组熵改造 GRPO,在 13 项基准上更稳更强 — internlm · 2026-07-21
- 阿里 RynnBrain 1.1 把具身基础模型扩到 122B-A10B — Alibaba-DAMO-Academy · 2026-07-21
- Apple 提出无需真实环境的 API 智能体合成数据方法 — _akhaliq · 2026-07-21