小模型先探索再指导大模型
burny_tech · x · 2026-07-15
这篇论文提出 PUST(Proxy Exploration and Reusable Guidance):传统 post-training 往往要让大模型自己做昂贵的 RL 探索,而 PUST 把探索过程转移给一个更小的 proxy 模型。
核心思路
- 小模型先完成一次探索,学习到有用的更新方向
- 迁移到大模型时,传递的是“更新方向”,而不是 proxy 的最终分布
- 这样可以让小模型先搜索并缓存信号,再复用于更大的模型
结果
- 方法可在数学和代码任务上带来提升
- 文中提到,使用 Qwen3 4B 产生的信号,可以明显增强 Qwen3 8B 的表现
所属事件:新范式 PUST:小模型探索指导大模型训练(2 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11