TREK框架:蒸馏驱动探索+强化精化,提升数学与Agent任务表现
Yuanda Xu · hf · 2026-07-08
TREK(Distill to Explore, Reinforce to Refine)是一种新型策略优化框架,核心创新在于将知识蒸馏用于「探索」阶段而非传统的模仿阶段,通过扩大策略搜索空间来突破现有方法在探索支持上的瓶颈,再配合强化学习在精化阶段提升最终性能。在具有挑战性的数学推理任务和智能体(agentic)任务上,TREK 均取得显著性能提升,为大模型训练中探索与利用的权衡提供了新思路。
所属事件:TREK框架通过蒸馏驱动探索提升GRPO表现(2 条相关)→
「研究」频道最新
- ACT-2 Preview 号称一例微调即可在陌生家庭达成 99% 成功率 — tonyzzhao · 2026-07-21
- 《黑客帝国》梗回击 LLM 解题争论:信念与资源同样关键 — prasanna_says · 2026-07-21
- 更多算力会显著提升前沿模型的网络攻防表现 — peterwildeford · 2026-07-21
- 论文称随机探索可修复 3DGS 两类优化瓶颈 — zhenjun_zhao · 2026-07-21
- SSR 用稀疏体素迭代细化单目几何 — zhenjun_zhao · 2026-07-21
- 300 多篇论文综述:更强推理并不等于更会自知 — blaizedsouza · 2026-07-21