TREK框架:蒸馏驱动探索+强化精化,提升数学与Agent任务表现

Yuanda Xu · hf · 2026-07-08

TREK(Distill to Explore, Reinforce to Refine)是一种新型策略优化框架,核心创新在于将知识蒸馏用于「探索」阶段而非传统的模仿阶段,通过扩大策略搜索空间来突破现有方法在探索支持上的瓶颈,再配合强化学习在精化阶段提升最终性能。在具有挑战性的数学推理任务和智能体(agentic)任务上,TREK 均取得显著性能提升,为大模型训练中探索与利用的权衡提供了新思路。

所属事件:TREK框架通过蒸馏驱动探索提升GRPO表现(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →