Salesforce RISE:从自身 RL 轨迹自外推生成监督,免外部教师

Salesforce · hf · 2026-09-07

Salesforce 发布 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation),一种语言模型后训练方法。

核心想法是让模型从自己的强化学习轨迹中递归地生成密集的 token 级监督信号,通过“自外推”产生训练数据,全程无需外部教师模型或人工标注。这为减少后训练对昂贵教师/标注的依赖提供了一条路线。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →