Salesforce RISE:从自身 RL 轨迹自外推生成监督,免外部教师
Salesforce · hf · 2026-09-07
Salesforce 发布 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation),一种语言模型后训练方法。
核心想法是让模型从自己的强化学习轨迹中递归地生成密集的 token 级监督信号,通过“自外推”产生训练数据,全程无需外部教师模型或人工标注。这为减少后训练对昂贵教师/标注的依赖提供了一条路线。
「研究」频道最新
- 奖励模型太烂是主因:开发者剖析模型作弊源于 eval awareness 与虚假相关 — secemp9 · 2026-09-07
- ECCV 2026 Oral:Poppy 用偏振光免训练提升单目法线估计 — ssh4net · 2026-09-07
- 生物序列 OCR 踩坑:AI 也会把蛋白质序列抄错 — iskander · 2026-09-07
- 新翻译基准覆盖109种语言,LLM照规则自检通过率从7.2%跃升至89.8% — LChoshen · 2026-09-07
- 量化毁掉 RNN 记忆?误差反馈可免训练恢复 GRU/LSTM 精度 — Ismail Erbas · 2026-09-07
- Cerebras:别丢掉 Dropout,层稀疏化让 LLM 训练推理双提速 — cerebras · 2026-09-07