RL后训练更新可被稀疏分解
menhguin · x · 2026-07-15
这条转发介绍了一项关于 RL 后训练(post-training) 的新研究,核心问题是:RL 更新虽然有效,但参数变化本身像“黑箱”。
论文提出把 RL 中真正有效的“推理部分”看作基模型谱空间里的一个紧凑重接矩阵,并据此设计了 SAR:一种无需再训练的后处理方法,可以把原始 RL 更新投影到这个“推理核心”上,用来更好地理解、净化和合并 RL 训练后的模型。
文中给出的关键结论包括:
- 推理核心非常稀疏:少于 1% 的谱参数就能恢复,甚至提升完整 RL 的收益。
- 能去噪:把无关/噪声方向去掉后,模型表现仍可保持或变好。
- 可用于模型合并:不仅能分析 RL 更新,还能把训练后的改动更干净地融合回模型。
「研究」频道最新
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11