RL 后训练新方法称用 2.7 倍更少步数达标
teortaxesTex · x · 2026-07-26
一种 RL 后训练新方法:只改奇异向量也能做优化
这条帖转述了一篇关于 ISO(Isospectral Optimization) 的研究:在 RLVR 风格的后训练里,模型似乎可以复用基座模型的谱结构,只通过改变权重矩阵的 singular frames / 奇异向量框架 来获得新行为。
方法分成两部分
- ISO-Merger:只用 checkpoint,把多个 RL expert 合并成一个模型,不需要数据、rollout 或 OPD。
- ISO-Optimizer:可直接套在 AdamW / Muon 上,帖中称它能以 约 2.7 倍更少的训练步数 达到与 AdamW 相近的准确率。
整体结论是:在这类 RL 后训练中,优化矩阵的谱结构/旋转,可能就足以取得很强的效果。
「研究」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11