RL 后训练新方法称用 2.7 倍更少步数达标
teortaxesTex · x · 2026-07-26
一种 RL 后训练新方法:只改奇异向量也能做优化
这条帖转述了一篇关于 ISO(Isospectral Optimization) 的研究:在 RLVR 风格的后训练里,模型似乎可以复用基座模型的谱结构,只通过改变权重矩阵的 singular frames / 奇异向量框架 来获得新行为。
方法分成两部分
- ISO-Merger:只用 checkpoint,把多个 RL expert 合并成一个模型,不需要数据、rollout 或 OPD。
- ISO-Optimizer:可直接套在 AdamW / Muon 上,帖中称它能以 约 2.7 倍更少的训练步数 达到与 AdamW 相近的准确率。
整体结论是:在这类 RL 后训练中,优化矩阵的谱结构/旋转,可能就足以取得很强的效果。
「研究」频道最新
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27
- TechCrunch 讨论脑波信号或成 physical AI 训练新钥匙 — TechCrunch AI · 2026-07-27
- NeurIPS 反驳阶段临近:如何写出高质量回复? — furongh · 2026-07-27
- 一篇名为“在康托空间没人听见你流”的计算机论文 — fkasummer · 2026-07-27
- YC 讨论具身机器人:预训练、记忆和组合行为才是关键 — ycombinator · 2026-07-27