RL 后训练新方法称用 2.7 倍更少步数达标

teortaxesTex · x · 2026-07-26

一种 RL 后训练新方法:只改奇异向量也能做优化

这条帖转述了一篇关于 ISO(Isospectral Optimization) 的研究:在 RLVR 风格的后训练里,模型似乎可以复用基座模型的谱结构,只通过改变权重矩阵的 singular frames / 奇异向量框架 来获得新行为。

方法分成两部分

整体结论是:在这类 RL 后训练中,优化矩阵的谱结构/旋转,可能就足以取得很强的效果。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →