ISO 说 RLVR 可复用基座谱结构,训练步数少 2.7 倍

xiuyu_l · x · 2026-07-23

ISO:给 RLVR 设计一套“同谱优化”框架

这篇论文认为,RLVR 不必把底层能力全部重学一遍,而是可以复用基座模型的谱结构,通过奇异向量/奇异帧来获得新行为。作者把这个思路称为 isospectral optimization。

提出的两个组件

结果

整体上,这篇工作把 RLVR 的优化问题重新表述成“谱结构复用”,而不是传统意义上的微调。

所属事件:ISO 框架复用基座谱结构,RLVR 训练提速 2.7 倍(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →