ISO提出固定谱RLVR优化栈,100步追平AdamW

burny_tech · x · 2026-07-24

论文要点

这篇工作认为,RLVR 的学习并不是主要通过“重写”模型的权重谱,而是保留基础谱结构,只调整对应的奇异框架。

ISO:面向 RLVR 的固定谱优化栈

报告结果

这篇论文的核心结论是:后训练优化也许应该围绕“继承谱结构,优化框架”来设计。

所属事件:新框架 ISO 优化 RLVR 训练可将步数缩减 2.7 倍(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →