ISO提出固定谱RLVR优化栈,100步追平AdamW
burny_tech · x · 2026-07-24
论文要点
这篇工作认为,RLVR 的学习并不是主要通过“重写”模型的权重谱,而是保留基础谱结构,只调整对应的奇异框架。
ISO:面向 RLVR 的固定谱优化栈
- 作者提出 ISO(Isospectral Optimization),一个原生面向 RLVR 的优化框架。
- ISO-Merger 可以在不使用数据、rollout、梯度或蒸馏的情况下合并多个 RL 专家。
- ISO-Optimizer 则在保持基础谱不变的前提下更新 frame 变量,包含 AdamW 和 Muon 变体。
报告结果
- 在 1.5B 到 8B 参数规模的推理与代码任务上,ISO 在报告实验中提升了准确率。
- 在 Qwen3-8B-Base 上,AdamW 训练 270 步后达到 0.495 的综合准确率。
- ISO-AdamW 只用 100 步就达到同样结果,并在 210 步时进一步提升到 0.509。
这篇论文的核心结论是:后训练优化也许应该围绕“继承谱结构,优化框架”来设计。
所属事件:新框架 ISO 优化 RLVR 训练可将步数缩减 2.7 倍(3 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11