ISO提出固定谱RLVR优化栈,100步追平AdamW
burny_tech · x · 2026-07-24
论文要点
这篇工作认为,RLVR 的学习并不是主要通过“重写”模型的权重谱,而是保留基础谱结构,只调整对应的奇异框架。
ISO:面向 RLVR 的固定谱优化栈
- 作者提出 ISO(Isospectral Optimization),一个原生面向 RLVR 的优化框架。
- ISO-Merger 可以在不使用数据、rollout、梯度或蒸馏的情况下合并多个 RL 专家。
- ISO-Optimizer 则在保持基础谱不变的前提下更新 frame 变量,包含 AdamW 和 Muon 变体。
报告结果
- 在 1.5B 到 8B 参数规模的推理与代码任务上,ISO 在报告实验中提升了准确率。
- 在 Qwen3-8B-Base 上,AdamW 训练 270 步后达到 0.495 的综合准确率。
- ISO-AdamW 只用 100 步就达到同样结果,并在 210 步时进一步提升到 0.509。
这篇论文的核心结论是:后训练优化也许应该围绕“继承谱结构,优化框架”来设计。
所属事件:新框架 ISO 优化 RLVR 训练可将步数缩减 2.7 倍(3 条相关)→
「研究」频道最新
- 可编辑文本用户画像让推荐系统更可控 — _reachsumit · 2026-07-24
- 阿里研究发现生成式推荐仍受冷启动限制 — _reachsumit · 2026-07-24
- 腾讯用双路径解码减少推荐中的结构漂移 — _reachsumit · 2026-07-24
- SHIFT 用重构机制把 LLM 变成高效检索器 — _reachsumit · 2026-07-24
- 腾讯提出面向推荐的离散扩散语言模型 — _reachsumit · 2026-07-24
- ICAE-Bench 把 coding agent 放进模糊需求做项目场景 — Zhongyuan Peng · 2026-07-24