ISO 认为 RLVR 可保持权重谱并把训练提速 2.7 倍
UTEXAS · hf · 2026-07-22
ISO 提出 RLVR 的固定谱优化框架,训练步数少 2.7 倍
这篇工作讨论的是强化学习 with verifiable rewards(RLVR)背后的优化层。
- 作者认为,RLVR 会保留基座模型的权重谱结构,只通过输入/输出奇异框架的变化来获得新行为,这一现象被称为 spectral inheritance。
- 基于此,他们提出 Isospectral Optimization(ISO),分为离线和在线两种版本。
- ISO-Merger 能把多个从同一基座模型训练出的 specialist 合成一个固定谱模型,而且不需要后验数据、rollout、梯度更新或 on-policy distillation。
- 这个合并模型能恢复互补的 specialist 能力,并在对比的数据无关合并方法里表现最好。
- ISO-Optimizer 则把 AdamW、Muon 等优化器作用在框架变量上,同时保持基础谱不变。
- 在 1.5B 到 8B 规模的推理和编程任务上,ISO-Optimizer 在已报告实验中提升了准确率,并能用更少步数达到相同分数。
- 以 Qwen3-8B-Base 为例,普通 AdamW 训练 270 步 后达到 0.495 的综合准确率;ISO-AdamW 只用 100 步 就达到同样水平,并在 210 步 时提升到 0.509。
- 论文的核心观点是:RLVR 后训练不应照搬预训练的优化结构,而要“继承谱、优化框架”。
「编程与Agent」频道最新
- AgentDebugX 变成了 LLM 智能体的开源闭环调试器 — UIUC-CS · 2026-07-22
- 把交易员转写内容变成 Python 纸面交易机器人 — tom_doerr · 2026-07-22
- 扫描 36 个 MCP server 后,三分之一没过 agent 可用性测试 — Normal_Sherbert_1520 · 2026-07-22
- 开发者给 Claude 做了数字鞭子,指向 AI 控制层趋势 — Olivier__OG · 2026-07-22
- AI 正把开发者推向整层技术栈重写 — mobileraj · 2026-07-22
- ASC CLI 让手机开发 iOS 的智能体流程更完整了 — rudrank · 2026-07-22