ISO 认为 RLVR 可保持权重谱并把训练提速 2.7 倍
UTEXAS · hf · 2026-07-22
ISO 提出 RLVR 的固定谱优化框架,训练步数少 2.7 倍
这篇工作讨论的是强化学习 with verifiable rewards(RLVR)背后的优化层。
- 作者认为,RLVR 会保留基座模型的权重谱结构,只通过输入/输出奇异框架的变化来获得新行为,这一现象被称为 spectral inheritance。
- 基于此,他们提出 Isospectral Optimization(ISO),分为离线和在线两种版本。
- ISO-Merger 能把多个从同一基座模型训练出的 specialist 合成一个固定谱模型,而且不需要后验数据、rollout、梯度更新或 on-policy distillation。
- 这个合并模型能恢复互补的 specialist 能力,并在对比的数据无关合并方法里表现最好。
- ISO-Optimizer 则把 AdamW、Muon 等优化器作用在框架变量上,同时保持基础谱不变。
- 在 1.5B 到 8B 规模的推理和编程任务上,ISO-Optimizer 在已报告实验中提升了准确率,并能用更少步数达到相同分数。
- 以 Qwen3-8B-Base 为例,普通 AdamW 训练 270 步 后达到 0.495 的综合准确率;ISO-AdamW 只用 100 步 就达到同样水平,并在 210 步 时提升到 0.509。
- 论文的核心观点是:RLVR 后训练不应照搬预训练的优化结构,而要“继承谱、优化框架”。
所属事件:新框架 ISO 优化 RLVR 训练可将步数缩减 2.7 倍(3 条相关)→
「编程与Agent」频道最新
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11
- hyperresearch 开源:让 Agent 把网络调研沉淀为可搜索知识库 — jordan-gibbs · 2026-09-11
- Forter 两周全员 Agent 冲刺 13 条经验:跳过自建 RAG 靠企业搜索 — bibryam · 2026-09-11
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11