ISO 框架复用基座谱结构,RLVR 训练提速 2.7 倍
针对强化学习与可验证奖励(RLVR)的优化层,研究者提出了“同谱优化”框架(ISO)。该研究指出,RLVR 无需让模型从头重学底层能力,而是可以直接复用基座模型的谱结构,利用奇异向量或奇异帧来获取新行为。通过保持权重谱的固定,ISO 框架有效避免了底层能力的重复学习,成功将训练步数减少了 2.7 倍,实现了显著的提速效果。
2026-07-22 ~ 2026-07-23 · 2 条相关
- ISO 认为 RLVR 可保持权重谱并把训练提速 2.7 倍 — UTEXAS · 2026-07-22
- ISO 说 RLVR 可复用基座谱结构,训练步数少 2.7 倍 — xiuyu_l · 2026-07-23