NVIDIA 发布 LoGRA:低秩梯度草图把 LLM 强化学习训练内存最高省 45.7%
nvidia · hf · 2026-10-07
NVIDIA 提出 LoGRA,一种面向 LLM 强化学习后训练的内存优化方法:
- 核心思路:用低秩梯度草图保留有效学习信号,压缩梯度的同时支持模型更新与高效的策略同步。
- 配套机制:引入 predicted-KL 步长控制,在每次更新前估算策略变化幅度并据此调节步长,防止过大的更新破坏训练稳定性。
- 实测效果:在推理任务上平均降低训练内存最高 45.7%,性能不损失;让 27B 参数模型在单台 8 卡 GPU 节点上稳定训练超过 1100 步——稠密 Adam 在此配置下会直接 OOM。
- 代码已开源(基于 Molt 库)。
「Infra」频道最新
- Intel 高管:agentic AI 大量时间耗在等待,关键指标是端到端时长 — ryanshrout · 2026-10-07
- 三台异构机器跑本地推理,如何统一服务与监控? — ziyaulhuk12 · 2026-10-07
- Beff Jezos:解耦推理是未来,异构算力云正当其时 — beffjezos · 2026-10-07
- 「拥有自己的 AI」在技术上到底意味着什么? — Imaginary_Choice_430 · 2026-10-07
- 前 NVIDIA 工程师爆料:一颗内存控制器报废的芯片如何靠 L2 完成测试 — blelbach · 2026-10-07
- 谁承担资金风险谁有议价权:从押金结构看 AI 算力真稀缺在哪 — tengyanAI · 2026-10-07