美团获ACL杰出论文:GeoRA解决RLVR训练错位
美团技术团队 · wechat · 2026-08-27
美团技术团队获得ACL 2026杰出论文奖的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》提出了解决RLVR(强化学习验证奖励)与现有参数高效微调(PEFT)方法之间几何错位的新方案。
背景与问题
RLVR已成为提升大模型推理能力的关键范式,但其训练开销高。LoRA等PEFT方法主要针对SFT设计,直接用于RLVR会导致效果欠优、能力遗忘甚至训练崩溃,因为RLVR的更新倾向于稀疏子空间并避开预训练权重主方向,而LoRA等并未考虑这种优化几何差异。
GeoRA 方法
- 构造几何子空间:结合谱先验(强调稳定性)和欧氏先验(强调可塑性),从预训练权重中筛选出更稳定且可塑的参数区域。
- 低秩近似:对筛选出的子空间进行SVD分解,取前r个奇异分量初始化低秩适配器。
- 残差锚点:冻结剩余权重,使模型初始化时函数不变,平滑冷启动并保护预训练结构。
实验结果
- 在数学、医学、代码三类RLVR任务上,GeoRA在1.5B到32B模型上稳定优于LoRA、PiSSA等基线,甚至超过全参微调(如Qwen3-8B在AIME24上达23.75%)。
- 分布外(OOD)表现:显著减少了能力遗忘,在HumanEval上反而有所提升。
- 效率:相比全参微调,可训练参数降低99.5%,显存降低28.5%,单步耗时降低19.9%。相比稀疏微调,有效避免了算力浪费。
业务应用
该方法已应用于美团的AI招聘Agent(AgenticRL)场景,以LoRA的训练成本取得了接近全参训练的效果,相比LoRA提升约12%,显存大幅降低。
「公司和人」频道最新
- Liam Fedus 宣布重返 Google DeepMind — LiamFedus · 2026-08-27
- 观点:HF 被 NVIDIA 收购后或丧失硬件中立性 — QuixiAI · 2026-08-27
- Viam 举办机器人精细操作黑客松 — chrismatthieu · 2026-08-27
- 英伟达手握算力分配权:AI 公司成败皆由它裁决 — matt_slotnick · 2026-08-27
- 传英伟达 129 亿美元收购 HuggingFace — 机器之心 · 2026-08-27
- 公司拥有众多系统却仍租用人脑,关键员工离职后能力剩多少? — sujingshen · 2026-08-27