美团获ACL杰出论文:GeoRA解决RLVR训练错位

美团技术团队 · wechat · 2026-08-27

美团技术团队获得ACL 2026杰出论文奖的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》提出了解决RLVR(强化学习验证奖励)与现有参数高效微调(PEFT)方法之间几何错位的新方案。

背景与问题

RLVR已成为提升大模型推理能力的关键范式,但其训练开销高。LoRA等PEFT方法主要针对SFT设计,直接用于RLVR会导致效果欠优、能力遗忘甚至训练崩溃,因为RLVR的更新倾向于稀疏子空间并避开预训练权重主方向,而LoRA等并未考虑这种优化几何差异。

GeoRA 方法

实验结果

业务应用

该方法已应用于美团的AI招聘Agent(AgenticRL)场景,以LoRA的训练成本取得了接近全参训练的效果,相比LoRA提升约12%,显存大幅降低。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →