清华 NLP 推出 LexReward:三维分类体系驱动法律大模型奖励建模
TsinghuaNLP · hf · 2026-10-05
清华 NLP 发布 LexReward,一个分类体系驱动的法律奖励建模框架,解决现有奖励方法粗粒度、缺乏领域可解释性的问题。
- 三维质量分类:Style(词汇与句法质量)、Element(法律主体、事实、法条与裁判)、Chain(推理顺序、完整性、正确性与无冗余)
- 为每个维度制定 rubric,明确评价标准与质量等级
- 产出用于构建成对偏好数据,支持 DPO 训练与奖励模型训练,后者在三个维度上均提升表现
- 维度专属奖励模型 LexRM 可通过强化学习优化对应维度,且奖励时无需参考答案
实验证明 rubric 奖励能可靠区分不同质量的法律回答,分类体系与奖励构建方式均有效。
「研究」频道最新
- 佛蒙特大学获最高 3800 万美元打造 ICU 患者数字孪生 — HealthcareLdr · 2026-10-05
- SimuVerity基准:最强Agent生成Simulink模型仅得42.86分 — Ruiqi Zhang · 2026-10-05
- MIT提出LSL框架:无需旧数据即可解决大模型灾难性遗忘 — MIT · 2026-10-05
- HelixWorld:单GPU实时24FPS的音视频同步交互世界模型 — NoizAI · 2026-10-05
- BlockRank:用分块稀疏注意力加速 LLM 文档排序 — dejanseo · 2026-10-05
- Judea Pearl:逻辑与因果推断是西方科学两大支柱 — yudapearl · 2026-10-05