清华 NLP 推出 LexReward:三维分类体系驱动法律大模型奖励建模

TsinghuaNLP · hf · 2026-10-05

清华 NLP 发布 LexReward,一个分类体系驱动的法律奖励建模框架,解决现有奖励方法粗粒度、缺乏领域可解释性的问题。

实验证明 rubric 奖励能可靠区分不同质量的法律回答,分类体系与奖励构建方式均有效。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →