法律回答拆成文风、要件与推理链,要素均分比 SFT 高 6.04

LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models

Yida Cai, Xin Dai, Bingxiang He, Huiyuan Xie, Yuxiao Ye, Zhenghao Liu, Yang Bai, Zhiyuan Liu

cs.CL

2026-09-30

LexReward 用细则把中文法律回答的文风、要件、推理链分别打分并训出 LexRM。Qwen3-8B 经 GRPO 后,Legal∆ 均分由 60.62 升至 66.66,推理链仅由 55.99 升至 56.40。

这篇在解决什么

法律模型可以结论正确,同时漏掉决定性事实、援引错误法条,或用流畅但站不住的推理把结论兜住。只核对罪名、法条、金额的 outcome reward 对这条路径无感;通用奖励模型又把文风、长度和实质质量揉成一个分数。奖励该鼓励哪一种法律回答,缺少一个拆得开的定义。

LexReward 是北大、清华与东北大学合作的奖励框架。法律专家把回答质量收成文风、要件、推理链三个维度,先写成评分细则,再变成偏好数据和奖励模型 LexRM,接到 DPO 与 GRPO。论文称 LexRM 是第一组中文法律奖励模型。

方法

专家先按法律写作要求定维度,再对照模型输出和参考答案把遗漏补进标准。

文风不看题目。五项是术语特异性、主观词控制、句子衔接、句式和搭配。参照来自中国裁判文书网 1000 篇真实判决,归一化尺度另用 986 篇估计。术语和主观词用 KL 散度,连词看频率差,句长和 3 至 6 元搭配用欧氏距离,归一化后取负号等权平均。分高表示更像真判决的写法。

要件交给 DeepSeek-V4-Flash,按主体、事实、法条、裁判结论打 0 到 1,不看参考答案,四项平均。推理链看顺序、完整、正确、不重复:任务规定了步骤就用规则核对,否则仍用这个裁判模型。提示词是中文。

规则分经常打平。五个模型(Qwen3-4B、Qwen3.5-4B、Qwen3.5-9B、Llama-3.1-8B-Instruct、gemma-4-12B-it)对每题各采一条,按分数配成高、中、低档偏好对,同分题丢弃。Style 的偏好来自 CLASE 的 4000 条训练题,Element 得到 2244 对,Chain 把 4000 条训练题用于偏好构造。Qwen3-8B 以 Bradley-Terry 损失各训一个 LexRM。三份任务向量的余弦相似度平均不超过 0.03、最高不超过 0.14,于是用 task arithmetic 加到同一基座,得到 LexRM-Merge。

DPO 从 Qwen3-8B 直接训练。GRPO 先用 1000 条该维最高分回答做 SFT,再从同一检查点用另 1000 条分别接 LexRM 和规则奖励。Element 与 Chain 的规则奖励核对最终答案,Style 用相对参考文本的 ROUGE。正例是细则挑出的模型回答,训练文本不是真实判决。

结果

Style 的选择指标是成对准确率,要在金标和模型负例之间挑中金标。Element 与 Chain 是五模型里选最高分,再送进 Legal∆ 或 LexChain。

设置指标结果
Style 成对准确率LexRM-Style 81.75,细则 79.00,Skywork-Qwen 78.50,随机 50.00
Element 五选一Legal∆ 均分Skywork-Qwen 68.04,LexRM-Element 66.32,细则 60.27,五模型均值 49.63
Chain 五选一LexChain 总分LexRM-Chain 50.46,Skywork-Qwen 50.19,细则 47.80,五模型均值 45.41
生成 StyleCLASE-Mix(满分 10)基座 3.08,DPO 5.21,SFT 7.32,GRPO 规则 8.43,GRPO+LexRM 8.54
生成 ElementLegal∆ 均分基座 57.78,DPO 58.13,SFT 60.62,GRPO 规则 60.86,GRPO+LexRM 66.66
生成 ChainLexChain 总分基座 53.55,DPO 54.47,SFT 55.99,GRPO 规则 55.29,GRPO+LexRM 56.40

Element 上的 GRPO+LexRM 把分数拉开了:相对 SFT 五项都涨,均分高 6.04,刑期准确率从 46.80 到 56.70,金额计算从 81.80 到 89.80。只奖最终答案的 GRPO 均分停在 60.86,金额计算掉到 75.80。选择阶段的 Element 上,Skywork-Qwen 仍以 68.04 高于 LexRM 的 66.32。Style 从 3.08 到 7.32 发生在 SFT,LexRM 比 ROUGE 只多 0.11。Chain 上 LexRM 比 SFT 高 0.41,规则奖励的 GRPO 还低于 SFT;争议焦点从 39.00 降到 37.30,法条项 39.55 也低于基座的 42.10。生成实验里原告识别都在 97.25 以上,被告在 88.90 到 90.85。

子标准拆开后,三维都是加总总分最高。只奖主体时,刑期选择分掉到 7.60,加总回到 33.10。LexRM-Merge 在 Legal∆ 上为 65.77,接近要件专家的 66.32;文风准确率从 81.75 掉到 69.75,推理链总分从 50.46 掉到 46.84。

为什么重要

开放法律问答常常没有可核对的罪名或金额。要件和推理链打分时不读参考答案,奖励阶段可以不依赖金标文书。

对已有法律 SFT 的团队,增量主要在要件。文风分大多在监督微调里已经拿到,推理链总分几乎不动。这是一张把奖励拆开的清单,要加训练的是要件这一维。

局限与存疑

附录写了两条:分类和评测绑在中国法与中文数据上,其他语言和法系没测;多维度收成一个奖励时,权重、偏好怎么混、怎么训,仍是开放问题。

DPO 从 Qwen3-8B 起训,三个维度都高于基座、低于对应 SFT。起点不同,这组对照说明不了偏好优化和监督微调谁更强。CLASE-Mix 一半在比文风特征,和文风奖励是同类信号。细则侧由 DeepSeek-V4-Flash 打分,LexChain 终评是 GPT-4o,文风主观分是 GPT-4o-mini,全文没有自动分和律师判断的相关性。推理链选择上 LexRM 只比 Skywork-Qwen 高 0.27。

术语

原文与代码

相关论文

全部论文解读