法律模型训练弃用 SFT 转向 LLM 判别 RL

ivan_bezdomny · x · 2026-08-21

观察发现法律模型训练已从传统的监督微调(SFT)转向使用“LLM as a judge”作为奖励信号的强化学习(RL)。这表明行业趋势是利用习得的奖励函数而非标准 SFT 进行优化。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →