法律模型训练弃用 SFT 转向 LLM 判别 RL
ivan_bezdomny · x · 2026-08-21
观察发现法律模型训练已从传统的监督微调(SFT)转向使用“LLM as a judge”作为奖励信号的强化学习(RL)。这表明行业趋势是利用习得的奖励函数而非标准 SFT 进行优化。
「研究」频道最新
- AI 经济指标发布:量化消费者放弃工具的意愿 — soumitrashukla9 · 2026-08-21
- 研究称机器人基础模型具备少样本学习能力 — scaling01 · 2026-08-21
- RL 优化模型自动写新闻,确定性奖励函数替代 LLM 评判 — ivan_bezdomny · 2026-08-21
- 别用LLM当裁判:用确定性奖励函数评RL轨迹更稳 — ivan_bezdomny · 2026-08-21
- Arc Institute 推出 2026 虚拟细胞挑战赛,奖金 10 万美元 — AllThingsApx · 2026-08-21
- 2026 分析连接主义夏季学校即将举办 — SaxeLab · 2026-08-21