LLM 裁判难点在细微判断,纯在线 RL 难解持续学习

herbiebradley · x · 2026-08-29

Herbie Bradley(EleutherAI 研究者)在讨论中回应两个技术问题。关于 LLM-as-judge 评估长任务,难点不在长度,而在裁判模型能否捕捉更细微的定性判断;这很大程度取决于预训练规模,以及数据覆盖的持续打磨。关于持续学习,取决于具体的 in-weight 方法,但 RL 的样本效率问题等挑战让他怀疑仅靠完全在线 RL 无法解决这一难题。

所属事件:AI 能否堆叠 S 曲线持续进步的多方论辩(16 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →