LLM 裁判难点在细微判断,纯在线 RL 难解持续学习
herbiebradley · x · 2026-08-29
Herbie Bradley(EleutherAI 研究者)在讨论中回应两个技术问题。关于 LLM-as-judge 评估长任务,难点不在长度,而在裁判模型能否捕捉更细微的定性判断;这很大程度取决于预训练规模,以及数据覆盖的持续打磨。关于持续学习,取决于具体的 in-weight 方法,但 RL 的样本效率问题等挑战让他怀疑仅靠完全在线 RL 无法解决这一难题。
所属事件:AI 能否堆叠 S 曲线持续进步的多方论辩(16 条相关)→
「研究」频道最新
- 周末资源:从第一性原理推导位置编码 — zainhas · 2026-08-30
- COLM 论文用梯度归因揭示 LLM 能力来源 — ziv_ravid · 2026-08-30
- Toby Ord 论文指递归自我改进受物理限制 — Exponential View (Azeem Azhar) · 2026-08-30
- Fable 与 Sol 形式化验证文献,首次找出论文可修复错误 — Sauers_ · 2026-08-30
- Mark Schmidt 发布 ICML 教程视频:数值优化理论在 2026 年还重要吗 — MarkSchmidtUBC · 2026-08-30
- 46 行 Python 实现 SDF 甜甜圈渲染 — voooooogel · 2026-08-30