Jason Weston:LLM 评委偏爱机器味文本,需学习人类偏好 rubric
ivan_bezdomny · x · 2026-09-28
Meta 的 Jason Weston 发推讨论标准 LLM-as-judge 的失败:在论文写作任务上,GPT-5.6 或 Opus-4.8 这样的强评委用两两对比或常规 rubric 打分时,会认为当前的「slop」模型胜过精选的人类高质量论文。其方法的核心是让评委学习新的 rubric,使得评分时人类被认为更好——这是后续训练的关键。引用者 ivanbezdomny 补充共鸣:LLM 评委常偏好人类并不太在意的奖励信号,模型随即开始 hack 这些奖励;这在「事实密度」等启发式指标上同样成立,他自己训练新闻写作时也遇到。
「研究」频道最新
- RECLAIM 预印本:最佳 AI agent 仅复现 41% 有代码论文结果 — VraserX · 2026-09-29
- 扩散薛定谔桥论文:迭代扩散求解熵正则最优传输加速生成建模 — skoularidou · 2026-09-29
- NeurIPS 论文揭秘蛋白质折叠模型:三模型收敛出相同两阶段机制 — rishabh16_ · 2026-09-29
- 斯坦福新课 CME 295 回归:Lecture 1 已上线 YouTube — afshinea · 2026-09-29
- Astra 通关 Zork 靠作弊?博主分析:像背攻略而非真探索 — rajammanabrolu · 2026-09-29
- USC 论文:九种 LLM 数字嵌入均现周期 2/5/10 傅里叶尖峰 — BrihiJ · 2026-09-29