翻译评测指标存系统性长度偏置,论文称排名被句子长短扭曲
shangbinfeng · x · 2026-10-04
- 一篇将在 COLM 会议上展示的论文(作者来自 @WendaXu2、@yilinjz 等,与 Google AI/Google DeepMind 相关)指出,当前表现最好的翻译评测指标/奖励模型存在系统性的长度偏置。
- 论文认为这些指标可能在给"更长的译文"打高分,而非真正衡量翻译质量,从根本上扭曲了模型排名——评测分数部分反映的是序列长度而非质量。
「研究」频道最新
- 一周收到 10 份 ICRA/RAL 审稿邀请,机器人学界审稿压力激增 — ChongZzZhang · 2026-10-04
- David Silver 2024 演讲幻灯片流出:AGI 路线就是 LLM 加 RL — akbirthko · 2026-10-04
- 数学终结了吗?传奇研究者 Szegedy 撰文谈 AI 时代数学的未来 — ChrSzegedy · 2026-10-04
- 标注 15282 条推理轨迹:思考模型放大的行为并非最能预测正确 — Jeande_d · 2026-10-04
- LLM 数学与安全能力为何骤升?业界缺一套可证伪的预测理论 — burny_tech · 2026-10-04
- Sutton 第 15 位博士生毕业,论文研究神经网络终身学习可塑性 — RichardSSutton · 2026-10-04