MRCR 长上下文基准陷刷分争议

研究员 eliebakouch 指出长上下文基准 MRCR 疑似被严重刷分:仅用约 1k 个样本训练,就能把长上下文成绩从 60% 提升到 90%,若只依赖该基准衡量长上下文能力会有误导性。随后 Google MRCR 作者 Kiran Vodrahalli 回应称,MRCR 本质上测的不是「大海捞针」式检索,而是顺序理解能力,争论仍在持续。

2026-09-03 ~ 2026-09-03 · 2 条相关