MRCR 疑似被刷爆:1k 样本即可把长上下文成绩从 60% 提到 90%

eliebakouch · x · 2026-09-03

研究员 eliebakouch 指出长上下文基准 MRCR 疑似被严重 overfit(benchmaxed),只用它衡量长上下文能力有误导性。

作者呼吁厂商发布更多样化的长上下文基准(如 graphwalks)以及 test-time scaling 曲线,而非只给单一原始分数。

所属事件:MRCR 长上下文基准陷刷分争议(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →