Meta 长上下文 MRCR 被指刷分:1k 样本可从 60% 提到 90%+

eliebakouch · x · 2026-09-04

eliebakouch 对 Meta 长上下文 MRCR 成绩提出重要更正:仅以 MRCR 作为长上下文基准有误导性,Meta 很可能严重过拟合。微软 MAI 技术报告显示,只用 1000 个样本就能把 MRCR 分数从 60% 刷到 90% 以上——而且是更小的模型做到的,刷分嫌疑更重。Google 的 Denny Zhou 则补充他们在 graph walks 上也有未公开的 SOTA 结果。

所属事件:Hugging Face 研究员质疑长上下文基准 MRCR 可被轻易刷分(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →