MRCR 作者回应刷分争议:它测的不是检索,而是顺序理解
eliebakouch · x · 2026-09-03
围绕 MRCR 是否被刷爆(benchmaxed)的争论出现新进展:
- Google MRCR 作者 Kiran Vodrahalli 回应称,MRCR 本质上不是「大海捞针」式检索,而是考察模型对内容顺序(ordering)的理解;长上下文理解有很多维度,MRCR 只是衡量其中一个较难做好的简单任务。
- eliebakouch 补充整理了 MRCR 作者的推文与 Anthropic 官方说明,认为这是目前最好的复盘;他承认长上下文与其他能力一样,某些方向可以被刷分但仍有重要性,只是仅以 MRCR 代表长上下文能力有误导性。
这是对「单一基准能否代表长上下文能力」这一问题的多方位澄清。
「模型」频道最新
- 开发者称 GPT 电脑操作能力领先,Anthropic 远远落后 — CtrlAltDwayne · 2026-09-03
- 疑似 GPT-6 曝光:分支命名现踪迹,主攻 computer use 能力 — scaling01 · 2026-09-03
- GPT-5.6 会学你说话的腔调,被赞比 Claude 更有人味 — CtrlAltDwayne · 2026-09-03
- 前 OpenAI 政策总监吐槽:Fable 5.1 在实际工作流中极度费 token — Miles_Brundage · 2026-09-03
- Gemini 视频 token 省 88% 的关键更新落在 3.7 Flash 而非 3.8 — Servola-Journal · 2026-09-03
- 全自动开源模型追踪站上线:新 HF 模型 1 天内收录并给出理论最高 tok/s — helloiamleonie · 2026-09-03