MRCR 作者回应刷分争议:它测的不是检索,而是顺序理解

eliebakouch · x · 2026-09-03

围绕 MRCR 是否被刷爆(benchmaxed)的争论出现新进展:

这是对「单一基准能否代表长上下文能力」这一问题的多方位澄清。

所属事件:MRCR 长上下文基准陷刷分争议(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →