研究者呼吁公开长上下文技术细节:MRCR 高分≠真长文能力

eliebakouch · x · 2026-09-03

Hugging Face 研究员 eliebakouch 回应 Google DeepMind 的 Jack Rae,指出 MRCR 作为长上下文基准非常容易被「刷分」——Microsoft 的 MAI 技术报告与 Anthropic 都表示,MRCR 得分更高(很可能因为训练中用了类似基准的合成数据)并不对应真实的长上下文用户体验。

他呼吁各大实验室公开更多长上下文技术细节,并猜测其他实验室可能也在做类似工作但未披露;还提到开源权重模型 Muse Spark 即将发布,或许是一个分享这类技术细节的好机会。

所属事件:MRCR 长上下文基准被指刷分,作者回应引争议(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →