研究者呼吁公开长上下文技术细节:MRCR 高分≠真长文能力
eliebakouch · x · 2026-09-03
Hugging Face 研究员 eliebakouch 回应 Google DeepMind 的 Jack Rae,指出 MRCR 作为长上下文基准非常容易被「刷分」——Microsoft 的 MAI 技术报告与 Anthropic 都表示,MRCR 得分更高(很可能因为训练中用了类似基准的合成数据)并不对应真实的长上下文用户体验。
他呼吁各大实验室公开更多长上下文技术细节,并猜测其他实验室可能也在做类似工作但未披露;还提到开源权重模型 Muse Spark 即将发布,或许是一个分享这类技术细节的好机会。
所属事件:MRCR 长上下文基准被指刷分,作者回应引争议(6 条相关)→
「模型」频道最新
- Astra 从低算力到满配解决率几乎不变,RL 扩展故事遭数据打脸 — zainhas · 2026-09-05
- Sam Altman:下一代模型会让所有人清醒, capability 远超现有水平 — ChrisGPT · 2026-09-05
- 实测发现 Astra 高努力档空耗 token,terminal bench 上仅低中高档可用 — zainhas · 2026-09-05
- GPT 6 Astra 支持对话中途调整推理强度且缓存不失效 — intellectronica · 2026-09-05
- 「别用过去式称呼模型」:网友惋惜 Opus 3 时代落幕 — repligate · 2026-09-05
- Astra 以 30k tokens 跑出 74% DeepSWE 成绩,效率碾压 GPT-5.6 Sol — haider1 · 2026-09-05