MRCR 疑似被刷爆:1k 样本即可把长上下文成绩从 60% 提到 90%
eliebakouch · x · 2026-09-03
研究员 eliebakouch 指出长上下文基准 MRCR 疑似被严重 overfit(benchmaxed),只用它衡量长上下文能力有误导性。
- 微软 MAI 技术报告显示,仅用 1k 样本微调就能把 MRCR 成绩从 60% 拉到 90%+,而且做到 90%+ 的是更小的模型,说明该基准很容易被针对性优化。
- 被引用讨论的 Muse Spark 1.3 在 MRCR 上表现亮眼,但在其他长上下文基准(如 graphwalks、AA-LCR)上并无对应优势,进一步佐证刷分嫌疑。
- 作者推测多数发布 MRCR 成绩的厂商(不只 Meta)都可能在训练中混入了合成样本;微软表示无证据表明刷分带来通用能力提升,Anthropic 几个月前也已停止发布 MRCR 成绩。
作者呼吁厂商发布更多样化的长上下文基准(如 graphwalks)以及 test-time scaling 曲线,而非只给单一原始分数。
「模型」频道最新
- 传 Google Astra 今日发布,各家实验室为何扎堆抢发新模型 — haider1 · 2026-09-03
- 一周连发多款新模型,Open-weight 中国版或 3-5 个月内跟进 — scottleibrand · 2026-09-03
- Sam Altman 玩梗官宣:GPT-6 将更名为 GPT-6-7 — Miles_Brundage · 2026-09-03
- 网友深挖页面更新时间,推测 OpenAI Astra 或于今日 1pm PT 发布 — imjustnewatai · 2026-09-03
- 网友泼冷水:Astra 被高估,实际不会明显强于 Fable 5.1 — Linahuaa · 2026-09-03
- Sergey Karayev:Fable 5.1 是我用过最好的编程模型,快且不怕长会话 — sergeykarayev · 2026-09-03