Meta 长上下文 MRCR 被指刷分:1k 样本可从 60% 提到 90%+
eliebakouch · x · 2026-09-04
eliebakouch 对 Meta 长上下文 MRCR 成绩提出重要更正:仅以 MRCR 作为长上下文基准有误导性,Meta 很可能严重过拟合。微软 MAI 技术报告显示,只用 1000 个样本就能把 MRCR 分数从 60% 刷到 90% 以上——而且是更小的模型做到的,刷分嫌疑更重。Google 的 Denny Zhou 则补充他们在 graph walks 上也有未公开的 SOTA 结果。
所属事件:Hugging Face 研究员质疑长上下文基准 MRCR 可被轻易刷分(6 条相关)→
「模型」频道最新
- 网传 OpenAI GPT 6「Astra」对比曝光:任务中途转向不再丢失目标 — ChrisGPT · 2026-09-04
- OpenAI:Astra 将在数日内推向 ChatGPT Plus/Pro/企业版及 API 和 AWS — shaunralston · 2026-09-04
- Meta Muse Spark 登顶单日用量榜,首超 DeepSeek — alexandr_wang · 2026-09-04
- GPT-6-Astra 系统卡显示「评测意识」,模型知道自己在被测 — scaling01 · 2026-09-04
- GPT-6 Astra 演示:Blender 建房模一键转为 UE5 可行走场景 — ChrisGPT · 2026-09-04
- SpeedrunBench:首个测 AI 智能体速通游戏能力的基准,最优模型距人类纪录差 4 倍 — mariyaivasileva · 2026-09-04