开发者批基准污染:别在 BEIR 上训练又拿它评测
bo_wangbo · x · 2026-10-09
bowangbo 在 reranker 争论中直指问题核心:BEIR 本身是很好的基准,但业界常见做法是「在 BEIR 上训练、在 BEIR 上评测、然后宣称模型很好」,这构成基准污染。他的建议是:构建自己的、保密的基准来验证模型真实泛化能力,而非依赖已被训练污染的公开榜单。
所属事件:Reranker存亡之争:新论文刷新BEIR与基准污染质疑(2 条相关)→
「研究」频道最新
- FreeMatching:突破时空先验的图像编辑稠密对应匹配框架 — hkuhk · 2026-10-09
- WorldGuide:闭环任务执行的定向视频世界模型,胜 MiniMax-H3 — MBZUAI · 2026-10-09
- REMORY:用软记忆 token 补全上下文压缩,仅 5.2% 输入逼近全上下文 — Hanchen Xia · 2026-10-09
- OpenAI 纳维-斯托克斯证明引 $5000 对赌,2027 年见分晓 — ctjlewis · 2026-10-09
- 系外行星发现者公开代码与预注册预测,征求天文学家人工复核 — paraschopra · 2026-10-09
- 用 Claude Code 扫 NASA TESS 数据,一早上发现两颗类地行星候选 — paraschopra · 2026-10-09