开发者批基准污染:别在 BEIR 上训练又拿它评测

bo_wangbo · x · 2026-10-09

bowangbo 在 reranker 争论中直指问题核心:BEIR 本身是很好的基准,但业界常见做法是「在 BEIR 上训练、在 BEIR 上评测、然后宣称模型很好」,这构成基准污染。他的建议是:构建自己的、保密的基准来验证模型真实泛化能力,而非依赖已被训练污染的公开榜单。

所属事件:Reranker存亡之争:新论文刷新BEIR与基准污染质疑(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →