研究者吐槽:评测代码里大量函数只为修数据集而存在

remilouf · x · 2026-10-11

开发者 remilouf 统计自己多个 eval harness 里的函数,发现相当一部分的唯一作用是修补数据集本身的问题。他感叹这对整个 eval 领域的状态来说不是好信号——评测基础设施的复杂度被数据质量问题大量消耗。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →