Eval 工程师缺的不是更好的基准,而是更好的工具链

sarahcat21 · x · 2026-09-19

作者参与了一场关于「对评测本身进行评测」的讨论后指出:当前的瓶颈不只是基准质量,而是 eval 工程师缺少构建、审查、改进和维护基准的工具。她认为这个需求显而易见却至关重要,呼吁社区把注意力从「做出更好的 benchmark」转向「为评测工程师提供更好的基础设施」。

这一观点把 eval 定位成一项需要工具支撑的长期工程工作,而非一次性的榜单构建。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →