Eval 工程师缺的不是更好的基准,而是更好的工具链
sarahcat21 · x · 2026-09-19
作者参与了一场关于「对评测本身进行评测」的讨论后指出:当前的瓶颈不只是基准质量,而是 eval 工程师缺少构建、审查、改进和维护基准的工具。她认为这个需求显而易见却至关重要,呼吁社区把注意力从「做出更好的 benchmark」转向「为评测工程师提供更好的基础设施」。
这一观点把 eval 定位成一项需要工具支撑的长期工程工作,而非一次性的榜单构建。
「编程与Agent」频道最新
- 无需 prompt 与 JSON 解析:Jev 结构化 API 直连 Java 记录 — therealdanvega · 2026-09-19
- Claude Code 2.1.277 正式支持 AGENTS.md 规范 — josh_wills · 2026-09-19
- 零技术背景用 Codex 20 分钟重建社区打卡机器人 — Travi3000 · 2026-09-19
- 用 agent 3 分钟分类 63045 封邮件,成本不到 1 美元 — NathanWilbanks_ · 2026-09-19
- Edward Yang:用 LLM 标注终结符,动态分析从未如此简单 — ezyang · 2026-09-19
- mitsuhiko:认真试用 Web Components 后团队全线转投 React — mitsuhiko · 2026-09-19