开源无依赖 LLM 评测工具:盯回归而非平均分
zahidsaim23 · reddit · 2026-09-07
一位日常做 LLM 评测的作者开源了一个零依赖、仅用 Python 标准库的轻量评测框架(MIT):github.com/zahid23saim/llm-eval-harness。
- 用法:评测集就是一个 JSON gold set,每条包含问题、正确答案和匹配规则(exact / contains / numeric);每次改 prompt 或换模型就跑一遍,输出准确率、逐条失败原因,且非零退出码可直接进 CI。
- 经验一:变更后真正要看的数字不是平均分,而是「过去通过、现在失败」的条目——一次改动可能拉高均分却弄坏了大客户依赖的三个问题,所以要 diff 两次运行、盯回归。
- 经验二:开放式答案用字符串匹配很快失效,用显式 rubric 让模型在 temperature 0 下打分稳定得多,但仍需抽几条人工标注来校验裁判模型,否则它会自信地撒谎。
「编程与Agent」频道最新
- LLM 复活经典 Put-That-There:语音加手势在 XR 里免手放窗口 — twi_mar · 2026-09-07
- Anthropic Claude Code 工程师谈内部 AI 编码最佳实践与自主化比例 — trq212 · 2026-09-07
- 爆料:OpenAI 拟推 Managed Agents,可在平台托管或自建部署 — testingcatalog · 2026-09-07
- 只改 harness 不换模型:deepagents-cli 在 Terminal-Bench 提升 13.7 个百分点 — Gauri_the_great · 2026-09-07
- 开源 macOS 应用 Chops:一站式管理各编码 Agent 的 skills — tom_doerr · 2026-09-07
- 用 LLM 硬跑 CV 任务遭吐槽:200 行代码就能实时解决的活别烧 token — mervenoyann · 2026-09-07