审计 7 款 LLM 评测工具源码,发现 13 处打分与实际检查不符
maverick_man1111 · reddit · 2026-10-06
作者花一个月阅读了 7 款常用于评估 Claude Code skills 与 LLM 应用的工具的打分源码(包括 agent-skills 仓库的 eval harness、NVIDIA SkillEvaluator,以及 MLflow、LangSmith、DSPy、DeepEval、Harbor),发现 13 处工具给出的分数/通过判定并不被其实际检查支撑,每一处都可复现并写了复现步骤。
典型问题包括:
- 评审模型(多为 Claude)回复"无法打分",工具却把该回复硬转成分数;
- MLflow 中"新模型须比旧模型高 10%"的门控,遇到负分(如 R²)时除法翻转,反而让更差的模型通过(作者提交的修复已被合并);
- 分数写错到别的 run、上次运行的残留状态被当成本次结果读取。
作者向全部 13 处上游提交了 issue,送出 12 个修复,已合并 6 个。其中 3 个 bug 出自作者自己的 Claude Code 插件 Driftproof(用于检测 skill 在模型更新后是否仍有效,开源,v0.14.0 已发布)。
作者的核心警示:如果评测代码检查的是错误的东西,跑更多次评测只会让你对错误答案更自信——而"这个 skill 在新版 Claude 上还有没有用"恰恰是这类工具本该回答的问题。完整报告发布在 Zenodo(DOI: 10.5281/zenodo.23050796)。
「编程与Agent」频道最新
- t3 code 用多 agent 审 PR:本地即时反馈,CI 约 20 秒部署 — samgoodwin89 · 2026-10-06
- Hugging Face Hub 上线 RL 环境筛选器,支持四大框架 — lmoroney · 2026-10-06
- 前特斯拉AI总监跳槽Anthropic,编码Agent差距被点名 — Kuprel · 2026-10-06
- 「五年内 docx 被 Markdown 取代」引发争论:排版与普通用户怎么办 — bytebot · 2026-10-06
- 一个标签页刷新 Bug 让服务器 CPU 打满四天,根因是请求量随标签页数平方增长 — Ok_Negotiation_2587 · 2026-10-06
- loop-engineering:8 种无人值守 Agent 循环模式,让 AI 整夜跑你的仓库 — JafarNajafov · 2026-10-06