审计 7 款 LLM 评测工具源码,发现 13 处打分与实际检查不符

maverick_man1111 · reddit · 2026-10-06

作者花一个月阅读了 7 款常用于评估 Claude Code skills 与 LLM 应用的工具的打分源码(包括 agent-skills 仓库的 eval harness、NVIDIA SkillEvaluator,以及 MLflow、LangSmith、DSPy、DeepEval、Harbor),发现 13 处工具给出的分数/通过判定并不被其实际检查支撑,每一处都可复现并写了复现步骤。

典型问题包括:

作者向全部 13 处上游提交了 issue,送出 12 个修复,已合并 6 个。其中 3 个 bug 出自作者自己的 Claude Code 插件 Driftproof(用于检测 skill 在模型更新后是否仍有效,开源,v0.14.0 已发布)。

作者的核心警示:如果评测代码检查的是错误的东西,跑更多次评测只会让你对错误答案更自信——而"这个 skill 在新版 Claude 上还有没有用"恰恰是这类工具本该回答的问题。完整报告发布在 Zenodo(DOI: 10.5281/zenodo.23050796)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →