开源工具 EvalSeal v2.2.0:给 LLM 评测盖防篡改回执,实测 5/20 边界判例被 judge 抖动翻转

Fit_Fortune953 · reddit · 2026-09-28

开源工具 EvalSeal 旨在让 LLM/Agent 评测结果可复现、可审计,v2.2.0 新增:

作者一个关键发现:用 LLM judge 时 20 个边界用例有 5 个在重复运行中翻转,而用数值匹配跑 40 道 GSM8K 题 0 个翻转——不稳定来自评分器而非被测模型。

局限也写得清楚:本地工具无法证明别人没私下重跑到出好成绩,requireciclaim 只是声明不是证明,暂无 Rekor/OpenTimestamps 后端。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →