开源工具 EvalSeal v2.2.0:给 LLM 评测盖防篡改回执,实测 5/20 边界判例被 judge 抖动翻转
Fit_Fortune953 · reddit · 2026-09-28
开源工具 EvalSeal 旨在让 LLM/Agent 评测结果可复现、可审计,v2.2.0 新增:
- evalseal drift:对两次跑分不一致自动归因(evaluator 漂移、judge 方差、目标模型方差/变更、或稳定)
- evaluator 指纹:固定 judge 端点、模型、temperature、topp、prompt 模板、rubric、数据集等
- preregister + gate --prereg:在跑分前声明评测契约(套件、用例、重复次数、所需 artifact)
- Agent 场景支持同时绑定工具 ACL 与冻结的工具响应——ACL 定义 agent 能调什么,冻结响应定义它被评测时的"世界"
- 实验性 RFC 3161 时间戳、本地锚定
作者一个关键发现:用 LLM judge 时 20 个边界用例有 5 个在重复运行中翻转,而用数值匹配跑 40 道 GSM8K 题 0 个翻转——不稳定来自评分器而非被测模型。
局限也写得清楚:本地工具无法证明别人没私下重跑到出好成绩,requireciclaim 只是声明不是证明,暂无 Rekor/OpenTimestamps 后端。
「编程与Agent」频道最新
- 免费 MCP 把 AI 助手变成懂你棋路的国际象棋教练 — ProfessionalSplit296 · 2026-09-28
- AI Agent 五大安全风险:越自主越要管控,防线怎么搭 — goyalshaliniuk · 2026-09-28
- 开发者吐槽 Google AX 沙盒体验:跑一个任务要凑齐 K8s 全家桶 — aniketmaurya · 2026-09-28
- 独立开发者:200 美元套餐后,Token 不再是瓶颈,而是审核周期和精力 — ezshine · 2026-09-28
- LangWatch 开源团队用自家基准实测多个 Jev 开源替代方案 — _rchaves_ · 2026-09-28
- 开源 Genomics MCP 发布:23 个工具让 AI 代理直接读取基因组数据 — Fair-Rain3366 · 2026-09-28