EvalSeal 开源:LLM 评测可信度回执,20 例边界判定 5 例翻车
Fit_Fortune953 · reddit · 2026-09-21
开发者发布开源工具 EvalSeal v1.5.0,解决 LLM 评测分数变化时无法判断是模型进步、judge 变化、prompt 漂移还是评测本身噪声的问题。
核心功能
- 多次重复运行评测用例,逐例测量不稳定性
- 捕获来源信息,把结果封存进防篡改账本
- evaluator 指纹识别、签名账本头、CI 门禁
- evalseal diff 漂移对比、可附到 PR 的确定性 HTML 回执
- 无需 API key 的可复现示例
关键发现:用 LLM judge 评 20 个边界用例,重复运行中 5 个判定翻转;改用数值答案匹配评 40 个 GSM8K 用例,0 个翻转。同一模型家族下,不稳定性来自评测器而非被测模型。
所属事件:EvalSeal 开源发布,为 LLM 评测提供可信度回执(2 条相关)→
「编程与Agent」频道最新
- 开源 hearim:无需专用模型,把普通本地 LLM 变成 Jev 决策 API — ziozzang0 · 2026-09-21
- 腾讯开源 T-Mem 记忆架构:写入时预判未来用途,关联回忆强 28pp — aigclink · 2026-09-21
- 两度冲击百万美元生意的开发者发布「AI 员工」平台 — marclou · 2026-09-21
- Jev 评估器实测:比 LLM 评委快且便宜数个量级,或解 RL 验证瓶颈 — NandoDF · 2026-09-21
- LLM 网关自动故障转移前必须测过的 7 类失败场景清单 — Rama_Surasani_ · 2026-09-21
- HarnessRouter 开源:一个 API 统一调度 Codex、Claude Code 等多款 Agent Harness — gaganghotra_ · 2026-09-21