EvalSeal 开源:LLM 评测可信度回执,20 例边界判定 5 例翻车
Fit_Fortune953 · reddit · 2026-09-21
开发者发布开源工具 EvalSeal v1.5.0,解决 LLM 评测分数变化时无法判断是模型进步、judge 变化、prompt 漂移还是评测本身噪声的问题。
核心功能
- 多次重复运行评测用例,逐例测量不稳定性
- 捕获来源信息,把结果封存进防篡改账本
- evaluator 指纹识别、签名账本头、CI 门禁
- evalseal diff 漂移对比、可附到 PR 的确定性 HTML 回执
- 无需 API key 的可复现示例
关键发现:用 LLM judge 评 20 个边界用例,重复运行中 5 个判定翻转;改用数值答案匹配评 40 个 GSM8K 用例,0 个翻转。同一模型家族下,不稳定性来自评测器而非被测模型。
所属事件:EvalSeal 开源发布,为 LLM 评测提供可信度回执(2 条相关)→
「编程与Agent」频道最新
- Addy Osmani 演示用 claude plugin eval 自动验证插件是否提升回答 — addyosmani · 2026-09-21
- 开发者呼吁:避免 cache miss 或是提升 Claude Code/Codex 用量上限最关键一招 — chaseleantj · 2026-09-21
- 独立开发者开源 AI 工作流平台获 38 处部署,开始操心维护 — Feathered-Beast · 2026-09-21
- AI 客服 agent 该给谁退款?「动作授权层」该放哪里引热议 — witty_queen123 · 2026-09-21
- 两年从零到 3.5 万美元自由职业收入与首个创业项目的复盘 — PratikKadam_ · 2026-09-21
- ai-toolkit 已支持 Qwen-Image-2.1 LoRA 训练,HF 上尚无现成模型 — reeight · 2026-09-21