EvalSeal 开源:LLM 评测可信度回执,20 例边界判定 5 例翻车

Fit_Fortune953 · reddit · 2026-09-21

开发者发布开源工具 EvalSeal v1.5.0,解决 LLM 评测分数变化时无法判断是模型进步、judge 变化、prompt 漂移还是评测本身噪声的问题。

核心功能

关键发现:用 LLM judge 评 20 个边界用例,重复运行中 5 个判定翻转;改用数值答案匹配评 40 个 GSM8K 用例,0 个翻转。同一模型家族下,不稳定性来自评测器而非被测模型。

所属事件:EvalSeal 开源发布,为 LLM 评测提供可信度回执(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →