LLM 评测复现工具 EvalSeal:LLM 裁判 20 例中 5 例翻转
Fit_Fortune953 · reddit · 2026-09-18
- 开源工具 EvalSeal(v0.3.0)旨在让 LLM 评测结果可信:对每个用例多次运行、测量翻转率(flip rate)、记录来源信息,并将结果写入防篡改账本。
- 作者实测:用 LLM 作裁判时,20 个边界用例中有 5 个在重复运行时翻转了判定;而在 40 道 GSM8K 数值题上用精确答案匹配,0 个翻转。
- 结论:同一模型家族下,不稳定性来自评判方式(LLM judge)而非被测模型本身,单一评测分数不足为信。
- v1 路线图包含结果签名、套件文件与面向 benchmark 的打分,欢迎评测、CI 门禁与 agent 可靠性方向的反馈。
「编程与Agent」频道最新
- Pydantic AI agent 接入分类模型 Jev,结构化输出按字段返回置信度 — Paimaamu · 2026-09-18
- 演示:GPT-6 Astra 经 MCP 直接在 DaVinci 里剪辑视频 — toolstelegraph · 2026-09-18
- 实测 Jev 一天后:一个快得离谱的分类器,不是 GPT 替代品 — jiayuan_jy · 2026-09-18
- 用同一个 MCP 记忆服务器打通 Claude Code、Codex 和 Cursor — Asly97 · 2026-09-18
- 同时跑 Claude Code、Codex 和 Cursor 三个月:我这样解决了丢上下文问题 — Asly97 · 2026-09-18
- Multica 破 5 万 GitHub 星,携 Qoder 推出云端 Agent 集成 — jiayuan_jy · 2026-09-18