别把 eval 当单元测试:分数每次跑都会变,85% 单看无意义
emeka_boris · x · 2026-10-05
开发者 chiziaruhoma 指出一个常见误区:很多人把 AI 评测(eval)当成单元测试来用。单元测试非过即败,结果确定;而 eval 每次跑出的分数都会波动,因此单独一个「85%」没有意义——关键要说明是多少次运行、哪些 prompt、哪种模型设置下得出的。这条观点提醒做 agent/模型评测的工程师关注评测的统计性质,而非套用传统测试思维。
「编程与Agent」频道最新
- 开发者自建 Followon MCP:让 Agent 自己记住 PR 里的待办 — TheWebUiGuy · 2026-10-05
- 给 MCP 工具调用加许可层:同键重试返回原回执不重复扣费 — HotPocketWaves · 2026-10-05
- llama.cpp 新 Metal 内核合并,Mac 投机解码提速 3.4 倍至 110 tok/s — ggerganov · 2026-10-05
- Alter Zero:Rust 编写的开源终端 Agent 框架,主打省内存 — linuztxx · 2026-10-05
- 开源项目 Familiar 把 Claude「装进」VRChat 纸蛾化身 — repligate · 2026-10-05
- 给 Agent 完整部署日志权限,生产部署耗时直降 30% — DanielLockyer · 2026-10-05