别把 eval 当单元测试:分数每次跑都会变,85% 单看无意义

emeka_boris · x · 2026-10-05

开发者 chiziaruhoma 指出一个常见误区:很多人把 AI 评测(eval)当成单元测试来用。单元测试非过即败,结果确定;而 eval 每次跑出的分数都会波动,因此单独一个「85%」没有意义——关键要说明是多少次运行、哪些 prompt、哪种模型设置下得出的。这条观点提醒做 agent/模型评测的工程师关注评测的统计性质,而非套用传统测试思维。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →