LLM 评测跑两次结果不同是回归还是噪声?作者公开判别方法

bgoncalves · x · 2026-09-13

data4sci 发布长线程讨论 LLM 评测的常见痛点:同一 eval 跑两次得到不同分数,多数团队无法判断这是真实回归还是统计噪声。

对做 agent eval 工程的团队是实用素材,线程原文含完整方法论。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →