三种 LLM 评测指标能抓住生产故障,另外两种会漏掉
Future_AGI · reddit · 2026-07-23
这篇帖子讨论了 LLM 生产环境里真正能提前发现故障的评估指标,并指出了两个常见但容易误导人的指标。
有效的三类指标
- 逐答案的 context adherence:检查生成内容里的每个断言是否都能被检索到的上下文支持,能抓到事实数字错误、知识库变更后的漂移,以及“检索对了但总结错了”的问题。
- 逐步骤的 tool-choice + tool-argument correctness:不是只看最终任务成败,而是看每一步是不是选对工具、参数有没有填对。这样能识别“工具选对了,但参数错了”的隐性失败。
- Judge consistency:用来衡量 LLM-as-judge 是否稳定,观察不同随机种子、pairwise 顺序变化和轻微改写下的分数一致性。作者把它视为“评估评估本身”的元指标。
失效的两类指标
- 聚合 task-success rate:会把长尾失败平均掉,尤其会掩盖重试循环中的问题。
- BLEU / ROUGE / cosine similarity:更像在奖励文本相似度,而不是事实正确性。
作者的建议是:把评估拆成逐答案、逐步骤、重复判分,不要只盯着仪表盘上的聚合数字。
「编程与Agent」频道最新
- 大家如何用 AI 让设计画布持续同步代码改动 — petergyang · 2026-07-23
- Harness Handbook 把 agent 行为映射回源码,显著提升规划准确率 — omarsar0 · 2026-07-23
- Hermes Agent 新增可迁移 Profiles,工作和个人代理彻底分离 — Teknium · 2026-07-23
- AI 编程智能体写码快过人类阅读,重塑开发工作流 — Al_Grigor · 2026-07-23
- Daniel Miessler 认为 AI 工作流会收敛成一个理想状态文档 — daniel_mac8 · 2026-07-23
- 一条转发指向《The Next Token》的 agent 工程工作流节目 — threepointone · 2026-07-23