Agent 上线前怎么测?光评「回答好不好」远远不够

sixeyedhere · reddit · 2026-09-28

一位开发者发帖讨论:传统 LLM 评测只问「回复好不好」,但生产环境的 agent 还要验证数据正确性、工具/API 调用、鉴权与权限规则、实际执行动作、何时转人工等。作者举了放贷 agent 报出 ₹18,400 的例子:数字听起来对,但无法确认是否为后端真实值、客户鉴权是否正确、账户是否取对、语音识别是否误听。作者向社区征集目前的测试手段:人工 QA、自定义评测集、LLM-as-a-judge、工具函数单测、可观测性平台、生产监控等,以及上线后见过的最大故障案例。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →