Agent 上线前怎么测?光评「回答好不好」远远不够
sixeyedhere · reddit · 2026-09-28
一位开发者发帖讨论:传统 LLM 评测只问「回复好不好」,但生产环境的 agent 还要验证数据正确性、工具/API 调用、鉴权与权限规则、实际执行动作、何时转人工等。作者举了放贷 agent 报出 ₹18,400 的例子:数字听起来对,但无法确认是否为后端真实值、客户鉴权是否正确、账户是否取对、语音识别是否误听。作者向社区征集目前的测试手段:人工 QA、自定义评测集、LLM-as-a-judge、工具函数单测、可观测性平台、生产监控等,以及上线后见过的最大故障案例。
「编程与Agent」频道最新
- 数百万页井数据 OCR 后交给 agent 检索,勘探省下 40 小时 — oilmutt · 2026-09-28
- Muse 被称「最易魔改的 AI OS」:连 Docker 造工具还能拍电影 — NathanWilbanks_ · 2026-09-28
- 开源 macOS 小工具:一键切换浏览器,隔离 AI Agent 测试会话 — sormagec · 2026-09-28
- Google Antigravity 原生支持 agent 间消息与用户私聊 agent — rseroter · 2026-09-28
- 数据可视化从业者:用 AI 后反而转向更底层的绘图语言 — randal_olson · 2026-09-28
- Cloudflare 生日周发布汇总:Rust 支持、Agent 浏览器与 Rust 工具链提速 — ritakozlov · 2026-09-28