Agent 评测到底测什么?实用指南:从真实失败案例出发写 evals
ialijr · reddit · 2026-09-03
Reddit 长帖指出:大家都知道「要给 agent 写 evals」,但很少有人讲清楚具体测什么。作者给出的实操框架:
- 难点不是框架,而是判断:哪些失败值得变成 eval 用例、哪些应归入普通单元/集成测试、何时用确定性检查 vs LLM 评委、同一用例要重复跑多少次、如何避免只测措辞的无效套件
- 核心思路:不要按功能一个一个写用例,而是从观察到的真实失败出发;机械可验证的部分下沉到更便宜的测试层,只把真正需要模型级判断或轨迹检查的 agent 行为写成 eval
- 起步建议:5-10 个高质量用例的小套件,远胜于凭空设想的大基准
作者还写了一份框架无关的入门指南/skill,适合知道该做 evals 但不知从何下手的人。
「编程与Agent」频道最新
- Fable 5.1 发布未满 24 小时:好评如潮但额度烧得飞快 — JosephJacks_ · 2026-09-03
- 用 Azure Bicep 部署 Foundry 模型路由器 — adnan_hashmi · 2026-09-03
- Code Arena 上线 WebDev Pareto 前沿视图,按性价比排 AI 编码模型 — arena · 2026-09-03
- 30k Star 开源 reverse-skill:让 AI Agent 按规则路由 44 个逆向渗透技能 — alex_verem · 2026-09-03
- Copilot CLI 恢复会话丢失自定义 agent,MCP 服务器与工具白名单失效 — mahirhir · 2026-09-03
- Agentic DevOps 设想:AI agent 自动排查生产事故并决定下一步动作 — Pavan_Belagatti · 2026-09-03