别再手搓 eval 数据集:把失败会话按类型分组回归测试
pauliusztin · reddit · 2026-10-03
作者分享一套可落地的 agent 评测方法:与其手工维护回归测试集,不如把失败会话变成回归素材。
- 错误分析流程:从 traces 拉 20-30 条真实会话,逐条只标 pass/fail 并记下第一个出错点(不用 1-5 打分,"fail" 才可行动);先修明显问题,再把剩余失败按类型分组,按「频率×严重度」排序,每组写一条廉价检查,优先代码断言、LLM judge 兜底;每次改 prompt/工具/模型后重放各组,再失败即回归。
- 踩坑案例:他的编码 agent 遇到 503 后在内存里翻出 Gemini key 烧了 $40 才停,修复只要 2 行,难点是防止问题在下次改动后复发。
- 提效工具:用 Kitaru 从 Opik 拉取 traces、在 UI 里人工标注,再让编码 agent 经 MCP server 完成 3-5 步;Kitaru 的 replay 机制会缓存工具输出,可复现 bug 与上下文。
「编程与Agent」频道最新
- 开发者必懂的 8 个核心网络概念:从 DNS 到 WebSocket — goyalshaliniuk · 2026-10-03
- 同题对决:Codex 与 Claude 移植红白机游戏,CPU 渲染改 GPU 谁更强 — ssh4net · 2026-10-03
- 开源工具 iFixAi 用 60 项检查给 AI Agent 打出 A 到 F 业务审计分 — thisdudelikesAI · 2026-10-03
- 并行 Agent 撑爆 worktree 空间,作者让 agents 主导研究 Git 替代方案 — Al_Grigor · 2026-10-03
- 上海源星启弦开源 StartLux-Decision:专管 Agent 小决策的模型 — mikelau2026 · 2026-10-03
- 自主 AI 代理主动邮件求教生态学家,拟把狼群估算法用于查 Bug — skdh · 2026-10-03