Agent 评测也做 bootstrap 吗
abcdedcbaa · reddit · 2026-07-19
帖子在问:做 agent 评测时,是否也会像 chatbot eval 一样用高量测试集 + 统计抽样。
作者的做法是先用约 70 个 golden case 评估,再通过 bootstrap / resampling 扩到约 1k+ 作为 sanity check;他想了解大家在 agent 场景里是否也这样做,以及现在常见的 agent eval / observability 标准是否已经转向更关注轨迹级指标,例如工具调用序列、推理过程和最终答案。
「编程与Agent」频道最新
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11