Agent 评测也做 bootstrap 吗

abcdedcbaa · reddit · 2026-07-19

帖子在问:做 agent 评测时,是否也会像 chatbot eval 一样用高量测试集 + 统计抽样。

作者的做法是先用约 70 个 golden case 评估,再通过 bootstrap / resampling 扩到约 1k+ 作为 sanity check;他想了解大家在 agent 场景里是否也这样做,以及现在常见的 agent eval / observability 标准是否已经转向更关注轨迹级指标,例如工具调用序列、推理过程和最终答案。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →