没有用户怎么测 AI Agent?用模型生成真实查询先建 eval 集
hugobowne · x · 2026-09-24
Hugo Bowne 给出 AI agent 冷启动评测的实操方法:
- 问题:agent 还没上线,没有真实对话数据,怎么找到它的失败点?
- 起点:先明确谁会用、他们想完成什么、处于什么场景,把这份上下文喂给模型,让它批量生成可能的问题(query),再人工筛选——这些问题像不像真人问的?是否覆盖 agent 要处理的核心任务?
- 复用已有积累:客服团队长期回答的问题、帮新员工入职的人掌握的常见问题,都是现成的真实样例来源。
- 落地:把这些问题跑一遍原型,逐条记录通过/失败及原因,形成初始 eval 集;此后每次改 prompt 或换工具都能回归测试。
「编程与Agent」频道最新
- 让 Copilot CLI 与 Grok Build 开会共识,跨框架审阅新玩法 — DanWahlin · 2026-09-24
- Robinhood 已推 MCP 与托管智能体账户,Schwab 两项皆无 — MartinGTobias · 2026-09-24
- OpenRSI 招募贡献者:用你的研究出题考核前沿 Agent — ChengleiSi · 2026-09-24
- 用户实测:OpenAI Neon 连接器语音可用但项目操作失败 — koltregaskes · 2026-09-24
- 实测 105 个隐藏 bug:作者称其 code-review skill 可显著提升模型成绩 — PawelHuryn · 2026-09-24
- 仅 30 条标注:GEPA 提示词优化让线索打分准确率提升 43%、成本降 5 倍 — CShorten30 · 2026-09-24