如何评测爬虫型 Agent 的召回率?发起者探讨无金标准难题
Spirited-Cheek8436 · reddit · 2026-09-13
作者正在运营一个「公司情报研究」Agent 挑战赛:每个 Agent 需找到目标公司的人员、地点、职位、财务结果等公开信息并为每条事实给出来源。难点在于如何评估召回率——如果用自己的爬虫做对比基准,就受限于自家爬虫的覆盖面。他考虑的方案是:汇总所有参赛提交与自有爬虫发现的事实,验证去重后作为共享真值集打分,单家 Agent 独有的发现也计入。明显的漏洞是所有 Agent 可能同时漏掉同一事实;他考虑对随机样本公司做人工研究来估计这个缺口,但不确定样本量是否足够,向社区征求类似评测经验。
「编程与Agent」频道最新
- 实招:用 agents.md 锁定代码区域,防止 AI Agent 乱改 — cyrus_zei · 2026-09-13
- 开源工具 thesys-core:在 100+ 页 PDF 上高亮 AI 答案出处 — Flat-Phone-1596 · 2026-09-13
- 开发者用 Opus 5 为游戏预埋分屏多人模式,bug 仍不少 — gandamu_ml · 2026-09-13
- 开源 freecad-mcp 让 Claude Desktop 直接操控 FreeCAD 建模与有限元分析 — tom_doerr · 2026-09-13
- 标注 8 万余条数据微调 Qwen 3.8,写作品质盲测提升 86% — Scobleizer · 2026-09-13
- 实践者吐槽:用 API/MCP 串联健康数据容易打结,改用 Whoop 当真源 — gethackteam · 2026-09-13