用分页陷阱给 Agent 技能做回归测试:防止假完整答案
Bhaskar_roy · reddit · 2026-09-17
作者指出一个隐蔽的 agent 失败模式:MCP 搜索返回的第一页结果合法且总结流畅,但「找出全部」的问题实际需要翻页,agent 却停止并声称完成。
建议用 Reef 基础设施构建测试夹具:
- 已知应返回的全部记录且需要翻页;评估器检查 agent 实际取回了什么、最终主张是否有依据。
- 套件还应包含单页场景,以及超出预算的大结果——后者应奖励诚实的部分结果,而非让 agent 谎称完整或无限调用。
收益在于反馈比「答案不好」更具体:比如 agent 停止时还有记录未取、或未建立依据就宣称完整,为后续 skill 修订提供了可对照的失败用例。
「编程与Agent」频道最新
- 开发者用 LLM 对话式做出完整多人游戏 Tideball,回击「AI 做不出成品游戏」 — TAbrodi · 2026-09-17
- 多模态 RAG 被严重低估:别把音频视频先转成文本再检索 — victorialslocum · 2026-09-17
- Stripe Directory 实测:商家攻略让 Agent 购物成功率 20/28 升至 24/28 — jeff_weinstein · 2026-09-17
- 开发者分享 3D 浏览器游戏 vibe coding 全流程:几小时出成品 — chongdashu · 2026-09-17
- Mac MCP 2.1.4 发布:公网端点、SSRF 加固与事务撤销 — bulutarkan · 2026-09-17
- AI 电影制作的难点已不是画质,而是跨集连续性 — Ok_Low_5536 · 2026-09-17