Agent 评测 SDK 亮相:用真实网站而非 mock 工具测试 agent
Able-Ingenuity8885 · reddit · 2026-09-25
有开发者团队推出一个 agent 评测 SDK,主张在真实网站与真实工作流上测试 agent,而非依赖 mock 工具。做法是给 agent 下达完整任务(例如「找一台 1000 美元以下的笔记本、叠加最优折扣并结账」),SDK 会精确定位 agent 在哪一步成功、卡住或「静默做错事」。MVP 已完成,正在招募若干 agent 开发者免费试用,需私信提交 agent 与关心的工作流。对做 agent eval 的人有一定参考价值,但本质是产品推广帖。
「编程与Agent」频道最新
- 微软 Foundry 给 AI Agent 加上语音,可构建自然对话式体验 — lee_stott · 2026-09-25
- 用 LLM 从 Git diff 挑选需运行的测试,jev-test-impact 开源 — alchemist-301 · 2026-09-25
- 天文学家用 Opus 5.5 花 5 小时做出新手学习工具并上线 — niloofar_mire · 2026-09-25
- 30 年老兵用 ClickHouse 做 GSC MCP:重活放服务端,模型只看结论 — DutchSEOnerd · 2026-09-25
- 微软 Foundry Agent Service 原生语音智能体进入公开预览 — lee_stott · 2026-09-25
- 开发者提出「证据性框架」:给 LLM 每条输出打上溯源标记 — jzesbaugh · 2026-09-25