实测 120 次:无指令时编码 agent 0 次完成 MCP 工作流
colinmcnamara · x · 2026-10-06
Jeff Linwood 在 Austin AI MUG 分享了用 Harbor 框架做的编码 agent 指令对照实验,核心发现:指令对 MCP 工具使用是决定性的。
实验设计:
- 5 个任务 fixture × 2 个 agent(Claude Code/Codex)× 2 档模型 × 3 种指令条件 × 2 次重复 = 120 次沙盒运行
- 用隐藏 pytest 测编码成功率,用 Zebric 审计日志/最终数据库状态验证任务工作流
结果:
- 编码测试 120/120 全部通过
- 无指令:40 次运行 0 次完成任务工作流(agent 不去任务板取任务)
- 简短指令(先列任务→标记 inprogress→完成标 done):20/40 完成
结论:agent 不是不会用工具,而是不知道该用;把任务跟踪器工具描述写进仓库指令文件是让 agent 真正执行工作流的关键。
「编程与Agent」频道最新
- 他用 5 个 Grok Agent 花 3 天预生成整本 AI 英文阅读词典 — sujingshen · 2026-10-06
- 学生用 Gemma 打造本地优先日程规划 agent dAIly — damnGruz · 2026-10-06
- 所谓 harness 不过是重组输入输出,一切皆是 prompt — shakoistsLog · 2026-10-06
- 用 Claude Code 三条 prompt 一小时做出域名查询工具,只因「我想让它存在」 — TheMoonMidas · 2026-10-06
- Sai 登顶 OSWorld 2.0,单任务成本 $14.34 低于 Claude — nikola_mr64990 · 2026-10-06
- Agent 服务商难题:如何算清每个客户到底烧了多少 API 钱 — Informal-Cricket2470 · 2026-10-06