改个工具返回格式:agent 多文件重命名 pass@1 从 0.67 升到 0.83
RunAI_Coder · reddit · 2026-09-07
一个小型试点实验揭示了 coding agent 的一个反直觉问题:agent 总在忽略 LSP 这类语义工具,而问题往往出在工具返回的格式而非工具本身。
- 在纯代码定位任务中,三个 Claude 模型主动选择 LSP findreferences 的比例仅为 0%、4%、6%,几乎全用 grep
- 关键实验:后端与引用集不变,只给每个 LSP 返回的「文件:行:列」附上 ±2 行源码,多文件重命名任务的 pass@1 从 0.67 升至 0.83,每轮后续文件读取从 15.2 次降到 3.2 次(低于 grep 的 4.3 次)
- 但 LSP 并非全面占优:「找出所有调用者」任务模型约半数会主动选它;噪声大的仓库(hono)上 F1 +0.246 且省 12% token,干净仓库(remeda)上无增益且多花 16% token;重命名涉及的 docstring/配置字符串本就在 findreferences 排除范围,grep 仍有位置
- 配套案例(HN/Spotify):先用 CLAUDE.md 规则建议 Claude Code 把大文件读取路由到小模型,发现「只是建议、不强制」,最终改为 PreToolUse hook 直接拦截 350 行以上文件的 Read 并指向替代方案——「即使 Claude 不读技能描述,hook 也能拦住昂贵读取」
核心启示:工具输出应直接返回答案所需上下文而非裸地址;强制模型选对工具比写规则更可靠。
「编程与Agent」频道最新
- CubeSandbox v0.7.0 支持沙箱状态跨节点暂停与恢复 — HeyAmit_ · 2026-09-07
- 用户仅一段提示词让 GPT-6 Astra 经 Blender MCP 生成斗兽场 8 视角 3D 视频 — Scobleizer · 2026-09-07
- 开源项目 awesome-ai-apps 收录 132 个 AI 应用示例与教程 — Arindam_1729 · 2026-09-07
- 88%~95% Agent 试点难落地:真正杀手是不确定性与静默失败 — ankitsharma112 · 2026-09-07
- 开源项目 Graft 用 Markdown 文件解决 Agent 失忆,称超越 Claude Code — thisdudelikesAI · 2026-09-07
- 独立开发者分享 agent 新工作流:先让 AI 实现功能,再推倒从零重写 — remilouf · 2026-09-07