一个工具搞定抓取+提取:开发者实战解决 Agent 上下文溢出

OkShirt9372 · reddit · 2026-10-06

作者用 OpenAI Agents SDK + ZenRows 搭建线索挖掘 agent 时踩坑:第一版把「抓取网页」和「提取公司」拆成两个 agent 工具,结果一个目录页抓下来的 Markdown 约 54 万字符,整页塞进模型上下文直接溢出。

解法是把步骤合并进单个工具:

底层四个函数保留可独立测试,大数据留在 Python 侧,单条线索失败可单独重试,一个坏 URL 不再毁掉整个 run。错误处理上,429 返回重试指令、403 则指示 agent 不再重试,agent 按固定流程 discover → qualify → 排序 → 返回。

实测在一个 Clutch 目录页提取 78 家公司,前 10 条打分每条不到 20 秒;打分附带的推理比分数更有用,能指出缺失的证据(如有案例研究但没写客户名)。作者最后抛出讨论:多步 agent 中,模型编排与确定性代码的边界该画在哪?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →