一个工具搞定抓取+提取:开发者实战解决 Agent 上下文溢出
OkShirt9372 · reddit · 2026-10-06
作者用 OpenAI Agents SDK + ZenRows 搭建线索挖掘 agent 时踩坑:第一版把「抓取网页」和「提取公司」拆成两个 agent 工具,结果一个目录页抓下来的 Markdown 约 54 万字符,整页塞进模型上下文直接溢出。
解法是把步骤合并进单个工具:
- discoverleads = 抓页 → 提取公司 → 返回紧凑的 Lead 记录,模型只看记录不看全文
- qualifylead = 单条线索补全 → 打分 → 返回推理,同样避免把大段网站摘要交给模型
底层四个函数保留可独立测试,大数据留在 Python 侧,单条线索失败可单独重试,一个坏 URL 不再毁掉整个 run。错误处理上,429 返回重试指令、403 则指示 agent 不再重试,agent 按固定流程 discover → qualify → 排序 → 返回。
实测在一个 Clutch 目录页提取 78 家公司,前 10 条打分每条不到 20 秒;打分附带的推理比分数更有用,能指出缺失的证据(如有案例研究但没写客户名)。作者最后抛出讨论:多步 agent 中,模型编排与确定性代码的边界该画在哪?
「编程与Agent」频道最新
- 一个标签页刷新 Bug 让服务器 CPU 打满四天,根因是请求量随标签页数平方增长 — Ok_Negotiation_2587 · 2026-10-06
- loop-engineering:8 种无人值守 Agent 循环模式,让 AI 整夜跑你的仓库 — JafarNajafov · 2026-10-06
- 用 Claude Projects 存设计样例,生成公司风格 PPT 几乎不用改 — NirantK · 2026-10-06
- Pi Durable:面向长时运行 Agent 的实验性执行框架 — asankhs · 2026-10-06
- JojoScript:专为 LLM 编写而设计的开源数据管道脚本语言 — panagos_stathis · 2026-10-06
- 开发者直言 MCP、Harness、Skills 都是伪需求,注定如 prompt engineering 般过时 — shlomifruchter · 2026-10-06