LLM 分块抽取边界丢数据,2K 重叠加双去重修复
InsideDebt6345 · reddit · 2026-10-06
作者用 OpenAI Agents SDK 和 ZenRows 做线索抓取 agent,对约 54 万字符的 Clutch 目录页按 4 万字符分块做 LLM 抽取。提示词要求模型跳过「不完整条目」,导致跨块边界的条目在两个块里都被当作部分记录跳过,静默丢数据且总数看起来正常。
修复与经验要点:
- 块间加 2K 字符重叠,保证每个边界条目至少在一个块中完整出现
- 重叠引入重复,去重需两步:URL 归一化后比对(处理 www/尾斜杠差异);无网站时回退用公司名比对,否则空网站字段记录会全部坍缩成一条
- 解包目录站的追踪跳转 URL,页面体积减约 8.6 万字符,并避免模型把追踪链接当公司官网
最终单页抽出 78 家公司、无遗漏;结果数仍会因目录变动和模型分段差异而波动。
「编程与Agent」频道最新
- Matt Pocock 推出 AI Coding Dictionary,统一 AI 编程术语定义 — mattpocockuk · 2026-10-06
- AI 智能体三周吃掉 780GB 磁盘空间 — kevinkern · 2026-10-06
- 谷歌 AIM 论文:给研究 Agent 建"想法地图",提速 3.1 倍逼近最优 — rohanpaul_ai · 2026-10-06
- 跨项目协调 150 个 PR,banteg 分享 agent 工作流用法 — banteg · 2026-10-06
- 律所AI采用仍处初级:多数律师只会一次性提示词 — jkubicki · 2026-10-06
- GPT-2×Codex 造出「眨眼外星人」追踪器,遮挡即认输 — MikePFrank · 2026-10-06