7 个开源爬虫项目盘点:自适应抓取到 AI 驱动提取一应俱全
JafarNajafov · x · 2026-09-22
作者盘点了 7 个可用于大规模网页数据提取的开源爬虫项目:
- Scrapling:自适应爬虫,网站改版后可自动重新定位元素,支持 JS 渲染、代理轮换、并发抓取、输出干净 Markdown,并提供 MCP server 供 AI agent 调用
- Botasaurus:一体化 Python 框架,集浏览器自动化、缓存、并行处理、代理与反检测于一体,还能把爬虫打包成桌面应用
- Crawlee:面向 JavaScript/TypeScript 的严肃爬取框架,可在快速 HTTP 请求与完整浏览器间切换,处理重试、队列、会话、代理、截图与数据存储
- ScrapeGraphAI:用自然语言描述即可完成抓取的 AI 驱动方案(正文截断)
整体是面向 AI agent 数据获取场景的工具选型参考。
「编程与Agent」频道最新
- 他用 vibe coding 写油猴脚本,修大学系统多年无人理的 UX 问题 — craig_macdonald · 2026-09-22
- 用语音+本地转写模型直接「说」出 shadcn 界面布局 — _AustinCalvert_ · 2026-09-22
- GitHub 千星项目 ai-copywriter:写出吸睛文案并抹掉 AI 痕迹 — tom_doerr · 2026-09-22
- 开源 ContextBridge:让任务自己找算力,打通本地机、API 与共享主机 — IamAngusU · 2026-09-22
- 微软复盘百余个内部 AI 项目:先发工具没用,先改流程才有效 — alex_verem · 2026-09-22
- 开源 signal-mcp:让 Claude 本地访问你的 Signal 聊天记录 — googlarz · 2026-09-22