开源项目 WaterCrawl:把网页内容抓取并转换为 LLM 就绪数据
tom_doerr · x · 2026-08-27
GitHub 热门项目 WaterCrawl(2k stars,252 forks)是一个用 Python、Django、Scrapy 和 Celery 构建的网页抓取应用,核心定位是把网页内容提取并转换为「LLM 就绪」的数据结构,方便直接喂给大模型。
项目支持 Docker 快速部署:克隆仓库后进入 docker 目录、复制 .env.example 配置、docker compose up -d 即可在 localhost 跑起来;非 localhost 部署时需把 MinIO 配置中的地址改成实际域名或 IP。仓库包含前后端、文档和教程等完整结构。
「编程与Agent」频道最新
- FrontierAgent 开源:支持科研金融任务的本地 Agent 框架 — SimonShaoleiDu · 2026-08-27
- SiteSpeakAI 推出 Google Chat 集成,知识库问答进群聊 — hermanschutte · 2026-08-27
- Apodex 发布 Qwen3.5-MoE 驱动的多模态 Agent 模型 — apodex · 2026-08-27
- RubSE 利用评分标准自进化提升 UI 生成稳定性 — Tianyi Xiong · 2026-08-27
- 跑数周的Sol智能体蜂群自创私有词汇与留言板逻辑 — Sauers_ · 2026-08-27
- Memoria V4.5:4GB 内存实现 82.6% 检索召回 — kitkatz69 · 2026-08-27