半数网站屏蔽爬虫,如何自查是否被 AI 训练?
VeryWellVersed · x · 2026-08-03
Common Crawl 发布了旨在帮助网站被 AI 爬虫抓取的指南,但目前已有超 50 万个网站屏蔽了该爬虫,且由于 Cloudflare 等工具的默认拦截,许多站长可能并不清楚自身站点的状态。
作者开发了一个免费检测工具,能够读取 Common Crawl 的归档数据,并在 15 秒内告知用户其网站是否被纳入 AI 训练集。
「Infra」频道最新
- Meta 承诺近 7000 亿美元 AI 算力开支,面临变现与时机困境 — Stratechery · 2026-08-03
- ARPL:让 llama.cpp 在 ARM 芯片上自动识别硬件并优化 — OpeningTough145 · 2026-08-03
- 1300美元预算:二手 RTX 3090 仍是搭建 AI 主机的性价比首选吗? — Z3r0_Code · 2026-08-03
- 实测:Sage Attention 让本地跑 Minimax 模型生成提速超 60% — Glad_Abrocoma_4053 · 2026-08-03
- NVIDIA B300 实物跑分曝光:283GB 显存与 1100W 功耗 — Maximus-CZ · 2026-08-03
- llama.cpp 实用技巧:用 Win 搜索快速启动本地模型 — Addyad · 2026-08-03