别把原始 HTML 直接喂给 Agent
iamfakhrealam · x · 2026-07-19
这条在讲一个给 agent 用的网页结构化提取思路: - 现在很多“给 agent 一双眼睛”的工具,拿到的却是**原始 HTML、脚本、导航垃圾、cookie banner**。 - 这些内容会直接进入上下文,造成**token 浪费**,而且数据噪音很大。 - 作者主张用结构化 API,把页面变成**干净的 JSON**,这样更适合 RAG 和 agent 工作流。 - 配图用“raw HTML isn't data”来强调:用户真正想要的是字段化结果,而不是一坨网页源码。
所属事件:ZooData 推出面向 AI Agent 的结构化数据层(19 条相关)→
「Infra」频道最新
- Emad Mostaque 认为 Kimi K3 推理成本未来数月可降 10 到 50 倍 — rohanpaul_ai · 2026-07-21
- Emad Mostaque 称 Kimi K3 推理成本未来可降 10 到 50 倍 — rohanpaul_ai · 2026-07-21
- TokenPrint 把 Qwen 推理做成 DevTools 式调试器 — Rich-Fruit-326 · 2026-07-21
- 路由故障让 Claude Code 智能体 3.5 小时烧掉 3020 万 token — RileyRalmuto · 2026-07-21
- 单集群可扩至50万卡,华为Atlas 950 SuperPoD算力架构曝光 — pstAsiatech · 2026-07-21
- 韩国七月前 20 天出口增逾五成,AI 芯片带动 — Polymarket · 2026-07-21