别把原始 HTML 直接喂给 Agent

iamfakhrealam · x · 2026-07-19

这条在讲一个给 agent 用的网页结构化提取思路: - 现在很多“给 agent 一双眼睛”的工具,拿到的却是**原始 HTML、脚本、导航垃圾、cookie banner**。 - 这些内容会直接进入上下文,造成**token 浪费**,而且数据噪音很大。 - 作者主张用结构化 API,把页面变成**干净的 JSON**,这样更适合 RAG 和 agent 工作流。 - 配图用“raw HTML isn't data”来强调:用户真正想要的是字段化结果,而不是一坨网页源码。

所属事件:ZooData 推出面向 AI Agent 的结构化数据层(19 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →