不全喂 HTML:agent 改内链防幻觉的拆解方案
cneuralnetwork · x · 2026-09-21
开发者 @pujasr22 分享了为 SEO 机构 Enfra 做 agent 技术工作的实践:agent 接入客户 WordPress 后执行内容刷新时,更新内链会引入 LLM 幻觉、弄坏图片、插入裸链接。
- 解法思路:不把整篇 post 的完整 HTML 喂给 LLM。
- 具体做法:用 bs4(BeautifulSoup)把 HTML 解析成树结构,第一层过滤只保留 p、li、h2-h6 等文本类标签交给模型处理;img、figure 等其余标签放进另一个桶,所有操作结束后字节级原样保留。
- 效果:LLM 只触碰它该改的文本节点,结构性与媒体内容不被污染,从根上规避了全量 HTML 输入带来的幻觉和破坏。
「编程与Agent」频道最新
- TypeSafe Jev 实测:让 Grok Build 同任务成本降 22-40% — Daniel_Farinax · 2026-09-21
- jev-skill-suggester:用前置技能路由解决 Agent 调错工具问题 — udmrzn · 2026-09-21
- OpenClaw 推出 FaceTime 插件:你的 agent 能主动打电话给你 — steipete · 2026-09-21
- 花 3 天逆向 Instinct 记忆机制:极简设计,60 行代码可复刻 — julianweisser · 2026-09-21
- 实测 3 周日志:40% 编码 Agent 输入是无效开销 — Lucky-Group9525 · 2026-09-21
- Humanizer Academic 更新:一个文件去掉医学论文的 AI 味 — udmrzn · 2026-09-21