浏览器智能体基准测试:diff 记忆让 token 增长降 37%
Desperate_Title1595 · reddit · 2026-07-25
作者把自己的浏览器智能体内存管理器 Rote,和 Browser Use 在真实 WordPress 站点上做了同模型、150 次验证运行的对比。
核心改动
- 不再每一步都重发整页渲染,而是在首次 grounded snapshot 之后只发送 diff。
- 元素 ID 由内容哈希生成(role + name + ancestry),即使页面重渲染或跳转也能保持稳定。
结果
- token 增长速度从 每步 3,437 降到 2,160,减少 37.2%。
- 共发送 849 个 diff,中位数只有 24 字符,而完整快照中位数为 9,270 字符。
- 每次运行大约少用 2.7 倍 输出 token。
代价与限制
- 在短任务(约 9 步)里,Browser Use 仍然约 便宜 15%,因为它的长固定前缀更能吃到 provider cache。
- 大约到 13 步 后,Rote 的成本才反超;在 25 步时约 便宜 16%。
- 一个关键缺点是:这种 eviction 记住的是 agent 做过什么,不是 看见过什么,因此需要记住页面左侧信息的任务会失效,作者还在准备 notes 机制。
作者还补充,Browser Use 默认带历史压缩,而 Rote 目前还没有。
「编程与Agent」频道最新
- Bio 正在做研究 agent,先向科研人员做需求调研 — melnykowycz · 2026-07-25
- Kimi K3 接入 NEO,并在真实 AI 工程任务上胜出 — Nilofer_tweets · 2026-07-25
- 开源 TokenShield 用按轮次哈希拦住 CrewAI 失控重试 — bulleykebaal · 2026-07-25
- 非程序员做石化交易多智能体,学到系统必须模块化 — Sphere_Project · 2026-07-25
- OpenAI 推出企业 agent 产品 Presence,可自动解决 75% 客服问题 — dl_weekly · 2026-07-25
- Hermes 通过持久记忆和技能生成走向自我进化 — Teknium · 2026-07-25