浏览器智能体基准测试:diff 记忆让 token 增长降 37%
Desperate_Title1595 · reddit · 2026-07-25
作者把自己的浏览器智能体内存管理器 Rote,和 Browser Use 在真实 WordPress 站点上做了同模型、150 次验证运行的对比。
核心改动
- 不再每一步都重发整页渲染,而是在首次 grounded snapshot 之后只发送 diff。
- 元素 ID 由内容哈希生成(role + name + ancestry),即使页面重渲染或跳转也能保持稳定。
结果
- token 增长速度从 每步 3,437 降到 2,160,减少 37.2%。
- 共发送 849 个 diff,中位数只有 24 字符,而完整快照中位数为 9,270 字符。
- 每次运行大约少用 2.7 倍 输出 token。
代价与限制
- 在短任务(约 9 步)里,Browser Use 仍然约 便宜 15%,因为它的长固定前缀更能吃到 provider cache。
- 大约到 13 步 后,Rote 的成本才反超;在 25 步时约 便宜 16%。
- 一个关键缺点是:这种 eviction 记住的是 agent 做过什么,不是 看见过什么,因此需要记住页面左侧信息的任务会失效,作者还在准备 notes 机制。
作者还补充,Browser Use 默认带历史压缩,而 Rote 目前还没有。
「编程与Agent」频道最新
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11