同一模型三次修复 harness,浏览器 agent 从答错到答对
Stunning-Sherbet1853 · reddit · 2026-10-05
作者在一张 3090 上用本地 35B 模型(Ornith 1.5)跑 Online-Mind2Web 基准(300 任务/136 真实站点),不改模型只改 harness,把一个答错的 TED 视频检索任务修对了。
三次运行的发现
- Run 1:agent 在搜索框输入 "robots" 逐个翻结果——正确答案是一段标题不含 robot 的四旋翼演讲,搜索路径永远找不到。
- Run 2:加入检查项"是否用了站点自带的排序/筛选",agent 到了主题页但按最新排序、跳过时长筛选;且原评分标准太松,只要用了筛选就算过。
- Run 3:把检查项收紧为"应用了请求所需的全部条件",并把提示从运行末尾移到首次搜索结果处——agent 正确设置"最多观看"排序 + 12-18 分钟筛选,答对,还补充"严格说这是无人机演讲不是机器人"。
核心结论:当容易的路径看起来在正常工作,模型不会离开它;提示词里写一句"优先用筛选"没用,检查项 + 在工具结果中插入 nudge 才有效。
后续 30 个新任务
- 前 15 个(漏给起始站点):排除 5 个反爬拦截后 6/10 通过。
- 后 15 个(按官方设置给定起始站):排除 1 个反爬后 5/14;9 个失败里 6 个是 UI 操作问题(地址自动补全、下拉框、cookie 弹窗、搜索框)。
作者指出研究型任务基本能过,UI 操纵是主要失分点;评分是自建的而非 WebJudge,样本量小不下大结论。作者还提问:大家如何处理这类 UI 元素、如何诱导 agent 用筛选、benchmark 中反爬拦截该如何计分。
「编程与Agent」频道最新
- 用 AI Agent 5 分钟重建个人网站:迁移 83 篇文章,每年省 120 美元 — thisiskp_ · 2026-10-05
- 把「清空收件箱」设为 agent 目标,Anthropic 高管首次实现 Inbox Zero — BorisMPower · 2026-10-05
- 想让 PM 和设计师用 agent 干活?先给他们一个接好线的种子应用 — gethackteam · 2026-10-05
- 社区共识:Hermes 是 agent 界的 Arch Linux,自由但折腾 — thisiskp_ · 2026-10-05
- Claude Code 自建 QA 系统:逐帧审查火柴人打斗动画再渲染 — MrFelliks · 2026-10-05
- Antithesis 将在 SPLASH/ISSTA 2026 讲「时光旅行 Agent 自主测试」 — moarbugs · 2026-10-05