同一模型三次修复 harness,浏览器 agent 从答错到答对

Stunning-Sherbet1853 · reddit · 2026-10-05

作者在一张 3090 上用本地 35B 模型(Ornith 1.5)跑 Online-Mind2Web 基准(300 任务/136 真实站点),不改模型只改 harness,把一个答错的 TED 视频检索任务修对了。

三次运行的发现

核心结论:当容易的路径看起来在正常工作,模型不会离开它;提示词里写一句"优先用筛选"没用,检查项 + 在工具结果中插入 nudge 才有效。

后续 30 个新任务

作者指出研究型任务基本能过,UI 操纵是主要失分点;评分是自建的而非 WebJudge,样本量小不下大结论。作者还提问:大家如何处理这类 UI 元素、如何诱导 agent 用筛选、benchmark 中反爬拦截该如何计分。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →