31B 开源 Gemma 网页 Agent 得分 74.6%,超越 Gemini 3 Flash
dair_ai · x · 2026-10-08
Salesforce AI Research 的新论文(CLIFT)显示,一个 31B 的开源 Gemma 网页 Agent 在 9 应用的 WebArena Infinity 集上拿到 74.6%,超过使用 browser use 的 Gemini 3 Flash 的 70.1%,且全程无需在每一步调用前沿模型做裁判。
方法要点:
- 让 Agent 自己回答关于其 rollout 的验证问题(CLIFT);
- 一个 conformal certifier 只保留与训练期裁判一致的验证问题,按可信度加权,并入每步奖励;
- 测试时用同一套冻结问题库在 greedy rollout 和少量重试之间选择,不依赖外部裁判。
结果:Agent 比基座模型提升 12.8 分,在 9 个应用中赢下 7 个;问题库还能在测试时迁移到 GPT-5.5(VisualWebArena),翻译后的问题库无需任何训练即可提升 live-web Agent 在 Online Mind2Web 上的表现。
「模型」频道最新
- 曝 OpenAI 黎曼猜想论文有瑕疵,Astra 核查指其未形式化证明有误 — ctjlewis · 2026-10-08
- repligate 观察:一年前 LLM 开始强烈偏爱 they 而非 it — repligate · 2026-10-08
- GLM 5.3 Flash 接 USB 搞硬件逆向:本地跑 55 tok/s、1M 上下文 — glenbeer · 2026-10-08
- 乘法零加速,只把评测榜单刷爆:AI 圈调侃刷榜乱象 — ChrisGPT · 2026-10-08
- 圈内共识:AI 模型目前还不擅长生物领域 — nlarusstone · 2026-10-08
- 双卡 192GB 玩家跑通 456GB 版 DeepSeek v4.1,SSD 分担专家权重 — HankYeomans · 2026-10-08