蚂蚁开源 UI-Venus-2:9B 小模型三端通吃,跨端成绩反超大模型
大模型之路 · wechat · 2026-09-17
蚂蚁 InclusionAI 开源跨端 GUI 智能体 UI-Venus-2,一个 checkpoint 覆盖手机、电脑、网页三端,放出 9B 与 27B 两个版本(Apache-2.0,基于 Qwen3.5-9B 初始化)。
核心成绩
- 9B 版:WebVoyager 90.8%(Kimi-K2.6 为 76.8%)、MobileWorld 50 步成功率 65.8%、OSWorld-Verified 70.8%
- 27B 版:WebVoyager 93.4%、DeskCraft 55.5%、AndroidWorld 84.0%,多项刷新 SOTA
- 统一训练 Grounding 与 CAPTCHA:27B 在五项验证码基准全部 SOTA
技术要点
- 三阶段训练:大规模轨迹中训 → 分场景离线 RL → 多教师在线蒸馏(MOPD),动作感知监督只对影响结果的动作 token 加重
- 两级验证:轨迹级(完成/部分完成/不可行/失败)+ 样本级(每步动作预判),多异构模型投票汇总,避免部分完成被误判为成功
- 同步开源 Venusframeworkmobile(40+ 中文 App,多设备并行)与浏览器插件,配 OSHARM 等安全基准
文章也提醒:榜单为厂商自报未独立复现,关键动作仍建议人工确认。
「编程与Agent」频道最新
- LangGraph 用 Jev 做廉价分类器,为 Agent 流程引入更多控制原语 — hwchase17 · 2026-09-18
- Claude Code 2.1.276 更新明细:距上版不到 6 小时,提示词增 440 token — ClaudeCodeLog · 2026-09-18
- Claude Code 2.1.276 发布:修复代理网关下全部请求 400 的回归 — ClaudeCodeLog · 2026-09-18
- Claude Code 2.1.276 发布:修复代理网关下全部请求 400 的回归 — ClaudeCodeLog · 2026-09-18
- Layers 跑通首个自主闭环:Detail 提修 PR,Devin 审查,Claude 终审 — saranormous · 2026-09-18
- 用 Gradio 把 4B 小模型微调成答案打分器,温度缩放校准置信度 — Gradio · 2026-09-18