港大提出OS-Shepherd:低成本高可靠的CUA奖励模型
hkunlp · hf · 2026-08-07
港大 HKUNLP 团队针对计算机使用智能体(CUA)的评估难题,发布了全新基准 OSReward。
- 背景与痛点:CUA 的轨迹验证高度依赖视觉语言模型(VLM)作为裁判,但现有 VLM 普遍存在系统性宽容偏差,容易将失败运行误判为成功;而可靠的商业模型成本过高,开源模型表现又严重滞后。
- 基准与数据集:团队构建了包含真实轨迹的 OSReward 及高难度挑战集 OSReward-Hard,并发布了包含 10 万条推理标注的轨迹判断语料库 OS-Shepherd-100K。
- 模型与效果:基于该语料训练了开源奖励模型 OS-Shepherd(9B 和 35B),能以比前沿商业模型低 30-60% 的成本提供稳定可靠的奖励信号。
「编程与Agent」频道最新
- 实测Claude Opus结合Unity CLI开发游戏:3D空间理解能力大突破 — chongdashu · 2026-08-07
- MCP是否正沦为新的架构依赖?开发者担忧可移植性 — dancepeop · 2026-08-07
- Agent 调用环境膨胀是实情:精简上下文更省成本 — zainhas · 2026-08-07
- 独立开发者用 VoxCPM 复刻千万粉网红声音,实时对话端到端延迟仅 3 秒 — 面壁智能 · 2026-08-07
- 本地小模型跑 Agent 总翻车?能力边界与选型探讨 — Marblapas · 2026-08-07
- 实测 DeepSeek 智能体循环成本暴降百倍,质量不减 — bindureddy · 2026-08-07