HF 工程师自述:给 CUA 智能体做互联网任务伪标注的坑
mervenoyann · x · 2026-09-20
Hugging Face 工程师 Merve 分享了业余项目:为在真实互联网上运行的 CUA(computer-using agent)构造伪标注数据集。核心难点:
- 网站 constantly 变化,现有互联网数据集全部过时,必须针对具体问题伪标注,并为任务设计可验证/不可验证的完成判据。
- 反爬是硬门槛:她用 openenv、helium 写了精简的 harness + 环境并跑在 HF sandbox 上,但没能绕过 Cloudflare(认为 browserbase 在这方面做得好)。
- 奖励设计:不可验证部分用大 VLM 打分,可验证部分用 DOM 等结构化信号计算 reward。
她坦言还有不少 know-how 欠缺,但这正是好玩的所在。
「编程与Agent」频道最新
- Scoble:同一 agent 已独立写出整本书的全部内容 — Scobleizer · 2026-09-20
- 「先看你的数据」:开发者吐槽盲目上线新 Agent — chrisalbon · 2026-09-20
- 7 模型×3 编码 Harness 实测:Harness 选择影响成本而非成功率 — CShorten30 · 2026-09-20
- 开源工具 Flywheel:给 AI 结果附可离线复验的证明回执 — MeAndClaudeMakeHeat · 2026-09-20
- 开发者开源 MCP 个人数据脱敏中间件,防隐私进 AI 上下文 — Danielloesoe · 2026-09-20
- 从 TabNine 到今天:早期 LLM 语言补全也能写代码,还要后训练吗 — menhguin · 2026-09-20