Browserbase 实测:让浏览器 Agent 写代码,比纯像素点击更靠谱
adnan_hashmi · x · 2026-09-10
Browserbase 工程团队复盘了自 OpenAI 2025 年 1 月发布 Operator 以来的计算机使用模型(CUA)实践,并提出关键改进思路:让 Agent 写代码来操作浏览器,而不是只靠视觉坐标点击。
- CUA 模型的痛点:模型在特定分辨率/视口(如 1280p)上训练,改变视口就会"致盲"导致误点;纯视觉方案只能操作截图里可见的元素,现代网页大量组件无法靠截图触达。
- Browserbase 的结论:放手让模型做擅长的事——写代码,浏览器操作在所有领域表现都更好。
- 团队还回顾了自家 Astra 架构、开源实现历史,并称曾协助 Anthropic 和 Google DeepMind 训练与评估其 Sonnet/Opus、Gemini 2.5 Pro 的计算机使用能力。
「编程与Agent」频道最新
- Notion CEO:智能可租,上下文须自有 — ivanhzhao · 2026-09-10
- 开发者实测 Codex 语音模式学数学:好用但 bug 不少 — SIGKITTEN · 2026-09-10
- 量子传感器团队用 GPT-5.6 Pro 做伽罗瓦逆问题研究,IGP24 排名第 14 — paulfinneyx · 2026-09-10
- 开发者在浏览器里复刻 MacBook 折叠动画,效果惊艳 — jh3yy · 2026-09-10
- AI gateway 能否替代 MCP gateway?生产环境边界之争 — Purple_Morning_8735 · 2026-09-10
- LangChain 深度文章:让 Agent 写代码操控浏览器全面超越坐标点击 — hwchase17 · 2026-09-10