WebBrain:开源本地浏览器 Agent,配 450M 浏览器专用小视觉模型
ButtercupLyn100 · reddit · 2026-09-29
开发者开源了 WebBrain,一个可以让 LLM「看见并操作」浏览器的开源 agent,刻意避免绑定单一云端模型:既支持 LM Studio / Ollama 本地模型,也可用云端 API。
核心亮点是自训的小视觉模型 webbrain-vl-2-450M:基于 LFM-2.5-VL-450M,用浏览器截图/任务微调,让部分浏览器感知在小模型本地完成(可走 WebGPU 在用户机器上运行),而不必每张截图都发给大型多模态模型。
架构大致为:截图 + 浏览器无障碍树做感知(而非纯 DOM 解析)、浏览器专用小 VLM、模型无关的 planner、支持 Chrome/Edge/Firefox/Chromium、可选云端执行、全部开源。作者想探索小本地模型在浏览器 agent 上到底能走多远,并征集大家会选什么模型当 planner。
- Repo: github.com/webbrain-one/webbrain
- 模型与数据集已发布在 Hugging Face
「编程与Agent」频道最新
- LLM 写大项目时「看起来对」如何变成「已验证」?Reddit 热议验收难题 — T_hompson · 2026-09-29
- 视频转写纠错思路:抽音抽帧+ASR+前沿模型结合画面修正 — capetorch · 2026-09-29
- bdsqlsz 近期用 vibe coding 训练 DLSS5 权重,为自研 3D 游戏做准备 — bdsqlsz · 2026-09-29
- 周末做出让 Agent「正确失败」的故障:记忆也可能学到错误教训 — Similar-Split7292 · 2026-09-29
- Jev mode 玩出新花样:让 llama.cpp 直接用图像当提示词做选择 — opUserZero · 2026-09-29
- 用 Codex 控制安卓机抓取小红书爆款数据,Build in Public 或选小红书 — huangyun_122 · 2026-09-29