抛弃视觉盲读,新框架让 Agent 成本降 9 倍
_akhaliq · x · 2026-07-28
当前计算机使用智能体普遍依赖视觉模型读取屏幕像素,而 StateAct 提出了一种反向思路:将程序状态(如文件、后端和 DOM)作为核心交互接口,仅在极少数(约 1.1%)真正需要视觉判断的步骤中才调用 GUI 专家模型。
这种“少看屏幕”的方法在 OSWorld 2.0 基准测试中创造了新的 SOTA。在相同的 Claude Opus 4.8 环境下,该方法不仅将任务成功率从 20.6% 提升至 26.9%,还大幅压缩了 Token 消耗(从 22.4 万降至 10 万),使单任务成本从约 72 美元骤降至 7.8 美元。
此外,该框架具备通用性,不仅限于 Claude,换用内部自研的 31B 参数模型 SFR-CUA 也能在多项基准测试中取得显著跨越。
「编程与Agent」频道最新
- Vibe coding 先像玩具,后来却能做出真实应用 — alexmacgregor__ · 2026-07-28
- 把《孙子兵法》做成 AI 决策 Skill 并开源 — yangyi · 2026-07-28
- Hugging Face 开源实时语音到语音对话管线 — anselm · 2026-07-28
- AI 代理代你用非商用软件,责任算谁的 — gabepgomes · 2026-07-28
- 作者称语音或将取代键盘,成为管理 agents 的主界面 — noahsolomon · 2026-07-28
- 有用户称:定制脚本往往比等 MCP 变好更有效 — DavidWells · 2026-07-28