抛弃视觉盲读,新框架让 Agent 成本降 9 倍

_akhaliq · x · 2026-07-28

当前计算机使用智能体普遍依赖视觉模型读取屏幕像素,而 StateAct 提出了一种反向思路:将程序状态(如文件、后端和 DOM)作为核心交互接口,仅在极少数(约 1.1%)真正需要视觉判断的步骤中才调用 GUI 专家模型。

这种“少看屏幕”的方法在 OSWorld 2.0 基准测试中创造了新的 SOTA。在相同的 Claude Opus 4.8 环境下,该方法不仅将任务成功率从 20.6% 提升至 26.9%,还大幅压缩了 Token 消耗(从 22.4 万降至 10 万),使单任务成本从约 72 美元骤降至 7.8 美元。

此外,该框架具备通用性,不仅限于 Claude,换用内部自研的 31B 参数模型 SFR-CUA 也能在多项基准测试中取得显著跨越。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →