Sai 代理登顶 OSWorld 2.0,成本仅为竞品 2/3
TianbaoX · x · 2026-08-28
Simular 发布的计算机代理 Sai 在 OSWorld 2.0 基准测试中取得了 73% 的成功率,击败了 OpenAI 的 GPT-5.6 Sol (62.57%) 和 Anthropic 的 Opus 5 (70.57%)。该基准包含 108 项复杂任务,每项任务需熟练人类超过 1 小时完成。Sai 的单任务成本仅为竞品的三分之二。其核心优势在于采用神经符号框架,结合神经网络的探索能力与符号代码的逻辑,提升了可靠性并降低了成本。
「编程与Agent」频道最新
- 工程探讨:如何优化 DeepSeek Harness 的上下文压缩策略? — shady101852 · 2026-08-28
- Microsoft Foundry 将 Agent Hosting 设为 .NET 原语 — adnan_hashmi · 2026-08-28
- 开发者征集高难度 Web App 规格,压力测试自主编程 Agent — ZenenoDev · 2026-08-28
- Florence 发布:专供 AI 智能体理解的设计系统 — Scobleizer · 2026-08-28
- 编程 Agent 导致问题堆积,Backlog 变成负担 — rseroter · 2026-08-28
- 时隔一年重用 Cursor,Agent 能力令人印象深刻 — doooyle · 2026-08-28