Scale AI 联合论文 READY:基准分数相同的企业 Agent,部署成本可能天差地别

rohanpaul_ai · x · 2026-09-05

Scale AI 与加州大学的论文《READY or Not: Reliable Enterprise Agent Deployment》提出,企业选 Agent 不应只看基准准确率,而应按「达到目标可靠度所需人工监督与成本」来排名。

论文指出:现有基准回答的是「Agent 能否完成专业工作」,而企业部署真正要问的是「在可接受的人工监督和成本下,Agent 能否达到所需可靠性」。READY 框架的核心做法:

在覆盖 16 个 Agent 系统、750 个案例的临床审计端到端案例研究中,READY 揭示了自主基准分数无法区分的系统差异——两个 Agent 基准得分几乎相同,所需人工审核量却差别很大。框架已开源为测试床,可在现有 Agent 评测基础设施上运行。

所属事件:Scale AI 提出READY框架:评估Agent需算人类审核成本(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →