READY or Not: Reliable Enterprise Agent Deployment
Veronica Chatrath, Bryan Zhu, Jingxuan Fan, George Pu, Soham Dinesh Tiwari, Soham Dan, Ryan Young, Yuan, Li, Yuang Yao, Apaar Shanker, Minglai Yang, Daniel Yue Zhang, Yunzhong He, Ying Liu, Chenguang Wang, Zhijun Yin, Yuan Xue
Christy
cs.AI
2026-09-02
Scale AI提出READY,把企业Agent部署做成可靠度达标认证。750例临床审计上,准确率只差0.3点的两套系统达76%可靠度时,审查率分别为29.6%与39.2%。
企业要把 Agent 接到真实工作流上,真正卡住上线的不是榜上那一列准确率。80 分只说明它独自干对了八成。剩下两成会不会被拦下来、拦下来要花多少人工,才决定这套系统能不能按给定可靠度运行。
现有专业工作基准主要测自主完成质量。Agents' Last Exam、GDPval、τ-bench 问的是工作产品好不好、重复尝试稳不稳。级联和 routing 优化的是模型之间怎么分活;选择性预测和 learning-to-defer 研究何时弃权、何时交给人。缺的是同一套手续:给定可靠度门槛,选最小人工成本的介入策略,再在留出集上做统计达标。
Scale AI 的 READY(Reliable Enterprise Agent Deployment)把部署写成约束优化。候选策略里选出满足目标可靠度 Y、运行成本最低的那条,冻结后再到留出样本上认证。产出是一份 deployment profile:可靠度、审查负担、成本,以及这份结论成立的前提。
工作流自己定义什么叫干成,对错、流程、证据、合规都可以写进成功谓词。READY 只提供统一的达标手续,分三步:跑任务拿轨迹,在开发集上选最低成本策略,冻结后在留出集上认证。
跑通的例子是 CliniCARE-Bench 的回顾性临床审计。Agent 拿到纵向病历和一条审计问题,例如 ICU 患者 CT 后 48 小时内有没有急性肾损伤,必须检索证据、套 KDIGO 肌酐标准,给出 Yes / No / 证据不足 / 医学上两可,并报置信度。正确的「不确定」也算成功,不等于必须升级给人。
策略类是事后的 accept-or-escalate:置信度 ≥ τ 就放行,否则给人审。路由发生在 Agent 干完之后,同一批轨迹可以回放很多条阈值,不用重跑。成本近似成模型费用加上审查率乘人工单价;常数成本下,最小化成本就是最小化审查率。
人审成功率 ah 在这篇里是部署假设,主分析取 0.90。系统可靠度是自主成功与人审成功的凸组合,所以超不过 ah。策略在开发集上按 Y+δ 选,δ 固定 0.05,避免点估计刚过线、留出下限过不去。认证看单侧 95% 下限,接受部分用 Clopper–Pearson;点估计过线不够。
16 套系统、750 例(开发 / 留出各 375),共 12,000 次运行。四分类标签不均衡:Yes 46.9%、No 33.1%、缺数据 16.4%、医学两可 3.6%。
自主准确率 a0 和置信度排序能力 AUROC 几乎不相关(Pearson ρ = -0.12)。Qwen-3.7-Plus 准确率只有 66.4%,AUROC 却最高,0.711。AURC 则和准确率绑得很紧(ρ = -0.80)。Gemini 系列最高可对 73% 的病例报 100% 自信,能选的工作点很少;Gemini-3.1-Pro 只有 5 档置信度。
在 Y = 0.76、ah = 0.90 的留出认证上:
| 系统 | 自主准确率 | 审查率 | 可靠度点估计 | 95% 下限 | 是否达标 |
| GPT-5.5 | 75.7% | 21.3% | 0.843 | 0.811 | 是 |
| Opus 5 | 75.7% | 22.4% | 0.839 | 0.807 | 是 |
| Sonnet 5 | 72.5% | 29.6% | 0.856 | 0.826 | 是 |
| GPT-5.4 | 72.8% | 39.2% | 0.828 | 0.797 | 是 |
| GLM-5.2 | 75.7% | 10.9% | 0.762 | 0.725 | 否 |
| Gemini-3.1-Pro | 70.9% | 100% | 0.900 | 0.900 | 仅全人工 |
GPT-5.4 和 Sonnet 5 自主准确率只差 0.3 点,达标审查率差 9.6 个百分点,后者大约少审三分之一。AUROC 分别是 0.601 和 0.681。
GLM-5.2 自主准确率并列最高、审查率最低,点估计 0.762 刚过线,但约 89% 的可靠度压在被测量的自主部分上,区间最宽,下限 0.725 没过 0.76。把 ah 调到 1 也救不了它。要达标得把 δ 提到至少 0.075,审查率会升到 32.0%。
Gemini-3.1-Pro 只能靠 100% 人审「达标」,可靠度刚好等于 ah,等于没部署。
不加 δ,前沿扫描里只有 46% 的策略能过留出下限;加上 δ 是 95%。Qwen 和 MiniMax 开发集准确率同为 66.4%,Qwen 信号更好,但最近可达阈值冲到可靠度 0.874,审查率 61.9%,MiniMax 只要 33.9%。单点审查率会被离散阈值网格带歪,跨系统比较要看整条可靠度与审查负担前沿。
对企业采购和上线决策,这把「谁分高」换成「同样可靠度下谁更省人」。置信度校准差的系统,即使任务分接近,也会被迫多审。开发者该盯的还有路由信号的分辨率和排序质量,单看准确率不够。
READY 不替代现有基准,是吃掉它们产出的轨迹再做一层认证。参考实现跑在 Inspect AI 上,工作流定义、执行、评分、达标分开。终端策略可以回放;执行中介入则要 policy-in-the-loop。
这是评价问题的平移,不是新的 Agent 架构。渐进,但把部署决策从排行榜感觉改成可审计的统计声明。
实验只覆盖事后 accept-or-escalate。执行中改轨迹的审查、纠正、接管没有大规模实证。人审成功率、时延、成本是假设不是测出来的,主结论全部条件于 ah = 0.90。作者给了盈亏平衡 ahmin,但人审本身会不会审对,这篇没有数据。
达标只对当前病例总体和当前配置成立。分布漂移、工具变了、模型改了都要重新认证。Y = 0.76 和 δ = 0.05 是研究设定,不是临床规范。审查率是阈值网格上的阶跃函数,单点对比噪声大。人机组合的元分析还显示,平均成绩打不过两者中更强的那个,READY 把 ah 当外生参数,可能偏乐观。