Scale AI 提出READY框架:评估Agent需算人类审核成本

Scale AI 与加州大学联合发表论文,提出面向企业级智能体部署的 READY 评估框架。其核心发现是:两个 agent 在基准测试中得分几乎相同,所需的人类审核量却可能相差巨大。因此论文认为企业选型不应只看基准准确率,而应把人类审核成本纳入评估,否则部署成本可能天差地别。

2026-09-05 ~ 2026-09-05 · 2 条相关