ApprenticeBench 基准:顶尖人类测试者首试仅 51%,agent 不必满分

hhsun1 · x · 2026-09-16

moyicat 在构建 ApprenticeBench(考察计算机使用 + 持续学习的真实工作基准)时提出一个核心问题:如果最好的人类测试者首试通过率只有 51%,我们为什么认为他们在真实会计团队中的工作接近完美?

答案是制衡机制:真实工作中有多人复核、仪表盘和对账流程兜底,人类从不靠单人拿满分,而是靠团队协作与设计好的机制来对冲认知局限。

由此推论:agent 不需要首试 100% 也能有用——只要能边干边学、响应纠错、嵌入现有制衡体系即可。原帖发布方宣称 Fable 5.1 和 GPT-6 Astra 已能在此基准上持续学习并超越人类专业人士,且无需 FDE、agent 可自行部署上岗。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →