ApprenticeBench 基准:顶尖人类测试者首试仅 51%,agent 不必满分
hhsun1 · x · 2026-09-16
moyicat 在构建 ApprenticeBench(考察计算机使用 + 持续学习的真实工作基准)时提出一个核心问题:如果最好的人类测试者首试通过率只有 51%,我们为什么认为他们在真实会计团队中的工作接近完美?
答案是制衡机制:真实工作中有多人复核、仪表盘和对账流程兜底,人类从不靠单人拿满分,而是靠团队协作与设计好的机制来对冲认知局限。
由此推论:agent 不需要首试 100% 也能有用——只要能边干边学、响应纠错、嵌入现有制衡体系即可。原帖发布方宣称 Fable 5.1 和 GPT-6 Astra 已能在此基准上持续学习并超越人类专业人士,且无需 FDE、agent 可自行部署上岗。
「编程与Agent」频道最新
- Primitive 融资重建邮件基础设施,让 Agent 拥有自己的邮箱 — Madisonkanna · 2026-09-16
- Slack API 不堪 Agent 用,开发者让 AI 直接用 computer use 滚动找信息 — Yuchenj_UW · 2026-09-16
- 用 WebMCP 给长期运行 Agent 搭共享看板,可视化协作工作流 — prd_008 · 2026-09-16
- Poolday 融资 1100 万美元:Agent 已完成 1 亿次视频剪辑 — kimmonismus · 2026-09-16
- Taste 发布 Brand API:让 AI Agent 输出符合品牌规范 — sarahcat21 · 2026-09-16
- Scale AI 新方法:把长程 Agent 失败根因归因当作持续搜索问题 — ScaleAI · 2026-09-16