ApprenticeBench 称最强区分度:同级模型实际工作完成率 72% 对 18%
ysu_nlp · x · 2026-09-11
博主 WadeYin9712 引用 ApprenticeBench 发布帖,称该基准可能是目前区分度最强的 agent 评测,显示 Fable 5.1 与 GPT-6 Astra 出现代际跃迁。
- ApprenticeBench 考察「计算机使用 + 在真实岗位上持续学习」:agent 需从历史账单学习公司惯例、适应政策变化、并用公司软件完成工作,追求生态效度
- 关键反差:Fable 5.1 与 Opus 5 在 AA、Terminal-Bench 4.0、CursorBench 4.0 上仅差几分,但在该基准上完成率为 72% vs 36%
- 开源权重模型差距更大:AA 上 53 与 44 分的 Fable 5.1 和 Kimi K3,在这里为 72% 与 18%
- 作者解释:单项挑战上模型差距不明显,但所有挑战叠加时小差距会复利放大为「能否胜任工作」的巨大差异
所属事件:NeoCognition 发布 ApprenticeBench:首个岗位级持续学习基准(10 条相关)→
「漫话AGI」频道最新
- 博主提议新评测维度:看 Agent 敢不敢劝阻坏实验 — VraserX · 2026-09-11
- Reddit 网友发问:为何辩护 AI 的人总在用稻草人论点 — wild_crazy_ideas · 2026-09-11
- 超越 Navier-Stokes:AI 破解数学之后,谁掌控科学发现 — hugobowne · 2026-09-11
- 陶哲轩警告:AI 数学能力与网络攻击能力高度相关,风险非常真实 — sytelus · 2026-09-11
- 学者讽高校 STEM 教育:刻意让学生对 AI 技术一无所知 — RexDouglass · 2026-09-11
- 多个公司逼近 AGI 时,对齐的 AI 会不会先关掉竞争对手的 AI? — Diligent-Buy-5428 · 2026-09-11