ApprenticeBench:Agent 真实岗位持续学习已超越人类专家
ysu_nlp · x · 2026-09-12
NeoCognition 发布 ApprenticeBench,把「计算机使用 + 持续学习」放到真实工作岗位上评测,声称这是衡量 AI 就业能力的关键基准。
- 核心结论:Fable 5.1 与 GPT-6 Astra 能在岗位上持续学习并超越人类专业人士,作者称这是 AI 就业能力的「决定性阶跃变化」。
- 关键设计:无需前向部署工程师(No FDEs),Agent 自主把自己部署进工作场景,测试的是从零上手一份真实工作的持续学习闭环。
- 作者 yuxiangwcs 表示,项目过程让他了解到不同前沿模型在 LLM agent 能力上的差异,甚至包括训练方自己都不知道的局限。
所属事件:NeoCognition 发布 ApprenticeBench:岗位级持续学习基准,闭源领先开源(12 条相关)→
「编程与Agent」频道最新
- LangChain 90 秒讲透 Agent Harness:不做模型,就在做 harness — LangChain · 2026-09-12
- Fable 5.1 演示自主入职:agent 从反馈中沉淀可复用技能 — ysu_nlp · 2026-09-12
- 开源桌面应用 Vyact:围绕本地 LLM 打造可审查的工作流 — vyact · 2026-09-12
- Runway 推出 MCP 服务,可直接在 ChatGPT 和 Claude 里生成图像视频 — runwayml · 2026-09-12
- 新版模型下 token 压缩工具还有用吗?RTK 成本实测揭晓 — Bartaseth · 2026-09-12
- Warp 终端 remote-control 搭配 Grok 实测:终端画面直接流式上网页 — Daniel_Farinax · 2026-09-12