ApprenticeBench:测 agent 能否像新员工一样在岗位中成长并超越人类
hhsun1 · x · 2026-09-11
ApprenticeBench 发布:让 agent 真正“上班”的基准
- 现有基准大多考察模型在考试式环境中解题,ApprenticeBench 提出更接近职场考核的问题:agent 能否进入一个真实工作场景,从历史记录与反馈中学习,并随时间积累岗位专长。
- 基准结合 computer use 与持续学习(continual learning),且不设 FDE(前向部署工程师)——agent 自行部署进入岗位。
- 作者声称 Fable 5.1 与 GPT-6 Astra 已能在岗位上持续学习并超越人类专业人士,称这是 AI 岗位胜任力的决定性跃迁。
所属事件:NeoCognition 发布 ApprenticeBench:首个岗位级持续学习基准(8 条相关)→
「模型」频道最新
- 编程 Pareto 前沿仅剩 Muse Spark 1.3 与 Fable 5.1 — jyangballin · 2026-09-11
- Muse Spark 1.3 在全新 CursorBench 4.0 上表现亮眼 — jyangballin · 2026-09-11
- 用户吐槽 Anthropic 过度拦截:古籍与递归 AI 查询也被挡 — NickPassig · 2026-09-11
- Codex 做网络安全工作需切换 Daybreak 模型,否则会被安全护栏拦截 — HankYeomans · 2026-09-11
- 传 DeepSeek 新模型霸榜开源:比 GLM、Kimi 便宜 4-10 倍,Codeforces 第六 — anselm · 2026-09-11
- GPT-6 Astra 从视频看懂并重建 Cessna 起落架机械结构 — FinanceYF5 · 2026-09-11