首个端到端基准:在真实工作中评测 AI 的持续学习与长程智能体能力
ysu_nlp · x · 2026-09-11
研究者 Zhihan Liu 发布首个针对计算机使用、持续学习与长程智能体能力的端到端 benchmark,场景设定在一份真实工作中。论文指出通往 AGI 的两大路障——递归自我改进与持续学习——本质同源:AI 不仅要像人一样行动,还要像人一样在快节奏、时间敏感、复杂的世界里自我教学。该基准观察前沿 AI 如何像学徒一样在真实岗位上行动与学习,作者称这将预示 AI 原生世界的未来。
所属事件:NeoCognition 发布 ApprenticeBench:首个岗位级持续学习基准(8 条相关)→
「研究」频道最新
- MSRA 等发布 UniSteer:人类纠错可注入 flow-matching VLA 的强化学习 — jiqizhixin · 2026-09-11
- KAIST 发布 TIDES 数据集:跟踪 12 支学生团队一学期的真实协作对话 — josephseering · 2026-09-11
- 世界模型替代真实执行,加速自动研究智能体后训练 — illinois · 2026-09-11
- 研究者分享 AI 就业「适应能力」论文与 Economist 报道链接 — soumitrashukla9 · 2026-09-11
- RL 训练让模型默认相信世界是模拟的,agent 行为有了新解释 — voooooogel · 2026-09-11
- Humansand 发布:用 AI 模拟人类做 RLHF 的新方向 — gharik · 2026-09-11