清华新基准:超半数 AI 智能体未能改进训练算法

alex_verem · x · 2026-08-23

清华大学与 MosaicML 研究人员发布了 AI4AI-Bench 基准,用于测试 AI 智能体重新设计训练算法以实现递归自我改进(RSI)的能力。该基准包含 10 个真实研究仓库,允许智能体在 4 小时内重写训练代码,随后通过 12 小时的重新训练评分。测试结果显示,6 个前沿系统在 29 种配置下的平均得分仅为 0.166(基准线 0.1,满分 1.0),超过一半的智能体甚至未能修改代码。

所属事件:AI4AI-Bench基准测试:AI自我改进能力仍薄弱(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →