AI4AI-Bench基准测试:AI自我改进能力仍薄弱

清华大学与 MosaicML(EinsiaAI 旗下 NaversLab 参与)研究人员发布 AI4AI-Bench 基准,测试 AI 智能体能否重新设计 AI 训练算法本身以实现递归自我改进,而非仅停留在调参层面。该基准覆盖 10 个真实算法库与研究任务,结果显示平均得分很低,超半数智能体未能改进训练算法,表明递归自我改进仍极其困难。相关发布在 X 上 7 小时内获得大量关注。

2026-08-22 ~ 2026-08-23 · 3 条相关