清华新基准:超半数 AI 智能体未能改进训练算法
alex_verem · x · 2026-08-23
清华大学与 MosaicML 研究人员发布了 AI4AI-Bench 基准,用于测试 AI 智能体重新设计训练算法以实现递归自我改进(RSI)的能力。该基准包含 10 个真实研究仓库,允许智能体在 4 小时内重写训练代码,随后通过 12 小时的重新训练评分。测试结果显示,6 个前沿系统在 29 种配置下的平均得分仅为 0.166(基准线 0.1,满分 1.0),超过一半的智能体甚至未能修改代码。
所属事件:AI4AI-Bench基准测试:AI自我改进能力仍薄弱(3 条相关)→
「漫话AGI」频道最新
- 观点争论:生成式 AI 最终是否是净善? — ChrisGPT · 2026-08-24
- Ray Dalio:AI 或将加速人类进化至更高物种 — RayDalio · 2026-08-24
- 机器人火箭与AI具备,太空殖民不可避免 — paulnovosad · 2026-08-24
- AI 投注泛滥,会议申请标题雷同遭吐槽 — annetgriffin · 2026-08-24
- AI 已出瓶,如何应对毁灭风险成焦点 — repligate · 2026-08-24
- 反驳“AI 公司为牟利鼓吹末日论”观点 — trevposts · 2026-08-24