AI4AI-Bench 揭示:递归自我改进仍极其困难

_akhaliq · x · 2026-08-22

Einsia 发布了 AI4AI-Bench 基准,用于测试 AI Agent 是否能改进 AI 训练算法本身(而非仅调参)。测试覆盖 10 个真实算法库和任务,结果显示平均得分仅 0.166,最强的 Opus 5 也只拿到 0.288 分。此外,每个任务的探索成本从 1.69 美元飙升至 34.60 美元。这表明目前的递归自我改进 (RSI) 仍面临巨大挑战。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →