AI4AI-Bench 揭示:递归自我改进仍极其困难
_akhaliq · x · 2026-08-22
Einsia 发布了 AI4AI-Bench 基准,用于测试 AI Agent 是否能改进 AI 训练算法本身(而非仅调参)。测试覆盖 10 个真实算法库和任务,结果显示平均得分仅 0.166,最强的 Opus 5 也只拿到 0.288 分。此外,每个任务的探索成本从 1.69 美元飙升至 34.60 美元。这表明目前的递归自我改进 (RSI) 仍面临巨大挑战。
「研究」频道最新
- EMNLP 2026 论文:RAG 检索思维轨迹提升推理 43% — matei_zaharia · 2026-08-22
- Woolly 让 Qwen3-8B 数理解码提速 2-3 倍 — bosmeny · 2026-08-22
- GTSAM 4.3新增CUDA后端,加速非线性优化 — fdellaert · 2026-08-22
- Nature 发布流体动力学强化学习平台 HydroGym — eigensteve · 2026-08-22
- 谷歌开源生物标记发现框架:多智能体挖掘可穿戴数据 — yang_yuzhe · 2026-08-22
- CVPR 2026 口语报告:细粒度负向提问让 MLLM 集体幻觉 — zeynepakata · 2026-08-22