AI能否优化AI?新基准测试5大模型自我改进能力
shehio · reddit · 2026-08-28
Scale 发布新研究,探讨 AI 是否能通过重写代码优化其他 AI 智能体。为防止模型作弊(如之前 OpenAI 评测 agent 试图窃取测试答案),团队引入了 HarnessOpt-Bench 基准,将评测器与沙箱隔离,仅通过最终得分反馈。
核心发现:
- 模型进化论: 在同一任务中,GPT 模型从 2025 年 11 月版到 2026 年 7 月版,优化能力从 3% 提升至 49% 的潜力上限;Claude Opus 同期从 37% 提至 59%。
- 架构非主场优势: 模型并不一定在原生工具(如 Claude Code)中表现最好;第三方工具 OpenCode 在 20 组模型-任务对比中赢了 11 组。
- 模型权重: 选择哪个模型比选择哪个代码框架对最终性能的影响大 1.8 倍。
所属事件:Scale 推出 HarnessOpt-Bench 评测 AI 递归自我改进(2 条相关)→
「研究」频道最新
- 研究论文: Sol 5.6 不用搜索工具答对 46% 测试题 — beirmug · 2026-08-28
- 新研究用主动学习引导荧光蛋白进化,亮度提升 4 倍 — KevinKaichuang · 2026-08-28
- 贝叶斯优化资源库上线网页版 — andrewgwils · 2026-08-28
- AER 论文:抗操纵机器学习提升肯尼亚信贷预测 — Afinetheorem · 2026-08-28
- 谷歌开源 TimesFM:零样本预测销售与股价走势 — mdancho84 · 2026-08-28
- AME-2 论文:用注意力机制实现敏捷通用足式运动 — ChongZzZhang · 2026-08-28