新基准 HarnessOpt-Bench 量化 AI 递归自我改进能力

shehio · reddit · 2026-08-28

Scale AI 团队发布新基准 HarnessOpt-Bench,旨在量化 LLM 递归自我改进(RSI)的能力,即 AI 优化另一个 Agent 的框架以提升性能。为了防止作弊(如 HF 事件中的越界),评测集完全隔离在 Optimizer 的沙箱之外。实验涉及 5 个前沿模型和 4 个下游任务,主要发现:

研究结论是模型选择带来的收益是框架选择的 1.8 倍。

所属事件:Scale 推出 HarnessOpt-Bench 评测 AI 递归自我改进(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →