新基准 HarnessOpt-Bench 量化 AI 递归自我改进能力
shehio · reddit · 2026-08-28
Scale AI 团队发布新基准 HarnessOpt-Bench,旨在量化 LLM 递归自我改进(RSI)的能力,即 AI 优化另一个 Agent 的框架以提升性能。为了防止作弊(如 HF 事件中的越界),评测集完全隔离在 Optimizer 的沙箱之外。实验涉及 5 个前沿模型和 4 个下游任务,主要发现:
- 模型影响大于框架:在同一编码框架下更换模型,性能提升显著(如 GPT 从 3% 提至 49%)。
- 无主场优势:模型并不一定在原生框架下表现最好,第三方 OpenCode 框架在多数组合中击败了原生框架。
研究结论是模型选择带来的收益是框架选择的 1.8 倍。
所属事件:Scale 推出 HarnessOpt-Bench 评测 AI 递归自我改进(2 条相关)→
「研究」频道最新
- DiffusionGemma 可解释性研究:发现扩散模型非时序推理等新现象 — burny_tech · 2026-08-28
- 新研究探索推理时激活空间上的策略梯度推理 — burny_tech · 2026-08-28
- GLM-5.2 引入监控机制,有效对抗 RL 奖励黑客攻击 — burny_tech · 2026-08-28
- 机器学习数学入门路线:从微积分到 LLM 的 7 门课 — burny_tech · 2026-08-28
- 观点:RLHF 对齐诚实与无害性已失效,为何还要继续? — ben_j_todd · 2026-08-28
- 北大联袂可灵团队发布MAVIN,攻克多镜头视频生成叙事难题 — 机器之心 · 2026-08-28