研究发现自动化发现系统没有通用最优 harness
LChoshen · x · 2026-07-22
一项受控研究发现:自动化发现并不存在“放之四海皆准”的最佳 harness。
- 更简单的 harness 往往能和更复杂的系统打平,甚至超过 OpenEvolve 这类方案。
- 最优选择会随着 model–problem pair 改变,因此 harness 的泛化性很差。
- 作者使用了重复的预算匹配实验、强基线和统计假设检验,以应对这种高方差设置。
- 研究还指出,如果在 rollout 过程中在线选择不同 harness,能缓解这个泛化问题,并推动更自适应的发现系统设计。
所属事件:研究称自动化发现不存在通用最优框架(2 条相关)→
「研究」频道最新
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- ARC AGI 3 应该保持私有,不该公开示例和数据集 — flowersslop · 2026-07-27
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27
- Chollet 认为智能可能有硬上限,AI 进步会趋于边际递减 — binarybits · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- 一个问题追问多智能体分支如何随算力和模型规模变化 — iskander · 2026-07-27