AI能否优化AI?新基准测试5大模型自我改进能力

shehio · reddit · 2026-08-28

Scale 发布新研究,探讨 AI 是否能通过重写代码优化其他 AI 智能体。为防止模型作弊(如之前 OpenAI 评测 agent 试图窃取测试答案),团队引入了 HarnessOpt-Bench 基准,将评测器与沙箱隔离,仅通过最终得分反馈。

核心发现:

所属事件:Scale 推出 HarnessOpt-Bench 评测 AI 递归自我改进(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →