研究者:前沿模型似已针对自动科研任务完成深度 RL,自我改进或已到来

generativist · x · 2026-09-13

AI 研究者 generativist 复跑了自己旧有的 auto-research ML agent 基准,换用新模型 astra 后结果「惊艳」。他此前就判断:用前沿模型构建自动科研风格的 ML agent 时,很难避免一个结论——这些模型已经针对这类任务做过非常出色的 RL 训练,自我改进很可能已经在发生。

补充说明:他的测试 harness 偏好筛选非主流、off-beaten-path 的解法,而这次 astra 给出的方案连他都称得上「wild」,进一步强化了上述判断。

所属事件:研究者复跑自动科研基准:前沿模型表现惊艳引自我改进之问(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →