研究者复跑自动科研基准:前沿模型表现惊艳引自我改进之问

AI 研究者 generativist 复跑了自己旧有的 auto-research ML agent 基准,换用新模型 astra 后结果「惊艳」。他补充称测试 harness 会特意筛选非主流解法,而 astra 给出的「狂野」解法超出预期。他此前就判断用前沿模型构建自动科研已有深度 RL 优化的迹象,这次结果令他认为自我改进或已到来。

2026-09-13 ~ 2026-09-13 · 2 条相关