研究者复跑自动科研基准:前沿模型表现惊艳引自我改进之问
AI 研究者 generativist 复跑了自己旧有的 auto-research ML agent 基准,换用新模型 astra 后结果「惊艳」。他补充称测试 harness 会特意筛选非主流解法,而 astra 给出的「狂野」解法超出预期。他此前就判断用前沿模型构建自动科研已有深度 RL 优化的迹象,这次结果令他认为自我改进或已到来。
2026-09-13 ~ 2026-09-13 · 2 条相关
- 研究者:前沿模型似已针对自动科研任务完成深度 RL,自我改进或已到来 — generativist · 2026-09-13
- astra 复跑自动科研基准:非主流解法「狂野」程度超预期 — generativist · 2026-09-13