研究者:前沿模型似已针对自动科研任务完成深度 RL,自我改进或已到来
generativist · x · 2026-09-13
AI 研究者 generativist 复跑了自己旧有的 auto-research ML agent 基准,换用新模型 astra 后结果「惊艳」。他此前就判断:用前沿模型构建自动科研风格的 ML agent 时,很难避免一个结论——这些模型已经针对这类任务做过非常出色的 RL 训练,自我改进很可能已经在发生。
补充说明:他的测试 harness 偏好筛选非主流、off-beaten-path 的解法,而这次 astra 给出的方案连他都称得上「wild」,进一步强化了上述判断。
所属事件:研究者复跑自动科研基准:前沿模型表现惊艳引自我改进之问(2 条相关)→
「漫话AGI」频道最新
- 评论称 OpenAI 与 Anthropic 若无法控险就该停售模型 — AlexTensor · 2026-09-13
- AI 沙皇 Sacks 力挺前沿双寡头:放慢?不需要谁批准 — kevinnbass · 2026-09-13
- 算力将转向可解释性与对齐,RL 狂奔前须先解决奖励劫持 — zephyr_z9 · 2026-09-13
- 三大巨头罕见齐声呼吁放慢 AI,Reddit 猜有未公开事故 — Traditional-Chip8339 · 2026-09-13
- tszzl 预测重大事故后开源模型恐遭禁,Kimi/DeepSeek 应受 API 监控 — mimi10v3 · 2026-09-13
- HealthRanger:前沿实验室怕的不是 AI 灭世,是开源击垮营收 — whurley · 2026-09-13