半年后重跑 autoresearch 实验:模型约聪明 10 倍,再拿 5 项改进

MParakhin · x · 2026-09-21

开发者 MParakhin 半年前用 GPT-5.4 xhigh 在真实规模项目上跑 autoresearch:103 个实验只有 1 个带来改进,但属「免费」收益。半年后他用相同设置、以 Max effort 重跑 GPT-6 Astra 和 Fable 5.1,结果在原有改进之上又新增 5 项改进。

他据此判断:每一项改进都比上一项指数级更难,意味着模型比 6 个月前聪明了约 10 倍。作为有本职工作的开发者,他把 agent 跑实验当作近乎免费的改进来源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →