半年后重跑 autoresearch 实验:模型约聪明 10 倍,再拿 5 项改进
MParakhin · x · 2026-09-21
开发者 MParakhin 半年前用 GPT-5.4 xhigh 在真实规模项目上跑 autoresearch:103 个实验只有 1 个带来改进,但属「免费」收益。半年后他用相同设置、以 Max effort 重跑 GPT-6 Astra 和 Fable 5.1,结果在原有改进之上又新增 5 项改进。
他据此判断:每一项改进都比上一项指数级更难,意味着模型比 6 个月前聪明了约 10 倍。作为有本职工作的开发者,他把 agent 跑实验当作近乎免费的改进来源。
「模型」频道最新
- 观察:各家模型做工具调用时中间步骤风格各异 — DanielLockyer · 2026-09-21
- 传 Anthropic Opus 5.5 本周发布:或比 Astra 更强更便宜 — daniel_mac8 · 2026-09-21
- Burkov 锐评神秘项目 Jev:号称秒杀 LLM,结论是 BS — burkov · 2026-09-21
- 曝月之暗面与腾讯混元竞逐 Flash 小模型,主攻 Agent 推理成本 — TheZachMueller · 2026-09-21
- 开发者上线 Made With Jev 目录站,汇总模型演示、工具与 Skills 资源 — Sea_Supermarket_5891 · 2026-09-21
- 逆向工程该选哪个模型?开发者求助 Ghidra/IDA 的 MCP 工作流 — obese_coder · 2026-09-21