实测发现 GPT-5 批量走步能力严重拉垮,不批量也吃力
patience_cave · x · 2026-09-07
patiencecave 在 X 上与 FakePsyho、stalkermustang 讨论 agent 基准测试中的批量走步(batched moves)策略:GPT-5 在允许一次提交多步操作时表现极差,但即使不批量也照样吃力。
讨论要点:
- FakePsyho 基于跑 ARC-AGI-3 的经验认为,批量走步虽会降低质量,但能大幅削减成本(5.4-5.6 档),整体仍划算——更好的做法是既允许更多步数又允许批量,而不是步数少且不批量。
- patiencecave 指出在 ARC-AGI-3 上批量合理因为走错一步代价很高,打算在 mazebench 上改为一回合一步再测。
- 具体的质量下降现象目前仅在 Astra 和 Fable 上观察到;上一代模型在批量提交多步时表现同样糟糕。
「编程与Agent」频道最新
- 19 岁学生打造 Murmell:像 Google Docs 一样云端协作跑编程 Agent — According-Chain-8246 · 2026-09-07
- 开源 Routed:本地 CPU 零成本离线路由 Agent 技能,1 秒内完成 — iAmQubick · 2026-09-07
- 为 Agent 搭的 MCP 公告板 Bulletin:跨机器发帖、回复、公开可见 — MeAndClaudeMakeHeat · 2026-09-07
- 开发者搭建本地+云端混合 AI 工作流:双 Spark 加超代理聚合 80+ 模型 — jasonkneen · 2026-09-07
- 产品设计副总裁:Cursor、Paper MCP 与 Codex 间无缝切换的理想工作流 — davidhoang · 2026-09-07
- 开源 HuggingFace 下载器 GUI:修复浏览器下载慢、断连难题 — acedelgado · 2026-09-07