元推理框架登 ProgramBench:GPT-5.5 达 71.5%,超 Codex 13.5 个百分点
anirudhg9119 · x · 2026-10-02
arXiv 论文《Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning》(作者含 Salakhutdinov、Jason Weston、Anirudh Goyal 等)提出 agentic meta-reasoning:一个推理时框架,让 agent 显式推理「该继续、复用还是停止」哪些工作。
- 架构:Worker 负责任务级计算,controller 负责汇总当前进展、评估各选项在剩余预算下的价值、从持久记忆提取上下文并分派工作;决策之间只携带紧凑的运行记录而非重放全部历史。
- 成绩:ProgramBench(长程程序重建)上,GPT-5.5 + 元推理达 71.5%,对照 Codex 的 58.0%;Opus 4.8 达 67.2%,对照 Claude Code 的 65.5%。
- 泛化:在抽象推理、多域长程推理与证明生成等其他基准上,比直接控制的同算力基线高 3.6–4.2 个百分点。
核心主张:随 agent 处理更长更复杂的问题,「控制执行本身」成为一项任务,需要独立的元推理层来处理。
所属事件:Meta 提出元推理框架:GPT-5.5 登 ProgramBench 71.5%(5 条相关)→
「编程与Agent」频道最新
- 用流程挖掘 agent 审计企业工作流:文档写 7 步,实际 20 步 — vasuman · 2026-10-02
- Geoffrey Huntley 反驳「两周后大家都得回去读代码」 — kieranklaassen · 2026-10-02
- Claude Skills 入门:从 PDF 填表看提示词与 Skill 的真正区别 — lxfater · 2026-10-02
- Eye.Art 推出聊天式图像生成 MCP,支持参考图编辑与 SVG 输出 — axiomofaxiom · 2026-10-02
- 开发者把 GitHub Copilot 当「项目主管」用:自己只提 issue,其余全交 agent — 0xkarasy · 2026-10-02
- theo 深夜发布 Slopalytics,为 Artificial Analysis 数据做更佳可视化 — 0xkarasy · 2026-10-02