元推理框架论文:让控制器调度智能体推理,ProgramBench 达 71.5%
rohanpaul_ai · x · 2026-10-01
arXiv 论文《Thinking Before Thinking: Scaling Agentic Inference Through Meta-Reasoning》(Paras Dahal 等 12 位作者)提出「智能体元推理」:一个推理时框架,把执行控制变成显式的结构化推理过程。
核心设计
- Worker 负责任务级计算;Controller 负责整合本次运行已确立的结论、探索下一步选项、在剩余预算下评估各选项价值并分派工作,并从持久记忆中调取上下文。
- 两次决策之间,Controller 只携带一份运行状态的紧凑摘要,而非重放完整历史。
- 解决的问题:智能体处理长复杂任务时,每一步都面临控制选择——基于哪些部分成果继续、是否重来、何时停止。
实验结果
- 基线包括生产级编码智能体与研究 harness,以及同等 worker 与算力预算的 Direct Control Agent。
- ProgramBench(通过程序重构测试长程智能体能力):GPT-5.5 达 71.5% vs Codex 58.0%;Opus 4.8 达 67.2% vs Claude Code 65.5%。
- 在抽象推理、多领域长程推理、证明生成等基准上,比直接控制提升 3.64.2 个百分点。
所属事件:Meta 提出元推理框架,让模型自建推理计算图(4 条相关)→
「编程与Agent」频道最新
- Agent 知道何时停手才是真产品:演示自主暂停关键操作 — SucceededMind · 2026-10-01
- LiteLLM 发布 Lens:用网关流量数据帮 Agent 持续改进 — ycombinator · 2026-10-01
- 梗图: review AI 输出后直接推上生产环境 — tlakomy · 2026-10-01
- 6GB 显存跑通对口型工作流:本地加载、唇形同步走 API — Extreme-Shock1930 · 2026-10-01
- 烧够了视频渲染费后,我让 Agent 花钱前必须先请示 — coolxeo · 2026-10-01
- ComfyUI 开源插件 Continuity 大更新:屏幕替换、图生 3D 全都有 — Fine_Rhubarb3786 · 2026-10-01