微软发布 Taste-Bench:最强模型长程决策判断力仅 59.7%
microsoft · hf · 2026-09-23
微软提出「品味(taste)」概念:智能体在长周期任务中的关键分叉决策——比如选哪条假设去验证、在哪个实现上继续构建——决定整个任务的成败,但现有 benchmark 都只测端到端成功率,不测这种决策能力。
Taste-Bench 的做法
- 从智能体在工程与研究任务中的轨迹自动挖掘「决策分叉」:同一任务多次并行尝试、以及单条轨迹中的绕路,无需人工标注
- 每道题给出分叉点上的多个方向,其中一个导向更好结果,被测模型在不看到后续结果的情况下选择
主要发现
- 最强前沿模型正确率仅 59.7%
- 决定性证据出现在轨迹后段的分叉对所有模型都更难
- 增大推理预算并不能提升准确率
可训练:把「看过结果」的教师模型的判断蒸馏进学生模型后,学生在未见过的任务上决策更好,并在 held-out 的 SWE-bench Pro 上提升端到端成功率。
「编程与Agent」频道最新
- 开发者用 Opus 5.5 做 Lean 形式化验证,几条提示修出 16 个 bug — jimmykoppel · 2026-09-23
- Rogo 创始人:记忆压缩是企业 agent 最未解的难题 — rohanpaul_ai · 2026-09-23
- 告别巨型 Prompt:Graph Engineering 用图结构编排 AI Agent 工作流 — Pavan_Belagatti · 2026-09-23
- 让编码 Agent 在 PR 里附上火焰图,性能回归一目了然 — DanielLockyer · 2026-09-23
- 开发者实测新模型 Sol 6 擅长目标导向任务,让其通宵跑任务 — gregmushen · 2026-09-23
- Theorem 团队:用 Lean 形式化验证 AI 沙箱,全自动验证距落地仅数月 — ctjlewis · 2026-09-23