微软发布 Taste-Bench:最强模型长程决策判断力仅 59.7%

microsoft · hf · 2026-09-23

微软提出「品味(taste)」概念:智能体在长周期任务中的关键分叉决策——比如选哪条假设去验证、在哪个实现上继续构建——决定整个任务的成败,但现有 benchmark 都只测端到端成功率,不测这种决策能力。

Taste-Bench 的做法

主要发现

可训练:把「看过结果」的教师模型的判断蒸馏进学生模型后,学生在未见过的任务上决策更好,并在 held-out 的 SWE-bench Pro 上提升端到端成功率。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →