Taste-Bench 论文:最强模型也错四成长任务决策,更长思考没用

alex_verem · x · 2026-09-24

微软与香港城市大学的论文《The Tasteful Agent》提出:长任务成败取决于 agent 在"分叉点"上的选择能力,作者称之为"品味"(taste)。

Taste-Bench 基准

关键发现

可训练

用 27B 开源 Qwen3.6 学习历史分叉的结局,未见任务准确率提升 17.9 个百分点;给编码 agent 在 41 道 SWE-bench Pro 任务前提供"品味"建议,成功率从 14.6% 翻倍到 33.7%(完美建议上限 39%)。

结论直指"更大模型+更长思考"的卖点:在决定长任务生死的决策上,更长思考改变不了什么。

所属事件:微软发布 Taste-Bench:最强模型长程决策也仅及格(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →