Taste-Bench 论文:最强模型也错四成长任务决策,更长思考没用
alex_verem · x · 2026-09-24
微软与香港城市大学的论文《The Tasteful Agent》提出:长任务成败取决于 agent 在"分叉点"上的选择能力,作者称之为"品味"(taste)。
Taste-Bench 基准
- 从 2,677 个编码运行与 1,132 个研究运行中自动挖掘决策分叉:4,657 个候选中筛出 502 道题,人工审核与标注一致率 98.8%,无需人工标注。
- 14 个前沿模型参加,选项顺序调换均需答对方计分(瞎猜 25%)。
关键发现
- 最好的 GPT-5.6 Sol 仅 59.7%,每十次关键抉择仍错约四次。
- 决定性线索在已见上下文中时模型平均 62.3%;线索要靠后续工作才能显现时暴跌到 21%,低于瞎猜——而长任务恰恰由后者构成。
- 加大思考时间无效:两个模型在三个推理档位下均无提升,且最多的 token 恰恰烧在错得最多的分叉上。
可训练
用 27B 开源 Qwen3.6 学习历史分叉的结局,未见任务准确率提升 17.9 个百分点;给编码 agent 在 41 道 SWE-bench Pro 任务前提供"品味"建议,成功率从 14.6% 翻倍到 33.7%(完美建议上限 39%)。
结论直指"更大模型+更长思考"的卖点:在决定长任务生死的决策上,更长思考改变不了什么。
所属事件:微软发布 Taste-Bench:最强模型长程决策也仅及格(2 条相关)→
「编程与Agent」频道最新
- 用 Grok 搭 4 个机器人营销团队,单条视频 750 万播放涨粉 3300 — PrajwalTomar_ · 2026-09-24
- Celesto 发布 agent 专用计算机:500ms 启动 microVM,给智能体配浏览器和终端 — aniketmaurya · 2026-09-24
- 跑长上下文 Agent 任务,llama.cpp -cram 默认值该调大了 — My_Unbiased_Opinion · 2026-09-24
- Airbnb 前员工长文复盘欺诈检测:信号特征、时序与速率维度实战经验 — jeff_weinstein · 2026-09-24
- 让 AI 只做选择不生成答案:Jev 一步步导航 Neo4j 图谱 — JeremyCMorgan · 2026-09-24
- OpenClaw 用 test-audit skill 删掉 40 万行无用测试 — steipete · 2026-09-24