微软发布 Taste-Bench:最强模型长程决策也仅及格
微软联合香港城市大学发布论文《The Tasteful Agent》并推出 Taste-Bench 基准,提出「品味」概念,即智能体在长周期任务关键分叉点上的选择能力。测试显示最强模型的长程决策判断力仅 59.7%,约四成决策出错,而延长思考时间也无济于事,凸显现有端到端评测的盲区。
2026-09-23 ~ 2026-09-24 · 2 条相关
- 微软发布 Taste-Bench:最强模型长程决策判断力仅 59.7% — microsoft · 2026-09-23
- Taste-Bench 论文:最强模型也错四成长任务决策,更长思考没用 — alex_verem · 2026-09-24