微软发布 Taste-Bench:前沿 Agent 选对方向概率不足 60%
omarsar0 · x · 2026-09-25
微软等机构发布 Taste-Bench 基准,考察递归自我改进中 Agent 的「品味」——在长任务的决策分叉点,模型能否选出更好的方向。
- 分叉自动从工程/研究运行的平行尝试与绕路中挖掘,每个问题给出轨迹中的开放分叉点,其中一条通向更好结果
- 最佳模型正确率仅 59.7%
- 决定性证据在轨迹后段出现的分叉明显更难,更大的推理预算并不能提升准确率
- 作者将教师模型对结果的判断蒸馏到学生模型,在 held-out 任务的端到端成功率上有提升
「编程与Agent」频道最新
- pnpm 呼吁用 coding agent 修 bug,附完整可复用提示词 — itsOmSarraf_ · 2026-09-25
- 产品自己开发自己:Huntley 演示把产品内置成 IDE 的软件工厂 — teropa · 2026-09-25
- 无 Mac 也能用的 iCloud MCP:31 个工具连 Notes 和提醒事项 — sjdonado · 2026-09-25
- 微软基于 OpenClaw 推出企业级产品,OpenClaw 作者致谢 — steipete · 2026-09-25
- 归藏开源 product video skill:AI 读代码库自动产出软件宣传片 — op7418 · 2026-09-25
- BlackRock 报告引热议:Agent 已能花钱,权限撤销却追不上支付 — tallmetommy · 2026-09-25