内部评测:任务每翻倍一倍,Haiku 完成率近乎减半

EvalRaccoonDev · reddit · 2026-09-22

UiPath 工程团队对比 Claude Haiku 4.5 与 Sonnet:SWE-bench Verified 上两者只差 6 分(73.3% vs 79.6%),但在同一天、同一 harness 的内部 agent 任务上差距达 42.0% vs 85.6%。

按 Sonnet 所需命令数分桶后的结果:

核心发现:任务长度每翻倍,Haiku 完成概率大约减半,而 Sonnet 在全区间只损失约 11 分。

作者解释为什么 benchmark 抓不到这个差距:SWE-bench 的 agent 能跑测试并修正错误步骤,而他们的检查是隐藏的——第 3 条命令打错参数,到第 40 条依然是错的。结论是选模型要按任务步数判断,短任务 Haiku 够用,长链路 agent 任务必须上更贵模型。完整分析见 UiPath 工程博客。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →