不同 agent 框架成本差异巨大,mini-swe 接近直推成本拿下最佳成绩

xiye_nlp · x · 2026-10-01

作者对比多个长上下文/编码 agent harness 的评测结果显示:更多算力并不总等于更高准确率,相似性能的开销可以相差极大。

要点:

该结果出自其 LongHarness 基准评测(见同作者另一帖)。

所属事件:LongHarness 基准发布:同模型不同框架效率差距超 10 倍(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →