LongHarness 基准发布:同模型不同框架效率差距超 10 倍

作者发布 LongHarness 基准,用于评测 RLM、编码 agent 等长上下文 harness 的准确率与效率,发现同一模型在不同 harness 下准确率与效率差距可超 10 倍。评测显示更多算力并不总等于更高准确率,相似性能的开销相差极大,其中 mini-swe 以接近直推的成本取得最佳成绩。

2026-10-01 ~ 2026-10-01 · 2 条相关