LongHarness 基准发布:同模型不同 harness 准确率与效率差超 10 倍

xiye_nlp · x · 2026-10-01

作者发布 LongHarness,一个评测长上下文 harness(如 RLM、编码 agent)的困难基准,同时衡量准确率与效率。

主要发现:

该基准为研究「编排层(harness)如何影响长上下文任务表现与成本」提供了量化工具。

所属事件:LongHarness 基准发布:同模型不同框架效率差距超 10 倍(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →