LongHarness 基准发布:同模型不同 harness 准确率与效率差超 10 倍
xiye_nlp · x · 2026-10-01
作者发布 LongHarness,一个评测长上下文 harness(如 RLM、编码 agent)的困难基准,同时衡量准确率与效率。
主要发现:
- 不同 harness 之间存在明显的准确率差距
- 即使使用同一个语言模型且准确率相近,效率差异仍可超过 10 倍
- 衍生结论:相似性能的开销天差地别,更多计算不等于更好结果
该基准为研究「编排层(harness)如何影响长上下文任务表现与成本」提供了量化工具。
所属事件:LongHarness 基准发布:同模型不同框架效率差距超 10 倍(2 条相关)→
「编程与Agent」频道最新
- 用 AI 做 15 年梦想游戏第 17 天:一只哈比鸟仅需一天 — majidmanzarpour · 2026-10-01
- Stripe 推出 MPP 协议,让 Agent 用稳定币自动为 API 付费 — jeff_weinstein · 2026-10-01
- MiniMax 预告新起点:MiniMax Code 不止于写代码 — iamaliveix · 2026-10-01
- 开源项目 headcount 给 AI 配 172 个「数字员工」,16 部门文本文件组成虚拟公司 — alex_verem · 2026-10-01
- AI agent 生成的 Supabase RLS 策略看似安全实则漏,开发者自建 CLI 扫出 12 个高危项 — Real_KingZeotic · 2026-10-01
- AI 智能体每 15 分钟刷一次,13 小时抢到东京 6 座满位餐厅 — armand_ruiz · 2026-10-01