Hermes Index 测评口径:统一 harness,推理强度尽量拉满

NousResearch · x · 2026-10-07

Nous Research 补充 Hermes Index 的测试方法:所有模型运行同一套 harness,凡提供推理档位的模型一律将推理强度设为最高;榜单报告四套基准上的平均得分与平均单任务成本。

所属事件:Nous Research 发布 Hermes Index 智能体榜单,Claude Opus 5.5 居首(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →